[vllm] [vLLM] CPU MoE 성능을 극대화하는 전략: 고정 임계값을 넘어선 동적 GEMM 디스패치 최적화vLLM의 CPU FP8/MXFP4 MoE 커널에서 전역 평균 기반의 GEMM 선택 로직을 제거하고, 개별 전문가 블록 단위로 BRGEMM을 동적 선택하여 최대 1.59배의 성능 향상을 달성했습니다.#vLLM#CPU Optimization#MoE#FP8#BRGEMM#Deep Learning2026년 8월 8일댓글 수 로딩 중
[onnxruntime] ONNX Runtime의 CPU GQA 최적화: Flash Attention과 Flash Decoding 도입CPU 환경에서 INT8/INT4 양자화된 KV 캐시를 위한 Flash Attention 기반의 타일링 및 Flash Decoding 구현으로 성능을 극대화합니다.#ONNX Runtime#LLM#Flash Attention#CPU Optimization#Quantization2026년 5월 29일댓글 수 로딩 중
[Loki] 청크 재정렬 시 파이프라인 처리 바이패스로 CPU 최적화청크 flush 시 불필요한 라벨 파싱과 메타데이터 처리를 건너뛰는 최적화#Grafana Loki#Chunk Processing#CPU Optimization#Performance2025년 10월 17일댓글 수 로딩 중