[vllm] [vLLM] CPU MoE 성능을 극대화하는 전략: 고정 임계값을 넘어선 동적 GEMM 디스패치 최적화vLLM의 CPU FP8/MXFP4 MoE 커널에서 전역 평균 기반의 GEMM 선택 로직을 제거하고, 개별 전문가 블록 단위로 BRGEMM을 동적 선택하여 최대 1.59배의 성능 향상을 달성했습니다.#vLLM#CPU Optimization#MoE#FP8#BRGEMM#Deep Learning2026년 8월 8일댓글 수 로딩 중