[vllm] vLLM의 차세대 CPU 가속: Intel Diamond Rapids를 위한 AMX-FP8 어텐션 구현Intel Diamond Rapids CPU의 AMX-FP8 하드웨어 가속을 활용해 KV 캐시 디퀀트 오버헤드를 제거하고 추론 성능을 극대화했습니다.#vLLM#CPU#AMX#FP8#Performance2026년 9월 6일댓글 수 로딩 중
[onnxruntime] ONNX Runtime의 CPU int4 가중치 프리패킹 최적화: 병렬 처리 효율성 개선ONNX Runtime에서 int4 양자화 모델 로딩 시 CPU 프리패킹 병렬화를 개선하여 세션 생성 속도를 약 25% 향상시켰습니다.#ONNX Runtime#Performance Optimization#CPU#Quantization#Parallelization2026년 9월 1일댓글 수 로딩 중
[vllm] vLLM CPU 추론 성능 최적화: Speculative Decoding과 libiomp5의 중요성vLLM의 CPU Speculative Decoding 환경에서 libiomp5 누락 시 발생하는 성능 저하 문제를 진단하고 경고하는 최적화 가이드.#vLLM#CPU#Speculative Decoding#OpenMP#Performance2026년 6월 8일댓글 수 로딩 중
[vllm] vLLM CPU 성능 최적화: NEON 하드웨어를 위한 고속 Exp 연산 도입vLLM의 CPU 어텐션 연산에서 저정밀도 데이터 타입을 위한 고속 exp 루틴을 도입하여 성능을 3-4% 향상시켰습니다.#vLLM#CPU#Optimization#NEON#Performance2026년 4월 23일댓글 수 로딩 중