[논문리뷰] Daedalus-150M: A Convolution-Attention Hybrid Designed for CPU Inference본 논문은 GPU용으로 설계된 거대 모델을 단순히 경량화하여 CPU에 적용하는 방식의 비효율성을 해결하고자 합니다.#Review#CPU Inference#Language Models#Hybrid Architecture#Memory Bandwidth#Quantization#Convolution#Attention#Efficiency2026년 8월 23일댓글 수 로딩 중
[onnxruntime] [ONNX Runtime] CPU GQA 성능의 한계를 넘다: FP16 입력과 양자화된 KV 캐시 최적화 분석FP16 활성화 함수와 INT8/INT4 KV 캐시를 결합하여 CPU 추론 성능을 극대화한 ONNX Runtime의 최신 GQA 최적화 기법을 살펴봅니다.#ONNX Runtime#LLM Optimization#CPU Inference#SIMD#C++2026년 7월 24일댓글 수 로딩 중