[논문리뷰] Llama-Mobile: Efficient 2.7-Bit Quantization of VLMs본 논문은 VLM을 모바일 및 자원 제약 환경에 배포할 때 발생하는 막대한 메모리 및 컴퓨팅 자원 요구 문제를 해결하고자 합니다.#Review#Vision-Language Models#Quantization-Aware Training#Model Compression#Numerical Formats#Mobile Inference#Arm CPU2026년 8월 23일댓글 수 로딩 중
[vllm] vLLM, Arm CPU의 BF16 GELU 연산을 LUT 기반 구현으로 8배 가속vLLM이 Arm CPU 환경에서 BF16 GELU 연산을 LUT 기반으로 구현하여 성능을 크게 향상시킨 PR 분석.#vLLM#Arm CPU#BF16#GELU#최적화#성능 개선#LUT2026년 4월 16일댓글 수 로딩 중