[논문리뷰] Softmax Reparameterization for Output-Head Quantization본 논문은 Small Language Models (SLMs)에서 large vocabularies가 output heads의 상당한 inference cost를 유발하는 문제를 해결하고자 합니다.#Review#Softmax Reparameterization#Output-Head Quantization#Post-Training Quantization#KL Divergence#Inference Latency#W4 Quantization#Small Language Models#Fidelity2026년 9월 27일댓글 수 로딩 중