[논문리뷰] SigmaScale: LLM Compression with SVD-based Low-Rank Decomposition and Learned Scaling Matrices본 논문은 기존의 LLM 압축 기법들이 가중치 분해 시 발생하는 정밀도 저하와 그로 인한 성능 손실을 효과적으로 극복하지 못한다는 문제를 해결하고자 한다.#Review#LLM Compression#SVD#Low-Rank Decomposition#Weight Quantization#Model Pruning#Parameter Efficiency2026년 6월 8일댓글 수 로딩 중
[SGLang] AWQ: 활성화 인식 가중치 양자화SGLang의 AWQ 구현을 분석한다. 활성화 분포를 고려한 가중치 양자화의 원리, 채널별 스케일링, GPTQ 대비 장점을 코드와 함께 살펴본다.#sglang#AWQ#Activation-aware#Weight Quantization2026년 4월 12일댓글 수 로딩 중