[논문리뷰] SAF-OPD: Stable Advantage Fusion for On-Policy Distillation본 논문은 RLVR과 OPD를 결합할 때 발생하는 고정 계수 통합 방식의 한계를 해결하고자 합니다. 기존 방식은 GRPO의 안정적인 보상과 OPD의 조밀한 피드백을 단순히 더하지만, 실제로는 두 보상의 크기와 시간적 가중치가 서로 달라 학습 과정에서 Entropy Collapse와 같은 심각한 불안정성을 유발합니다 .#Review#Reinforcement Learning#On-Policy Distillation#Advantage Fusion#Large Language Models#GRPO#Training Dynamics#Entropy Collapse2026년 8월 2일댓글 수 로딩 중
[논문리뷰] Training Dynamics Impact Post-Training Quantization Robustness본 연구는 대규모 언어 모델(LLM)의 효율적인 배포를 위해 널리 사용되는 Post-Training Quantization (PTQ) 의 견고성이 훈련 과정 및 동적 특성에 의해 어떻게 영향을 받는지 규명하는 것을 목표로 합니다.#Review#Post-Training Quantization#Quantization Robustness#Training Dynamics#Learning Rate Schedules#Weight Averaging#Large Language Models#LLMs#Hyperparameter Tuning2025년 10월 8일댓글 수 로딩 중
[논문리뷰] Align Your Tangent: Training Better Consistency Models via Manifold-Aligned Tangents본 연구는 Consistency Models (CMs) 의 느린 수렴 문제와 높은 배치 사이즈 요구 사항을 해결하는 것을 목표로 합니다.#Review#Consistency Models#Generative Models#Manifold Learning#Tangent Alignment#Diffusion Models#Training Dynamics#Manifold Feature Distance2025년 10월 6일댓글 수 로딩 중