[논문리뷰] SAF-OPD: Stable Advantage Fusion for On-Policy Distillation본 논문은 RLVR과 OPD를 결합할 때 발생하는 고정 계수 통합 방식의 한계를 해결하고자 합니다. 기존 방식은 GRPO의 안정적인 보상과 OPD의 조밀한 피드백을 단순히 더하지만, 실제로는 두 보상의 크기와 시간적 가중치가 서로 달라 학습 과정에서 Entropy Collapse와 같은 심각한 불안정성을 유발합니다 .#Review#Reinforcement Learning#On-Policy Distillation#Advantage Fusion#Large Language Models#GRPO#Training Dynamics#Entropy Collapse2026년 8월 2일댓글 수 로딩 중