[논문리뷰] Demystifying On-Policy Distillation: Roles, Pathologies, and Regulations본 논문은 최신 LLM post-training의 표준이 된 OPD의 학습 동역학이 여전히 불투명하다는 점을 지적한다. OPD는 때때로 성능 향상을 이끌지만, 많은 경우 불안정성을 보이거나 탐색 붕괴를 초래하며 심지어 outcome-based RL보다 성능이 저하되기도 한다 .#Review#On-Policy Distillation#LLM Post-training#Reinforcement Learning#Exploration Catalyst#Pathology#Signal Regulation2026년 7월 16일댓글 수 로딩 중