[논문리뷰] On-Policy Delta Distillation본 논문은 기존의 On-Policy Distillation (OPD) 방식이 교사 모델의 전체 출력 분포를 모방하는 데 그쳐, 추론 능력 향상에 필수적인 핵심 학습 궤적을 충분히 전달하지 못한다는 문제를 제기합니다 .#Review#Knowledge Distillation#On-Policy Distillation#Reasoning Capability#Delta Signal#LLM Post-training#Reinforcement Learning2026년 7월 19일댓글 수 로딩 중