[논문리뷰] Does On-Policy Distillation Really Distill? From Noisy Teacher to Self-Improvement본 논문은 On-Policy Distillation (OPD)의 Teacher Supervision 신호가 off-policy context에서 본질적으로 noisy하며, 이러한 노이즈가 학생 모델의 성능 향상에 미치는 영향이 불분명하다는 문제를 제기한다.#Review#On-Policy Distillation#Self-Adaptation#Reinforcement Learning#LLM#Token-level Supervision#Entropy-adaptive Advantages#Mathematical Reasoning2026년 8월 31일댓글 수 로딩 중