[논문리뷰] Beyond Imitation: Filtering On-Policy Distillation by Reasoning Progress본 논문은 기존의 OPD가 교사 모델과의 토큰 수준 일치만을 중요시하여, 실제 추론 성능 향상과는 배치되는 오해의 소지가 있는 지도 신호를 제공할 수 있다는 문제를 제기합니다.#Review#On-Policy Distillation#Reasoning Progress#Process Reward#Reward Filtering#Language Models#Knowledge Distillation2026년 8월 24일댓글 수 로딩 중