[논문리뷰] Beyond Imitation: Filtering On-Policy Distillation by Reasoning Progress
링크: 논문 PDF로 바로 열기
메타데이터
저자: Chen Yang, Haiyuan Wan, Rengrong Xiong, Yize Chen, Danny H. K. Tsang
1. Key Terms & Definitions (핵심 용어 및 정의)
- OPD (On-Policy Distillation): 학생 모델이 생성한 실시간 응답(trajectory)을 학습 입력으로 사용하여, 교사 모델의 토큰 분포와 일치하도록 최적화하는 포스트 트레이닝 기법입니다.
- Process Reward: 전체 결과의 정답 여부뿐만 아니라, 추론 과정의 중간 단계들이 실제 문제 해결 확률(solve probability)을 얼마나 향상시켰는지 정량화한 지표입니다.
- Sign-Consistent Merging: 인접한 추론 세그먼트 중 Process Reward의 부호가 동일한 것들을 병합하여, Monte Carlo 노이즈를 줄이고 추론 세그먼트의 평가 신뢰도를 높이는 기법입니다.
- Inconsistency Score: 교사 모델의 출력(distillation loss)과 독립적인 Process Reward 간의 랭킹 충돌을 정량화하여, 어떤 세그먼트가 신뢰할 수 없는 지도 신호(supervision)를 제공하는지 판별하는 지표입니다.
2. Motivation & Problem Statement (연구 배경 및 문제 정의)
본 논문은 기존의 OPD가 교사 모델과의 토큰 수준 일치만을 중요시하여, 실제 추론 성능 향상과는 배치되는 오해의 소지가 있는 지도 신호를 제공할 수 있다는 문제를 제기합니다. 교사 모델을 모방하는 것이 항상 정답을 찾아가는 과정과 일치하지는 않으며, 특히 추론 과정에서 교사와 다른 경로를 선택하더라도 더 높은 성공 확률을 가질 수 있는 경우를 효과적으로 처리하지 못합니다 [Figure 1]. 이러한 불일치를 해결하기 위해 교사 의존적인 기존 OPD의 한계를 보완하고, 실제 추론의 진전(reasoning progress)을 독립적으로 평가하여 지도 신호를 선택적으로 필터링하는 방식이 필요합니다.
3. Method & Key Results (제안 방법론 및 핵심 결과)
본 논문은 추론 과정의 진전 상황을 평가하고 불일치하는 지도 신호를 마스킹하는 R²-OPD (Reasoning-Progress-Aware Reward Filtering for On-Policy Distillation) 프레임워크를 제안합니다 [Figure 3]. R²-OPD는 먼저 Sign-Consistent Merging을 통해 인접한 세그먼트들을 병합하여 noisy한 Process Reward를 안정화하고, 세그먼트별 평균 KL divergence를 계산하여 교사 모델과의 불일치 정도를 산출합니다 [Figure 5]. 이후 세그먼트 간의 랭킹 충돌(Rank-Based Conflict)을 감지하여, 높은 잠재적 추론 진전을 보임에도 불구하고 교사 모델과의 높은 오차로 인해 부당하게 큰 손실(penalty)을 받는 세그먼트들을 마스킹합니다 [Figure 2]. DeepSeek-R1-Distill-Qwen-1.5B 모델을 사용한 실험 결과, R²-OPD는 표준 OPD 대비 AIME 2024에서 4.17점(avg@4) 향상된 성능을 기록했으며, 전체적인 pass@4 성능에서도 51.83%를 달성하여 우위를 점했습니다 [Table 1]. 또한, Qwen3-1.7B 기반의 전이 학습 실험에서도 pass@4를 45.70%에서 48.19%로 일관되게 개선하였습니다 [Table 2].
4. Conclusion & Impact (결론 및 시사점)
본 연구는 추론 지향적 언어 모델 학습에서 교사 모방(Imitation)과 실제 추론 진전(Reasoning Progress) 사이의 근본적인 간극을 성공적으로 규명했습니다. 제안된 R²-OPD는 Process Reward를 활용한 랭킹 기반 필터링을 통해 모델이 무조건적인 모방에서 벗어나 더 생산적인 추론 경로를 학습하도록 유도합니다. 이 기법은 고비용의 인간 피드백 없이도 자동으로 학습 데이터를 정제할 수 있어, 향후 데이터 효율적인 추론 모델 학습 및 지식 증류 생태계에 중요한 기술적 토대를 제공할 것으로 기대됩니다.
Part 2: 중요 Figure 정보

Figure 1 — 모델별 추론 경로 분석

Figure 2 — 추론 진전과 OPD 불일치 사례

Figure 3 — R²-OPD 전체 프레임워크
⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.
관련 포스트
- [논문리뷰] Trust Region On-Policy Distillation
- [논문리뷰] Self-Supervised Visual On-Policy Distillation
- [논문리뷰] SPOT: Sparse Probing and Outcome Calibration for On-Policy Distillation
- [논문리뷰] Distill Where You Fail: Recovering Learning Signals of Negative RL-Groups from Adaptive Teacher Guidance
- [논문리뷰] Pass the Baton: Trajectory-Relayed On-Policy Distillation
Review 의 다른글
- 이전글 [논문리뷰] Better Retrieval, Worse Robustness:How Multi-hop RAG Amplifies Upstream ASR Errors
- 현재글 : [논문리뷰] Beyond Imitation: Filtering On-Policy Distillation by Reasoning Progress
- 다음글 [논문리뷰] Beyond the Stability-Exploration Dilemma: Environmental Regularization for LLM Policy Optimization
댓글