[논문리뷰] Distilled Reinforcement Learning for LLM Post-training
링크: 논문 PDF로 바로 열기
메타데이터
저자: Chen Wang, Zhaochun Li, Jionghao Bai, Yining Zhang, Hexuan Deng, Ge Lan, Yue Wang
1. Key Terms & Definitions (핵심 용어 및 정의)
- OPD (On-Policy Distillation): 학생 모델이 생성한 경로(trajectories)에 대해 교사 모델과의 KL divergence를 최소화하여 지식을 전수하는 방식입니다.
- Distilled RL: 교사 모델의 지식을 별도의 KL-divergence 손실 없이 RL 목적 함수(objective) 내에 통합하여 토큰 수준의 fine-grained 지침을 제공하는 제안된 프레임워크입니다.
- Reverse Importance Sampling: 학생 모델의 정책(behavior policy)을 교사 모델의 분포에 맞추기 위해, 교사-학생 간의 토큰 수준 likelihood 비율을 활용하여 학습 신호를 재분배하는 기법입니다.
- Sequence-level Geometric Normalization: 토큰 수준의 비율을 응답 전체의 기하 평균으로 정규화하여, 교사 모델과 학생 모델 간의 시스템적 척도 차이를 제거하고 상대적인 선호도를 보존하는 기법입니다.
2. Motivation & Problem Statement (연구 배경 및 문제 정의)
본 논문은 기존 RL과 OPD가 가진 한계를 해결하기 위해 Distilled RL을 제안합니다. RL은 결과 중심의 coarse-grained 보상을 사용하여 credit assignment 문제를 겪으며 새로운 지식 습득에 한계가 있습니다. 반면, OPD는 교사 모델과 학생 모델의 분포가 다를 경우 무조건적인 KL-divergence 최적화가 성능 저하를 초래하는 딜레마를 가집니다. 특히 cross-family 설정에서 이러한 분포 불일치는 효율적인 지식 전수를 어렵게 만듭니다 [Figure 1].
3. Method & Key Results (제안 방법론 및 핵심 결과)
본 논문은 교사 모델의 지식을 RL의 gradient에 직접 통합하여 선택적인 fine-grained 가이드를 제공하는 Distilled RL을 제안합니다 [Figure 1]. 이 방법론은 세 가지 핵심 구성 요소로 이루어집니다: 교사-학생 간 likelihood 비율을 재조정하는 Reverse importance sampling, 긍정적 보상(positive advantage) 응답에만 교사 정보를 적용하고 부정적 샘플은 원래의 RL 보상을 유지하는 Negative sample reset, 그리고 시퀀스 단위로 가중치를 정규화하는 Sequence-level geometric normalization입니다. 실험 결과, Distilled RL은 DSQW-1.5B 모델 기준 Pass@1 점수에서 기존 OPD 대비 4.73점, RL 대비 3.14점 향상된 성능을 기록하였습니다 [Table 2]. 또한 Qwen3-4B 학생 모델에서도 모든 베이스라인을 상회하며, 특히 cross-family distillation 환경에서 우수한 안정성과 성능을 입증하였습니다 [Figure 5].
4. Conclusion & Impact (결론 및 시사점)
Distilled RL은 무조건적인 KL 기반 모방 학습 대신, RL 목적 함수 내에서 교사의 선호도를 선택적으로 반영함으로써 효율적인 지식 전수를 가능하게 합니다. 본 연구는 정성적 사례 연구를 통해 모델이 단순 보상을 넘어 교사의 분포 특성(예: 엔트로피)을 학습할 수 있음을 입증하였습니다. 이 프레임워크는 대규모 언어 모델의 post-training 과정에서 모델 아키텍처가 다른 경우에도 안정적인 성능 향상을 보장하며, 향후 다양한 reasoning 모델 최적화 연구에 핵심적인 토대를 제공할 것으로 기대됩니다.
Part 2: 중요 Figure 정보

Figure 1 — Distilled RL의 전체 프레임워크

Figure 5 — 학습 동학 비교

Figure 4 — 엔트로피 기반 정보 전수 사례
⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.
관련 포스트
- [논문리뷰] On-Policy Delta Distillation
- [논문리뷰] Distill Where You Fail: Recovering Learning Signals of Negative RL-Groups from Adaptive Teacher Guidance
- [논문리뷰] Demystifying On-Policy Distillation: Roles, Pathologies, and Regulations
- [논문리뷰] STARE: Surprisal-Guided Token-Level Advantage Reweighting for Policy Entropy Stability
- [논문리뷰] Zone of Proximal Policy Optimization: Teacher in Prompts, Not Gradients
Review 의 다른글
- 이전글 [논문리뷰] DiffGI: Differentiable Geometry Images for High-Fidelity Thin-Shell 3D Generation
- 현재글 : [논문리뷰] Distilled Reinforcement Learning for LLM Post-training
- 다음글 [논문리뷰] Do Language Models Dream of Binding Molecules? Benchmarking LLMs under Spatial Constraints
댓글