[논문리뷰] On-Policy Delta Distillation
링크: 논문 PDF로 바로 열기
메타데이터
저자: Byeongho Heo, Jaehui Hwang, Sangdoo Yun, Dongyoon Han
1. Key Terms & Definitions (핵심 용어 및 정의)
- On-Policy Distillation (OPD): 학생 모델이 생성한 샘플(Rollout)을 기반으로 교사 모델의 지식을 전수하는 포스트 트레이닝 기법으로, 전통적인 RL의 보상 모델 제약 없이 토큰 수준의 감독 신호를 활용합니다.
- Delta Signal ($\Delta$): 교사 모델의 추론 튜닝 전후 가중치 차이를 활용하여, 단순 next-token prediction이 아닌 추론 능력의 학습 궤적(learning trajectory)을 포착하는 핵심 학습 신호입니다.
- OPD$^2$ (On-Policy Delta Distillation): Delta signal을 보상으로 활용하고, 원본 OPD 신호와의 정렬을 통해 과적합과 불안정성을 방지하는 개선된 지식 증류 프레임워크입니다.
- Centering: 샘플링된 토큰에 대한 기대 보상을 제거하여 학습 신호의 노이즈를 줄이고 보상값의 방향성을 명확히 하는 기법입니다.
2. Motivation & Problem Statement (연구 배경 및 문제 정의)
본 논문은 기존의 On-Policy Distillation (OPD) 방식이 교사 모델의 전체 출력 분포를 모방하는 데 그쳐, 추론 능력 향상에 필수적인 핵심 학습 궤적을 충분히 전달하지 못한다는 문제를 제기합니다 [Figure 1]. 기존 연구들은 단순히 교사 모델과 학생 모델 간의 확률 차이만을 보상으로 사용하므로, 교사 모델이 원래 가지고 있던 스타일적 경향성이나 불필요한 노이즈까지 학생 모델에 전이될 위험이 있습니다. 따라서 저자들은 교사 모델의 추론 튜닝 과정에서 얻은 변화만을 추출하여 학생 모델에 효과적으로 전이할 수 있는 새로운 접근 방식의 필요성을 강조합니다.

Figure 1 — OPD와 OPD^2^의 개념 비교
3. Method & Key Results (제안 방법론 및 핵심 결과)
저자들은 교사 모델(reasoning-tuned)과 베이스 모델(base model) 사이의 차이를 나타내는 Delta signal을 도입하여 추론 지식만을 정밀하게 추출하는 **OPD$^2$**를 제안합니다 [Figure 1]. 이 과정에서 학습 신호의 노이즈를 처리하기 위해 Centering 기법을 적용하고, 원본 OPD 신호와 Delta signal을 결합하는 Joint conditioning 설계를 통해 학습의 수렴 안정성을 확보하였습니다 [Figure 2, Figure 3].
실험 결과, **OPD$^2$**는 Math, Code, Science 등 다양한 추론 벤치마크에서 기존 OPD 및 ExOPD 대비 일관된 성능 우위를 보였습니다. 특히 Qwen3-1.7B 모델을 대상으로 Math 벤치마크 수행 시, **OPD$^2$**는 평균 성능 54.6점을 기록하여 기존 OPD (51.0점) 및 ExOPD (51.4점)를 상회하는 결과를 얻었습니다. 또한 Qwen3-4B에 적용했을 때에도 70.3점의 평균 성능을 달성하며, 모델 파라미터를 증대시킨 8B급 모델의 성능을 압도하는 정량적 효율성을 입증하였습니다 [Table 2].
4. Conclusion & Impact (결론 및 시사점)
본 연구는 Delta signal 기반의 **OPD$^2$**가 대형 언어 모델의 추론 능력을 효율적으로 전이하는 데 강력한 성능을 발휘함을 입증하였습니다. 이 방법론은 별도의 복잡한 보상 모델 설계 없이도 고성능 모델의 핵심 추론 기제만을 타겟팅하여 학생 모델을 최적화할 수 있는 경로를 제시합니다. 본 연구의 성과는 향후 소형 언어 모델의 성능 한계를 극복하고, 자원이 제한된 환경에서도 고도의 추론 능력을 갖춘 모델을 효율적으로 구축하는 데 중요한 기술적 토대가 될 것으로 기대됩니다.

Figure 2 — 학습 신호별 워드 클라우드 비교

Figure 3 — 토큰 수준의 증류 신호 시각화
⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.
관련 포스트
- [논문리뷰] Demystifying On-Policy Distillation: Roles, Pathologies, and Regulations
- [논문리뷰] A Survey of On-Policy Distillation for Large Language Models
- [논문리뷰] Learning beyond Teacher: Generalized On-Policy Distillation with Reward Extrapolation
- [논문리뷰] Weak-to-Strong Generalization via Direct On-Policy Distillation
- [논문리뷰] TurnOPD: Making On-Policy Distillation Turn-Aware for Efficient Long-Horizon Agent Training
Review 의 다른글
- 이전글 [논문리뷰] Loop the Loopies!
- 현재글 : [논문리뷰] On-Policy Delta Distillation
- 다음글 [논문리뷰] Qwen-Music Technical Report
댓글