[논문리뷰] Pass the Baton: Trajectory-Relayed On-Policy Distillation
링크: 논문 PDF로 바로 열기
메타데이터
저자: Haolei Xu, Xiaowen Xu, Haiwen Hong, et al.
1. Key Terms & Definitions (핵심 용어 및 정의)
- On-Policy Distillation (OPD): 학생 모델이 생성한 궤적(trajectory)을 기반으로 교사 모델이 실시간으로 토큰별 지도(supervision)를 제공하여 학습하는 방식입니다.
- Prefix Failure: 학생 모델이 초기 생성 단계에서 잘못된 추론 경로로 진입하면, 이후 모든 생성이 그 오류를 기반으로 이루어져 잘못된 정답으로 이어지는 현상입니다.
- Handoff Trigger: 교사 모델이 추론 방향을 수정하고자 하는 시점과 학생 모델이 기존 경로를 고수하려는 시점의 불일치를 포착하여, 교사 모델의 개입이 필요한 지점을 자동으로 감지하는 메커니즘입니다.
- Teacher Leg: Handoff Trigger 지점에서 교사 모델이 짧게 개입하여 추론 경로를 바로잡고 다시 학생 모델에게 제어권을 넘기기 전까지 생성하는 일련의 토큰 세그먼트입니다.
- Speculative Decoding: 본 논문에서 Relay-OPD를 효율적으로 구현하기 위해 사용된 기술로, 학생 모델이 초안(draft)을 생성하고 교사 모델이 이를 검증하거나 수정하는 구조를 통해 오버헤드를 최소화합니다.
2. Motivation & Problem Statement (연구 배경 및 문제 정의)
본 논문은 OPD 과정에서 발생하는 Prefix Failure 문제를 해결하기 위해 고안되었습니다. 기존 연구들은 고정 길이로 궤적을 절단하거나(FastOPD), 오프라인으로 궤적을 수정(TRD)하는 방식을 취했으나, 이는 잘못된 추론이 시작되는 시점을 정확히 반영하지 못하거나 인위적인 생성 결과물을 초래한다는 한계가 있었습니다 [Figure 1]. 학생 모델의 잘못된 추론이 초기 단계에서 교정되지 않으면 이후의 학습 데이터는 신뢰도가 낮아지며, 결과적으로 연산 자원이 낭비되는 문제가 발생합니다 [Figure 1]. 따라서 저자들은 학생의 생성 과정을 실시간으로 모니터링하여 오류 발생 시 즉각적으로 교사의 지도를 받는 온라인 개입 방식의 필요성을 제기합니다.

Figure 1 — Prefix Failure 및 Relay-OPD 개념
3. Method & Key Results (제안 방법론 및 핵심 결과)
본 논문은 Handoff Trigger를 기반으로 교사 모델이 일시적으로 개입하는 Relay-OPD 방법론을 제안합니다. 학생 모델이 생성하는 궤적 중 교사와 학생의 추론 방향이 충돌하는 지점을 실시간으로 감지하고, 교사 모델이 짧은 Teacher Leg를 생성하여 추론을 바로잡은 뒤 다시 학생 모델에게 제어권을 넘기는 방식입니다 [Figure 3]. 이를 위해 저자들은 두 모델의 생성 파이프라인을 Speculative Decoding 엔진 하나로 통합하여 효율성을 극대화했습니다 [Figure 3]. 8개의 수학적 추론 벤치마크 실험 결과, Relay-OPD는 Qwen3-1.7B-Non-Thinking 학생 모델 기준 표준 OPD 대비 평균 정확도에서 +5.73% 향상된 성능을 기록했습니다 [Table 1]. 또한, 강력한 기준 모델인 FastOPD 대비 +1.49%의 우위를 점하면서도, 평균 훈련 궤적 길이를 50% 이상 단축하여 높은 데이터 효율성을 입증했습니다 [Table 1].

Figure 3 — Relay-OPD 전체 아키텍처
4. Conclusion & Impact (결론 및 시사점)
본 논문은 Prefix Failure가 발생하는 핵심 지점을 파악하고 교사의 짧은 개입만으로도 추론 성능을 크게 개선할 수 있음을 입증했습니다. Relay-OPD는 외부 라벨이나 보상 모델 없이도 모델 간의 불일치를 활용하여 더 정확한 추론 궤적을 생성하고 학습에 활용할 수 있는 프레임워크를 제시합니다. 이 연구는 대규모 언어 모델의 지식 증류 과정에서 발생하는 비효율을 해결하고, 더 작은 규모의 모델도 복잡한 추론 능력을 확보할 수 있게 함으로써 효율적인 모델 경량화 및 고성능화에 기여할 것으로 기대됩니다.
⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.
관련 포스트
- [논문리뷰] ReNIO: Reweighting Negative Trajectory Importance for LLM On-Policy Distillation
- [논문리뷰] OPRD: On-Policy Representation Distillation
- [논문리뷰] SPOT: Sparse Probing and Outcome Calibration for On-Policy Distillation
- [논문리뷰] Distill Where You Fail: Recovering Learning Signals of Negative RL-Groups from Adaptive Teacher Guidance
- [논문리뷰] Multi-Turn On-Policy Distillation with Prefix Replay
Review 의 다른글
- 이전글 [논문리뷰] Parallel Decoding Distillation for Fast Image and Video Generation
- 현재글 : [논문리뷰] Pass the Baton: Trajectory-Relayed On-Policy Distillation
- 다음글 [논문리뷰] PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models
댓글