[논문리뷰] Influence-Directed Distillation: Solving the Diversity Bottleneck in Sampled-Token On-Policy Distillation
링크: 논문 PDF로 바로 열기
메타데이터
저자: Run Yang, Runpeng Dai, Jie Sun, Jielei Zhang, Fan Zhou, Hongtu Zhu, Peiyi Li, Longwen Gao
1. Key Terms & Definitions (핵심 용어 및 정의)
- On-Policy Distillation (OPD): 학생 모델이 생성한 궤적(prefix)에 대해 Teacher 모델의 분포를 모방하도록 학습시키는 기법입니다.
- Sampled-Token OPD: 전체 vocabulary가 아닌, 샘플링된 특정 토큰에 대해서만 Teacher의 확률 값을 활용하여 학습 비용을 절감하는 OPD 방식입니다.
- Diversity Distillation Failure: OPD 학습 과정에서
pass@1성능은 향상되지만, 샘플링 다양성을 나타내는pass@kk성능이 정체되거나 하락하는 현상을 의미합니다. - First-Order Local Entropy Influence: 샘플링된 각 토큰 업데이트가 학생 모델의 Local Entropy에 미치는 영향을 Teacher-Student log-probability 격차와 Student의 확률 구조로 분해하여 산출한 지표입니다.
2. Motivation & Problem Statement (연구 배경 및 문제 정의)
본 논문은 Sampled-Token OPD가 효율적임에도 불구하고 pass@kk 성능이 정체되는 Diversity Distillation Failure 문제를 해결합니다. 기존 방법론들은 무분별하게 엔트로피를 높이거나, 비용이 높은 Forward-KL을 사용하여 효율성을 저해하는 한계가 있습니다. 저자들은 이러한 엔트로피 감소가 특정 위치의 업데이트에서 발생하는지 규명하고자 하며, Teacher의 sampled-token 확률 정보만으로 다양성을 보존할 방법을 모색합니다. Figure 2는 대부분의 엔트로피 손실이 Teacher와 Student의 격차가 적은 저-변동성(low-discrepancy) 지역에서 누적됨을 보여줍니다 [Figure 2].
3. Method & Key Results (제안 방법론 및 핵심 결과)
본 논문은 엔트로피를 보존하면서 학습 효과를 극대화하는 Influence-Directed Adaptive On-Policy Distillation (IDA-OPD)를 제안합니다. 제안 방법론은 First-Order Local Entropy Influence를 통해 엔트로피를 감소시키는 업데이트를 식별하고, Teacher-Student 간의 격차에 따라 divergence-adaptive weight를 적용하여 학습 강도를 조절합니다 [Figure 1]. 이를 통해 저-변동성 구간에서의 엔트로피 감소는 억제하고, 고-변동성 구간의 중요한 학습 신호는 보존합니다. 실험 결과, IDA-OPD는 기존 OPD 대비 pass@16 수치에서 유의미한 성능 향상을 달성했습니다 [Table 1]. 특히, 고가의 full-vocabulary 정보를 사용하지 않고도 기존 최첨단 teacher-informed 방법론들과 대등하거나 더 우수한 성능을 입증하였습니다 [Table 1].

Figure 1 — Advantage와 엔트로피 변화량의 관계
4. Conclusion & Impact (결론 및 시사점)
본 연구는 Sampled-Token OPD의 엔트로피 감소 경로를 이론적으로 규명하고, 효율적인 다양성 보존 방법론인 IDA-OPD를 성공적으로 설계하였습니다. 이 연구는 모델 post-training 과정에서 연산 비용을 증가시키지 않으면서도 모델의 생성 다양성을 유지할 수 있음을 보여주었습니다. 이는 대규모 언어 모델의 추론 능력 향상을 위한 효율적인 정렬(alignment) 전략으로서 학계와 산업계 모두에 실질적인 기여를 할 것으로 기대됩니다.
⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.
관련 포스트
- [논문리뷰] Does On-Policy Distillation Really Distill? From Noisy Teacher to Self-Improvement
- [논문리뷰] Training Agents to Evolve with Their Harness: TaoLive Digital Avatar Agent Technical Report
- [논문리뷰] Self-OPD: On-Policy Distillation for Flow Matching Models without Teacher
- [논문리뷰] Beyond Imitation: Filtering On-Policy Distillation by Reasoning Progress
- [논문리뷰] Self-Supervised Visual On-Policy Distillation
Review 의 다른글
- 이전글 [논문리뷰] Ignorance or Incompetence? Constructing Knowledge-Gated, Verifiable Tasks for LLM Agents
- 현재글 : [논문리뷰] Influence-Directed Distillation: Solving the Diversity Bottleneck in Sampled-Token On-Policy Distillation
- 다음글 [논문리뷰] Institutional Newspapers Pipeline: Deriving billions of high quality tokens from historical newspapers
댓글