본문으로 건너뛰기

[논문리뷰] Distilled Reinforcement Learning for LLM Post-training

링크: 논문 PDF로 바로 열기

메타데이터

저자: Chen Wang, Zhaochun Li, Jionghao Bai, Yining Zhang, Hexuan Deng, Ge Lan, Yue Wang


1. Key Terms & Definitions (핵심 용어 및 정의)

  • OPD (On-Policy Distillation): 학생 모델이 생성한 경로(trajectories)에 대해 교사 모델과의 KL divergence를 최소화하여 지식을 전수하는 방식입니다.
  • Distilled RL: 교사 모델의 지식을 별도의 KL-divergence 손실 없이 RL 목적 함수(objective) 내에 통합하여 토큰 수준의 fine-grained 지침을 제공하는 제안된 프레임워크입니다.
  • Reverse Importance Sampling: 학생 모델의 정책(behavior policy)을 교사 모델의 분포에 맞추기 위해, 교사-학생 간의 토큰 수준 likelihood 비율을 활용하여 학습 신호를 재분배하는 기법입니다.
  • Sequence-level Geometric Normalization: 토큰 수준의 비율을 응답 전체의 기하 평균으로 정규화하여, 교사 모델과 학생 모델 간의 시스템적 척도 차이를 제거하고 상대적인 선호도를 보존하는 기법입니다.

2. Motivation & Problem Statement (연구 배경 및 문제 정의)

본 논문은 기존 RLOPD가 가진 한계를 해결하기 위해 Distilled RL을 제안합니다. RL은 결과 중심의 coarse-grained 보상을 사용하여 credit assignment 문제를 겪으며 새로운 지식 습득에 한계가 있습니다. 반면, OPD는 교사 모델과 학생 모델의 분포가 다를 경우 무조건적인 KL-divergence 최적화가 성능 저하를 초래하는 딜레마를 가집니다. 특히 cross-family 설정에서 이러한 분포 불일치는 효율적인 지식 전수를 어렵게 만듭니다 [Figure 1].

3. Method & Key Results (제안 방법론 및 핵심 결과)

본 논문은 교사 모델의 지식을 RL의 gradient에 직접 통합하여 선택적인 fine-grained 가이드를 제공하는 Distilled RL을 제안합니다 [Figure 1]. 이 방법론은 세 가지 핵심 구성 요소로 이루어집니다: 교사-학생 간 likelihood 비율을 재조정하는 Reverse importance sampling, 긍정적 보상(positive advantage) 응답에만 교사 정보를 적용하고 부정적 샘플은 원래의 RL 보상을 유지하는 Negative sample reset, 그리고 시퀀스 단위로 가중치를 정규화하는 Sequence-level geometric normalization입니다. 실험 결과, Distilled RLDSQW-1.5B 모델 기준 Pass@1 점수에서 기존 OPD 대비 4.73점, RL 대비 3.14점 향상된 성능을 기록하였습니다 [Table 2]. 또한 Qwen3-4B 학생 모델에서도 모든 베이스라인을 상회하며, 특히 cross-family distillation 환경에서 우수한 안정성과 성능을 입증하였습니다 [Figure 5].

4. Conclusion & Impact (결론 및 시사점)

Distilled RL은 무조건적인 KL 기반 모방 학습 대신, RL 목적 함수 내에서 교사의 선호도를 선택적으로 반영함으로써 효율적인 지식 전수를 가능하게 합니다. 본 연구는 정성적 사례 연구를 통해 모델이 단순 보상을 넘어 교사의 분포 특성(예: 엔트로피)을 학습할 수 있음을 입증하였습니다. 이 프레임워크는 대규모 언어 모델의 post-training 과정에서 모델 아키텍처가 다른 경우에도 안정적인 성능 향상을 보장하며, 향후 다양한 reasoning 모델 최적화 연구에 핵심적인 토대를 제공할 것으로 기대됩니다.


Part 2: 중요 Figure 정보

Figure 1: Distilled RL의 전체 프레임워크

Figure 1 — Distilled RL의 전체 프레임워크

Figure 5: 학습 동학 비교

Figure 5 — 학습 동학 비교

Figure 4: 엔트로피 기반 정보 전수 사례

Figure 4 — 엔트로피 기반 정보 전수 사례

⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.

댓글

관련 포스트

Review 의 다른글