본문으로 건너뛰기

[논문리뷰] Weak-to-Strong Generalization via Direct On-Policy Distillation

링크: 논문 PDF로 바로 열기

메타데이터

저자: Shiyuan Feng, Huan-ang Gao, Haohan Chi, et al.


1. Key Terms & Definitions (핵심 용어 및 정의)

  • Direct-OPD (Direct On-Policy Distillation): 스몰 모델의 RL 학습 전후 체크포인트 간 policy shift를 추출하여, 이를 타겟 모델(Student)의 온-정책(On-policy) 상태에서 학습 신호로 활용하는 weak-to-strong 학습 기법입니다.
  • Policy Shift ($\Delta_T$): Post-RL 교사 모델과 Pre-RL 참조 모델 간의 로그 확률 차이($\log \pi_T - \log \pi_{T_{\text{ref}}}$)로 정의되며, RL이 학습시킨 개선 방향을 나타내는 일종의 implicit reward입니다.
  • Adaptive KL Control: Direct-OPD 학습 과정에서 전송되는 보상 신호의 스케일 차이를 보정하기 위해, 배치 단위의 평균 보상(sign of the dense reward)에 따라 KL 계수 $\alpha$를 동적으로 조절하는 매커니즘입니다.

2. Motivation & Problem Statement (연구 배경 및 문제 정의)

본 논문은 대규모 언어 모델의 post-training 단계에서 발생하는 RLVR(Reinforcement Learning with Verifiable Rewards)의 높은 컴퓨팅 비용 문제를 해결하고자 합니다. 기존에는 강력한 모델을 개선하기 위해 해당 모델 자체로 많은 롤아웃을 수행해야 했으며, 이는 모델 스케일이 커질수록 학습 병목 현상을 유발합니다. 저자들은 작은 모델에서 RL을 수행한 뒤, 그 학습 결과를 더 큰 모델로 전송하는 weak-to-strong 패러다임을 제안합니다. 기존의 일반적인 OPD는 스몰 모델의 최종 정책을 그대로 모방하여 스몰 모델의 용량 한계까지 전송하는 문제가 있어, 더 성능이 좋은 타겟 모델의 성능을 저하시키는 한계가 있습니다 [Figure 1].

Figure 1: Direct-OPD 개요 및 성능 비교

Figure 1 — Direct-OPD 개요 및 성능 비교

3. Method & Key Results (제안 방법론 및 핵심 결과)

본 논문은 스몰 모델의 RL 학습 결과인 policy shift만을 추출하여 타겟 모델에 적용하는 Direct-OPD를 제안합니다. 이 방법은 교사 모델의 RL 학습으로 인해 특정 토큰이 강화되거나 억제된 방향성을 implicit reward로 해석하여, 타겟 모델이 자신의 온-정책 상태에서 해당 방향으로 정책을 최적화하도록 합니다 [Figure 1]. 실험 결과, Direct-OPDQwen3-1.7B 모델의 AIME 2024 성능을 48.3%에서 58.3%로 크게 향상시켰으며, 이는 8개의 A100 GPU에서 단 4시간 만에 달성되었습니다 [Table 1]. 또한, R1-Distill-7B와 같은 더 큰 모델에서도 기존의 direct RL 방식보다 적은 비용으로 우수한 성능을 입증하였습니다 [Figure 3]. 특히, 독립적인 RL 학습에서 얻은 서로 다른 policy shift를 순차적으로 조합하여 하나의 모델에 누적 적용하는 sequential composition 역시 가능함을 보였습니다 [Figure 4].

Figure 3: Direct-OPD와 Direct RL 비용-효율성 비교

Figure 3 — Direct-OPD와 Direct RL 비용-효율성 비교

4. Conclusion & Impact (결론 및 시사점)

본 연구는 RL 학습 결과물이 단지 모방의 대상이 아니라, 모델 규모를 초월하여 전송 가능한 implicit reward 신호로 활용될 수 있음을 증명합니다. Direct-OPD는 강력한 모델을 새로 RL 학습시키는 대신, 비용 효율적인 스몰 모델의 RL 경험을 재사용함으로써 대규모 언어 모델의 post-training 효율성을 극대화합니다. 이는 향후 모델 학습의 컴퓨팅 자원 제약을 극복하고, 모델 스케일링과 무관하게 지식을 효과적으로 전이할 수 있는 핵심적인 학습 프레임워크로 자리 잡을 것으로 기대됩니다.

Figure 2: 다양한 모델/학습 세팅에서의 전이 성능

Figure 2 — 다양한 모델/학습 세팅에서의 전이 성능

⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.

댓글

관련 포스트

Review 의 다른글