[논문리뷰] Distill Where You Fail: Recovering Learning Signals of Negative RL-Groups from Adaptive Teacher Guidance
링크: 논문 PDF로 바로 열기
저자: Zhuowen Han, Jinwei Xiao, et al.
1. Key Terms & Definitions (핵심 용어 및 정의)
본 논문에서 다루는 주요 기술 용어는 다음과 같습니다:
- RLVR (Reinforcement Learning with Verifiable Rewards): Large Language Models (LLMs)의 후처리 훈련(post-training)을 위한 표준 패러다임으로, 검증 가능한 보상(verifiable rewards)을 활용합니다.
- GRPO (Group Relative Policy Optimization): RLVR 방법론 중 하나로, 여러 롤아웃(rollout) 그룹에 걸쳐 결과 보상(outcome rewards)을 정규화하여 스칼라 어드밴티지(scalar advantage)를 추정합니다.
- On-Policy Distillation (OPD): 학생 모델(student model)이 자체 롤아웃을 생성하고, 교사 모델(teacher model)의 토큰 수준 로그 확률(per-token log-probabilities)로부터 밀도 있는(dense) 지도 학습 신호(supervision signal)를 받는 지식 증류(knowledge distillation) 기법입니다.
- Negative Zero-Variance Prompts: GRPO 환경에서 모든 롤아웃이 동일한(대개 부정적인) 보상을 받아 어드밴티지가 0이 되어 학습 신호가 소실되는 프롬프트(prompt)를 지칭합니다.
- Supervised Fine-Tuning (SFT): 교사 모델의 데모 데이터(demonstration data)를 사용하여 학생 정책(student policy)이 교사 정책을 모방하도록 훈련하는 기법으로, 순방향 KL 발산(forward KL divergence)을 최소화합니다.
2. Motivation & Problem Statement (연구 배경 및 문제 정의)
LLM의 추론 능력 향상을 위한 RLVR(Reinforcement Learning with Verifiable Rewards) 방법 중 GRPO (Group Relative Policy Optimization)는 단순하고 안정적이지만, 희소한 보상 신호(sparse reward signals)와 Negative Zero-Variance Prompts에서 그래디언트 소실(vanishing gradients) 문제를 겪습니다. 이러한 GRPO의 한계를 해결하기 위해 On-Policy Distillation (OPD)이 토큰 수준의 밀도 있는 지도 학습(dense token-level supervision)을 제공하며 자연스러운 해결책으로 제시되었으나, GRPO와 OPD를 단순히 결합하는 방식은 성능 저하를 초래합니다 [Figure 1]. 이러한 성능 저하의 주요 원인은 세 가지로 분석됩니다: 첫째, 모든 샘플(sample)이 증류(distillation)로부터 이득을 얻는 것은 아니며, 교사 모델의 전문성에 따라 지도 학습의 품질이 달라집니다. 둘째, OPD는 교사 모델 수준으로 너무 빠르게 수렴하여 RL의 탐색 능력(exploratory capacity)을 저해합니다. 셋째, 학생이 생성한 토큰에 대해 교사 모델이 낮은 확률을 부여하여 대부분의 토큰 수준 어드밴티지(token-level advantages)가 음수로 나타나 학습 신호를 억제하는 Advantage Asymmetry 문제가 발생합니다.

Figure 1 — 학습 다이내믹스
3. Method & Key Results (제안 방법론 및 핵심 결과)
본 논문은 GRPO와 OPD의 결합 시 발생하는 문제를 해결하기 위해 RSTG (Recovering Learning Signals via Adaptive Teacher Guidance)를 제안합니다 [Figure 2]. RSTG는 OPD를 가장 중요한 곳에 선택적이고 정밀하게 적용합니다. 첫째, Data Selection and Teacher-Guided Advantage Weighting을 통해 OPD는 학생이 실패하지만 교사가 성공하는 Negative Zero-Variance Prompts에만 제한적으로 적용됩니다 [Figure 3]. 이 과정에서 교사의 mean@8 점수를 사용하여 토큰 수준 OPD 어드밴티지를 동적으로 가중치 부여합니다. 이는 교사의 자신감(confidence)이 높은 토큰에 더 큰 최적화 가중치를 할당하여 신뢰할 수 있는 정책 최적화를 유도합니다. 둘째, Mitigating Premature Convergence via Token Selection을 통해 학생의 entropy가 높거나 교사-학생 divergence가 큰 토큰으로 OPD 그래디언트 업데이트를 제한하여 조기 수렴(premature convergence)을 완화하고 그래디언트 노이즈(gradient noise)를 줄입니다. 셋째, Complementary Supervision on Negative Zero-Variance Prompts를 위해 교사 모델이 미리 생성한 올바른 궤적(correct trajectories)에 대한 보조 SFT (Supervised Fine-Tuning) 손실을 추가합니다. 이는 RL이 학습 신호를 제공하지 못하는 프롬프트에 긍정적인 그래디언트 신호를 주입하고, OPD의 지역성(locality)을 완화하며, Advantage Asymmetry 문제를 해결합니다 [Figure 4, 6].

Figure 2 — RSTG 프레임워크
실험 결과, RSTG는 수학 및 코드 벤치마크에서 Qwen2.5 및 Qwen3 모델 패밀리 전반에 걸쳐 상당한 성능 향상을 달성했습니다. 특히, RSTG는 naive GRPO+OPD 대비 수학 벤치마크에서 +4.02% 및 코드 벤치마크에서 +3.05%의 정확도 향상을 보였습니다. 또한, RSTG는 OPD에 의해 발생하는 Advantage Asymmetry를 완화하고 [Figure 6], 교사 모델로의 수렴 속도를 늦추며, 급격한 Response Length Inflation 문제를 효과적으로 완화하는 것으로 나타났습니다 [Figure 7].

Figure 6 — Advantage 값 비교
4. Conclusion & Impact (결론 및 시사점)
본 연구는 GRPO와 OPD의 단순 결합에서 발생하는 성능 저하 문제를 해결하기 위해 RSTG (Recovering Learning Signals via Adaptive Teacher Guidance)를 제안합니다. RSTG는 학생이 어려워하는 샘플에 대해 교사의 숙련도에 따라 가중치를 부여한 OPD를 선택적으로 적용하고, 토큰 선택을 통해 수렴을 늦추고 노이즈를 줄이며, 보조 SFT 목적 함수를 통해 긍정적인 그래디언트 신호와 전역적인 관점을 제공합니다. 수학 및 코드 도메인의 다양한 벤치마크와 세 가지 모델 쌍에 대한 실험은 RSTG가 표준 GRPO 및 naive GRPO+OPD 기준선 대비 일관된 성능 개선을 입증했습니다. 이 연구는 On-Policy Distillation의 적용 범위를 명확히 하고 교사 전문성이 효과에 미치는 영향을 밝힘으로써, RL과 지식 증류의 통합을 보다 강력하고 효율적으로 만들어 LLM의 추론 능력 향상에 중요한 기여를 합니다. 이러한 접근 방식은 특히 학습 신호가 부족한 Negative Zero-Variance Prompts와 같은 어려운 시나리오에서 LLM의 학습 역량을 강화하는 데 큰 시사점을 제공합니다.
⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.
관련 포스트
- [논문리뷰] SAF-OPD: Stable Advantage Fusion for On-Policy Distillation
- [논문리뷰] A Survey of On-Policy Distillation for Large Language Models
- [논문리뷰] Reference-Free Post-Training of Open Large Language Models for Multilingual Machine Translation
- [논문리뷰] SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs
- [논문리뷰] From Proprietary to Open-Source: Bridging the Distribution Gap via Multi-Agent Protocol Distillation in Agentic Search
Review 의 다른글
- 이전글 [논문리뷰] DRIFT: Derailing Denoising Trajectories of Flow-Matching VLAs with Adversarial Patch Attack
- 현재글 : [논문리뷰] Distill Where You Fail: Recovering Learning Signals of Negative RL-Groups from Adaptive Teacher Guidance
- 다음글 [논문리뷰] Ego2Robot: Scalable Robot Data Synthesis from Egocentric Human Data
댓글