본문으로 건너뛰기

[논문리뷰] On-policy Distillation with Verifiable Reward

링크: 논문 PDF로 바로 열기

메타데이터

저자: Wenze Lin, Jiale Zhao, Xitai Jiang, Songde Rao, Yining Li, Shenzhi Wang, Bingxiang He, Gao Huang


1. Key Terms & Definitions (핵심 용어 및 정의)

  • RLVR (Reinforcement Learning with Verifiable Rewards): 결과가 정답인지 여부를 확인할 수 있는 검증기(Verifier)를 통해 획득한 보상을 바탕으로 모델을 최적화하는 학습 패러다임입니다.
  • OPD (On-policy Distillation): 교사 모델(Teacher model)의 출력 분포를 학생 모델(Student model)이 모방하도록 하여 토큰 단위의 밀도 높은 지도 신호를 제공하는 학습 방식입니다.
  • OPDVR (On-policy Distillation with Verifiable Reward): 제안된 방법론으로, sampled-token OPD에 ReLU Gating 메커니즘을 적용하여 모델의 학습 신호와 경로상의 정답 여부를 정렬하는 기법입니다.
  • GRPD (Group Relative Policy Distillation): OPDVR의 확장판으로, 이진 보상 대신 GRPO 스타일의 그룹 단위 상대적 이점(Group-relative advantage)을 활용하여 distillation 신호를 생성합니다.

2. Motivation & Problem Statement (연구 배경 및 문제 정의)

본 연구는 RLVR의 희소한 보상 신호와 OPD의 순수 분포적 목표 사이의 근본적인 한계를 해결하는 것을 목표로 합니다. RLVR은 정확한 작업 성공 여부를 제공하지만 학습 과정에서 신호가 희소하여 credit assignment가 어렵고, OPD는 토큰 단위의 정교한 guidance를 제공하지만 답변의 정오 여부를 고려하지 않아 교사 모델 이상의 성능을 내기 어렵습니다. 기존의 두 패러다임을 결합하려는 시도들은 복잡한 가중치 설정이나 휴리스틱한 스위칭 메커니즘을 사용하여 추가적인 하이퍼파라미터를 야기하는 문제를 안고 있습니다 [Figure 1].

3. Method & Key Results (제안 방법론 및 핵심 결과)

본 논문은 sampled-token OPD의 암묵적 보상을 궤적의 정답 여부와 연계하여 재해석하고, 이를 표준 RLVR 원칙에 맞게 정렬하는 OPDVR을 제안합니다 [Figure 2]. 저자들은 ReLU 게이트를 사용하여 정답 궤적에서는 토큰별로 비음수(non-negative)의 보상을, 오답 궤적에서는 비양수(non-positive)의 보상을 부여하도록 하여 모델이 학습 신호와 작업 성과를 일치시키도록 설계했습니다. 이 메커니즘은 별도의 하이퍼파라미터 추가 없이 distillation 과정에서 잘못된 방향의 업데이트를 효과적으로 차단합니다. 6개의 추론 벤치마크 실험 결과, OPDVR은 기존 sampled-token OPD 대비 일관된 성능 향상을 보였으며, 특히 AIME24 등에서 우수한 성능을 달성했습니다 [Table 1, Table 2]. 또한, GRPD로 확장 시 기존 GRPO 대비 AIME25에서 10.9 포인트의 현격한 성능 향상을 기록하며 방법론의 범용성을 입증했습니다 [Table 3].

4. Conclusion & Impact (결론 및 시사점)

본 논문은 sampled-token OPDRLVR 관점에서 재정의하고, ReLU Gating을 통해 정답 궤적과 오답 궤적에 최적화된 학습 신호를 제공함으로써 distillation 효율을 극대화하는 성과를 거두었습니다. 이 연구는 기존의 개별적인 두 패러다임을 우아하게 통합하여 하이퍼파라미터 튜닝의 번거로움을 제거했다는 점에서 학술적 의미가 큽니다. 향후 LLM의 추론 능력 향상을 위한 post-training 프레임워크 설계에 있어, 작업 성과와 모델 분포 정렬을 동시에 고려하는 본 방식은 표준적인 접근법으로 자리 잡을 것으로 기대됩니다.


Part 2: 중요 Figure 정보

Figure 1: OPDVR 개요 및 성능 결과

Figure 1 — OPDVR 개요 및 성능 결과

Figure 2: OPDVR 방법론 파이프라인

Figure 2 — OPDVR 방법론 파이프라인

Figure 3: 게이팅 메커니즘 절제 실험

Figure 3 — 게이팅 메커니즘 절제 실험

⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.

댓글

관련 포스트

Review 의 다른글