본문으로 건너뛰기

[논문리뷰] Parameter Exploration for RLVR via Variational Learning

링크: 논문 PDF로 바로 열기

메타데이터

저자: Vatsal Venkatkrishna, Nico Daheim, Iryna Gurevych, et al.

1. Key Terms & Definitions (핵심 용어 및 정의)

  • RLVR (Reinforcement Learning with Verifiable Rewards): 모델이 생성한 출력물에 대해 정답 확인이 가능한 환경(예: 수학 문제, 코드 생성)에서 인간의 데몬스트레이션 없이 강화학습으로 모델을 최적화하는 패러다임입니다.
  • GRPO (Group-Relative Policy Optimization): RLVR에서 널리 사용되는 알고리즘으로, 하나의 프롬프트에 대해 여러 개의 출력을 생성하고, 그룹 내 상대적 보상을 통해 정책을 업데이트합니다.
  • Parameter-Space Exploration: 기존의 action-space 탐색(Temperature scaling 등)과 달리, 정책의 파라미터 자체에 노이즈를 주입하여 출력 분포의 다양성을 확보하는 기법입니다.
  • IVON (Implicit Variational Optimization): 학습 가능한 노이즈 분포를 사용하여 파라미터의 불확실성을 관리하는 옵티마이저로, Hessian 정보를 활용해 가중치 노이즈를 적응적으로 제어합니다.

2. Motivation & Problem Statement (연구 배경 및 문제 정의)

본 논문은 RLVR 환경에서 발생하는 정책의 정체(Stall)와 탐색의 한계를 해결하기 위해 파라미터 공간에서의 탐색 기법을 제안합니다. 기존의 action-space 탐색 방식인 Temperature scaling은 토큰의 상대적 순서를 변경하지 못하며, 지나치게 높은 온도는 토큰 분포를 왜곡시켜 학습을 퇴보시키는 한계가 있습니다 [Figure 1]. 또한, GRPO와 같은 기존 알고리즘은 그룹 내 보상이 모두 동일할 경우 학습 신호를 얻지 못하는 'zero-advantage' 문제로 인해 계산 효율성이 저하되는 현상이 발생합니다. 따라서 저자들은 파라미터 분포를 직접 샘플링하여 더 질 높은 탐색을 수행하는 새로운 접근 방식이 필요함을 강조합니다.

Figure 1: Temperature 대 Weight noise 탐색 비교

Figure 1 — Temperature 대 Weight noise 탐색 비교

3. Method & Key Results (제안 방법론 및 핵심 결과)

본 연구는 3PO (Perturbed Parameter Policy Optimization) 프레임워크를 제안하며, IVON 옵티마이저를 통해 학습된 사후 분포에서 모델 가중치를 샘플링하여 탐색을 유도합니다 [Figure 2]. B3PO는 단계별로 단일 가중치 섭동을 적용하며, M3PO는 다수의 Monte-Carlo 샘플을 통해 그래디언트 분산을 줄이고, C3PO는 그룹을 여러 노이즈 청크로 분할하여 그룹 다양성을 극대화합니다. 실험 결과, C3POOLMo-3-1025-7BQwen2.5-Math-7B 모델에서 기존 GRPO 대비 수학적 추론 및 코드 생성 과제에서 일관된 성능 향상을 보였습니다 [Table 1]. 정량적으로는 어려운 벤치마크인 AIME에서 GRPO 대비 최대 5.83%의 Pass@1 향상을 기록했습니다. 또한, 3PO 방법론은 학습 과정에서 zero-advantage 그룹을 더 효과적으로 구조(rescue)하며, 부적절한(malformed) 결과물 생성 비율을 낮추는 등 훨씬 효율적인 학습 탐색을 실현했습니다 [Figure 3].

Figure 2: 3PO 노이징 전략 개요

Figure 2 — 3PO 노이징 전략 개요

Figure 3: 3PO 탐색 효율성 및 결과 분석

Figure 3 — 3PO 탐색 효율성 및 결과 분석

4. Conclusion & Impact (결론 및 시사점)

본 논문은 파라미터 공간에서의 탐색이 LLM 강화학습의 성능과 학습 효율성을 개선할 수 있는 강력한 레버(Lever)임을 입증했습니다. 특히 C3PO와 같은 chunked noising 전략은 기존 action-space 기반 기법보다 더 우수한 탐색 품질을 제공하며, 학습 정체 문제를 완화하는 효과를 보여주었습니다. 이 연구는 강화학습 모델의 초기화나 기존 체크포인트에 대한 drop-in replacement로 활용될 수 있어 실용적인 가치가 높습니다. 향후 연구에서는 더욱 큰 모델 규모에서의 확장성과 구조화된 사후 분포 추정기 활용이 기대됩니다.

⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.

댓글

관련 포스트

Review 의 다른글