본문으로 건너뛰기

[논문리뷰] Bellman Policy Optimization

링크: 논문 PDF로 바로 열기

저자: Zhuoqing Song, Haotian Xu, Xikun Zhang, Lidong Bing

1. Key Terms & Definitions (핵심 용어 및 정의)

  • Reinforcement Learning with Verifiable Rewards (RLVR): Large Language Models (LLMs)의 추론 능력 향상을 위해 task-specific verifier가 생성된 응답에 outcome-level rewards를 부여하여 모델을 훈련하는 방법론.
  • Policy Mirror Descent (PMD): Action values와 divergence penalty를 사용하여 policy를 업데이트하는 일반적인 최적화 프레임워크.
  • Bellman Policy Optimization (BPO): PMD에서 파생된 critic-free policy optimization method로, Bellman equations를 활용하여 중간 상태의 value estimation 없이 trajectory-level objective를 최적화한다.
  • Critic-Free: 별도의 value model을 훈련하거나 intermediate states에서의 value 또는 advantage estimate가 필요 없는 방법론을 지칭한다.
  • Mismatch-Correction Weight (ω): BPO loss에서 Group-Relative Policy Optimization (GRPO)의 importance-sampling ratio를 대체하는 가중치로, smoothed ratio of complementary token probabilities로 정의된다.
  • Binary KL Divergence: Full KL divergence를 근사하기 위해 주어진 action과 그 complement로 action space를 이분화하여 사용하는 방법.

2. Motivation & Problem Statement (연구 배경 및 문제 정의)

본 논문은 Large Language Models (LLMs)의 추론 능력을 향상시키기 위한 Reinforcement Learning with Verifiable Rewards (RLVR) 접근 방식에서 발생하는 policy optimization의 비효율성 문제를 해결한다. 기존 연구들은 RLVR에서 policy optimization 선택이 추론 성능과 훈련 안정성에 상당한 영향을 미친다는 것을 보여주었다. 특히, Policy Mirror Descent (PMD)와 같은 방법론을 autoregressive generation에 직접 적용하기 위해서는 intermediate states에서의 value estimation이 필수적이다. 이러한 value estimate는 일반적으로 별도의 value model 훈련을 요구하는데, 이는 memory 및 computational costs를 증가시키며, reasoning tasks에서는 학습된 value estimate의 정확도가 낮을 수 있다는 한계가 존재한다. 따라서, 저자들은 value model을 필요로 하지 않으면서도 동일한 policy update를 수행할 수 있는 PMD의 효과적인 reformulation이 필요하다고 강조한다.

3. Method & Key Results (제안 방법론 및 핵심 결과)

저자들은 PMD에서 파생된 critic-free 정책 최적화 방법인 Bellman Policy Optimization (BPO)를 제안한다. BPO는 autoregressive generation with terminal rewards 환경에서 Bellman equations를 활용하여 PMD를 trajectory-level objective로 재구성한다. 이 재구성된 objective는 intermediate states에서의 value 또는 advantage estimation을 회피하며, 원본 PMD objective와 동일한 unique optimal solution을 가짐을 수학적으로 증명한다. 실용적인 BPO loss는 linearized approximation, group-based estimation, 그리고 Binary KL divergence를 통한 full reverse KL divergence의 근사를 통해 도출된다. 특히, GRPO의 importance-sampling ratio를 smoothed mismatch-correction weight (ω) (1 + ϵ - μ(y_t | x, y_<t)) / (1 + ϵ - π(y_t | x, y_<t)) 로 대체하여 수치적 안정성을 확보한다. BPO loss는 최종적으로 L_BPO(π) = - Â_i * M^i_t * min{sg(ω^i_t), C} * log π(y^i_t | x, y^i_<t) 형태로 정의된다.

실험은 Qwen3-30B-A3B-Base 모델과 DAPO-Math-17k 데이터셋을 사용하여 수학적 추론 벤치마크에서 수행되었다. BPO는 AIME 2024–2026 벤치마크에서 50.5%의 최고 평균 정확도(peak average accuracy)를 달성하며 state-of-the-art 성능을 입증했다. 이는 기존의 강력한 baseline들과 비교했을 때, GRPO-ClipHigher (39.5%) 대비 11.0 percentage points, GSPO (43.5%) 대비 7.0 percentage points, CISPO (47.4%) 대비 3.1 percentage points, 그리고 DPPO (46.4%) 대비 4.1 percentage points 높은 수치이다. 훈련 과정 중 평가 정확도에서도 BPO는 지속적으로 높은 성능을 보였다 [Figure 1]. 400 training steps 이후에도 BPO의 평균 정확도는 49.4%로, 당시 가장 강력한 baseline인 DPPO의 45.5%를 상회했다.

4. Conclusion & Impact (결론 및 시사점)

본 연구는 Reinforcement Learning with Verifiable Rewards (RLVR) 환경에서 LLM의 추론 능력 향상을 위한 Bellman Policy Optimization (BPO)을 성공적으로 제안했다. BPO는 Policy Mirror Descent (PMD)를 critic-free 및 trajectory-level objective로 재구성함으로써, 중간 상태의 value estimation 없이 효율적인 정책 업데이트를 가능하게 했다. 이 방법론은 수학적 추론 벤치마크인 AIME 2024–2026에서 기존의 모든 baseline들을 능가하는 50.5%의 최고 평균 정확도를 기록하며 그 효과를 입증했다. BPO는 3.1%에서 11.0%에 이르는 상당한 성능 향상을 제공하며, 이는 LLM의 추론 능력을 강화하는 데 있어 critic-free 접근 방식의 강력한 잠재력을 보여준다. 이 연구는 RLVR 시스템의 효율성과 안정성을 높이는 데 기여하며, 향후 LLM 기반 reasoning tasks 및 다양한 생성 모델 분야에서 더욱 발전된 정책 최적화 방법론 개발에 중요한 시사점을 제공한다.

⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.

댓글

관련 포스트

Review 의 다른글