본문으로 건너뛰기

[논문리뷰] Beyond the Stability-Exploration Dilemma: Environmental Regularization for LLM Policy Optimization

링크: 논문 PDF로 바로 열기

메타데이터

저자: Xianlei Zhou, Xiangdi Meng, Yu He, et al.


1. Key Terms & Definitions (핵심 용어 및 정의)

  • RLVR (Reinforcement Learning with Verifiable Rewards): 인간의 피드백 대신 수학적 정답이나 코드 실행 결과와 같은 객관적인 검증 수단을 통해 Reward를 계산하는 학습 설정입니다.
  • Query-KL (QKL): 정책 모델이 생성하는 입력 쿼리(Query)의 분포가 사전 학습된(Pre-RL) 참조 분포로부터 얼마나 벗어났는지를 측정하고 제어하는 정규화(Regularization) 기법입니다.
  • Environment Drift: 학습이 진행됨에 따라 모델이 스스로 쿼리 분포(Policy-induced query distribution)를 변화시켜, 학습 초기 환경과 실제 학습 환경이 불일치하게 되는 현상입니다.
  • Structural Decoupling: 정규화의 역할을 'Action 공간'에서 'Input(Query) 공간'으로 분리하여, 모델의 탐색 능력(Exploration)을 저해하지 않으면서도 정규화를 적용하는 설계 원칙입니다.

2. Motivation & Problem Statement (연구 배경 및 문제 정의)

본 논문은 LLM Policy Optimization 과정에서 발생하는 '안정성-탐색(Stability-Exploration) 딜레마'를 해결하고자 합니다. 기존의 방식은 주로 Action 레벨에서의 Policy-KL을 사용하여 정규화를 수행하는데, 이는 모델의 탐색 범위를 제한하거나 결과적으로 쿼리 분포의 무분별한 드리프트를 방어하지 못하는 한계가 있습니다. 실제 실험 결과, Action-level의 정규화만으로는 Query-level의 KL Divergence가 학습 내내 계속 상승하며 정책의 불안정성을 초래함을 확인하였습니다 [Figure 1]. 따라서 저자들은 정규화의 위치를 입력단으로 옮겨 정책의 탐색 자유도를 보존하면서도 환경적 드리프트를 효과적으로 통제하는 새로운 접근 방식이 필요하다고 주장합니다.

Figure 1: GRPO 학습 중 발생하는 Query-KL과 Policy-KL의 불균형

Figure 1 — GRPO 학습 중 발생하는 Query-KL과 Policy-KL의 불균형

3. Method & Key Results (제안 방법론 및 핵심 결과)

본 논문은 ERPO (Environment-Regularized Policy Optimization)를 제안하며, 이는 Query-KL 정규화와 참조 기반의 Query Reweighting을 결합한 프레임워크입니다 [Figure 2]. ERPO는 모델의 쿼리 가능도(Query likelihood)를 입력단에서 정규화하여 훈련 쿼리 분포가 Pre-RL 참조 분포에서 이탈하는 것을 방지하며, 이때 정규화 기울기가 Response Score에 영향을 주지 않도록 설계되었습니다. 또한, Query Reweighting을 통해 Reference 쿼리에 높은 가중치를 부여함으로써 학습 시 분포 편향을 줄이고 높은 온도(Temperature) 환경에서도 강력한 강건성(Robustness)을 확보합니다. 실험 결과, ERPOGRPO 대비 수학적 추론 벤치마크(AIME, MATH500 등)에서 평균 6.2% 이상의 높은 정확도 향상을 기록하였으며, 특히 고온 샘플링 환경에서 월등히 안정적인 성능을 보였습니다 [Table 1]. 추가적으로, 장기 학습 시에도 GRPO와 달리 성능 급락(Collapse) 현상을 효과적으로 억제하는 결과를 보였습니다 [Figure 5].

Figure 2: 제안 모델 ERPO의 전체 아키텍처

Figure 2 — 제안 모델 ERPO의 전체 아키텍처

Figure 5: 장기 RL 학습 시의 성능 유지력 비교

Figure 5 — 장기 RL 학습 시의 성능 유지력 비교

4. Conclusion & Impact (결론 및 시사점)

본 논문은 정책 정규화를 Action이 아닌 Environment(Input Query) 레벨로 전환함으로써, 학습 과정에서의 분포 드리프트를 근본적으로 제어할 수 있음을 입증하였습니다. ERPO는 별도의 Forward Pass 추가 없이 기존 GRPO, PPO, REINFORCE 등 주요 PG 파이프라인에 즉시 통합 가능한 범용성을 가집니다. 본 연구는 향후 LLM의 RLHF 과정에서 발생하는 정렬 세금(Alignment Tax) 및 환경 불안정성 문제를 해결하는 데 있어 매우 유연하고 강력한 방법론적 토대를 제공합니다.

⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.

댓글

관련 포스트

Review 의 다른글