[논문리뷰] Group Entropy-Controlled Policy Optimization
링크: 논문 PDF로 바로 열기
저자: Guangran Cheng, Chengqi Lyu, Songyang Gao, Wenwei Zhang, Kai Chen
## 1. Key Terms & Definitions (핵심 용어 및 정의)
- GEPO (Group Entropy-Controlled Policy Optimization): 다중 작업 환경에서 작업별 불균형을 해소하기 위해 그룹 단위 엔트로피를 기반으로 비대칭적(Asymmetric) 이점 조정(Advantage Shaping)을 수행하는 최적화 프레임워크입니다.
- Group Entropy (ℋg): 각 프롬프트 그룹의 응답들로부터 계산된 엔트로피 값으로, 해당 작업에 대한 모델의 탐색 상태를 진단하는 지표입니다.
- GRPO (Group Relative Policy Optimization): 그룹 단위로 샘플링된 응답들의 보상을 정규화하여 Advantage를 추정하는 RL 방식입니다.
- Advantage Shaping: 정책 업데이트 시 보상 신호를 직접 조정하는 기법으로, GEPO에서는 엔트로피 수준에 따라 긍정적 혹은 부정적 이점을 동적으로 가감합니다.
## 2. Motivation & Problem Statement (연구 배경 및 문제 정의) 본 논문은 현대 LLM의 Reinforcement Learning 과정에서 발생하는 다중 작업(Multi-task) 간의 최적화 불균형 문제를 해결합니다. 기존의 GRPO는 다양한 도메인이 섞인 학습 데이터에서 개별 작업의 특성을 고려하지 않고 그룹별 Advantage를 정규화하는데, 이로 인해 엔트로피가 서로 다른 작업들 간에 통계적 비교가 불가능한 구조적 편향(Structural Bias)이 발생합니다 [Figure 2]. 특히 고엔트로피 작업에서는 잘못된 응답에 대한 부정적 신호가 지나치게 희석되고, 저엔트로피 작업에서는 과도한 착취(Over-exploitation)로 인해 모델이 정체되는 문제가 존재합니다. 이러한 한계를 극복하기 위해 작업별 엔트로피 상태를 진단하고 학습을 제어할 수 있는 새로운 메커니즘이 필요합니다.

Figure 2 — 도메인별 엔트로피 분포
## 3. Method & Key Results (제안 방법론 및 핵심 결과) 본 연구에서 제안하는 GEPO는 그룹 단위 엔트로피를 이용하여 Adaptive한 임계값을 설정하고, 이를 바탕으로 Asymmetric Advantage Shaping을 수행합니다 [Figure 1]. 구체적으로, 엔트로피가 낮은 그룹에서는 긍정적 Advantage를 감쇄시켜 과도한 착취를 막고, 엔트로피가 높은 그룹에서는 부정적 Advantage를 감쇄시켜 탐색(Exploration)을 보존합니다. 이때 임계값은 학습 단계마다 배치 내 통계량을 Exponential Moving Average로 반영하여 자동 보정되므로 작업별 별도 튜닝이 불필요합니다. 실험 결과, Intern-S1-mini 및 Qwen3.5-9B 모델에서 GEPO는 기존 GRPO 및 AEPO, Clip-Cov 대비 우수한 성능을 입증하였습니다. 특히 13개 벤치마크 평균 점수에서 Qwen3.5-9B 기준 71.2점을 기록하며 최고 성능(SOTA)을 달성하였고, 학습 과정에서 발생하는 성능 붕괴(Collapse) 없이 안정적인 수렴 곡선을 보였습니다 [Figure 3].

Figure 1 — GEPO 아키텍처 비교

Figure 3 — 학습 안정성 비교
## 4. Conclusion & Impact (결론 및 시사점) GEPO는 다중 작업 환경에서 그룹 엔트로피를 효과적인 진단 신호로 활용하여 RL의 Exploration-Exploitation trade-off를 작업 단위로 정밀하게 제어하는 기술적 진보를 이루었습니다. 본 연구는 명시적인 작업 레이블이나 추가적인 샘플링 비용 없이도 학습 불균형을 해소할 수 있음을 보였으며, 대규모 언어 모델의 정렬(Alignment) 과정에서 엔트로피 역학을 관리하는 것이 모델의 일반화 성능 유지와 학습 안정성에 필수적임을 시사합니다. 향후 다양한 도메인의 복합적인 LLM 학습 프레임워크에 표준적인 최적화 기법으로 활용될 것으로 기대됩니다.
⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.
관련 포스트
- [논문리뷰] Enhancing Rubric-based RL via Self-Distillation
- [논문리뷰] N-GRPO: Embedding-Level Neighbor Mixing for Enhanced Policy Optimization
- [논문리뷰] FIPO: Eliciting Deep Reasoning with Future-KL Influenced Policy Optimization
- [논문리뷰] Self-Hinting Language Models Enhance Reinforcement Learning
- [논문리뷰] Reasoning-Aware GRPO using Process Mining
Review 의 다른글
- 이전글 [논문리뷰] GigaChat Audio: Time-aware Large Audio Language Model
- 현재글 : [논문리뷰] Group Entropy-Controlled Policy Optimization
- 다음글 [논문리뷰] HOMIE: Human-object Centric Video Personalization via Multimodal Intelligent Enchancement
댓글