[논문리뷰] Surprising Success, Repeated Failure: Entropy-Guided Credit Assignment for Exploration in LLM Reasoning
링크: 논문 PDF로 바로 열기
메타데이터
저자: Woongyeong Yeo, Minki Kang, Chanuk Lee, Sangwoo Park, Jinheon Baek, Sung Ju Hwang
1. Key Terms & Definitions (핵심 용어 및 정의)
- RLVR (Reinforcement Learning with Verifiable Rewards): 결과(outcome) 수준의 피드백을 통해 모델의 추론 능력을 향상시키는 강화학습 기법입니다.
- Policy Entropy: 모델의 다음 토큰 분포에 대한 Shannon entropy로, 토큰 수준의 불확실성과 잠재적인 추론 경로를 나타냅니다.
- EAPO (Entropic Advantage Policy Optimization): 성공과 실패를 비대칭적으로 다루며, entropy와 Advantage 신호를 결합하여 토큰 수준의 기여도를 할당하는 제안 방법론입니다.
- Surprising Success vs. Repeated Failure: 높은 불확실성(High-entropy)에서 나타나는 성공은 재현이 어렵지만, 낮은 불확실성(Low-entropy)에서 발생하는 실패는 반복되는 경향이 있음을 지칭하는 관찰 결과입니다.
2. Motivation & Problem Statement (연구 배경 및 문제 정의)
본 논문은 기존의 RLVR이 전체 trajectory에 대해서만 보상을 할당하여 세밀한 토큰 수준의 학습 피드백을 제공하지 못하는 문제를 해결하고자 합니다. 기존 방식들은 entropy를 단순히 탐색(exploration) 목적으로 사용하거나, 성공과 실패 상황에서 동일한 방식을 적용하여 불필요한 Penalty를 uncertain position에 부여함으로써 오히려 회복 가능한 경로를 차단하는 한계를 보입니다. 저자들은 "성공과 실패에 대해 uncertainty를 다르게 적용해야 한다"는 핵심 가설을 바탕으로, Surprising Success는 강화하고 Repeated Failure는 수정하는 효율적인 credit assignment 방식을 설계합니다 [Figure 1].
3. Method & Key Results (제안 방법론 및 핵심 결과)
EAPO는 토큰 수준의 이점(advantage)을 entropy와 결합하여 비대칭적으로 재가중치(reweighting)를 부여하는 기법입니다. 구체적으로, Advantage가 양수인 성공 시에는 고entropy 토큰에 더 큰 보상을 주어 성공적인 탐색을 고착화하고, Advantage가 음수인 실패 시에는 저entropy 토큰에 더 강한 페널티를 부여하여 자신감 있는 실패를 수정합니다 [Figure 1]. 동시에, 실패 시 고entropy 위치에서의 페널티는 완화(attenuation)하여 모델이 다른 추론 경로로 회복할 기회를 보존합니다 [Equation 4]. 실험 결과, EAPO는 6개의 수학 추론 벤치마크 및 8개의 Reasoning Gym 과제에서 기존 베이스라인인 GRPO, EntropyAdv, RLRT 등을 제괄적으로 능가하였습니다 [Table 2, Table 3]. 특히 Qwen3-4B-Base 및 Qwen3-8B-Base 모델에서 각각 31.0%와 34.0%의 평균 정확도를 달성하며 최고 성능을 입증하였습니다.
4. Conclusion & Impact (결론 및 시사점)
본 연구는 EAPO를 통해 LLM 추론 학습에서 성공과 실패를 구분한 entropy 기반의 비대칭적 credit assignment가 효율적인 탐색을 유도함을 보였습니다. 이 방법론은 별도의 보조 모델이나 외부 정보를 요구하지 않아 확장성이 매우 뛰어납니다. 연구 결과는 단순한 entropy 극대화보다 정책의 불확실성을 상황에 맞춰 최적화하는 것이 모델의 추론 능력 및 문제 해결 범위를 넓히는 데 결정적인 역할을 함을 시사합니다.
⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.
관련 포스트
- [논문리뷰] Nudging Beyond the Comfort Zone: Efficient Strategy-Guided Exploration for RLVR
- [논문리뷰] CAST: Game Solvers as Turn-Level Teachers for LLM Agents
- [논문리뷰] H^2SD: Hybrid Hindsight Self-Distillation
- [논문리뷰] Beyond Entropy: Correctness-Aware Advantage Shaping via Contrastive Policy Optimization
- [논문리뷰] STARE: Surprisal-Guided Token-Level Advantage Reweighting for Policy Entropy Stability
Review 의 다른글
- 이전글 [논문리뷰] Structured Residual Connectivity Matters for Diffusion Transformers
- 현재글 : [논문리뷰] Surprising Success, Repeated Failure: Entropy-Guided Credit Assignment for Exploration in LLM Reasoning
- 다음글 [논문리뷰] TT-VidT: Decoupling the Temporal Axis for Efficient Motion-Centric Video Pretraining
댓글