[논문리뷰] TGRL: Temperature-Grouped Reinforcement Learning for Efficient Exploration in LLMs
링크: 논문 PDF로 바로 열기
메타데이터
저자: Zihan Lin, Xiaohan Wang, Jie Cao, Jiajun Chai, Wei Lin, Guojun Yin, Ran He
1. Key Terms & Definitions (핵심 용어 및 정의)
- RLVR (Reinforcement Learning with Verifiable Rewards): 자동 검증 가능한 결과를 기반으로 모델의 추론 능력을 개선하는 RL post-training 패러다임.
- Exploration Gain: 고온(High-temperature) 탐색 그룹과 저온(Low-temperature) 참조 그룹 간의 Reward 차이를 통해 산출되는, 탐색 활동이 정책 성능 향상에 기여하는 정도.
- JS-based Credit Allocation: Jensen–Shannon (JS) divergence를 활용하여 고온/저온 간 확률 분포 차이가 큰 위치(토큰)를 식별하고, 해당 위치에 정책 업데이트를 위한 Credit을 집중 할당하는 기법.
- Mixed-temperature Grouping: 각 prompt에 대해 rollouts를 저온(Reference)과 고온(Exploration) 서브셋으로 분할하여 Reward Contrast를 극대화하는 방식 [Figure 1].
2. Motivation & Problem Statement (연구 배경 및 문제 정의)
본 연구는 LLM의 RLVR 학습 과정에서 효율적인 탐색(Efficient Exploration)이 부족하여 모델이 로컬 최적해에 머무르는 문제를 해결하고자 한다. 기존의 탐색 전략들은 Test-time scaling을 통해 샘플 수를 늘리거나, 단순한 온도 조절에 의존함으로써 불필요한 연산 비용을 발생시키거나 탐색으로 얻은 이득을 정량화하지 못하는 한계가 있다. 저자들은 탐색을 위한 샘플링 개입과 탐색 이득에 대한 명시적 추정이 결합되어야 효율적인 정책 개선이 가능하다고 판단하였다. 이에 따라, 탐색 과정에서 유도된 다양성을 명시적인 학습 신호로 전환하는 새로운 프레임워크가 요구된다 [Figure 1].
3. Method & Key Results (제안 방법론 및 핵심 결과)
본 논문은 TGRL (Temperature-Grouped Reinforcement Learning) 프레임워크를 제안한다. TGRL은 각 prompt에 대해 저온 참조 그룹과 고온 탐색 그룹을 형성하여 Reward Contrast를 계산함으로써, 탐색 이득(Exploration Gain)을 prompt 단위로 추정한다. 이어서, 동일한 Logit에서 계산된 JS divergence를 통해 모델의 다음 토큰 분포가 온도 변화에 민감하게 반응하는 위치를 식별하고, 이 위치들에 정책 그래디언트 Credit을 차등적으로 할당한다. 고온 그룹의 Advantage는 추정된 탐색 이득을 포함하며, 이를 통해 더 나은 탐색 경로에 대한 최적화를 유도한다.
실험 결과, TGRL은 추가적인 Rollout Budget 없이도 강력한 RLVR 베이스라인 대비 최대 36% 더 빠르게 동일 정확도에 도달하였다. 11개의 벤치마크 평가에서 TGRL은 32B 모델 기준 수학 벤치마크 평균을 1.6% 향상시켰고, CodeForces 레이팅을 196.7점 상승시켰으며, LiveCodeBench Pass@16에서 4.4%의 성능 개선을 기록하였다 [Table 1, Table 2].
4. Conclusion & Impact (결론 및 시사점)
TGRL은 온도 기반의 탐색 다양성을 명시적인 Token-level Credit으로 변환하는 이론적이고 실용적인 방법을 제시함으로써 RLVR 분야의 탐색 효율성을 비약적으로 개선하였다. 본 연구의 결과는 제한된 컴퓨팅 자원 내에서 LLM의 추론 및 코드 생성 능력을 극대화하고자 하는 학계와 산업계에 중요한 시사점을 제공한다. 향후 고도의 탐색이 필요한 복잡한 Reasoning Task에서 TGRL의 설계 원리가 표준적인 강화학습 아키텍처로 자리 잡을 것으로 기대된다.
Part 2: 중요 Figure 정보

Figure 1 — TGRL의 전체 프레임워크
⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.
관련 포스트
- [논문리뷰] Surprising Success, Repeated Failure: Entropy-Guided Credit Assignment for Exploration in LLM Reasoning
- [논문리뷰] Is Next-Chunk Reasoning RL Really Better than SFT? Revisiting Training Strategies under no-CoT Data
- [논문리뷰] The Unlearnability Phenomenon in RLVR for Language Models
- [논문리뷰] Nudging Beyond the Comfort Zone: Efficient Strategy-Guided Exploration for RLVR
- [논문리뷰] ThinkTwice: Jointly Optimizing Large Language Models for Reasoning and Self-Refinement
Review 의 다른글
- 이전글 [논문리뷰] SoL-Refiner: Speed-of-Light One-Step Refinement for High-Resolution Video
- 현재글 : [논문리뷰] TGRL: Temperature-Grouped Reinforcement Learning for Efficient Exploration in LLMs
- 다음글 [논문리뷰] TabFM: A Zero-Shot Foundation Model for Tabular Data
댓글