[논문리뷰] TGRL: Temperature-Grouped Reinforcement Learning for Efficient Exploration in LLMs본 연구는 LLM의 RLVR 학습 과정에서 효율적인 탐색(Efficient Exploration)이 부족하여 모델이 로컬 최적해에 머무르는 문제를 해결하고자 한다.#Review#Reinforcement Learning#Large Language Models#Exploration#Temperature-Grouped#RLVR#Jensen-Shannon Divergence#Credit Allocation2026년 9월 29일댓글 수 로딩 중