[논문리뷰] Group Entropy-Controlled Policy Optimization본 논문은 현대 LLM의 Reinforcement Learning 과정에서 발생하는 다중 작업(Multi-task) 간의 최적화 불균형 문제를 해결합니다.#Review#Reinforcement Learning#Large Language Models#Group Entropy#Policy Optimization#GRPO#Alignment#Exploration-Exploitation2026년 7월 20일댓글 수 로딩 중