[논문리뷰] Beyond the Stability-Exploration Dilemma: Environmental Regularization for LLM Policy Optimization본 논문은 LLM Policy Optimization 과정에서 발생하는 '안정성-탐색(Stability-Exploration) 딜레마'를 해결하고자 합니다.#Review#Policy Optimization#LLM#Reinforcement Learning#Query-KL#Stability#Environmental Regularization#Distribution Drift2026년 8월 24일댓글 수 로딩 중