[논문리뷰] Beyond Euclidean Clipping: Overcoming Exploration Collapse in LLM RL via Riemannian Isometric Policy Optimization본 논문은 LLM의 추론 성능 향상을 위한 RL 학습에서 발생하는 Exploration Collapse 문제를 해결하는 것을 목표로 한다.#Review#Reinforcement Learning#Large Language Models#Riemannian Manifold#Policy Optimization#Exploration Collapse#Geometric Isometry#PPO2026년 7월 22일댓글 수 로딩 중
[논문리뷰] Rewarding the Rare: Uniqueness-Aware RL for Creative Problem Solving in LLMsLLM의 RL 기반 학습에서 발생하는 탐색 붕괴(exploration collapse) 문제를 해결하는 것이 목표입니다.#Review#Reinforcement Learning (RL)#Large Language Models (LLMs)#Exploration Collapse#Strategy-level Diversity#Uniqueness-Aware Rewarding#Creative Problem Solving#Pass@k2026년 1월 15일댓글 수 로딩 중