[논문리뷰] Beyond Euclidean Clipping: Overcoming Exploration Collapse in LLM RL via Riemannian Isometric Policy Optimization본 논문은 LLM의 추론 성능 향상을 위한 RL 학습에서 발생하는 Exploration Collapse 문제를 해결하는 것을 목표로 한다.#Review#Reinforcement Learning#Large Language Models#Riemannian Manifold#Policy Optimization#Exploration Collapse#Geometric Isometry#PPO2026년 7월 22일댓글 수 로딩 중