[논문리뷰] UP: Unbounded Positive Asymmetric Optimization for Breaking the Exploration-Stability Dilemma본 연구는 기존 RL 프레임워크가 사용하는 Importance Sampling (IS) 기반의 클리핑 메커니즘이 LLM의 복잡한 추론 경로 탐색을 구조적으로 제한한다는 문제를 해결합니다.#Review#Reinforcement Learning#Large Language Models#Exploration-Stability Dilemma#Importance Sampling#Asymmetric Optimization#Probability Capacity2026년 7월 9일댓글 수 로딩 중