[논문리뷰] Group Adaptive Clipping Policy Optimization본 논문은 RLVR 환경에서 고정된 클리핑 경계가 학습 신호의 비대칭성을 적절히 반영하지 못하는 문제를 해결합니다. 기존 연구들은 롤아웃의 난이도나 그룹 내 정답 개수와 관계없이 일관된 클리핑 임계값을 적용하여, 어려운 문제에서 얻은 귀중한 학습 신호를 가진 롤아웃들을 과도하게 억제하는 경향이 있습니다 .#Review#RLVR#Policy Optimization#Adaptive Clipping#GRPO#Trust Region#Importance Sampling2026년 9월 6일댓글 수 로딩 중
[논문리뷰] Stale but Stable: Staleness-Adaptive Trust Regions for Stabilizing Asynchronous Reinforcement Learning본 논문은 대규모 비동기 강화학습에서 발생하는 training-inference mismatch와 누적된 staleness가 모델 학습의 조기 붕괴(collapse)를 야기한다는 점을 지적합니다.#Review#Asynchronous Reinforcement Learning#Staleness#Trust Region#PPO#Training-Inference Mismatch#Adaptive Clipping#LLM2026년 7월 21일댓글 수 로딩 중
[논문리뷰] BAPO: Stabilizing Off-Policy Reinforcement Learning for LLMs via Balanced Policy Optimization with Adaptive Clipping본 논문은 대규모 언어 모델(LLMs)을 위한 오프-폴리시(off-policy) 강화 학습(RL)의 불안정성 문제를 해결하고자 합니다. 오프-폴리시 RL은 정책 엔트로피 급감, 불안정한 최적화, 그리고 훈련 붕괴로 이어지는 경향이 있어, 샘플 효율성에도 불구하고 LLMs에 적용하기 어렵습니다.#Review#Off-Policy Reinforcement Learning#Large Language Models#Adaptive Clipping#Policy Optimization#PPO#Entropy Preservation#RL Stabilization2025년 10월 23일댓글 수 로딩 중