[논문리뷰] Rethinking Critic Learning in PPO: Understanding and Mitigating Value Flattening본 논문은 대규모 언어 모델(LLM)의 PPO 학습 과정에서 critic이 겪는 Value Flattening 현상을 분석하고 이를 해결하고자 합니다.#Review#Proximal Policy Optimization#Reinforcement Learning#Large Language Models#Value Flattening#Sparse Supervision#Critic Learning2026년 9월 16일댓글 수 로딩 중