[논문리뷰] Predictive Divergence Masks for LLM RL본 논문은 LLM RL에서 기존 PPO 스타일의 Direction criterion이 갖는 근본적인 불일치 문제를 해결하고자 합니다.#Review#LLM RL#Trust Region#Predictive Divergence Mask#Policy Optimization#Softmax Policy#Direction Criterion2026년 7월 23일댓글 수 로딩 중