[논문리뷰] RISE: Recursive Improvement via Self-Extrapolating Policy Distillation본 논문은 기존의 RLVR 및 OPD 방식이 겪는 근본적인 한계를 해결하고자 합니다. RLVR은 outcome reward만을 제공하여 token-level의 정교한 학습 신호가 부족하며, OPD는 적절한 teacher 모델의 부재로 인해 distribution mismatch 문제를 겪습니다 .#Review#On-policy Distillation#Policy Gradient#Recursive Improvement#Task Arithmetic#Reinforcement Learning with Verifiable Rewards2026년 9월 6일댓글 수 로딩 중