[논문리뷰] On-policy Distillation with Verifiable Reward본 연구는 RLVR의 희소한 보상 신호와 OPD의 순수 분포적 목표 사이의 근본적인 한계를 해결하는 것을 목표로 합니다.#Review#On-policy Distillation#Verifiable Reward#Reinforcement Learning#Reasoning Tasks#ReLU Gating#GRPO2026년 8월 25일댓글 수 로딩 중