[논문리뷰] On-policy Distillation with Verifiable Reward본 연구는 RLVR의 희소한 보상 신호와 OPD의 순수 분포적 목표 사이의 근본적인 한계를 해결하는 것을 목표로 합니다.#Review#On-policy Distillation#Verifiable Reward#Reinforcement Learning#Reasoning Tasks#ReLU Gating#GRPO2026년 8월 25일댓글 수 로딩 중
[논문리뷰] Low-probability Tokens Sustain Exploration in Reinforcement Learning with Verifiable Reward본 논문은 Verifiable Reward를 사용하는 RL(RLVR) 환경에서 Large Language Model(LLM)의 탐색 능력 저하, 즉 '탐색 붕괴' 문제를 해결하는 것을 목표로 합니다.#Review#Reinforcement Learning#LLM Exploration#Verifiable Reward#Low-Probability Regularization#Reasoning Sparks#Policy Entropy#KL Divergence#Mathematical Reasoning2025년 10월 10일댓글 수 로딩 중