[논문리뷰] Verifier-Induced Support Reshaping in On-Policy Optimization본 논문은 RLVR 기반의 Post-training 과정에서 특정 Objective를 강화할 때 발생하는 Support Reshaping 문제를 심도 있게 분석합니다 .#Review#On-Policy Optimization#RLVR#Support Reshaping#Continual Learning#Instruction Following#Mathematical Reasoning#Policy Distribution2026년 8월 16일댓글 수 로딩 중