[논문리뷰] Weak-to-Strong Generalization via Direct On-Policy Distillation본 논문은 대규모 언어 모델의 post-training 단계에서 발생하는 RLVR(Reinforcement Learning with Verifiable Rewards)의 높은 컴퓨팅 비용 문제를 해결하고자 합니다.#Review#Weak-to-Strong Generalization#Reinforcement Learning#On-Policy Distillation#Policy Shift#Implicit Reward#Post-Training#Large Language Models2026년 7월 13일댓글 수 로딩 중