[논문리뷰] β-OPSD: Deriving with Policy Optimization, Training with Self-Distillation본 논문은 기존의 OPSD가 가지는 취약성과 엔지니어링의 어려움을 해결하는 것을 목표로 합니다. 기존 연구들은 학생 모델이 Privileged Teacher를 직접 모방하도록 강제하며, 학습 과정에서 Reference Policy로부터 얼마나 멀어져야 하는지에 대한 명확한 제어 메커니즘을 제공하지 못합니다 .#Review#On-policy Self-distillation#Policy Optimization#KL-regularization#Logit Interpolation#Return-to-go Credit Assignment2026년 7월 30일댓글 수 로딩 중