[논문리뷰] 1% of Tokens Can Be Enough: On Gradient Estimation in On-Policy Distillation본 논문은 Sparse OPD에서 발생하는 기울기 추정의 신뢰성 문제를 해결하고자 합니다. 기존의 On-Policy Distillation(OPD) 방법론들은 학생 모델이 생성한 궤적의 모든 토큰에 대해 교사 감독을 적용하거나, 토큰의 '유용성(usefulness)'에 기반하여 중요한 토큰을 선별했습니다.#Review#On-Policy Distillation#Gradient Estimation#Information Geometry#Signal-to-Noise Ratio#Token Selection#Large Language Models#Sparse Supervision2026년 9월 21일댓글 수 로딩 중