[논문리뷰] SPOT: Sparse Probing and Outcome Calibration for On-Policy Distillation본 논문은 기존 OPD가 교사 모델의 불확실한 토큰에 대해 Reverse-KL 손실 함수를 사용함으로써, 교사가 제시하는 다양한 합리적 대안들을 충분히 포괄하지 못하는 문제(mode-seeking behavior)를 해결하고자 합니다.#Review#On-Policy Distillation#Language Model#Uncertainty-Aware#Sparse Probing#Outcome Calibration#Reasoning Benchmarks#Knowledge Distillation2026년 8월 10일댓글 수 로딩 중