[논문리뷰] CADENCE: Closing the Reasoning Gap via Coverage-Adaptive On-Policy Distillation본 논문은 소형 모델(Student)이 대형 모델(Teacher)의 복잡한 추론 능력을 전수받는 과정에서 발생하는 세 가지 고질적인 실패 모드(Failure Modes)를 해결하고자 합니다.#Review#Knowledge Distillation#On-Policy Learning#Reasoning Gap#Coverage-Adaptive Scheduling#Per-Token Surrogate#Reward Sparsity#LLM Compression2026년 7월 29일댓글 수 로딩 중