[논문리뷰] Distribution-Aligned Sequence Distillation for Superior Long-CoT Reasoning본 논문은 교사 모델이 생성한 응답에 대한 SFT(Supervised Fine-Tuning) 기반 시퀀스 레벨 증류 패러다임의 세 가지 주요 한계점(교사 분포 표현 부족, 교사-학생 모델 학습 능력 불일치, exposure bias)을 해결하고자 합니다.#Review#Knowledge Distillation#Sequence-level Distillation#Chain-of-Thought Reasoning (CoT)#Large Language Models (LLMs)#Temperature-scheduled Learning#Divergence-aware Sampling#Mixed-policy Distillation#Open-source Models2026년 1월 14일댓글 수 로딩 중