[논문리뷰] Rethinking On-Policy Distillation of Large Language Models II: One Training Example본 논문은 LLM의 후처리(post-training) 과정에서 널리 활용되는 On-policy Distillation (OPD) 방법론에서 훈련 데이터(training data)의 역할이 불분명하다는 핵심 문제를 제기합니다.#Review#On-policy Distillation (OPD)#Large Language Models (LLMs)#State Coverage#Absorption Rate#Data Efficiency#One-shot Learning#Multi-teacher OPD (MOPD)2026년 9월 3일댓글 수 로딩 중