[논문리뷰] Influence-Directed Distillation: Solving the Diversity Bottleneck in Sampled-Token On-Policy Distillation본 논문은 Sampled-Token OPD가 효율적임에도 불구하고 pass@kk 성능이 정체되는 Diversity Distillation Failure 문제를 해결합니다. 기존 방법론들은 무분별하게 엔트로피를 높이거나, 비용이 높은 Forward-KL을 사용하여 효율성을 저해하는 한계가 있습니다.#Review#On-Policy Distillation#Sampled-Token OPD#Diversity Bottleneck#Entropy Influence#First-Order Analysis#Divergence-Adaptive Shrinkage2026년 9월 2일댓글 수 로딩 중