[논문리뷰] DAPD: Dual-Anchored Policy Distillation본 논문은 OPSD 과정에서 발생하는 Privilege Illusion 문제를 해결하기 위해 고안되었습니다. 기존 연구들은 privileged information을 직접 활용하거나, 교사 신호를 선별적으로 재가중하는 방식을 취했으나, 이는 근본적인 정보 비대칭성을 해결하지 못하는 한계가 있습니다 .#Review#Policy Distillation#Language Model Post-training#Information Asymmetry#Privilege Illusion#Reasoning Models#On-policy Distillation2026년 8월 3일댓글 수 로딩 중
[논문리뷰] Pass the Baton: Trajectory-Relayed On-Policy Distillation본 논문은 OPD 과정에서 발생하는 Prefix Failure 문제를 해결하기 위해 고안되었습니다.#Review#On-Policy Distillation#Prefix Failure#Speculative Decoding#Mathematical Reasoning#Knowledge Distillation#Language Model Post-training2026년 7월 28일댓글 수 로딩 중
[논문리뷰] ReNIO: Reweighting Negative Trajectory Importance for LLM On-Policy Distillation본 논문은 표준 OPD 및 OPSD가 모든 SGO를 균등하게 취급하여 효율적인 학습 기회를 놓치고 있다는 점을 문제로 지적합니다.#Review#On-Policy Distillation#Language Model Post-training#Sample Reweighting#Negative Trajectory#Reasoning#Knowledge Distillation#Prefix-based Training2026년 6월 24일댓글 수 로딩 중