[논문리뷰] DAPD: Dual-Anchored Policy Distillation본 논문은 OPSD 과정에서 발생하는 Privilege Illusion 문제를 해결하기 위해 고안되었습니다. 기존 연구들은 privileged information을 직접 활용하거나, 교사 신호를 선별적으로 재가중하는 방식을 취했으나, 이는 근본적인 정보 비대칭성을 해결하지 못하는 한계가 있습니다 .#Review#Policy Distillation#Language Model Post-training#Information Asymmetry#Privilege Illusion#Reasoning Models#On-policy Distillation2026년 8월 3일댓글 수 로딩 중
[논문리뷰] DOPD: Dual On-policy Distillation본 논문은 OPD 환경에서 특권 정보를 주입할 때 발생하는 Privilege Illusion 문제를 해결하고자 합니다.#Review#On-policy Distillation#Privileged Information#Privilege Illusion#Advantage-aware#Dual Distillation#Large Language Model#Vision-Language Model2026년 6월 30일댓글 수 로딩 중