[논문리뷰] When Privileged Guidance Misaligns: State-Matched Routing and Contextualized Self-Distillation for Multi-Turn Agents본 논문은 멀티턴 에이전트 학습에서 Privileged On-Policy Distillation이 직면한 상태-참조 불일치 문제를 해결하고자 합니다.#Review#On-Policy Distillation#Multi-Turn Agents#State-Reference Mismatch#Self-Distillation#State-Matched Routing#Contextualized Guidance#Embodied AI2026년 8월 9일댓글 수 로딩 중