[논문리뷰] VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation본 논문은 기존의 다중 모달(multimodal) OPD 방법론들이 교사 모델의 예측 교정을 그대로 증류(distill)함으로써 발생하는 source-mixed 문제를 해결하고자 합니다.#Review#Multimodal On-Policy Distillation#Visual Attribution#Counterfactual Target Reconstruction#Privileged Distillation#Visual Evidence#LLM2026년 8월 3일댓글 수 로딩 중
[논문리뷰] Skill0.5: Joint Skill Internalization and Utilization for Out-of-Distribution Generalization in Agentic Reinforcement Learning본 논문은 에이전트의 효율적인 기술 습득과 OOD 환경에서의 범용성 확보를 위해 기술의 종류에 따른 차별화된 처리(Differentiated Treatment)가 필요함을 제기한다.#Review#Agentic Reinforcement Learning#Skill Internalization#Out-of-Distribution Generalization#Difficulty-Aware Routing#Privileged Distillation#Shortcut Learning2026년 5월 28일댓글 수 로딩 중