[논문리뷰] Diagnosing and Calibrating Tool-Call Boundary Drift in Multi-Teacher On-Policy Distillation본 논문은 Multi-Teacher On-Policy Distillation 과정에서 발생하는 Tool-Call Boundary Drift 문제를 해결하고자 합니다.#Review#Multi-Teacher On-Policy Distillation#Tool-Call Boundary Drift#Soft Clamp#Behavior Leverage#Generalized Knowledge Distillation2026년 7월 20일댓글 수 로딩 중
[논문리뷰] UI-MOPD: Multi-Platform On-Policy Distillation for Continual GUI Agent LearningGUI agent는 단일 플랫폼을 넘어 다양한 환경(데스크탑, 모바일)으로 확장되고 있으나, 플랫폼 간 이질적인 상호작용 방식과 높은 품질의 교차 플랫폼 궤적 부족으로 인해 학습에 어려움을 겪고 있다 .#Review#GUI Agent#Multi-Teacher On-Policy Distillation#Continual Learning#Cross-Platform#Desktop/Mobile#Reinforcement Learning2026년 7월 6일댓글 수 로딩 중
[논문리뷰] MiMo-V2-Flash Technical Report본 논문은 빠른 추론 속도와 강력한 추론 및 에이전트 능력을 동시에 갖춘 효율적이고 비용 효율적인 대규모 언어 모델(LLM)인 MiMo-V2-Flash를 개발하는 것을 목표로 합니다.#Review#Mixture-of-Experts#Sliding Window Attention#Multi-Token Prediction#Multi-Teacher On-Policy Distillation#Reinforcement Learning#Long-Context Modeling#Agentic AI2026년 1월 6일댓글 수 로딩 중