[논문리뷰] Open-MOPD: Diagnosing and Fixing Capability Imbalance in Multi-Teacher On-Policy Distillation본 논문은 멀티 도메인 전문가 모델들을 하나의 범용 모델로 통합하는 M-OPD가 실제로는 성능 저하와 불균형을 겪는다는 사실을 규명하고 이를 해결하고자 합니다.#Review#Multi-Teacher On-Policy Distillation#Capability Integration Gap#Token-Share Balancing#Gap-Following Allocation#Reward Refresh#Reinforcement Learning2026년 8월 26일댓글 수 로딩 중