[논문리뷰] Annotations as Rollouts: Efficient and Scalable Reinforcement Learning for Video MLLMs본 논문은 Video MLLM의 후속 학습(Post-training) 과정에서 발생하는 표본 효율성 저하와 확장성 문제를 해결하고자 합니다. 기존 강화학습 방식인 GRPO는 어노테이션을 단순한 스코어링 참조용으로만 사용하여 정작 모델이 학습해야 할 정확한 정답 지점(예: 시간, 좌표, 마스크)을 찾는 데 한계를 보입니다.#Review#Multimodal Large Language Models#Video Perception#Reinforcement Learning#Sample Efficiency#Oracle#Advantage Inversion#Annotation-as-Rollout2026년 8월 25일댓글 수 로딩 중