[논문리뷰] Annotations as Rollouts: Efficient and Scalable Reinforcement Learning for Video MLLMs본 논문은 Video MLLM의 후속 학습(Post-training) 과정에서 발생하는 표본 효율성 저하와 확장성 문제를 해결하고자 합니다. 기존 강화학습 방식인 GRPO는 어노테이션을 단순한 스코어링 참조용으로만 사용하여 정작 모델이 학습해야 할 정확한 정답 지점(예: 시간, 좌표, 마스크)을 찾는 데 한계를 보입니다.#Review#Multimodal Large Language Models#Video Perception#Reinforcement Learning#Sample Efficiency#Oracle#Advantage Inversion#Annotation-as-Rollout2026년 8월 25일댓글 수 로딩 중
[논문리뷰] MVU-Eval: Towards Multi-Video Understanding Evaluation for Multimodal LLMs본 연구는 기존 MLLM 평가 벤치마크가 단일 비디오 이해에만 초점을 맞추어 실세계의 다중 비디오 시나리오(예: 스포츠 분석, 자율 주행)의 중요성을 간과하는 한계를 해결하고자 합니다. 이를 위해 MLLM 의 다중 비디오 이해 능력을 종합적으로 평가할 수 있는 최초의 벤치마크인 MVU-Eval 을 제안합니다.#Review#Multimodal Large Language Models (MLLMs)#Multi-Video Understanding#Evaluation Benchmark#Video Perception#Video Reasoning#Sports Analytics#Autonomous Driving2025년 11월 10일댓글 수 로딩 중