[논문리뷰] Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent본 논문은 현재의 Multimodal Agent들이 비디오 기반의 심층 연구(Video-DR) 환경에서 직면한 두 가지 핵심 문제를 해결하고자 한다. 첫째, 에이전트들이 시각적 도구 사용을 회피하고 텍스트 검색에 의존하는 Modality Bias가 심각하다는 점이다 .#Review#Video-DeepResearch#Multimodal Agent#Spatiotemporal Grounding#GRPO#Modality Bias#Parametric Knowledge Leakage#Tool-augmented Execution2026년 8월 4일댓글 수 로딩 중
[논문리뷰] ReferTrack: Referring Then Tracking for Embodied Visual Tracking본 논문은 Embodied Visual Tracking (EVT) 분야에서 추상적인 공간 Latent를 통한 추론이 실제 이미지 기반 탐지와 불일치하는 문제를 해결하고자 합니다.#Review#Embodied Visual Tracking#Vision-Language-Action Models#Referring Expression#Target Identification#Trajectory Planning#Spatiotemporal Grounding2026년 7월 23일댓글 수 로딩 중