[논문리뷰] DeepVoyager-VL: Incentivizing Vision-in-the-Loop Search for Long-Horizon Multimodal Agents
링크: 논문 PDF로 바로 열기
메타데이터
저자: Huanyao Zhang, Jiepeng Zhou, Runhao Zhao, Yanzhe Shan, Jiaoyang Chen, et al.
1. Key Terms & Definitions (핵심 용어 및 정의)
- Vision-in-the-Loop Search: 새로 획득한 시각적 정보가 검색 프로세스의 중간 단계에서 의사결정에 직접적으로 관여하여 후속 쿼리를 유도하는 검색 패러다임입니다.
- EventVoyage-VL: 시각적으로 풍부한 다중 모달 이벤트 그래프를 기반으로, 복잡한 중간 시각적 종속성을 가진 데이터를 합성하는 파이프라인입니다.
- Active Visual Acquisition: 에이전트가 검색 중 필요한 이미지만 선택적으로 로드하고, 중요 정보를 캡처하여 시각적 컨텍스트를 관리하는 메커니즘입니다.
- Multimodal Event Graph: 시공간적, 인과적 연관성을 바탕으로 이벤트와 관련 시각적 증거를 구조화한 데이터 네트워크입니다.
2. Motivation & Problem Statement (연구 배경 및 문제 정의)
본 논문은 기존의 MLLM 기반 검색 에이전트가 지닌 고정된 파라미터 지식의 한계와 복잡한 장기적(long-horizon) 검색 과제에서의 부적합성을 해결하고자 합니다. 기존 방식들은 시각 정보를 단순히 입력 단계나 답변 생성 직전에만 활용하여, 검색 과정에서 발견된 이미지가 다음 단계의 검색을 주도하는 'loop' 구조를 학습하지 못하는 문제가 있습니다 [Figure 1]. 저자들은 이러한 한계로 인해 깊이 있는 다중 턴 검색과 복합적인 시각적 추론이 제약받고 있음을 지적합니다.
3. Method & Key Results (제안 방법론 및 핵심 결과)
본 논문은 DeepVoyager-VL이라는 새로운 프레임워크를 제안하며, 이는 구조화된 시각적 종속성을 포함한 데이터를 합성하고 에이전트가 능동적으로 시각적 증거를 확보하도록 설계되었습니다 [Figure 2]. 저자들은 EventVoyage-VL 파이프라인을 통해 중간 단계의 시각적 증거가 반드시 필요한 장기적 질문들을 합성하고, Supervised Fine-Tuning (SFT)만을 사용하여 강화학습 없이도 에이전트의 성능을 최적화했습니다. 실험 결과, DeepVoyager-VL-30B-A3B 모델은 10개의 다중 모달 검색 벤치마크에서 기존 SOTA 에이전트들 대비 압도적인 성능 향상을 보였습니다 [Table 1]. 특히, VisBrowse-Bench와 같은 검색 집중형 과제에서 기존 베이스라인 대비 평균 17.9% 이상의 성능 향상을 달성하며, 복합적 시각적 증거를 다루는 에이전트의 효과를 입증했습니다 [Table 2].
4. Conclusion & Impact (결론 및 시사점)
본 연구는 장기적 다중 모달 검색에서 시각적 증거가 검색 과정을 주도하는 'vision-in-the-loop' 패러다임의 유효성을 성공적으로 입증하였습니다. 이 프레임워크는 외부 도구 활용과 시각적 정보 관리를 결합하여 복잡한 개방형 세계 문제에 대한 에이전트의 대응력을 비약적으로 높였습니다. 향후 본 연구는 단순 검색을 넘어 다중 모달 연구(research) 에이전트 분야로 확장될 가능성을 제시하며, 학계 및 산업계의 검색 에이전트 설계에 중요한 설계 원칙을 제공합니다.
Part 2: 중요 Figure 정보

Figure 1 — 다중 모달 검색 데이터 합성 패러다임 비교

Figure 2 — DeepVoyager-VL 프레임워크 전체 아키텍처
⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.
관련 포스트
- [논문리뷰] An AI4AI Framework for Visual Token Pruning
- [논문리뷰] The Illusion of Visual Tool-Use: A Causal Audit of Thinking with Images
- [논문리뷰] NeuPAT: Neuron-aware Plasticity Allocation Tuning for Language-Preserving MLLMs
- [논문리뷰] InSight-doc: Agentic Visual Perception for Long-Document Understanding
- [논문리뷰] SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring
Review 의 다른글
- 이전글 [논문리뷰] DAPD: Dual-Anchored Policy Distillation
- 현재글 : [논문리뷰] DeepVoyager-VL: Incentivizing Vision-in-the-Loop Search for Long-Horizon Multimodal Agents
- 다음글 [논문리뷰] Deferred Exposure of Future Trajectories for Verifiable Reasoning in Autonomous Driving VLMs
댓글