[논문리뷰] InSight-doc: Agentic Visual Perception for Long-Document Understanding
링크: 논문 PDF로 바로 열기
메타데이터
저자: Kaican Li, Weiyan Xie, Lewei Yao, Jiannan Wu, Lanqing Hong, Yongxiang Huang, Nevin L. Zhang
1. Key Terms & Definitions (핵심 용어 및 정의)
- InSight-doc: 긴 문서 이해를 위해 저해상도 개요에서 시작하여 필요한 영역을 고해상도로 확대(Zoom-in)하며 추론하는 End-to-End 에이전트 프레임워크입니다.
- Context Rot: 긴 컨텍스트 입력 시 모델의 주의력이 희석되어 성능이 급격히 저하되는 현상으로, 본 논문은 이를 해결하기 위해 필요한 정보에만 집중하는 방식을 취합니다.
- Agentic Visual Perception: 고정된 전체 문서를 처리하는 대신, 모델이 스스로 시각적 증거를 탐색하고 획득하며 추론하는 능동적 인지 과정을 의미합니다.
- Multimodal CoT (Chain-of-Thought): 추론 과정 중 언어적 사고와 시각적 도구 호출(Zoom-in 등)을 결합한 일련의 멀티모달 추론 체인을 말합니다.
2. Motivation & Problem Statement (연구 배경 및 문제 정의)
본 논문은 긴 문서(Long-document) 이해 작업에서 발생하는 과도한 추론 비용과 Context Rot 문제를 해결하고자 합니다. 기존의 MLLM 기반 접근 방식은 전체 문서를 고해상도로 입력받아 처리하는데, 이는 O(N^2) 수준의 시간 복잡도를 야기하며 매우 비효율적입니다 [Figure 1]. 또한, 단순히 긴 문맥을 입력하는 방식은 주의력 희석을 초래하여 모델의 정확도를 떨어뜨립니다. 이에 저자들은 문서의 전체 개요에서 시작하여 필요한 부분만 선별적으로 확대하는 능동적 인지 프레임워크인 InSight-doc을 제안합니다 [Figure 2].

Figure 1 — 모델 성능 및 효율 개선 요약

Figure 2 — InSight-doc의 동작 원리
3. Method & Key Results (제안 방법론 및 핵심 결과)
InSight-doc은 저해상도 문서 뷰에서 시작하여, 추론 도중 필요에 따라 고해상도 영역을 Zoom-in 도구로 호출하는 End-to-End 프레임워크를 사용합니다 [Figure 2]. 저자들은 17.9K의 SFT 데이터와 19.2K의 RL 데이터를 구축하여 모델이 능동적인 시각적 탐색(Visual search)을 수행하도록 학습시켰습니다 [Figure 3]. SFT+RL 학습을 통해 InSight-doc-8B 모델은 기존 베이스라인 대비 문서 VQA 벤치마크에서 4.3~16.4 Accuracy points 향상을 달성하였습니다. 특히 긴 문서 처리 환경에서 할루시네이션(Hallucination)을 40% 이상 감소시켰으며, 추론 지연 시간(Latency)을 41%~68% 단축하는 성과를 보였습니다 [Table 1].

Figure 3 — 데이터 구축 파이프라인
4. Conclusion & Impact (결론 및 시사점)
본 논문은 능동적 시각 인지 프레임워크가 긴 문서 이해 작업의 효율성과 정확도를 동시에 극대화할 수 있음을 증명합니다. InSight-doc은 외부 검색 도구 없이도 인터리브된 멀티모달 CoT를 통해 복잡한 다중 문서 질의를 효과적으로 해결합니다. 이러한 방식은 대규모 언어 모델이 고정된 컨텍스트 입력의 한계를 극복하고, 필요한 시각적 정보에 자원을 집중하는 지능형 에이전트로 진화하는 데 중요한 시사점을 제공합니다.
⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.
관련 포스트
- [논문리뷰] iVGR: Internalizing Visually Grounded Reasoning for MLLMs with Reinforcement Learning
- [논문리뷰] Faithful GRPO: Improving Visual Spatial Reasoning in Multimodal Language Models via Constrained Policy Optimization
- [논문리뷰] Video-Thinker: Sparking 'Thinking with Videos' via Reinforcement Learning
- [논문리뷰] OneEmo: A Unified Multimodal Reasoning Model for Emotion Perception, Understanding, and Interaction
- [논문리뷰] ChronoVision: Temporal Reasoning via Latent State Reconstruction
Review 의 다른글
- 이전글 [논문리뷰] Ex-Omni-2D: Expressive Omni-Modal Dialogue Models with Native Visual Presence
- 현재글 : [논문리뷰] InSight-doc: Agentic Visual Perception for Long-Document Understanding
- 다음글 [논문리뷰] JigShape: Evaluating Visual-Geometric Reasoning in VLMs through Jigsaw Puzzles
댓글