[논문리뷰] ReToken: One Token to Improve Vision-Language Models for Visual Retrieval
링크: 논문 PDF로 바로 열기
메타데이터
저자: Yao Xiao, Reuben Tan, Zhen Zhu, Yuqun Wu, Jianfeng Gao, Derek Hoiem
1. Key Terms & Definitions (핵심 용어 및 정의)
- ReToken: 질문 토큰 뒤에 추가되는 학습 가능한 단일 임베딩으로, VLM이 긴 시각적 문맥에서 관련 정보가 포함된 프레임을 식별하도록 돕는 검색 타겟.
- Visual KV Cache: VLM의 추론 과정에서 비디오나 이미지의 시각적 토큰을 처리하여 생성된 Key-Value 상태를 저장하는 메모리 저장소.
- Value Space: 트랜스포머 어텐션 계층에서 토큰 간의 관련성을 결정하는 Query-Key 내적과 달리, 실제 전파되는 콘텐츠 정보를 담고 있는 투영(Projection) 공간.
- Visual Haystacks: 긴 시각적 문맥 속에서 단 하나의 관련 이미지를 찾아내는 능력을 평가하기 위한 벤치마크.
2. Motivation & Problem Statement (연구 배경 및 문제 정의)
본 논문은 긴 시각적 문맥(long visual context)을 처리해야 하는 VLM이 정보량이 많아짐에 따라 성능이 저하되는 문제를 해결하고자 한다. 기존의 Attention-based 검색 방식은 단순히 어텐션 점수를 기반으로 관련 토큰을 선택하는데, 이는 VLM이 애초에 검색이 아닌 다음 토큰 예측(next-token prediction)을 위해 학습되었기 때문에 검색 신호로서 신뢰성이 낮다 [Figure 1]. 또한 전체 시각적 문맥을 한꺼번에 처리하는 것은 GPU 메모리 제약상 비효율적이다. 따라서 저자들은 질문과 관련된 소수의 시각적 토큰만을 선별적으로 활용하는 효율적인 검색 메커니즘이 필요하다고 정의한다.

Figure 1 — 어텐션 점수의 한계
3. Method & Key Results (제안 방법론 및 핵심 결과)
본 논문은 질문 문장에 학습 가능한 ReToken을 추가하고, 이를 최종 계층(final layer)의 Value 벡터와 코사인 유사도를 계산하여 관련 프레임을 식별하는 방식을 제안한다 [Figure 3]. 기존의 Query-Key 기반 점수가 아닌 Value 공간에서의 검색이 훨씬 더 강력한 신호를 제공함을 입증하였으며, 학습 시에는 클래스 균형을 맞춘 이진 교차 엔트로피 손실 함수를 사용한다 [Table 1]. 제안된 ReToken은 고정된 VLM 모델 위에서도 동작하며, 학습 데이터인 멀티 이미지 QA셋을 넘어 긴 비디오 이해 벤치마크로 제로샷(zero-shot) 전이가 가능하다. 실험 결과, Visual Haystacks 벤치마크에서 Qwen3VL-8B 모델 기준 기존 대비 13.4 포인트, InternVL3.5 모델 기준 12.4 포인트의 정확도 향상을 달성하였다 [Table 4]. 또한, 긴 비디오 이해를 위한 LVBench에서 8.0 포인트의 개선을 기록하며, 단일 H100 GPU 환경에서도 효율적인 추론이 가능함을 증명하였다 [Figure 4].

Figure 3 — ReToken 학습 파이프라인

Figure 4 — ReToken 추론 파이프라인
4. Conclusion & Impact (결론 및 시사점)
본 연구는 ReToken이라는 경량화된 토큰 기반 검색 메커니즘을 통해 VLM의 긴 시각적 문맥 처리 능력을 획기적으로 개선하였다. 제안된 방식은 복잡한 아키텍처 변경 없이 기존의 frozen VLM에 플러그인 형태로 적용 가능하다는 점에서 실용적인 가치가 매우 높다. 특히, 단순한 이미지 QA 데이터 학습만으로 긴 비디오 도메인으로 확장 가능한 일반화 성능을 보여줌으로써, 효율적인 멀티모달 추론 및 RAG 시스템 발전에 중요한 이정표를 제시한다.
⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.
관련 포스트
- [논문리뷰] ScalSelect: Scalable Training-Free Multimodal Data Selection for Efficient Visual Instruction Tuning
- [논문리뷰] RePlan: Reasoning-guided Region Planning for Complex Instruction-based Image Editing
- [논문리뷰] InfiniteVL: Synergizing Linear and Sparse Attention for Highly-Efficient, Unlimited-Input Vision-Language Models
- [논문리뷰] Attention Is All You Need for KV Cache in Diffusion LLMs
- [논문리뷰] ERGO: Efficient High-Resolution Visual Understanding for Vision-Language Models
Review 의 다른글
- 이전글 [논문리뷰] Qwen-UI-Agent Technical Report: Toward Next-Generation Real-World Centric Foundation GUI Agents
- 현재글 : [논문리뷰] ReToken: One Token to Improve Vision-Language Models for Visual Retrieval
- 다음글 [논문리뷰] RefCaptioner: Multi-Reference Image-Grounded Video Captioning
댓글