[논문리뷰] Evidence Attribution in Visual Document Understanding without Coordinates or Region Labels
링크: 논문 PDF로 바로 열기
메타데이터
저자: Zhuchenyang Liu, Yao Zhang, Yu Xiao
1. Key Terms & Definitions (핵심 용어 및 정의)
- Attribution Hallucination: 모델이 질문에 대해 올바른 답변을 제시함에도 불구하고, 이를 뒷받침하는 문서 내 근거 영역(evidence region)을 잘못 지칭하거나 식별하지 못하는 현상입니다.
- Coordinate Interface: VLM이 근거 영역을 지칭할 때 Bounding Box 좌표를 직접 출력하도록 하는 기존의 표준적인 방식입니다.
- Language Interface: 모델이 좌표 대신 근거가 되는 내용을 Verbatim(원문 그대로) 텍스트로 인용하고, 이를 Multimodal Retriever가 문서 내 Semantic Block으로 변환하여 매칭하는 방식입니다.
- GRPO (Group Relative Policy Optimization): 본 논문에서 Region-level 레이블 없이도 모델이 효과적인 근거를 인용하도록 학습시키기 위해 도입한 강화학습 최적화 기법입니다.
2. Motivation & Problem Statement (연구 배경 및 문제 정의)
본 논문은 Visual Document Understanding 분야에서 발생하는 Attribution Hallucination 문제를 해결하기 위해, 현재의 좌표 기반 인터페이스가 모델의 근거 표현 능력을 제한하고 있는지 분석합니다 [Figure 1]. 기존 연구들은 모델이 Bounding Box 좌표를 생성하여 근거를 제시하도록 요구하는데, 이 방식은 모델이 올바른 답변을 도출하고도 잘못된 영역을 지목하는 현상을 빈번하게 유발합니다. 저자들은 이러한 성능 저하가 모델의 근본적인 능력 부족이 아니라, 부적절한 출력 인터페이스(Coordinate Interface) 때문일 수 있다는 가설을 제기합니다. 따라서 좌표나 영역 레이블(Region-level label)에 의존하지 않고도 정확한 근거를 제시할 수 있는 새로운 접근 방식이 필요합니다.

Figure 1 — 좌표 기반 인터페이스와 언어 기반 인터페이스 비교
3. Method & Key Results (제안 방법론 및 핵심 결과)
본 논문은 좌표 기반 인터페이스 대신 텍스트 기반 인용을 활용하는 Language Interface를 제안하고, 이를 GRPO로 학습시키는 프레임워크를 설계하였습니다 [Figure 2]. 제안된 방식은 모델이 문서에서 verbatim quote를 생성하면, Layout Parser가 추출한 Semantic Block과 Multimodal Encoder를 통해 정밀하게 매칭하여 근거 영역을 식별합니다. 실험 결과, Language Interface를 도입했을 때 모든 Backbone 모델에서 Evidence Recall이 기존 최대 8.1%에서 25.9%~46.9% 수준으로 크게 상승했습니다 [Table 1]. 또한, Attribution Hallucination 비율은 기존 8297% 수준에서 38.665.4%로 절반 가까이 감소하였습니다 [Table 1]. 특히, GRPO를 활용하여 영역 레이블 없이 학습시킨 8B 모델은 Strict Attributed Accuracy(SAA)를 22.4%에서 33.8%로 향상시키는 성과를 거두었습니다. 이러한 결과는 좌표 인터페이스 없이도 문서 근거를 정확히 추적할 수 있음을 입증하며, IoU 임계값 변화에도 높은 Recall을 유지하는 강건함을 보였습니다 [Figure 3].

Figure 2 — 제안 모델의 전체 아키텍처 및 학습 프로세스

Figure 3 — IoU 임계값에 따른 Evidence Recall 성능 비교
4. Conclusion & Impact (결론 및 시사점)
본 연구는 Visual Document Understanding에서 근거 제시의 인터페이스를 좌표에서 언어(Quote-based)로 전환하는 것만으로도 모델의 Attribution 성능을 획기적으로 개선할 수 있음을 입증하였습니다. 특히, 고비용의 영역 레이블 없이 강화학습만으로 모델의 신뢰성을 높일 수 있는 실용적인 경로를 제시했습니다. 이 연구 결과는 향후 금융, 법률, 의료 등 정밀한 근거 확보가 필수적인 도메인에서 VLM의 실질적인 적용 가능성을 크게 확대할 것으로 기대됩니다.
⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.
관련 포스트
- [논문리뷰] Evidence-RL: Towards Evidence-intensive Visual Reasoning
- [논문리뷰] Deferred Exposure of Future Trajectories for Verifiable Reasoning in Autonomous Driving VLMs
- [논문리뷰] CADENA: Stepwise CAD Reverse Engineering
- [논문리뷰] Rank-Then-Act: Reward-Free Control from Frame-Order Progress
- [논문리뷰] Thinking with Visual Grounding
Review 의 다른글
- 이전글 [논문리뷰] DriveDNA: A Large-Scale Multimodal Naturalistic Driving Dataset and Benchmark for Driving Style Identification
- 현재글 : [논문리뷰] Evidence Attribution in Visual Document Understanding without Coordinates or Region Labels
- 다음글 [논문리뷰] FilmBench: A Film-Grade Benchmark for Cinematic Video Generation
댓글