[논문리뷰] UniProbe: A Learnable Token-Level Hallucination Detector for Large VLMs using Multi-Structural Internal Representations
링크: 논문 PDF로 바로 열기
저자: Dvir Samuel, Guy Bar-Shalom, Fabrizio Frasca, Ethan Fetaya, Yftah Ziser, Gal Chechik, Haggai Maron
1. Key Terms & Definitions (핵심 용어 및 정의)
- Computational-trace Graph: LVLM의 forward pass에서 추출된 hidden states와 attention map을 활용하여, 이미지 패치, 쿼리 토큰, 생성된 응답 토큰 간의 관계를 구조화한 directed graph입니다.
- LVLM (Large Vision-Language Model): 시각적 입력과 텍스트 쿼리를 처리하여 응답을 생성하는 대규모 멀티모달 모델로, 본 논문에서는 Frozen 상태로 유지됩니다.
- Hallucination-aware Decoding: 생성 과정 중인 토큰을 실시간으로 검사하여 할루시네이션(hallucination) 확률이 임계값을 넘을 경우 해당 토큰을 거부하고 재샘플링하는 기법입니다.
- Self-adaptation: 특정 LVLM이 생성한 응답 데이터로 detector를 추가 학습시켜, 일반적인 데이터셋과 실제 배포 환경 간의 train-test distribution shift를 완화하는 전략입니다.
2. Motivation & Problem Statement (연구 배경 및 문제 정의)
본 논문은 LVLM이 생성하는 할루시네이션을 토큰 수준에서 정확하게 탐지하고 완화하는 문제를 해결합니다. 기존의 방법론들은 전체 모델을 Fine-tuning하여 자원 소모가 크거나, 외부 Verifier에 의존하여 모델의 내부 생성 과정을 무시하거나, 내부 신호를 단순 통계치로만 처리하여 데이터의 구조적 정보를 손실한다는 한계가 있습니다 [Figure 1]. 이러한 한계를 극복하기 위해, 본 연구는 LVLM을 수정하지 않으면서도 계산 과정의 구조적 정보를 활용하는 효율적인 탐지 프레임워크를 제안합니다.

Figure 1 — 토큰 수준 할루시네이션 탐지 및 완화 예시
3. Method & Key Results (제안 방법론 및 핵심 결과)
본 논문이 제안하는 UniProbe는 LVLM의 계산 과정에서 얻은 데이터를 GNN, ViT, GRU 모듈을 교차 배치(alternating blocks)하여 처리하는 경량화된 탐지기입니다. UniProbe는 고정된(frozen) LVLM의 computational-trace로부터 시각적, 관계적, 순차적 증거를 통합하며, 각 토큰에 대해 할루시네이션 확률을 예측합니다 [Figure 2]. 주요 실험 결과, UniProbe는 SOTA 탐지기들과 비교하여 MHALO 벤치마크에서 F1_M 점수를 유의미하게 향상시켰으며, 특히 GLM-4V 백본에서 63.2/52.9 (F1_M/F1_IoU)를 기록했습니다 [Table 1]. 또한, POPE 벤치마크에서는 90.0의 AUC를 달성하여 기존 방식들을 압도했습니다 [Table 3]. 실시간 생성 환경에서는 vanilla latency 대비 **1.06×**의 낮은 오버헤드만으로 할루시네이션을 최대 55%까지 감소시키는 성과를 보였습니다 [Table 4].

Figure 2 — UniProbe 모델의 전체 아키텍처
4. Conclusion & Impact (결론 및 시사점)
본 연구는 모델의 내부 상태를 구조적인 그래프로 해석함으로써, 고비용의 학습 없이도 강력한 할루시네이션 탐지 및 대응이 가능함을 입증했습니다. 제안된 UniProbe는 다양한 LVLM 백본에 유연하게 적용될 수 있으며, 실시간 디코딩 과정에서의 개입을 통해 응답 품질과 신뢰성을 크게 개선했습니다. 이러한 접근 방식은 향후 멀티모달 AI의 배포 환경에서 할루시네이션을 관리하기 위한 효율적이고 확장 가능한 표준 프레임워크로 활용될 것으로 기대됩니다 [Figure 3].

Figure 3 — 다양한 LVLM 백본에서의 정성적 탐지 결과
⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.
관련 포스트
- [논문리뷰] Reasoning Denoiser: Denoising Reasoning Traces for Hallucination Detection in Large Reasoning Models
- [논문리뷰] Quickest Detection of Hallucination Onset: Delay Bounds and Learned CUSUM Statistics
- [논문리뷰] Flat-Pack Bench: Evaluating Spatio-Temporal Understanding in Large Vision-Language Models through Furniture Assembly
- [논문리뷰] VideoSeeker: Incentivizing Instance-level Video Understanding via Native Agentic Tool Invocation
- [논문리뷰] MemLens: Benchmarking Multimodal Long-Term Memory in Large Vision-Language Models
Review 의 다른글
- 이전글 [논문리뷰] UNMASK: Discovering and Causally Verifying Spurious Shortcuts in Text Classifiers
- 현재글 : [논문리뷰] UniProbe: A Learnable Token-Level Hallucination Detector for Large VLMs using Multi-Structural Internal Representations
- 다음글 [논문리뷰] Verifier-Induced Support Reshaping in On-Policy Optimization
댓글