본문으로 건너뛰기

[논문리뷰] UniProbe: A Learnable Token-Level Hallucination Detector for Large VLMs using Multi-Structural Internal Representations

링크: 논문 PDF로 바로 열기

저자: Dvir Samuel, Guy Bar-Shalom, Fabrizio Frasca, Ethan Fetaya, Yftah Ziser, Gal Chechik, Haggai Maron

1. Key Terms & Definitions (핵심 용어 및 정의)

  • Computational-trace Graph: LVLM의 forward pass에서 추출된 hidden states와 attention map을 활용하여, 이미지 패치, 쿼리 토큰, 생성된 응답 토큰 간의 관계를 구조화한 directed graph입니다.
  • LVLM (Large Vision-Language Model): 시각적 입력과 텍스트 쿼리를 처리하여 응답을 생성하는 대규모 멀티모달 모델로, 본 논문에서는 Frozen 상태로 유지됩니다.
  • Hallucination-aware Decoding: 생성 과정 중인 토큰을 실시간으로 검사하여 할루시네이션(hallucination) 확률이 임계값을 넘을 경우 해당 토큰을 거부하고 재샘플링하는 기법입니다.
  • Self-adaptation: 특정 LVLM이 생성한 응답 데이터로 detector를 추가 학습시켜, 일반적인 데이터셋과 실제 배포 환경 간의 train-test distribution shift를 완화하는 전략입니다.

2. Motivation & Problem Statement (연구 배경 및 문제 정의)

본 논문은 LVLM이 생성하는 할루시네이션을 토큰 수준에서 정확하게 탐지하고 완화하는 문제를 해결합니다. 기존의 방법론들은 전체 모델을 Fine-tuning하여 자원 소모가 크거나, 외부 Verifier에 의존하여 모델의 내부 생성 과정을 무시하거나, 내부 신호를 단순 통계치로만 처리하여 데이터의 구조적 정보를 손실한다는 한계가 있습니다 [Figure 1]. 이러한 한계를 극복하기 위해, 본 연구는 LVLM을 수정하지 않으면서도 계산 과정의 구조적 정보를 활용하는 효율적인 탐지 프레임워크를 제안합니다.

Figure 1: 토큰 수준 할루시네이션 탐지 및 완화 예시

Figure 1 — 토큰 수준 할루시네이션 탐지 및 완화 예시

3. Method & Key Results (제안 방법론 및 핵심 결과)

본 논문이 제안하는 UniProbe는 LVLM의 계산 과정에서 얻은 데이터를 GNN, ViT, GRU 모듈을 교차 배치(alternating blocks)하여 처리하는 경량화된 탐지기입니다. UniProbe는 고정된(frozen) LVLM의 computational-trace로부터 시각적, 관계적, 순차적 증거를 통합하며, 각 토큰에 대해 할루시네이션 확률을 예측합니다 [Figure 2]. 주요 실험 결과, UniProbe는 SOTA 탐지기들과 비교하여 MHALO 벤치마크에서 F1_M 점수를 유의미하게 향상시켰으며, 특히 GLM-4V 백본에서 63.2/52.9 (F1_M/F1_IoU)를 기록했습니다 [Table 1]. 또한, POPE 벤치마크에서는 90.0AUC를 달성하여 기존 방식들을 압도했습니다 [Table 3]. 실시간 생성 환경에서는 vanilla latency 대비 **1.06×**의 낮은 오버헤드만으로 할루시네이션을 최대 55%까지 감소시키는 성과를 보였습니다 [Table 4].

Figure 2: UniProbe 모델의 전체 아키텍처

Figure 2 — UniProbe 모델의 전체 아키텍처

4. Conclusion & Impact (결론 및 시사점)

본 연구는 모델의 내부 상태를 구조적인 그래프로 해석함으로써, 고비용의 학습 없이도 강력한 할루시네이션 탐지 및 대응이 가능함을 입증했습니다. 제안된 UniProbe는 다양한 LVLM 백본에 유연하게 적용될 수 있으며, 실시간 디코딩 과정에서의 개입을 통해 응답 품질과 신뢰성을 크게 개선했습니다. 이러한 접근 방식은 향후 멀티모달 AI의 배포 환경에서 할루시네이션을 관리하기 위한 효율적이고 확장 가능한 표준 프레임워크로 활용될 것으로 기대됩니다 [Figure 3].

Figure 3: 다양한 LVLM 백본에서의 정성적 탐지 결과

Figure 3 — 다양한 LVLM 백본에서의 정성적 탐지 결과

⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.

댓글

관련 포스트

Review 의 다른글