본문으로 건너뛰기

[논문리뷰] When Context Bites: Detecting RAG Poisoning via Document-Level Attention Collapse

링크: 논문 PDF로 바로 열기

The full content is 14144 words. 저자: Yingtao Ren, Ziyi Zhao, et al.

1. Key Terms & Definitions (핵심 용어 및 정의)

  • RAG (Retrieval-Augmented Generation): Large Language Models (LLMs)의 지식 격차를 외부 검색을 통해 보완하여 답변 생성 성능을 향상시키는 프레임워크입니다.
  • RAG Poisoning Attack: 공격자가 검색 데이터베이스에 Adversarial Documents를 주입하여 LLM Generator가 공격자 지정의 유해한 응답을 생성하도록 조작하는 Security Threat입니다.
  • Blind Confidence: Poisoned Outputs가 Benign Outputs보다 더 낮은 Perplexity를 보이며 LLM이 공격자 목표에 대해 잘못된 확신을 갖는 Counter-intuitive Phenomenon입니다.
  • Attention Collapse: RAG Poisoning Attack 시 LLM의 Attention Mechanism이 조작된 문서(Poisoned Documents)에 불균형적으로 집중되고, 실제 증거를 억제하는 현상입니다.
  • D-SCAN (Document-level Signal Collapse Analysis): LLM의 Attention Dynamics를 모니터링하여 RAG Poisoning Attack을 효율적으로 탐지하는 Lightweight Framework입니다.

2. Motivation & Problem Statement (연구 배경 및 문제 정의)

본 논문은 RAG 시스템이 LLM의 지식 부족 문제를 효과적으로 해결하지만, Adversarial Documents 주입을 통한 Poisoning Attack에 취약하다는 핵심 문제를 다룹니다. 기존 공격 탐지 방법들은 Perplexity나 Consistency Checks와 같은 Output-Side Signals에 의존하지만, 저자들의 분석에 따르면 의도적인 공격은 때때로 더 낮은 Perplexity를 유발하여 "Blind Confidence" 현상을 나타내며, 이는 기존 Uncertainty-Based Detection Methods를 비효율적으로 만듭니다. 또한, 기존 접근 방식들은 RAG Context의 Granular한 특성을 간과하고, 탐지 과정의 Interpretability가 부족하여 공격의 내부 메커니즘을 파악하기 어렵다는 한계점을 가집니다. 저자들은 이러한 Limitations를 해결하기 위해 LLM Generator의 Internal Dynamics를 Mechanistic Interpretability 관점에서 조사하여 Poisoning Attack의 새로운 Neural Signature를 식별할 필요성을 제기합니다.

3. Method & Key Results (제안 방법론 및 핵심 결과)

저자들은 LLM Generator의 Internal Dynamics에 대한 Empirical Analysis를 통해 RAG Poisoning Attack의 고유한 Neural Signature인 "Attention Collapse" 현상을 발견하고, 이를 기반으로 D-SCAN (Document-level Signal Collapse Analysis) 프레임워크를 제안합니다. Attention Collapse는 Benign Generation 시 분산된 Attention Distribution과 달리, 공격받은 Generation에서는 Attention이 Poisoned Documents에 불균형적으로 집중되어 Document-Level Attention Entropy가 급격히 감소하는 현상을 의미합니다 [Figure 1, Figure 2, Figure 3, cite: 1]. D-SCAN은 이러한 Attention Dynamics를 모니터링하며, Inference 시 LLM의 Internal States에서 직접 Feature를 추출하는 Lightweight Detection Framework입니다. 구체적으로, D-SCAN은 Token-Level 및 Document-Level Attention Distribution Metrics (Entropy, Variance, Density 포함)를 Feature로 사용하여 Linear Classifier를 학습시킵니다.

Extensive Experiments 결과, D-SCAN은 2Wiki, HotpotQA, Musique 세 가지 Multi-Hop QA Benchmarks에서 기존 State-of-the-Art Baseline들을 일관되게 능가하는 우수한 탐지 성능을 보였습니다 [Table 1, cite: 1]. 예를 들어, 2Wiki 벤치마크에서 D-SCAN은 AUC 0.9337, F1 0.8578을 달성하여, HaloScope의 AUC 0.6563, ReDeep의 AUC 0.8403, RevPRAG의 AUC 0.7534를 크게 상회했습니다. 더욱이 D-SCAN은 Attack이 최종 답변을 변경하는 데 실패한 경우에도 높은 탐지 충실도를 유지하는 Robustness를 입증했습니다 [Figure 4, cite: 1]. 이는 Attention Collapse가 공격의 Behavioral Outcome과 독립적으로 나타나는 Poisoned Documents의 Intrinsic Signature임을 확인시켜 줍니다. Ablation Study에서는 Document-Level Attention Metrics의 제거가 Token-Level Metrics 제거보다 더 큰 성능 저하를 야기했으며 [Table 3, cite: 1], 이는 Cross-Document Attention Hijacking이 Attack Detection의 가장 Dominant Signal임을 시사합니다.

4. Conclusion & Impact (결론 및 시사점)

본 연구는 RAG Poisoning Attack 시 LLM의 Internal Dynamics를 Mechanistic Interpretability를 통해 분석하여 "Attention Collapse"라는 고유한 Neural Signature를 발견했습니다. 이 현상은 모델의 Attention이 공격적인 증거에 집중되고 실제 증거를 억제함으로써 Poisoning Attack이 성공하는 Fundamental Mechanism을 밝혀냈습니다. 이러한 발견을 바탕으로 제안된 Lightweight Detection Method인 D-SCAN은 Inference 시 Attention Dynamics를 모니터링하여 기존 State-of-the-Art Baseline들을 능가하는 우수한 공격 탐지 성능을 입증했습니다. 특히, D-SCAN은 공격이 실패하여 최종 답변이 조작되지 않은 경우에도 Attack Attempts를 신뢰할 수 있게 탐지할 수 있어, RAG 시스템의 Trustworthiness를 강화하는 데 중요한 기여를 합니다. 이 연구는 LLM의 내부 메커니즘을 이해하고 활용하는 Mechanism-Aware Defense 연구를 촉진하여 더욱 Robust하고 Trustworthy한 RAG 시스템 구축에 중요한 시사점을 제공합니다.

Figure 1: 내부 역학 비교

Figure 1 — 내부 역학 비교

Figure 2: D-SCAN 개요

Figure 2 — D-SCAN 개요

Figure 4: 탐지 성능 비교

Figure 4 — 탐지 성능 비교

⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.

댓글

관련 포스트

Review 의 다른글