[논문리뷰] Security Assessment of DeepSeek Harness with A.I.G: Evaluating Resistance to Indirect Prompt Injection
링크: 논문 PDF로 바로 열기
메타데이터
저자: Zonghao Ying, Xiangfan Wu, Huiyu Wu, Xing Zheng, Huangsheng Cheng, Xiaorong Shi, Jing Guo
1. Key Terms & Definitions (핵심 용어 및 정의)
- Indirect Prompt Injection: 사용자가 아닌 외부 콘텐츠(웹 페이지, 파일, 이메일 등)에 포함된 악의적인 지시사항이 에이전트의 의도하지 않은 행동을 유발하는 보안 위협.
- A.I.G (AI-Infra-Guard): 에이전트 시스템의 보안을 평가하기 위해 페이로드 구성, 테스트 실행, 트레이스 수집 및 결과 판단을 수행하는 통합 평가 프레임워크.
- Source-to-Sink: 에이전트가 외부 데이터를 읽는 지점(
Source)부터 민감한 행동(이메일 발송, 명령 실행 등)을 수행하는 지점(Sink)까지의 경로를 분석하는 보안 모델. - 𝒥R (RuleJudge): 트레이스 데이터를 바탕으로 sink 호출 여부, 인수 일치 여부 등 명시적인 규칙을 통해 공격 성공을 판단하는 결정론적 평가자.
- 𝒥L (LLMJudge): 트레이스 전체의 문맥을 이해하여 공격 목표 달성 여부를 판단하는 시맨틱 기반의 평가자.
2. Motivation & Problem Statement (연구 배경 및 문제 정의)
본 논문은 DeepSeek Harness (DSH) 프레임워크를 대상으로 indirect prompt injection에 대한 보안 취약점을 체계적으로 평가하는 것을 목표로 한다. 기존의 에이전트 보안 연구는 주로 정적인 프롬프트 공격에 집중되어 왔으나, 실제 에이전트 환경에서는 외부에서 유입되는 데이터가 에이전트의 추론 과정과 행동 선택에 직접적인 영향을 미칠 수 있다 [Figure 1]. 저자들은 에이전트의 전체 런타임 흐름, 특히 모델이 tool 결과물을 처리하고 이를 기반으로 후속 행동을 결정하는 과정에서 발생하는 경로를 분석할 필요성을 강조한다.

Figure 1 — A.I.G 평가 워크플로우
3. Method & Key Results (제안 방법론 및 핵심 결과)
저자들은 A.I.G 프레임워크를 활용하여 DSH 런타임 내에서 14,560건의 통제된 실행을 수행하고, 이를 두 가지 평가자(𝒥R, 𝒥L)를 통해 분석하였다 [Figure 1], [Figure 3]. 실험은 다양한 공격 기법과 콘텐츠 채널을 포함하며, 에이전트의 도구 레지스트리 및 세션 로그를 통해 실제 공격 시도 경로를 추적하였다 [Figure 4]. 주요 실험 결과, fake_completion 공격은 text mode에서 17.0%의 성공률을 기록하였으며, hidden Unicode 기법은 file mode에서 25.5%의 성공률을 보였다 [Table 5]. 또한, sink가 필요한 작업의 공격 성공률은 2.5%인 반면, 출력만 제어하는 작업은 35.7%로 나타나, 공격 목표에 따른 평가 지표의 차별화된 관점이 중요함을 확인하였다 [Table 3]. 모든 평가는 실제 DSH 런타임을 수정하지 않고 수행되어 높은 현실성을 확보하였다.

Figure 3 — DSH 런타임 어댑터 구조

Figure 4 — DSH 소스-싱크 경로 분석
4. Conclusion & Impact (결론 및 시사점)
본 연구는 에이전트 시스템에서 외부 콘텐츠 유입부터 민감한 행동 발생까지의 전체 경로를 평가하는 것이 필수적임을 입증하였다. 연구 결과는 단순한 프롬프트 방어를 넘어, 에이전트의 도구 결과물 처리, 권한 부여, 그리고 기술 자산(skills)에 대한 엄격한 거버넌스가 필요함을 시사한다. 특히 A.I.G를 통한 지속적인 레드팀 평가와 source-to-sink 분석은 향후 에이전트 시스템 개발 및 배포 과정에서 실질적인 보안 가이드라인을 제공할 것으로 기대된다.
⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.
관련 포스트
- [논문리뷰] One Polluted Page Is Enough: Evaluating Web Content Pollution in LLM Recommenders
- [논문리뷰] ToolHazard: Scaling Adversarial Environments for Security Evaluation and Alignment of LLM-based Agents
- [논문리뷰] OpenART: Scaling Agent Red Teaming via Open-Ended Environment Evolution
- [논문리뷰] Agent Against Agent: An Agentic System for Automatic Prompt Injection Red Teaming
- [논문리뷰] GPT-Red: Automated Red Teaming via Self-Play at Scale
Review 의 다른글
- 이전글 [논문리뷰] PixRestore: Unified Image Restoration via Pixel Diffusion Transformer
- 현재글 : [논문리뷰] Security Assessment of DeepSeek Harness with A.I.G: Evaluating Resistance to Indirect Prompt Injection
- 다음글 [논문리뷰] StartupBench: Benchmarking General-Purpose Agents on Market-Validated End-to-End Workflows
댓글