본문으로 건너뛰기

[논문리뷰] Agent Against Agent: An Agentic System for Automatic Prompt Injection Red Teaming

링크: 논문 PDF로 바로 열기

저자: Yanting Wang, Chenlong Yin, Runpeng Geng, Jinyuan Jia, et al.

## 1. Key Terms & Definitions (핵심 용어 및 정의)

  • Prompt Injection: LLM 기반 에이전트의 보안 취약점을 이용해, 사용자의 의도와 다른 악의적인 지시를 삽입하여 에이전트의 행동을 조작하는 공격입니다.
  • PIMiner: 본 논문에서 제안하는 계층적 메모리 메커니즘 기반의 자동화된 에이전트형 레드팀 시스템입니다.
  • Strategy Library: 학습을 통해 축적된 공격 전략들을 보관하는 장기 기억 저장소로, 새로운 타겟 모델에도 즉각 적용 및 전이가 가능합니다.
  • Strategy Router: 입력된 샘플의 컨텍스트를 분석하여, Strategy Library에 있는 전략 중 해당 샘플에 가장 적합한 상위 K개의 전략을 선별하는 컴포넌트입니다.
  • ASR@N: 공격 시도 횟수 N번 이내에 하나 이상의 삽입된 프롬프트가 성공할 확률(Attack Success Rate)을 의미하는 성능 평가 지표입니다.

## 2. Motivation & Problem Statement (연구 배경 및 문제 정의) 본 논문은 LLM 기반 에이전트의 취약점을 탐지하기 위한 기존 레드팀 방식의 낮은 효율성과 제한적인 전이 가능성을 해결하고자 합니다. 기존의 RL-based 방식은 특정 타겟 모델에 대한 방대한 학습 데이터와 수만 번의 쿼리가 필요하여 비용이 높고 새로운 모델에 대한 적응력이 떨어집니다. 반면, Search-based 방식은 샘플마다 학습을 다시 시작하므로 이전 공격 경험을 재사용하지 못해 공격 성능이 현저히 낮습니다. 이를 해결하기 위해 저자들은 과거의 공격 경험을 재사용 가능한 지식으로 변환하여, 검색 기반 방식의 한계를 극복하는 에이전트 시스템을 설계하였습니다 [Figure 1].

Figure 1: PIMiner의 핵심 구성 요소와 데이터 흐름을 보여주는 프레임워크 다이어그램

Figure 1 — PIMiner의 핵심 구성 요소와 데이터 흐름을 보여주는 프레임워크 다이어그램

## 3. Method & Key Results (제안 방법론 및 핵심 결과) 본 연구는 Strategy Library, Strategy Router, Iterative Attack Module, Experience Digester로 구성된 PIMiner를 통해 프롬프트 인젝션 공격의 효율성과 효과성을 극대화합니다. Experience Digester는 공격 성공 사례를 분석하여 전략을 정교화하고, 실패 사례를 바탕으로 실패 조건을 업데이트함으로써 라이브러리를 지속적으로 보강합니다. 실험 결과, PIMinerIPIArenaAgentDojo 벤치마크에서 Gemini-2.5-Pro, GPT-5.1, Claude-Sonnet-4.5 등 다양한 최첨단 모델을 대상으로 강력한 공격 성능을 보였습니다 [Figure 2]. 특히, InjecAgent 데이터셋에서 ASR@10 기준 1.0(100%)의 성능을 기록하여 RL-HammerPISmith와 같은 기존의 고비용 RL-based 방식과 대등한 성능을 달성하였습니다 [Table 1]. 또한, Strategy Router의 도입으로 인해 공격자의 입력 토큰 길이가 43%~61% 감소함과 동시에 공격 성공률은 유지되거나 오히려 향상되는 결과를 확인하였습니다.

Figure 2: 주요 모델들에 대한 PIMiner의 공격 성공률을 나타내는 핵심 성능 지표 비교 그래프

Figure 2 — 주요 모델들에 대한 PIMiner의 공격 성공률을 나타내는 핵심 성능 지표 비교 그래프

Table 1: 기존의 SOTA 방법론들과 PIMiner의 공격 성공률(ASR)을 비교한 수치 데이터

Table 1 — 기존의 SOTA 방법론들과 PIMiner의 공격 성공률(ASR)을 비교한 수치 데이터

## 4. Conclusion & Impact (결론 및 시사점) PIMiner는 공격 경험을 구조화된 전략으로 변환하여 기억함으로써, 타겟 모델에 의존하지 않는 전이 가능한 레드팀 공격 능력을 구현하였습니다. 이 시스템은 기존의 고비용 RL-based 학습 방식의 대안으로서 레드팀 수행에 드는 계산 자원과 비용을 획기적으로 절감합니다. 본 연구에서 생성된 해석 가능한 Strategy Library와 공격 기법은 향후 LLM 에이전트의 견고성(Robustness)을 검증하고, 보다 강력한 방어 모델을 학습시키기 위한 고품질 데이터를 제공하는 데 중요한 기여를 할 것으로 기대됩니다.

⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.

댓글

관련 포스트

Review 의 다른글