[논문리뷰] Agent Memory Distillation: Empowering Small LLM Agents with Hierarchical Teacher Memory
링크: 논문 PDF로 바로 열기
메타데이터
저자: Taeil Kim, Kangsan Kim, Sung Ju Hwang
1. Key Terms & Definitions (핵심 용어 및 정의)
- AMD (Agent Memory Distillation): 대규모 Teacher Agent의 성공적인 경험을 세 가지 계층적 메모리로 구조화하여, 훈련 과정 없이 소규모 Student Agent에 전달하는 프레임워크입니다.
- Workflow Memory: 작업 수준의 전략과 상위 수준의 계획을 인코딩하여, 작업 시작 시 Proactive Injection 방식으로 주입되는 메모리입니다.
- Subtask Memory: 중간 수준의 동작 예시와 구체적인 실행 단계를 제공하며, Proactive Injection을 통해 주입되는 메모리입니다.
- Function Memory: 도구 호출 오류 발생 시 Reactive Injection을 통해 보정 가이드를 제공하는 세밀한 함수 단위의 메모리입니다.
2. Motivation & Problem Statement (연구 배경 및 문제 정의)
본 논문은 기존의 메모리 기반 에이전트 시스템이 대규모 모델에서는 성공적이었으나, 상대적으로 추론 및 지시 이행 능력이 낮은 소규모 모델에서는 성능 개선이 미미하다는 한계를 해결하고자 합니다. 소규모 모델은 스스로 성공적인 경험을 축적하기 어렵고, 단순히 대규모 모델의 메모리를 전달받는 것만으로는 모델 간의 Capability Gap으로 인해 지식을 효과적으로 활용하지 못합니다 [Figure 1]. 이러한 문제로 인해 소규모 에이전트가 복잡한 도구 사용 작업을 수행할 때 필요한 구조화된 지식 전달 방법론의 부재가 강조됩니다.

Figure 1 — AMD의 동기 및 핵심 개념
3. Method & Key Results (제안 방법론 및 핵심 결과)
본 논문은 Teacher Agent로부터 추출한 경험을 Workflow, Subtask, Function이라는 세 가지 계층으로 재구성하여 Student Agent에 효율적으로 전이하는 AMD 프레임워크를 제안합니다 [Figure 2]. Workflow 및 Subtask 메모리는 작업 초기에 Proactive Injection으로 선제적 가이드를 제공하며, Function 메모리는 실제 도구 사용 오류 시 Reactive Injection으로 구체적인 해결책을 제시합니다. 실험 결과, AMD는 AppWorld, BFCL V3, ToolSandbox 벤치마크에서 기존 메모리 기반 기법들을 압도하는 성능을 보였습니다. 정량적으로 Qwen3-4B 모델 기준 AppWorld에서 34.52%p의 정확도 향상을 기록하였으며, 전체 평균적으로 기존 대비 월등한 성능 우위를 입증하였습니다 [Table 1]. 또한, AMD를 통해 소규모 모델의 작업 수행 경로가 Teacher Agent의 경로와 더욱 유사해짐을 확인하였습니다 [Figure 3].

Figure 2 — 계층적 메모리 생성 및 주입 과정

Figure 3 — 작업 단계별 비교 결과
4. Conclusion & Impact (결론 및 시사점)
본 논문은 소규모 LLM 에이전트가 대규모 모델의 지식을 성공적으로 활용할 수 있도록 돕는 최초의 계층적 메모리 증류 프레임워크인 AMD를 제시하였습니다. 이 연구는 모델의 파라미터 업데이트 없이도 효율적인 지식 전이가 가능함을 증명하며, 소규모 에이전트의 실질적인 활용 가능성을 크게 확장합니다. 향후 다양한 환경에서 에이전트 자율성을 높이고 효율적인 학습을 설계하려는 학계 및 산업계 연구에 핵심적인 가이드라인을 제공할 것으로 기대됩니다.
⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.
관련 포스트
- [논문리뷰] ToolHazard: Scaling Adversarial Environments for Security Evaluation and Alignment of LLM-based Agents
- [논문리뷰] SPOT: Sparse Probing and Outcome Calibration for On-Policy Distillation
- [논문리뷰] PrivacyPeek: Auditing What LLM-Based Agents Acquire, Not Just What They Say
- [논문리뷰] Efficient Knowledge Distillation for LLMs: Offline Top-K Logits and a Fused Chunked KL Loss
- [논문리뷰] SKILL-KD: Contrastive Skill Distillation for LLM Agents
Review 의 다른글
- 이전글 [논문리뷰] A^2E : An End-to-End Agent Auditing Engine
- 현재글 : [논문리뷰] Agent Memory Distillation: Empowering Small LLM Agents with Hierarchical Teacher Memory
- 다음글 [논문리뷰] BDH-CQ: In-Context Learning with Recurrent Latent Reasoning
댓글