[논문리뷰] AutoSaddler: Automatic Harness Optimization with Durable Updates from Agent Execution Traces
링크: 논문 PDF로 바로 열기
메타데이터
저자: Sungho Park, Wonjoong Kim, Rongyuan Tan, Jue Zhang, Wook-Shin Han, et al.
1. Key Terms & Definitions (핵심 용어 및 정의)
- Agent Harness: LLM의 외부에서 동작하며, 프롬프트, 도구 인터페이스, 실행 제어 로직 등을 정의하여 에이전트의 안정성과 성능을 보장하는 시스템 계층.
- Diagnosis-Patch Session: 에이전트의 실패한 실행 추적(Execution Trace)을 분석하여 원인을 파악하고, 시스템 코드를 수정(Patch)하는 자동화 프로세스.
- EvoDAG (Evolutionary Directed Acyclic Graph): harness 업데이트의 이력, 수행된 수정 사항, 각 단계에서의 성공/실패 패턴 및 학습한 교훈을 저장하는 방향성 비순환 그래프 기반의 메모리 구조.
- Phased Patch Scheduling: harness 최적화 시 Capability Patches(코드/로직 수정)와 Steering Patches(프롬프트/설명 수정)를 구분하여 순차적으로 적용하는 최적화 전략.
2. Motivation & Problem Statement (연구 배경 및 문제 정의)
본 논문은 LLM 기반 에이전트가 긴 호흡의 과제(Long-horizon tasks)에서 작은 오류가 누적되어 전체 실패로 이어지는 "jagged intelligence" 문제를 해결하고자 한다. 기존의 수동적인 harness 설계는 대규모의 설계 공간(프롬프트, 도구, 제어 로직)을 탐색해야 하는 비용이 크고 확장성이 부족하다는 한계가 있다. 저자들은 harness 개선 과정을 오프라인 학습 문제로 공식화하여, 에이전트의 실패 신호를 기반으로 harness를 체계적이고 자동적으로 최적화하는 프레임워크인 AutoSaddler를 제안한다 [Figure 2].
3. Method & Key Results (제안 방법론 및 핵심 결과)
AutoSaddler는 미니 배치 단위로 에이전트 실행 실패를 진단하고, harness를 코드로 취급하여 수정하며, 일반화 성능을 검증하는 반복적 루프를 통해 작동한다 [Figure 2]. 핵심 방법론은 크게 세 가지로 구성된다: (1) 실행 추적과 코드 기반의 심층적 진단(In-depth diagnosis), (2) harness 계층에 따른 구조적 개입(Structured intervention), (3) 검증 세트를 활용한 일반화 중심 선택(Generalization-aware selection). 실험 결과, AutoSaddler는 GAIA2, SWE-Bench Pro, Terminal-Bench 2.0에서 베이스라인 대비 성능을 각각 9.0%p, 9.6%p, 10.0%p 향상시키는 성과를 거두었다. 특히 GAIA2 환경에서 약 1,000번의 실행만으로 72.3%의 정확도에 도달하여, 훨씬 많은 실행을 요구하는 기존 방법론(GEPA, Meta-Harness) 대비 압도적인 학습 효율성을 입증했다 [Figure 1].
4. Conclusion & Impact (결론 및 시사점)
AutoSaddler는 harness 최적화를 단순히 실험적인 튜닝이 아닌, 구조화된 진단과 수정이 반복되는 오프라인 학습 과정으로 정의함으로써 에이전트 시스템의 신뢰성을 획기적으로 개선하였다. 본 연구는 대규모 환경에서 에이전트의 성능을 스스로 진화시키는 자동화된 파이프라인의 가능성을 제시하며, 향후 더 복잡한 에이전트 아키텍처 구축 및 최적화 연구의 기반이 될 것으로 기대된다.
Part 2: 중요 Figure 정보

Figure 1 — AutoSaddler 최적화 성능 비교

Figure 2 — AutoSaddler 전체 아키텍처
⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.
관련 포스트
- [논문리뷰] HarnessOpt-Bench: Evaluating LLMs at Harness Optimization
- [논문리뷰] S3Gym: Can LLMs Turn Self-Testing and Self-Judging into Self-Improvement?
- [논문리뷰] EarlyEval: Cheaper Agent Evaluation via Early Outcome Prediction
- [논문리뷰] E-Commerce Bench: Evaluating LLM Agents on Long-Horizon Autonomous Business Operation
- [논문리뷰] CAST: Critique-Aware Supervision for Training Reliable Long-Horizon Tool-Calling Agents
Review 의 다른글
- 이전글 [논문리뷰] Annotations as Rollouts: Efficient and Scalable Reinforcement Learning for Video MLLMs
- 현재글 : [논문리뷰] AutoSaddler: Automatic Harness Optimization with Durable Updates from Agent Execution Traces
- 다음글 [논문리뷰] Best Practice Critic Optimization
댓글