본문으로 건너뛰기

[논문리뷰] PILOT in the Loop: Live Self-Improvement for Long-Horizon Agents

링크: 논문 PDF로 바로 열기

메타데이터

저자: Yang Xiao, Yusong Sun, Haoyi Wu, et al.


1. Key Terms & Definitions (핵심 용어 및 정의)

  • Live Self-Improvement: 실행이 종료된 후가 아니라, 작업 수행 중에 발생하는 경험을 즉시 활용하여 현재 실행을 교정하고 영구적인 시스템(Harness)을 개선하는 closed-loop 방식의 프레임워크입니다.
  • Live Steering: Supervisor가 실행 중인 Worker의 작업을 모니터링하다가 오류나 비효율적인 경로를 발견하면, 이를 즉시 중단하거나(Abort) 올바른 방향으로 재지시(Steer)하는 기법입니다.
  • Live Self-Evolution: 실행 중에 발견된 유용한 절차, 프로젝트 관례, 실패 모드 등을 추출하여 시스템의 Skill Library 및 Memory에 기록함으로써, 이후 수행되는 작업에서 이를 즉시 재사용할 수 있도록 시스템을 진화시키는 과정입니다.
  • Supervisor-Worker Harness: 작업을 실제 수행하는 Worker와 이를 감독하며 self-improvement를 담당하는 Supervisor로 역할을 분리한 아키텍처입니다.

2. Motivation & Problem Statement (연구 배경 및 문제 정의)

본 논문은 Long-horizon 에이전트가 긴 작업 시간 동안 생성하는 풍부한 경험을 실시간으로 활용하지 못하는 기존의 한계를 해결하고자 합니다. 기존의 post-hoc(사후) 검토 방식은 작업이 완전히 종료된 후 반영되므로, 실행 중인 현재 작업의 성패에 기여하거나 즉각적인 교정을 수행할 수 없다는 치명적인 약점이 있습니다. 또한, 단일 에이전트 구조는 실행과 감독을 병행하느라 문맥(Context)이 혼잡해지는 문제가 있으며, 기존의 subagent delegation 방식은 실행 중인 하위 에이전트를 실시간으로 재지시할 수 없는 아키텍처적 공백이 존재합니다 [Figure 2]. 따라서 본 연구는 실시간성과 효율성을 동시에 달성하기 위해 Supervisor-Worker 구조를 기반으로 한 live self-improvement 프레임워크를 제안합니다.

Figure 2: PILOT 시스템 아키텍처

Figure 2 — PILOT 시스템 아키텍처

3. Method & Key Results (제안 방법론 및 핵심 결과)

본 논문은 Supervisor-Worker 구조의 PILOT 프레임워크를 통해 실시간 피드백 루프를 구현합니다. PILOT은 별도의 Supervisor가 작업 수행 중인 Worker와 실시간 채널로 연결되어, 작업 내용을 모니터링하고 필요 시 개입하여 경로를 수정하거나 유용한 경험을 Skill로 저장합니다. 저자들은 이 과정을 Live SteeringLive Self-Evolution으로 정의하여 Execution과 Oversight를 분리했습니다 [Figure 2]. 실험 결과, PILOTTerminal-Bench 2.0에서 기존 baseline 대비 최대 9.8%p 높은 성능을 기록했습니다 [Table 1]. 특히 GLM-5.1Kimi-K2.6 백본 환경에서 self-improvement 과정을 거친 결과, 패스율이 각각 14.6%p, 12.4%p 향상되었으며, 평균 출력 토큰(Mean output tokens)은 40% 이상 감소하여 토큰 효율성이 대폭 개선되었습니다 [Figure 1]. 이러한 정량적 지표는 PILOT이 복잡한 Long-horizon 태스크에서 시행착오를 줄이고 재사용 가능한 경험을 효과적으로 축적함을 입증합니다.

4. Conclusion & Impact (결론 및 시사점)

본 논문은 에이전트 시스템에서 작업 실행과 개선이 분리되어 있는 구조적 한계를 극복하고, 실행과 동시에 시스템을 최적화하는 PILOT 프레임워크를 통해 이 문제를 해결했습니다. PILOT은 실시간 교정과 축적된 경험의 즉각적인 반영을 통해 긴 호흡의 태스크 해결 능력을 비약적으로 향상시켰습니다. 본 연구는 에이전트 시스템이 어떻게 점진적으로 스스로를 진화시키며 효율성을 극대화할 수 있는지에 대한 새로운 패러다임을 제시하며, 향후 자동화된 소프트웨어 엔지니어링 및 복잡한 작업 실행 에이전트 분야에 큰 시사점을 줍니다.

⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.

댓글

관련 포스트

Review 의 다른글