본문으로 건너뛰기

[논문리뷰] LongHorizon-Harness: Advancing Long-Horizon Agents for Real-World Tasks

링크: 논문 PDF로 바로 열기

메타데이터

저자: Ziyu Ma, Hailang Huang, Shun Zou, Yong Wang, Shidong Yang, Yiming Hu, Fei Wei, XiangXiang Chu

1. Key Terms & Definitions (핵심 용어 및 정의)

  • Manage-Execute-Audit (MEA) loop: 긴 호흡의 작업을 관리자(Manager), 실행자(Executor), 감사자(Auditor)라는 세 가지 별도 역할로 분리하여 수행하는 핵심 프레임워크입니다.
  • Task State: 에이전트의 전체 작업 흐름에서 현재 요구사항, 완료된 작업, 환경의 변화(facts)를 독립적으로 저장하는 구조화된 기록입니다.
  • AgentAdapter: 기존의 에이전트 루프를 수정하지 않고도 다양한 모델 백엔드와 하네스를 프레임워크 내에서 교체 가능하게 지원하는 경량화된 인터페이스입니다.
  • Fresh-context execution: 매 작업 라운드마다 이전의 방대한 실행 히스토리를 제거하고, 오직 현재 계약(Contract)에 필요한 정보만으로 제한된 환경에서 실행하는 기법입니다.
  • Audit-result: 실행자의 보고서가 아닌, 감사자가 외부 환경을 읽기 전용(Read-only)으로 검증하여 생성한 환경-기반의 객관적 증거입니다.

2. Motivation & Problem Statement (연구 배경 및 문제 정의)

본 논문은 기존의 에이전트 하네스가 긴 작업(long-horizon task)을 수행할 때 발생하는 일관성 저하와 신뢰성 문제를 해결하고자 합니다. 대부분의 에이전트는 하나의 커지는 컨텍스트 안에서 작업을 수행하고 스스로 결과를 판단하는데, 이로 인해 이전의 오류가 누적(Compounding errors)되거나, 정보가 컨텍스트 한계를 초과하는 'Context rot' 현상이 발생합니다. 또한, 에이전트가 자신의 작업 완료 여부를 잘못 판단하여 잘못된 상태 기록이 이후 결정에 반영되는 근본적인 구조적 한계가 존재합니다 [Figure 1]. 따라서 저자들은 작업을 상태 관리 문제로 재정의하고 독립적인 검증이 가능한 새로운 하네스 프레임워크를 제안합니다.

Figure 1: MEA 루프 기반 아키텍처

Figure 1 — MEA 루프 기반 아키텍처

3. Method & Key Results (제안 방법론 및 핵심 결과)

본 논문은 작업을 관리자, 실행자, 감사자의 세 단계 MEA 루프로 순환시키는 LongHorizon-Harness를 제안합니다 [Figure 2]. 관리자는 작업 상태를 관리하고 하위 작업(subtask)을 정의하며, 실행자는 이를 독립적인 환경에서 수행하고, 감사자는 환경을 독립적으로 Inspect하여 결과를 확정합니다. 실험 결과, LongHorizon-HarnessQwen 3.7-Plus 모델 기준으로 WeaveBench에서 PassRate를 51.8%에서 80.7%로 대폭 향상시켰습니다. 또한 Terminal-Bench 2.1에서 성공률을 69.7%에서 77.2%로 높였으며, OSWorld 2.0에서는 이진 완료율을 2.8%에서 8.3%로 3배 가까이 개선하는 정량적 성과를 보였습니다 [Table 1, Table 2, Figure 3]. 이러한 결과는 복잡한 GUI 및 CLI 혼합 환경과 순수 CLI 환경 모두에서 강력한 성능 개선을 입증합니다.

Figure 2: MEA 루프 실행 흐름

Figure 2 — MEA 루프 실행 흐름

4. Conclusion & Impact (결론 및 시사점)

본 논문은 긴 호흡의 에이전트 작업을 '상태 관리 문제'로 체계화하여 해결함으로써 성능과 신뢰성을 동시에 확보했습니다. 독립적인 감사(Auditing)와 세분화된 상태 관리는 에이전트가 복잡한 장기 작업을 수행할 때 발생하는 목표 이탈과 오류 전파를 효과적으로 차단합니다. 이 연구는 산업계의 에이전트 자동화 분야에 있어 실질적인 시스템 구축 방안을 제시하며, 향후 더 안정적이고 확장 가능한 자율 에이전트 생태계를 구축하는 데 중요한 기술적 토대를 마련할 것으로 평가됩니다.

Figure 3: Terminal-Bench 결과

Figure 3 — Terminal-Bench 결과

⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.

댓글

관련 포스트

Review 의 다른글