본문으로 건너뛰기

[논문리뷰] Marathoner: Ultra-Long-Horizon Autonomous Intelligence

링크: 논문 PDF로 바로 열기

메타데이터

저자: Zhang Ruiyang, Ou Jinpeng, Xie Yifan, Zhou Jingang, Pan Lirui, Guo Qingpei, Zheng Zhedong

1. Key Terms & Definitions (핵심 용어 및 정의)

  • Marathoner: Ultra-Long-Horizon execution을 위해 고안된 자율형 에이전트 모델로, 연속적인 작업 수행 및 복잡한 코드베이스 관리에 특화됨.
  • Ultra-Long-Horizon Task Synthesis: GitHub의 major release PR을 활용하여 수천 줄 이상의 코드 변경이 필요한 고난도 작업을 합성하는 데이터 구축 파이프라인.
  • Multi-Task Chaining: 여러 개의 원자적 작업을 연결하여 모델이 장기적인 계획을 수립하고 장시간 지속적인 실행을 수행하도록 강제하는 작업 합성 기법.
  • Later Stage Bonus Reward: 실행 후반부에 중요한 기여를 한 행동에 추가 보상을 제공하여 에이전트가 종료 시점까지 성과를 지속하도록 유도하는 전략.
  • Harbor: 에이전트의 롤아웃 프로세스(환경 생성, harness 설치, 실행, 보상 계산)를 통합 관리하는 프레임워크.

2. Motivation & Problem Statement (연구 배경 및 문제 정의)

본 논문은 최신 독점 모델들이 보여주는 수일간의 자율적인 초장기 작업 수행 능력을 오픈 소스 모델에서도 구현하기 위해 제안되었다. 기존 모델들은 단기적 문제 해결에는 능숙하지만, 복잡한 소프트웨어 엔지니어링 프로젝트와 같이 장기간에 걸쳐 계획과 실행을 반복해야 하는 ultra-long-horizon 작업에서는 한계를 보인다. 특히 이러한 핵심 역량에 관한 학습 방법론이 공개되지 않아 학계의 발전이 저해되고 있다는 점이 문제이다 [Figure 2]. 따라서 연구자들은 베이스 모델에 이러한 능력을 명시적으로 주입할 수 있는 포괄적인 포스트 트레이닝 파이프라인을 구축하고자 한다.

Figure 2: 포스트 트레이닝 파이프라인

Figure 2 — 포스트 트레이닝 파이프라인

3. Method & Key Results (제안 방법론 및 핵심 결과)

본 논문은 Ultra-Long-Horizon Task Synthesis, Rejection Sampling Finetuning, 그리고 강화학습(Reinforcement Learning)으로 구성된 3단계 학습 파이프라인을 제안한다 [Figure 2]. 먼저, 10,000개의 다양한 GitHub 리포지토리로부터 major release PR을 마이닝하여 복잡도별 작업 세트를 구축하고, Multi-Task Chaining을 통해 Frontier급 난이도의 과제를 생성한다 [Figure 1]. 이후, 강력한 Teacher 모델인 Kimi K3를 활용하여 다양한 harness에서 생성된 고품질 궤적을 Rejection Sampling하고, 이를 통해 베이스 모델을 Supervised Finetuning하여 초기 기초 역량을 확보한다. 마지막으로, GRPO 알고리즘 기반의 강화학습을 수행하며, 특히 Later Stage Bonus Reward를 도입하여 실행 후반부의 의사결정을 보강한다. 실험 결과, Marathoner-9B 모델은 FrontierSWE 및 SWE-Marathon과 같은 5개 벤치마크에서 베이스 모델 대비 일관된 성능 향상을 보였으며, 일부 독점 모델의 성능을 상회하였다. 특히, Marathoner는 실 환경에서 10시간 이상 연속 실행하며 1,000회 이상의 Tool Call을 수행하는 강력한 지속성을 입증하였다 [Table 2]. 또한, 환경 스케일링 실험을 통해 RL 훈련 환경 수를 1,000개에서 8,000개로 확대할수록 모델의 성능이 지속적으로 개선됨을 확인하였다 [Figure 3].

Figure 1: 작업 합성 파이프라인

Figure 1 — 작업 합성 파이프라인

4. Conclusion & Impact (결론 및 시사점)

본 논문은 초장기 작업 수행이 가능한 에이전트 Marathoner를 성공적으로 구축함으로써 자율형 인공지능의 새로운 지평을 제시했다. 제안된 포스트 트레이닝 파이프라인은 벤치마크 최적화 없이도 일반적인 초장기 실행 역량을 강화할 수 있음을 보여준다. 이 연구는 복잡한 소프트웨어 엔지니어링 문제를 다루는 AI 에이전트의 실질적인 산업계 적용 가능성을 크게 높였으며, 향후 고차원적인 자율 에이전트 연구를 위한 중요한 베이스라인을 제공한다.

⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.

댓글

관련 포스트

Review 의 다른글