[논문리뷰] Harness-of-Harness: Multi-Day Autonomous Software Development with Continual Improvement
링크: 논문 PDF로 바로 열기
저자: Haoyang Yan, Min-le Su, Hangfan Zhang, Zhanhao Li, Chen Zhang, Shao Zhang, Yang Chen, Lei Bai, Shuyue Hu, et al.
1. Key Terms & Definitions (핵심 용어 및 정의)
- Autonomous Software Development: Large Language Model (LLM)-based
Coding Agent가High-Level Requirements를 바탕으로 인간의 개입 없이Complete,Functional,Usable Software Systems를 자율적으로 개발하는 과정. - Agent Harness:
Coding Agent가Software Environment와 상호작용하는 데 필요한Tools를 제공하고,Execution을 관리하며, LLM의Decision-Making을 중재하는Operational Layer를 의미한다. - Continual Improvement:
Harness-of-Harness (HoH)프레임워크가Autonomous Development과정에서Coding Agent가 소프트웨어의Quality를 지속적으로 향상시킬 수 있도록 하는 역량이다. - Planning–Coding–Testing Loop: HoH의 핵심 작동 방식으로,
Project Planner,Developer,QA Tester라는 세 가지 역할을 통해Planning,Implementation (Coding),Independent Testing (QA)단계를 반복적으로 수행하여 소프트웨어Artifact를 개선하는Iterative Cycle이다 [Figure 3]. - Cross-Loop State Management:
Iterative Development과정에서Software Artifact State(소스 코드, 구성, 리소스)와Execution Evidence State(검증된 지식, 관찰된 실패, 테스트 결과)를 루프 간에 보존하고 전달하여Continuity를 유지하고Informed Decision-Making을 가능하게 하는 메커니즘이다.

Figure 3 — HoH 프레임워크 개요
2. Motivation & Problem Statement (연구 배경 및 문제 정의)
본 논문은 LLM-based Coding Agents를 활용한 Autonomous Software Development라는 ambitious한 목표를 달성하기 위한 Continual Improvement의 필요성을 제기한다. 현재 대부분의 Coding Agent는 Human-in-the-Loop 환경에서 작동하여, 개발자가 Task 정의, Intermediate Decisions 가이드, Code Changes 검토 및 실패 시 개입해야 하는 한계를 가진다 [Figure 2]. 이러한 Human Intervention 없이 High-Level Requirements만으로 Software Systems를 처음부터 구축하는 Autonomous Development는 Long-Horizon Problem으로, 기존 Agentic Coding Tasks보다 훨씬 더 복잡한 도전 과제를 안고 있다. Agents는 Requirements 및 Design Decisions를 추적하지 못하거나, Local Fixes가 다른 제약 조건을 위반할 수 있으며, Failed Attempts와 Suboptimal Decisions가 누적되어 Repetitive Inspection 및 Repair Cycles로 이어질 수 있다. 기존 Coding Harnesses는 Bounded Episode 내에서 개발을 조직하며, Project Decisions, Verified Functionality, Evaluation Evidence를 Subsequent Revisions에 걸쳐 보존하는 데 제한적인 지원만 제공하므로, 시간 경과에 따라 Coherent하고 Effective Progress를 유지하기 어렵다는 문제점이 있다.

Figure 2 — 소프트웨어 개발 모드 비교
3. Method & Key Results (제안 방법론 및 핵심 결과)
본 논문은 Autonomous Software Development를 위한 Continual Improvement 역량을 갖춘 Harness-of-Harness (HoH) 프레임워크를 제안한다. HoH는 기존 Coding Agent Harness 위에 구축되며, 개발을 Iterative Planning–Coding–Testing Loop로 조직한다 [Figure 3]. 각 Iteration에서 Project Planner는 High-Level Requirements와 이전 Iteration의 Evidence를 바탕으로 Development Plan을 수립하며, 이 계획은 Outstanding Problems를 해결하고 Concrete New Capability를 제공하는 Small, Verifiable Increment에 초점을 맞춘다. Developer는 이 계획을 구현하고 Local Changes에 대한 즉각적인 Feedback을 위해 Implementation 전반에 걸쳐 Focused Testing (Shift-Left Testing)을 수행한다. 이후 QA Tester는 Overall Requirements와 Development Plan에 대해 White-Box 및 Black-Box Tests를 사용하여 시스템을 Independently Evaluate하고, 그 결과로 Structured Test Report를 다음 Iteration의 Evidence로 Planner에게 전달하여 Loop를 완성한다. Cross-Loop State Management는 Artifact State와 Evidence State를 유지하여 Continuity를 보장하고, Progressive Disclosure를 통해 Context Window의 과부하 없이 Relevant Artifacts에 접근하도록 한다.
실험 결과, HoH는 세 가지 벤치마크 (GameCraft-Bench, FrontierSWE, ProgramBench)에서 세 가지 Harness–Model Pair (Codex with GPT-5.5 (high), OpenCode with DeepSeek-V4-Pro, Pi with MiniMax-M3) 모두에서 Standalone Harnesses보다 일관되게 우수한 성능을 보였다. 세 번의 Iteration 후, HoH는 평균 Relative Gain 52.25% 및 최대 82.86%의 성능 향상을 달성했다. GameCraft-Bench에서 HoH@3는 Codex의 평균 Overall 점수를 49.58에서 71.52로, OpenCode는 26.90에서 48.98로, Pi는 42.16에서 58.78로 향상시켰다 [Table 1]. FrontierSWE 벤치마크에서는 Codex와 GPT-5.5 (high)를 사용한 HoH가 10번의 Loops에 걸쳐 Dominance를 22%에서 72.67%까지 지속적으로 개선하는 모습을 보였다 [Figure 5]. Ablation Study를 통해 Plan Update, Evidence Feedback, Warm-Start와 같은 Cross-Iteration Mechanisms의 중요성이 입증되었으며, 이들 중 하나라도 제거하면 GameCraft-Bench Overall Score가 Full HoH@3 대비 6.28에서 8.13 포인트 감소했다 [Table 3]. 또한, Multi-Day Autonomous FPS Game Development(Fusepoint) 케이스 스터디에서 HoH는 70회 이상의 Development Loop를 거쳐 Coherent Storyline, Core Mechanics, Human-Playable Experience를 갖춘 게임을 autonomous하게 개발하며, Long-Horizon Development Tasks에서의 Continual Progress 역량을 성공적으로 입증했다 [Figure 1].

Figure 1 — FPS 게임 개발 결과
4. Conclusion & Impact (결론 및 시사점)
본 연구는 기존 Coding Agent Harnesses의 구현을 수정하지 않고도 Autonomous Software Development를 지원하기 위해 Harness-of-Harness (HoH) 프레임워크를 도입했다. HoH는 Fixed Harness–Model Configuration을 Continuous Planning–Coding–Testing Cycle로 조직하여 Evolving Artifacts와 Execution Evidence를 Iterations에 걸쳐 전달한다. 이 연구는 Benchmark Tasks에서 Final Artifact Quality를 크게 향상시키고, 추가 Iterations를 통해 지속적인 이점을 제공함을 입증했다. 특히 Multi-Day Fusepoint Case Study는 HoH가 Versioned Workspace, Issue History, Evidence Packets를 통해 Development Trajectory를 기록하며 Long-Horizon Development를 성공적으로 이끌 수 있음을 보여주었다. HoH는 Persistent, Evidence-Grounded Orchestration을 통해 End-to-End Software Development를 향한 실용적인 경로를 제시하며, Autonomous Software Development 분야의 학계 및 산업계에 Software Quality와 Agentic Capability를 크게 향상시키는 중요한 시사점을 제공한다. 향후 연구는 HoH를 다양한 Real-World Development Scenarios로 확장하여 General Framework로 발전시키는 데 기여할 것이다.
⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.
관련 포스트
- [논문리뷰] SlopCodeBench: Benchmarking How Coding Agents Degrade Over Long-Horizon Iterative Tasks
- [논문리뷰] LoopArena: Benchmarking Models as Runtime Controllers for Loop Engineering
- [논문리뷰] Beyond Final Scores: A Systematic Evaluation of Agents for Long-Horizon AI Research and Development
- [논문리뷰] PrivacyPeek: Auditing What LLM-Based Agents Acquire, Not Just What They Say
- [논문리뷰] OneDayAgent: Towards a Long-Horizon Harness for Autonomous Agents
Review 의 다른글
- 이전글 [논문리뷰] H3-World: Turning Language Understanding into World Control
- 현재글 : [논문리뷰] Harness-of-Harness: Multi-Day Autonomous Software Development with Continual Improvement
- 다음글 [논문리뷰] Hi-Q: Hierarchical Evidence-guided Query Refinement for Multi-Hop Question Answering
댓글