본문으로 건너뛰기

[논문리뷰] Harness-of-Harness: Multi-Day Autonomous Software Development with Continual Improvement

링크: 논문 PDF로 바로 열기

저자: Haoyang Yan, Min-le Su, Hangfan Zhang, Zhanhao Li, Chen Zhang, Shao Zhang, Yang Chen, Lei Bai, Shuyue Hu, et al.

1. Key Terms & Definitions (핵심 용어 및 정의)

  • Autonomous Software Development: Large Language Model (LLM)-based Coding AgentHigh-Level Requirements를 바탕으로 인간의 개입 없이 Complete, Functional, Usable Software Systems를 자율적으로 개발하는 과정.
  • Agent Harness: Coding AgentSoftware Environment와 상호작용하는 데 필요한 Tools를 제공하고, Execution을 관리하며, LLM의 Decision-Making을 중재하는 Operational Layer를 의미한다.
  • Continual Improvement: Harness-of-Harness (HoH) 프레임워크가 Autonomous Development 과정에서 Coding Agent가 소프트웨어의 Quality를 지속적으로 향상시킬 수 있도록 하는 역량이다.
  • Planning–Coding–Testing Loop: HoH의 핵심 작동 방식으로, Project Planner, Developer, QA Tester라는 세 가지 역할을 통해 Planning, Implementation (Coding), Independent Testing (QA) 단계를 반복적으로 수행하여 소프트웨어 Artifact를 개선하는 Iterative Cycle이다 [Figure 3].
  • Cross-Loop State Management: Iterative Development 과정에서 Software Artifact State (소스 코드, 구성, 리소스)와 Execution Evidence State (검증된 지식, 관찰된 실패, 테스트 결과)를 루프 간에 보존하고 전달하여 Continuity를 유지하고 Informed Decision-Making을 가능하게 하는 메커니즘이다.

Figure 3: HoH 프레임워크 개요

Figure 3 — HoH 프레임워크 개요

2. Motivation & Problem Statement (연구 배경 및 문제 정의)

본 논문은 LLM-based Coding Agents를 활용한 Autonomous Software Development라는 ambitious한 목표를 달성하기 위한 Continual Improvement의 필요성을 제기한다. 현재 대부분의 Coding AgentHuman-in-the-Loop 환경에서 작동하여, 개발자가 Task 정의, Intermediate Decisions 가이드, Code Changes 검토 및 실패 시 개입해야 하는 한계를 가진다 [Figure 2]. 이러한 Human Intervention 없이 High-Level Requirements만으로 Software Systems를 처음부터 구축하는 Autonomous DevelopmentLong-Horizon Problem으로, 기존 Agentic Coding Tasks보다 훨씬 더 복잡한 도전 과제를 안고 있다. Agents는 RequirementsDesign Decisions를 추적하지 못하거나, Local Fixes가 다른 제약 조건을 위반할 수 있으며, Failed AttemptsSuboptimal Decisions가 누적되어 Repetitive InspectionRepair Cycles로 이어질 수 있다. 기존 Coding HarnessesBounded Episode 내에서 개발을 조직하며, Project Decisions, Verified Functionality, Evaluation EvidenceSubsequent Revisions에 걸쳐 보존하는 데 제한적인 지원만 제공하므로, 시간 경과에 따라 Coherent하고 Effective Progress를 유지하기 어렵다는 문제점이 있다.

Figure 2: 소프트웨어 개발 모드 비교

Figure 2 — 소프트웨어 개발 모드 비교

3. Method & Key Results (제안 방법론 및 핵심 결과)

본 논문은 Autonomous Software Development를 위한 Continual Improvement 역량을 갖춘 Harness-of-Harness (HoH) 프레임워크를 제안한다. HoH는 기존 Coding Agent Harness 위에 구축되며, 개발을 Iterative Planning–Coding–Testing Loop로 조직한다 [Figure 3]. 각 Iteration에서 Project PlannerHigh-Level Requirements와 이전 IterationEvidence를 바탕으로 Development Plan을 수립하며, 이 계획은 Outstanding Problems를 해결하고 Concrete New Capability를 제공하는 Small, Verifiable Increment에 초점을 맞춘다. Developer는 이 계획을 구현하고 Local Changes에 대한 즉각적인 Feedback을 위해 Implementation 전반에 걸쳐 Focused Testing (Shift-Left Testing)을 수행한다. 이후 QA TesterOverall RequirementsDevelopment Plan에 대해 White-BoxBlack-Box Tests를 사용하여 시스템을 Independently Evaluate하고, 그 결과로 Structured Test Report를 다음 IterationEvidencePlanner에게 전달하여 Loop를 완성한다. Cross-Loop State ManagementArtifact StateEvidence State를 유지하여 Continuity를 보장하고, Progressive Disclosure를 통해 Context Window의 과부하 없이 Relevant Artifacts에 접근하도록 한다.

실험 결과, HoH는 세 가지 벤치마크 (GameCraft-Bench, FrontierSWE, ProgramBench)에서 세 가지 Harness–Model Pair (Codex with GPT-5.5 (high), OpenCode with DeepSeek-V4-Pro, Pi with MiniMax-M3) 모두에서 Standalone Harnesses보다 일관되게 우수한 성능을 보였다. 세 번의 Iteration 후, HoH는 평균 Relative Gain 52.25% 및 최대 82.86%의 성능 향상을 달성했다. GameCraft-Bench에서 HoH@3는 Codex의 평균 Overall 점수를 49.58에서 71.52로, OpenCode는 26.90에서 48.98로, Pi는 42.16에서 58.78로 향상시켰다 [Table 1]. FrontierSWE 벤치마크에서는 Codex와 GPT-5.5 (high)를 사용한 HoH가 10번의 Loops에 걸쳐 Dominance22%에서 72.67%까지 지속적으로 개선하는 모습을 보였다 [Figure 5]. Ablation Study를 통해 Plan Update, Evidence Feedback, Warm-Start와 같은 Cross-Iteration Mechanisms의 중요성이 입증되었으며, 이들 중 하나라도 제거하면 GameCraft-Bench Overall Score가 Full HoH@3 대비 6.28에서 8.13 포인트 감소했다 [Table 3]. 또한, Multi-Day Autonomous FPS Game Development(Fusepoint) 케이스 스터디에서 HoH는 70회 이상의 Development Loop를 거쳐 Coherent Storyline, Core Mechanics, Human-Playable Experience를 갖춘 게임을 autonomous하게 개발하며, Long-Horizon Development Tasks에서의 Continual Progress 역량을 성공적으로 입증했다 [Figure 1].

Figure 1: FPS 게임 개발 결과

Figure 1 — FPS 게임 개발 결과

4. Conclusion & Impact (결론 및 시사점)

본 연구는 기존 Coding Agent Harnesses의 구현을 수정하지 않고도 Autonomous Software Development를 지원하기 위해 Harness-of-Harness (HoH) 프레임워크를 도입했다. HoH는 Fixed Harness–Model ConfigurationContinuous Planning–Coding–Testing Cycle로 조직하여 Evolving ArtifactsExecution EvidenceIterations에 걸쳐 전달한다. 이 연구는 Benchmark Tasks에서 Final Artifact Quality를 크게 향상시키고, 추가 Iterations를 통해 지속적인 이점을 제공함을 입증했다. 특히 Multi-Day Fusepoint Case Study는 HoH가 Versioned Workspace, Issue History, Evidence Packets를 통해 Development Trajectory를 기록하며 Long-Horizon Development를 성공적으로 이끌 수 있음을 보여주었다. HoH는 Persistent, Evidence-Grounded Orchestration을 통해 End-to-End Software Development를 향한 실용적인 경로를 제시하며, Autonomous Software Development 분야의 학계 및 산업계에 Software QualityAgentic Capability를 크게 향상시키는 중요한 시사점을 제공한다. 향후 연구는 HoH를 다양한 Real-World Development Scenarios로 확장하여 General Framework로 발전시키는 데 기여할 것이다.

⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.

댓글

관련 포스트

Review 의 다른글