[논문리뷰] Agensh: Scaling Organizational Intelligence to 1,024 Agents
링크: 논문 PDF로 바로 열기
저자: Zhihao Zhan, Ting Song, Li Dong, et al.
1. Key Terms & Definitions (핵심 용어 및 정의)
- Agensh: 중앙 Orchestrator 없이 Scalable한 Self-organized Multi-agent Harness를 지칭한다. 이는 동시적으로 작동하는 Worker들이 Context를 수집하고, Sub-task를 Claim하며, Action을 취하고, 결과를 공유 및 검증하여 Progress를 Asynchronous하게 Merge하는 Multi-agent Cooperation Loop를 실행한다.
- Multi-Agent Cooperation Loop: Agensh 내 각 Worker가 Concurrently 및 Asynchronously 실행하는 5단계 협력 프로세스이다. 이는 Context Gathering, Sub-task Claiming, Action Taking, Result Verification, Progress Merging으로 구성된다.
- Agentic Organization Infrastructure: Agensh의 Coordination 메커니즘을 지원하는 세 가지 핵심 컴포넌트이다. Shared Workspace, Message Interface, Shared Context로 이루어진다.
- Shared Workspace: 조직의 Ongoing 및 Integrated Work를 담는 파일 시스템이다. Concurrent Writes, Asynchronous Reads, Version History 관리를 지원하며, Merge Conflict 발생 시 Worker들이 이를 해결하도록 노출한다. 본 논문에서는 Git platform을 통해 구현되었다.
- Shared Context: Worker들이 재사용 가능한 Findings 및 Work Intentions을 보존하는 메커니즘이다. OBSERVED, FACT, FAIL, CLAIM, PATCH_SUMMARY와 같은 간결하고 Type이 지정된 Entry들을 포함하는 Append-only Database 형태로 구현되었다.
- ProgramBench: Agentic Software Engineering을 위한 고도로 Challenging한 Benchmark이다. Agent Organization이 인터넷 접근 없이 6시간 Budget 내에 Reference Software의 Behavior를 Rebuild하도록 요구한다.
2. Motivation & Problem Statement (연구 배경 및 문제 정의)
본 논문은 기존 Multi-Agent System의 중앙 Orchestrator가 야기하는 Scalability 제한 문제를 해결한다. Single-agent System은 Context Window, Action Stream, Memory Stream의 한계 및 Sequential Execution 제약으로 인해 복잡한 Task에서 높은 Latency를 초래한다. 이를 극복하기 위해 Multi-agent System의 Agent 수를 Scaling하는 필요성이 대두되었으나, 대부분의 선구적인 Multi-agent Harness Frameworks (예: Codex sub-agent, Claude Code sub-agent)는 중앙 Orchestrator-Worker 구조를 채택하고 있다. 이 구조는 Orchestrator의 Task Allocation, Worker Coordination, Contribution Integration 능력에 의해 Scalability가 근본적으로 제한되는 문제점을 가진다. 따라서, Agensh는 중앙 Orchestrator 없이 Self-organized Worker들이 Concurrently 및 Asynchronously 동작하여 이러한 Scalability Bottleneck을 해소하는 새로운 접근 방식을 제안한다 [Figure 2].
3. Method & Key Results (제안 방법론 및 핵심 결과)
저자들은 중앙 Orchestrator 없이 Scalable한 Self-organized Multi-agent Harness인 Agensh를 제안한다. Agensh는 Multi-Agent Cooperation Loop와 Agentic Organization Infrastructure를 결합하여 개별 Worker의 Progress를 조직의 통합된 Work로 전환한다. Multi-Agent Cooperation Loop는 각 Worker가 Concurrently 및 Asynchronously 실행하는 5단계 프로세스로 구성된다: (1) Shared User Goal, Peer Progress, Accumulated Findings를 바탕으로 Context를 Gathering하고 다음 Step을 Plan한다. (2) 수행할 Sub-task를 Claim하고 Shared Context에 범위(Scope)를 공지하며, Overlap이나 Conflict 발생 시 Direct Message를 통해 해결한다. (3) Local에서 Tool을 사용하여 Sub-task를 해결하고, 다른 Worker에게 도움이 될 수 있는 Finding을 Shared Context에 업데이트한다. (4) Local Progress가 Sub-task의 Acceptance Criteria를 충족하는지 Verify하고, 필요 시 접근 방식을 수정한다. (5) Local Contribution을 Shared Workspace에 Merge하여 Peer들에게 공유하고, Merge Conflict 발생 시 최신 Peer Progress를 통합하여 재시도한다 [Figure 3]. 이 과정은 Worker들이 Sub-task Discovery와 Allocation을 Self-organize하게 한다.
Agentic Organization Infrastructure는 Shared Workspace, Message Interface, Shared Context 세 가지 Coordination 컴포넌트로 구성된다. Shared Workspace는 조직의 Ongoing 및 Integrated Work를 보관하며, 본 논문에서는 Gitea로 구현되었다. Message Interface는 Worker들이 Communication을 통해 Ongoing Work를 Coordinate하고 Conflict를 해결할 수 있도록 Mattermost를 활용한다. Shared Context는 재사용 가능한 Findings 및 Work Claims를 유지하며, DeLM의 핵심 아이디어를 기반으로 OBSERVED, FACT, FAIL, CLAIM, PATCH_SUMMARY 등의 Typed Entry를 사용한다. Agensh는 Single-Agent Harness (예: Copilot) 위에 Layered되어 있으며, 협력 Loop는 각 Worker의 Prompt 내 Workflow Instructions를 통해 구현되어 Plug-and-Play 방식으로 다양한 Harness에 연결될 수 있다.
Agensh의 Scalability를 검증하기 위해, 저자들은 GPT-5.6-sol 모델을 사용하여 5개의 가장 어려운 ProgramBench Task에 대해 평가했다. 실험 결과, 1개에서 128개의 Agent로 Scaling했을 때, 5개 Task의 평균 Final Test-pass Rate가 19.31%에서 28.78%로 증가하여 약 49%의 Relative Improvement를 보였다 [cite: 1, Figure 5]. 또한, 더 큰 Organization은 더 일찍 Comparable한 Test-pass Rate에 도달하여, Concurrent Agent 수가 Latency를 줄일 수 있음을 입증했다. 특히 pandoc Task에서 1개에서 1,024개의 Agent로 Scaling했을 때, Final Test-pass Rate가 33.89%에서 55.06%로 상승했다. Worker Trajectories 분석 결과, Organization이 성장함에 따라 Peer Coordination, Multi-Worker Integration, Standardized Workflows, Organization-scale Role Specialization과 같은 Self-organized Cooperation의 다양한 형태가 점진적으로 Emergent하게 나타났다.
4. Conclusion & Impact (결론 및 시사점)
본 논문은 중앙 Orchestrator 없이 Scalable한 Multi-agent 조직 지능을 위한 Agensh Framework를 성공적으로 제시한다. Agensh는 Multi-agent Cooperation Loop와 Agentic Organization Infrastructure를 통해 Self-organized Worker들이 Sub-task를 효율적으로 Discovery 및 Claim하고, Findings를 교환하며, Contributions를 통합하도록 한다. 이 연구는 Agent 수를 Multi-agent 조직의 새로운 Scaling Dimension으로 입증했으며, 이는 Quality (Test-pass Rate)와 Speed (Latency Reduction) 측면 모두에서 복잡한 Task 수행 능력을 향상시켰다. Agensh는 엄격한 Latency 제약 또는 Time Budget 하의 복잡한 Task에 대한 실용적인 Solution을 제공할 뿐만 아니라, Self-organized Cooperation의 Scaling을 통해 General Intelligence의 Frontier를 확장할 잠재력을 보여준다.
⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.
관련 포스트
- [논문리뷰] From Proprietary to Open-Source: Bridging the Distribution Gap via Multi-Agent Protocol Distillation in Agentic Search
- [논문리뷰] Agon: Competitive Cross-Model RL with Implicit Rival Grading of Reasoning
- [논문리뷰] Economy of Minds: Emerging Multi-Agent Intelligence with Economic Interactions
- [논문리뷰] Solvita: Enhancing Large Language Models for Competitive Programming via Agentic Evolution
- [논문리뷰] daVinci-Dev: Agent-native Mid-training for Software Engineering
Review 의 다른글
- 이전글 [논문리뷰] ALPINE: Adaptive Localization for Parameter- and Sample-Efficient Few-Shot Learning
- 현재글 : [논문리뷰] Agensh: Scaling Organizational Intelligence to 1,024 Agents
- 다음글 [논문리뷰] All-in-One Multilingual Scene Text Recognition with Script-aware Mixture-of-Experts
댓글