[논문리뷰] WideSWE: Can Coding Agents Coordinate Changes Across Repositories?
링크: 논문 PDF로 바로 열기
메타데이터
저자: Baoyi Wang, Xingliang Wang, Jinyang Wu, Keming Wu, Chen Zhi, Jianwei Yin
1. Key Terms & Definitions (핵심 용어 및 정의)
- WideSWE: 다중 Repository에 걸친 소프트웨어 개발 작업을 평가하기 위해 설계된 새로운 벤치마크 데이터셋입니다.
- Cross-Repository Task: 단일 Repository가 아닌, 소프트웨어 생태계 내 여러 Repository에 걸쳐 변경이 필요한 버그 수정(Bug Fix) 또는 기능 구현(Feature) 작업을 의미합니다.
- Joint Execution: 여러 Repository를 하나의 Workspace 내에서 동시에 다루며 에이전트가 작업을 수행하는 방식입니다.
- Independent Execution: 각 Repository를 개별적인 환경에서 분리하여 작업하는 방식입니다.
- F2P (Fail-to-Pass) & P2P (Pass-to-Pass): F2P는 기존 실패 테스트가 수정 후 성공하는지를 측정하며, P2P는 기존 성공 테스트가 수정 후에도 유지되는지(Regression Check)를 측정하는 핵심 평가 지표입니다.
2. Motivation & Problem Statement (연구 배경 및 문제 정의)
본 논문은 기존의 Coding Agent 평가 방식이 주로 단일 Repository에 국한되어 있어, 실제 소프트웨어 생태계에서 빈번하게 발생하는 다중 Repository 간의 조율된 변경 요구사항을 충분히 다루지 못한다는 점을 문제로 제기합니다. 기존 연구인 SWE-bench 등은 실질적인 엔지니어링 문제를 다루지만, 여전히 단일 코드베이스에서의 작업 해결에 집중하고 있습니다. 하지만 실무에서는 하나의 기능을 완성하기 위해 서로 다른 언어나 의존성을 가진 여러 Repository를 동시에 수정하고 통합해야 하는 경우가 많습니다. 저자들은 이러한 복합적인 환경에서 에이전트가 어떻게 Coordination을 수행하고 의도된 변경을 완성하는지 검증하기 위해 본 연구를 수행하였습니다 [Figure 1].
3. Method & Key Results (제안 방법론 및 핵심 결과)
본 논문은 103개의 실제 소프트웨어 생태계에서 수집된 120개의 실사용 사례를 바탕으로 WideSWE 벤치마크를 구축하였습니다 [Figure 2]. 제안된 방법론은 각 작업의 요구사항을 반영하되 구현 방식의 유연성을 보장하기 위해, 기존 테스트 케이스를 수동으로 검토하고 수정하는 Requirement-aligned test review 과정을 포함합니다. 7가지 에이전트 설정을 통해 실험한 결과, Codex CLI와 GPT-5.6-sol 조합이 가장 우수한 42.50%의 Task 성공률을 기록했습니다 [Table 1]. 대조적으로, Joint와 Independent 실행 방식을 비교한 결과, Joint Execution 방식이 관련 Repository 간의 정보 공유를 통해 구현과 검증 단계에서 더 효율적인 가이드를 제공함을 확인했습니다. 연구 결과, 많은 에이전트가 수정 범위를 식별하지 못하거나, 일부 Repository에서만 작업을 완료하고 나머지 다운스트림 작업을 방치하는 문제점이 관찰되었습니다 [Figure 3].
4. Conclusion & Impact (결론 및 시사점)
본 연구는 다중 Repository 환경에서의 코드 변경 조율이 현대 Coding Agent에게 매우 도전적인 과제임을 실증적으로 증명하였습니다. 연구 결과는 단순한 코드 생성을 넘어, 대규모 소프트웨어 생태계를 이해하고 여러 저장소 간의 의존성을 관리하는 능력이 에이전트의 핵심 역량임을 시사합니다. 본 벤치마크와 데이터셋은 향후 에이전트가 더욱 복잡하고 실무적인 수준의 소프트웨어 엔지니어링 작업을 자율적으로 수행할 수 있도록 발전하는 데 중요한 기틀이 될 것입니다.
⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.
관련 포스트
- [논문리뷰] ProgramDistill: From Interactive Web Apps to Verifiable Reference-Guided SWE Tasks
- [논문리뷰] RealSWE: A Compositional Evaluation of Coding Agents under Realistic User Requests
- [논문리뷰] The Handoff Tax: Continuing Non-Native Trajectories in LLM Agents
- [논문리뷰] GameXpert-Bench: How Far Are Coding Agents from Expert Game Development?
- [논문리뷰] SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science?
Review 의 다른글
- 이전글 [논문리뷰] TraceDance: An Automated System for Building Agent Behavior Benchmarks from Real-World Agent Deployment Traces
- 현재글 : [논문리뷰] WideSWE: Can Coding Agents Coordinate Changes Across Repositories?
- 다음글 [논문리뷰] WorldPlay2: Extending Real-Time Interactive World Models in Control and Horizon
댓글