[논문리뷰] SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring
링크: 논문 PDF로 바로 열기
메타데이터
저자: Yuling Shi, Jinghan Xu, Kelin Fu, Wenhao Zeng, Shilin He, Lei Zhang, Yue Liu, Zelin Zhao, Terry Yue Zhuo, Jialun Cao, Siyu Ye, Tianyu Liu, Kai Cai, Shing-Chi Cheung, Xiaodong Gu
1. Key Terms & Definitions (핵심 용어 및 정의)
- Code Refactoring: 기존 외부 동작을 유지하면서 코드 구조를 개선하여 기술 부채를 관리하는 소프트웨어 엔지니어링 프로세스입니다.
- Pass@1: 모델이 주어진 문제를 해결하기 위해 생성한 코드가 모든 테스트 케이스를 통과하는 비율로, 본 연구의 주요 평가지표입니다.
- Agent Scaffold: 에이전트가 코드를 탐색, 편집, 실행하기 위해 사용하는 환경 프레임워크(본 논문에서는 mini-swe-agent 및 OpenHands를 사용)입니다.
- Resolve Rate: 에이전트가 제안한 패치가 테스트 스위트를 통과하여 문제가 완전히 해결되었음을 나타내는 성공률입니다.
2. Motivation & Problem Statement (연구 배경 및 문제 정의)
본 논문은 기존 소프트웨어 엔지니어링 벤치마크가 포화 상태에 도달하고, 다수의 불완전한 테스트 케이스와 데이터 오염 문제로 인해 실제 모델의 능력을 변별하기 어려워짐에 따라 SWE-Bench ProMax를 제안한다. 기존 벤치마크는 주로 단일 파일 수정에 집중되어 있어, 실제 현업에서 요구되는 대규모의 다중 파일(multi-file) 리팩토링 능력을 평가하기엔 부족하다 [Figure 1]. 또한, 무분별하게 설계된 테스트 스위트가 기술적으로 잘못된 판단을 내리는 경우가 많아, 보다 엄격하고 정밀한 전문가 검수를 거친 벤치마크 환경의 구축이 절실하다.

Figure 1 — 벤치마크 간 파일 수정 규모 비교
3. Method & Key Results (제안 방법론 및 핵심 결과)
본 연구는 실제 GitHub 커밋에서 추출한 170개의 리팩토링 인스턴스를 바탕으로, 3단계의 엄격한 전문가 큐레이션 파이프라인을 통해 SWE-Bench ProMax를 구축했다 [Figure 3]. 제안된 방법론은 모호한 커밋 메시지를 정교한 문제 명세로 재작성하고, 불필요하게 좁거나 넓은 테스트 케이스를 수동으로 제거하여 평가의 신뢰성을 극대화했다.

Figure 3 — 데이터 구축 및 큐레이션 파이프라인
주요 실험 결과, 최고 성능을 보인 GPT-5.2 모델의 Resolve Rate는 41.2%에 그쳐, 이 벤치마크가 현재의 프론티어 모델들에게도 여전히 큰 도전 과제임을 입증했다 [Table 3]. 또한, OpenHands 스캐폴드를 활용했을 때 성능 향상이 두드러졌으며, GLM-5와 같은 오픈 가중치 모델은 GPT-5.2 대비 훨씬 적은 비용으로도 36.5%의 Resolve Rate를 달성하여 높은 가성비를 보여주었다. 에이전트 분석 결과, 대규모 수정이 필요한 작업에서 많은 에이전트가 필요한 모든 파일을 수정하지 못하는 '불완전한 리팩토링(incomplete refactoring)'을 보이며 실패하는 경향이 뚜렷했다 [Figure 5].

Figure 5 — 에이전트 행동 및 실패 패턴 분석
4. Conclusion & Impact (결론 및 시사점)
본 논문은 대규모 다국어 코드 리팩토링 환경에서의 에이전트 성능을 측정하는 표준화된 기준을 제공함으로써 소프트웨어 엔지니어링 연구의 돌파구를 마련했다. 이 벤치마크는 단순한 코드 생성을 넘어 복잡한 의존성 관리와 행동 유지를 요구하는 실제 개발 환경에서의 에이전트 역량을 정밀하게 측정한다. 본 연구를 통해 향후 연구자들은 모델의 비용 효율성과 장기적인 문맥 유지 능력, 특히 다중 파일 협업 역량을 강화하는 데 집중할 수 있는 실질적인 토대를 얻게 될 것이다.
⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.
관련 포스트
- [논문리뷰] Agentic Refactoring: An Empirical Study of AI Coding Agents
- [논문리뷰] NVIDIA-labs OO Agents: Native Python Object-Oriented Agents
- [논문리뷰] From Human-Centric to Agentic Code Review: The Impact of Different Generations of Generative AI Technology on Review Quality
- [논문리뷰] Terminal-Bench: Benchmarking Agents on Hard, Realistic Tasks in Command Line Interfaces
- [논문리뷰] On the Use of Agentic Coding: An Empirical Study of Pull Requests on GitHub
Review 의 다른글
- 이전글 [논문리뷰] SPOT: Sparse Probing and Outcome Calibration for On-Policy Distillation
- 현재글 : [논문리뷰] SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring
- 다음글 [논문리뷰] Scaling Inherently Interpretable Language Models
댓글