[논문리뷰] SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring본 논문은 기존 소프트웨어 엔지니어링 벤치마크가 포화 상태에 도달하고, 다수의 불완전한 테스트 케이스와 데이터 오염 문제로 인해 실제 모델의 능력을 변별하기 어려워짐에 따라 SWE-Bench ProMax를 제안한다.#Review#Code Refactoring#AI Agents#Software Engineering#Multilingual Benchmark#Long-horizon Evaluation#Agentic Workflow2026년 8월 10일댓글 수 로딩 중