[논문리뷰] SWE-Touch: Benchmarking Coding Agents When Users Touch the Code
링크: 논문 PDF로 바로 열기
저자: Yuqiao Tan, Jinxiang Meng, Fangyu Lei, Minzheng Wang, Shizhu He, Jun Zhao, Kang Liu, et al.
1. Key Terms & Definitions (핵심 용어 및 정의)
- SWE-Touch: 사용자가 직접 코드를 수정하는 시나리오에서 LLM 기반
Coding Agents의robustness와adaptability를 평가하기 위해 제안된 새로운benchmark. - Coding Agents: 소프트웨어 개발 작업(예:
bug fixing,feature implementation)을 자율적으로 수행하도록 설계된AI systems. - Shared Workspace: 인간 개발자와
Coding Agents가 함께 코드를inspect,edit,test할 수 있는collaborative development environment. - Counter-Edit:
SWE-Touchbenchmark에서Coding Agent의trajectory중간에injection되는,task의objective와 의도적으로 충돌하는,syntactically valid하지만incorrect한 사용자code edit. - Resolve Rate: 주어진
task에서Coding Agent가issue를 성공적으로 해결하고 모든test를 통과하는 비율을 나타내는metric. - Retention:
VANILLA(autonomous) 조건에서majority-solved된task가Counter-Edit조건에서도majority-solved상태를 유지하는 비율을 나타내는metric.
2. Motivation & Problem Statement (연구 배경 및 문제 정의)
본 논문은 Coding Agents가 autonomous한 환경에서 impressive performance를 보였음에도 불구하고, real-world collaborative development 상황에서 사용자 intervention에 의해 workspace 상태가 변경될 때 struggle한다는 핵심 문제를 제기합니다. 기존 benchmarks는 주로 isolated settings에서 agent의 capability를 평가하거나, user interaction을 natural language messages로만 mediate하여 direct code edits의 영향을 제대로 capture하지 못했습니다. 이러한 gap은 agent가 evolving workspace states에 대한 robustness가 부족함을 의미하며, human-agent collaboration의 핵심 측면인 conflict reconciliation 및 code integration 능력을 평가할 수 없게 합니다. 저자들은 real-world에서 빈번히 발생하는 user-initiated code changes에 대한 agent의 adaptability를 systematically 평가하기 위한 새로운 benchmark의 필요성을 강조합니다.
3. Method & Key Results (제안 방법론 및 핵심 결과)
본 연구는 shared workspace에서 Coding Agents를 benchmark하기 위한 controlled framework인 SWE-Touch를 제안합니다. SWE-Touch는 agent trajectory 중간에 task-conflicting 사용자 edit인 Counter-Edit를 inject하여 agent가 modified workspace에서 task를 계속하도록 요구합니다 [Figure 2]. 이 framework는 세 가지 핵심 component로 구성됩니다: (1) user edit를 anchor하기 위한 task-critical code regions mining, (2) mistaken assumption을 encode하는 validated task-conflicting patch artifacts generation, (3) edit의 delivery 시점을 결정하는 deterministic delivery rule. Counter-Edit는 GPT-5.5-backed agent인 User Patch Generator에 의해 생성되며, syntactically valid하고 locally plausible한 incorrect patch입니다.

Figure 2 — SWE-Touch 벤치마크의 전체적인 파이프라인과 방법론을 보여주는 핵심 아키텍처 다이어그램
SWE-bench Verified, SWE-Bench Pro, DeepSWE benchmarks에 대한 9가지 coding model evaluation 결과는 Counter-Edit 조건에서 resolve rate가 VANILLA 조건 대비 평균 7.7 points 감소했으며, 모든 model에서 negative mean change를 보였습니다 [Table 3]. degradation의 정도는 1.3에서 16.5 points까지 다양하게 나타나, shared-workspace robustness가 autonomous resolve rate와는 별개의 evaluation dimension임을 시사합니다. 특히, Claude Opus 4.8과 GPT 5.5와 같은 strong autonomous agents는 각각 96.0%와 95.0%의 retention을 기록하며 intervention에 대한 stability가 가장 높았습니다. 반면, MiniMax M2.7은 resolve rate가 13.8 points 감소하여 가장 큰 degradation 중 하나를 보였습니다. failure analysis 결과 [Figure 4(a)], solved-to-unresolved runs의 63.3%가 retained conflict (agent가 사용자 conflict code를 유지)로 인해 발생했습니다. 또한, user message만으로는 limited impact를 보였지만, message 없이 code edit만 적용해도 상당한 performance drop이 발생했습니다. control condition인 Co-Edit (유용하지만 non-conflicting edits)에서는 minimal impact를 보여 difficulty가 conflicting changes에서 비롯됨을 확인했습니다.

Table 3 — 9가지 LLM 기반 코딩 에이전트들의 VANILLA 및 Counter-EDIT 조건에서의 핵심 성능 지표(Resolve Rate, Retention 등)를 정량적으로 비교하는 테이블
4. Conclusion & Impact (결론 및 시사점)
본 연구는 Coding Agents가 shared workspace 환경에서 사용자 edit과 conflict할 때 robustness가 부족하다는 결정적인 결론을 제시합니다. autonomous performance가 competitive하더라도, agent들은 task-conflicting 사용자 code를 retain하거나 충분한 re-inspection 및 re-validation 없이 replace하는 경향이 있습니다. 이 연구는 coding agent 개발 분야에 중요한 implication을 가집니다. 특히 agent가 real-world collaborative settings에서 deploy되기 위해서는 state awareness, conflict reconciliation, adaptive behavior 및 re-validation capability를 크게 향상시켜야 합니다. 이는 AI agent benchmark가 static leaderboard performance를 넘어 evolving workspace states에 대한 robustness를 prioritize해야 함을 강조하며, human-AI collaboration의 효율성과 신뢰성을 높이는 데 기여할 것입니다.

Figure 4 — Counter-EDIT 조건에서 에이전트들이 실패하는 주요 원인 (예: retained conflict) 및 모델별 실패 구성을 분석하여 핵심적인 취약점을 보여주는 차트
⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.
관련 포스트
- [논문리뷰] NL2Repo-Bench: Towards Long-Horizon Repository Generation Evaluation of Coding Agents
- [논문리뷰] A Survey of Vibe Coding with Large Language Models
- [논문리뷰] LLMs4All: A Review on Large Language Models for Research and Applications in Academic Disciplines
- [논문리뷰] Mendel Gödel Machine: Recursive Self-Improving Coding Agents via Comparative Evolution
- [논문리뷰] Self-Evolving Coding Agents
Review 의 다른글
- 이전글 [논문리뷰] SKT: Skill-Use Training at Scale via Verified Synthetic Data Generation
- 현재글 : [논문리뷰] SWE-Touch: Benchmarking Coding Agents When Users Touch the Code
- 다음글 [논문리뷰] ScrambleToolBench: Agents Search Exhaustively Even When Their Own Map Points to the Next Step
댓글