[논문리뷰] An Empirical Study of Harness Design for Coding Agents본 논문은 Coding agents의 성능을 결정짓는 핵심 Harness 구성 요소들의 개별적인 기여도를 체계적으로 분석합니다. 기존 연구들은 Harness를 단일 시스템으로 평가하여, 어떤 구성 요소가 정확도와 비용에 실질적으로 기여하는지 명확하지 않다는 한계가 있습니다 .#Review#Coding Agents#Harness Design#Context Management#Planning#Action Space#SWE-Bench#Terminal-Bench2026년 9월 17일댓글 수 로딩 중
[논문리뷰] SWE-Bench Pro Verified: A Reliable Benchmark for Software Engineering Agents본 논문은 기존의 소프트웨어 엔지니어링 에이전트 평가 표준인 SWE-Bench Pro가 가진 심각한 신뢰성 결여 문제를 해결하고자 한다.#Review#SWE-Bench#LLM Agents#Software Engineering#Reward Hacking#Benchmarking#Task Quality#Evaluation Validity2026년 9월 9일댓글 수 로딩 중
[논문리뷰] SWE-RM: Execution-free Feedback For Software Engineering Agents본 논문은 소프트웨어 엔지니어링(SWE) 에이전트 개발에서 실행 기반 피드백(execution-based feedback) 의 한계(희소성, 낮은 식별 능력)를 극복하고자 합니다.#Review#Software Engineering Agents#Execution-free Feedback#Reward Model#Reinforcement Learning#Test-Time Scaling#Calibration#AUC#SWE-Bench2025년 12월 28일댓글 수 로딩 중