[논문리뷰] Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction본 논문은 기존 코딩 에이전트 벤치마크들이 직면한 데이터 오염(Contamination)과 평가의 편향성 문제를 해결하고자 합니다. SWE-bench와 같은 기존 공개 벤치마크는 문제와 해결책이 온라인에 공개되어 있어 에이전트가 이를 기억하여 점수를 높이는 Memorization 문제가 발생합니다.#Review#Coding Agent#Benchmark#Contamination-Resistance#Software Engineering#Web Development#Office Workflow#Security Analysis2026년 7월 23일댓글 수 로딩 중
[논문리뷰] From Runnable to Shippable: Multi-Agent Test-Driven Development for Generating Full-Stack Web Applications from Requirements본 논문은 현재의 코딩 에이전트가 웹 애플리케이션 생성 시 겪는 70% 이상의 기능적 요구사항 미충족 문제를 해결하는 것을 목표로 합니다. 기존의 에이전트는 코드 파일이나 터미널 출력만을 기반으로 검증을 수행하지만, 웹 애플리케이션의 정확성은 브라우저 환경에서의 동적 상호작용을 통해서만 평가될 수 있습니다 .#Review#Multi-Agent System#Test-Driven Development#Web Development#Code Generation#Closed-Loop Validation#Large Language Model2026년 5월 18일댓글 수 로딩 중