본문으로 건너뛰기

[논문리뷰] Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction

링크: 논문 PDF로 바로 열기

메타데이터

저자: Tencent WorkBuddy Bench Team, Siqi Cai, et al.


1. Key Terms & Definitions (핵심 용어 및 정의)

  • WorkBuddy Bench: 코드, 웹, 오피스, 보안이라는 4개 작업 도메인에 걸쳐 코딩 에이전트를 평가하는 다중 도메인 벤치마크 프레임워크입니다.
  • Contamination-Resistant Task Construction: 웹 검색으로 정답을 찾을 수 없도록 실제 커밋이나 비즈니스 시나리오를 역할 기반의 구어체 요청으로 재구성하여 오염을 방지하는 설계 방식입니다.
  • Agent Harness: 에이전트가 작업 환경(Docker 샌드박스)과 상호작용하고 태스크를 수행하도록 지원하는 실행 인프라로, 본 연구에서는 CodeBuddy CodeClaude Code를 활용합니다.
  • Oracle-gated Admission: 태스크가 벤치마크에 등록되기 전, 베이스라인(미수행)에서는 낮은 점수를, 레퍼런스 솔루션(Gold patch)에서는 높은 점수를 받아야 하는 검증 통과 절차입니다.
  • Task-directory Format: 모든 도메인의 태스크를 표준화된 디렉토리 구조(메타데이터, 환경 파일, 테스트 스크립트 등)로 패키징하여 재현성을 보장하는 포맷입니다.

2. Motivation & Problem Statement (연구 배경 및 문제 정의)

본 논문은 기존 코딩 에이전트 벤치마크들이 직면한 데이터 오염(Contamination)과 평가의 편향성 문제를 해결하고자 합니다. SWE-bench와 같은 기존 공개 벤치마크는 문제와 해결책이 온라인에 공개되어 있어 에이전트가 이를 기억하여 점수를 높이는 Memorization 문제가 발생합니다. 반면, 상업적 벤치마크는 비공개적 특성으로 인해 평가의 투명성과 일반화 가능성을 외부에서 검증할 수 없다는 한계가 있습니다. 이를 해결하기 위해 저자들은 실제 업무 환경의 분포를 반영하면서도, 검색 불가능한 구어체 요청으로 재구성된 Tencent WorkBuddy Bench를 제안합니다 [Figure 1].

Figure 1: 워크버디 벤치마크 개요

Figure 1 — 워크버디 벤치마크 개요

3. Method & Key Results (제안 방법론 및 핵심 결과)

본 연구는 4개 도메인(Code, Web, Office, Security)을 통합하여 실제 업무 프로세스를 재현하는 Distribution-informed Methodology를 제안합니다. 각 태스크는 실제 코드 커밋이나 비즈니스 시나리오로부터 도출되었으며, 에이전트가 환경 내에서 문제를 스스로 탐색하도록 Deliberate Underspecification(의도적 정보 생략)을 적용하였습니다 [Figure 3]. Code 도메인에서는 80개의 태스크가 repository-level의 복잡한 엔지니어링을 테스트하며, Web 도메인은 70개의 태스크를 통해 Rule-based, LLM/VLM Judge, Agent-judge를 결합하여 인터랙티브한 프론트엔드 성능을 평가합니다 [Figure 4]. Office 도메인은 50개의 데이터/문서 워크플로우를 다루며, Security 도메인은 60개의 태스크에서 결정론적 스코어링을 통해 취약점 탐지 능력을 정밀하게 측정합니다. 실험 결과, 모든 태스크는 Oracle-gated admission을 통해 검증되었으며, 개별 도메인별로 차별화된 평가 지표(예: Hidden-test score, Rubric-based score)를 통해 에이전트의 실무 능력을 다각도로 증명하였습니다. 특히, Code 도메인에서 단순 버그 수정뿐만 아니라 5개의 사용자 역할에 기반한 다양한 엔지니어링 능력을 평가한 결과는 기존 연구 대비 높은 재현성과 신뢰성을 확보하였습니다 [Table 4].

Figure 3: 코드 태스크 평가 워크플로우

Figure 3 — 코드 태스크 평가 워크플로우

Figure 4: 웹 태스크 평가 워크플로우

Figure 4 — 웹 태스크 평가 워크플로우

4. Conclusion & Impact (결론 및 시사점)

본 논문은 코딩 에이전트 평가를 위한 개방적이고 재현 가능한 다중 도메인 벤치마크를 성공적으로 구축하였습니다. 이 벤치마크는 데이터 오염 방지 설계를 통해 모델의 실제 reasoning 능력을 측정하며, 4개 도메인에 걸친 통합된 하니스(Harness)를 제공함으로써 평가 표준을 제시합니다. 이러한 접근 방식은 향후 AI 에이전트가 단순 코딩을 넘어 복합적인 비즈니스 및 보안 업무를 수행하는 데 필요한 객관적인 성능 지표를 마련하는 중요한 이정표가 될 것입니다.

⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.

댓글

관련 포스트

Review 의 다른글