[논문리뷰] τ^τ-Bench: An Environment for End-To-End, Realistic Agent Construction본 논문은 LLM Agent가 Production 소프트웨어로 빠르게 발전하고 있음에도 불구하고, 기존 벤치마크들이 실제 Client Engagement 조건 하에서 에이전트 구축의 End-to-End 프로세스를 적절히 평가하지 못한다는 근본적인 문제점을 제기합니다.#Review#LLM Agents#Agent Construction#Realistic Benchmarking#End-to-End Evaluation#Requirements Engineering#Developer Agents#Multimodal Artifacts#Client Simulation2026년 9월 6일댓글 수 로딩 중
[논문리뷰] FrontierChallenge: Evaluating Scientific Workflow Completion본 논문은 현재 AI 에이전트 벤치마크가 Final Answers, Isolated Programs 또는 단일 도메인에 초점을 맞추고 있어, 복잡하고 이기종(Heterogeneous)적인 과학적 워크플로우를 End-to-End로 완료하는 에이전트의 능력을 충분히 특성화하지 못한다는 문제점을 제기한다.#Review#Scientific Workflow Completion#Large Language Model Agents#Cross-domain Benchmark#End-to-End Evaluation#Pass Rate Metric#Scientific Deliverables2026년 8월 26일댓글 수 로딩 중
[논문리뷰] GameCraft-Bench: Can Agents Build Playable Games End-to-End in a Real Game Engine?본 논문은 현대의 Coding Agent가 자연어 명세(Specification)를 실제 실행 가능한 게임으로 변환하는 End-to-End 생성 능력을 엄밀하게 평가하고자 합니다.#Review#Game Generation#Coding Agents#Game Engine#Godot#End-to-End Evaluation#Interactive Verification#Benchmark2026년 6월 16일댓글 수 로딩 중
[논문리뷰] CodeFuse-CR-Bench: A Comprehensiveness-aware Benchmark for End-to-End Code Review Evaluation in Python Projects기존 LLM 기반 코드 리뷰(CR) 벤치마크가 겪는 '현실성 격차'(reality gap) 문제를 해결하고자 합니다.#Review#Code Review#LLMs#Benchmark#Python Projects#End-to-End Evaluation#Context-Awareness#Software Engineering#LLM-as-a-Judge2025년 9월 23일댓글 수 로딩 중