[논문리뷰] StartupBench: Benchmarking General-Purpose Agents on Market-Validated End-to-End Workflows본 논문은 기존의 에이전트 벤치마크가 단일 태스크나 지나치게 단순화된 시나리오에 치중되어 있어, 실제 산업계에서의 복잡한 End-to-End 업무 수행 능력을 충분히 반영하지 못한다는 한계를 지적합니다.#Review#General-Purpose Agents#Benchmark#End-to-End Workflows#Market-Validated#Agent Evaluation2026년 8월 18일댓글 수 로딩 중