[논문리뷰] CADWorld: Computer-Use Benchmark for Long-Horizon Computer-Aided Design본 논문은 일반적인 GUI 작업에 특화된 기존 Computer-Use Benchmark들이 기계공학 분야의 전문적인 CAD 워크로드를 충분히 다루지 못한다는 문제의식에서 출발합니다.#Review#Computer-Use Agents#CADWorld#Mechanical-CAD#Artifact-Grounded Evaluation#Long-Horizon#GUI Interaction2026년 9월 20일댓글 수 로딩 중
[논문리뷰] DSAgentBench: Can Agents Automate End-to-End Data-Science Workflows in Real Computer Environments?본 논문은 현재의 AI 에이전트가 단편적인 코드 생성 능력은 뛰어나지만, 실제 컴퓨터 환경에서 복잡한 데이터 과학 워크플로우를 End-to-End로 수행하는 데에는 명확한 한계가 있다는 점을 지적합니다.#Review#Data Science#Agentic Systems#Benchmark#End-to-End Workflow#GUI Interaction#Long-horizon Reasoning#Tool Orchestration2026년 8월 11일댓글 수 로딩 중