[논문리뷰] DSAgentBench: Can Agents Automate End-to-End Data-Science Workflows in Real Computer Environments?본 논문은 현재의 AI 에이전트가 단편적인 코드 생성 능력은 뛰어나지만, 실제 컴퓨터 환경에서 복잡한 데이터 과학 워크플로우를 End-to-End로 수행하는 데에는 명확한 한계가 있다는 점을 지적합니다.#Review#Data Science#Agentic Systems#Benchmark#End-to-End Workflow#GUI Interaction#Long-horizon Reasoning#Tool Orchestration2026년 8월 11일댓글 수 로딩 중
[논문리뷰] AgenticDataBench: A Comprehensive Benchmark for Data Agents본 연구는 기존 데이터 에이전트 벤치마크가 복잡한 실제 비즈니스 시나리오를 충분히 반영하지 못하고, 세부적인 작업 수준의 성능 분석을 제공하지 못한다는 한계점을 해결하고자 합니다.#Review#Data Agent#Benchmark#Skill Extraction#Data Science#LLM#Task Generation#Evaluation Pipeline2026년 7월 2일댓글 수 로딩 중