[논문리뷰] FrontierChallenge: Evaluating Scientific Workflow Completion본 논문은 현재 AI 에이전트 벤치마크가 Final Answers, Isolated Programs 또는 단일 도메인에 초점을 맞추고 있어, 복잡하고 이기종(Heterogeneous)적인 과학적 워크플로우를 End-to-End로 완료하는 에이전트의 능력을 충분히 특성화하지 못한다는 문제점을 제기한다.#Review#Scientific Workflow Completion#Large Language Model Agents#Cross-domain Benchmark#End-to-End Evaluation#Pass Rate Metric#Scientific Deliverables2026년 8월 26일댓글 수 로딩 중