[논문리뷰] Beyond Final Scores: A Systematic Evaluation of Agents for Long-Horizon AI Research and Development현재 Long-Horizon AI R&D 분야의 Autonomous Agent 평가 방식은 주로 단일 최종 점수 (single final score)에 의존하며, 이는 Agent가 연구 Loop 내에서 왜 성공하거나 실패하는지에 대한 상세한 진단 정보를 제공하지 못하는 근본적인 한계가 있다.#Review#Autonomous Agents#AI Research#Long-Horizon Tasks#Systematic Evaluation#Process Metrics#Experience Reuse#Harness Design#Solution Novelty2026년 8월 16일댓글 수 로딩 중