[논문리뷰] Beyond Final Scores: A Systematic Evaluation of Agents for Long-Horizon AI Research and Development현재 Long-Horizon AI R&D 분야의 Autonomous Agent 평가 방식은 주로 단일 최종 점수 (single final score)에 의존하며, 이는 Agent가 연구 Loop 내에서 왜 성공하거나 실패하는지에 대한 상세한 진단 정보를 제공하지 못하는 근본적인 한계가 있다.#Review#Autonomous Agents#AI Research#Long-Horizon Tasks#Systematic Evaluation#Process Metrics#Experience Reuse#Harness Design#Solution Novelty2026년 8월 16일댓글 수 로딩 중
[논문리뷰] The Verification Horizon: No Silver Bullet for Coding Agent Rewards본 논문은 최신 Coding Agent의 성능이 발전함에 따라, 생성된 코드의 정확성을 신뢰할 수 있게 검증하는 문제가 생성 자체보다 훨씬 어려워진 현실을 지적합니다.#Review#Coding Agents#Reward Design#Reward Hacking#Alignment#Verification#Systematic Evaluation2026년 6월 25일댓글 수 로딩 중