[논문리뷰] How Do Agents Fail on AutoResearch: End-to-End Diagnostic Evaluation on 100 Real-World Frontier Research Tasks본 논문은 현재의 AutoResearch 에이전트가 연구 과정에서 어떻게 작동하고 어디서 실패하는지에 대한 체계적인 진단이 부재하다는 문제를 해결하고자 한다.#Review#AutoResearch#Agentic Scaffolds#Failure Taxonomy#Metacognitive Loop#Agent-as-a-Judge#Diagnostic Evaluation2026년 8월 17일댓글 수 로딩 중
[논문리뷰] What Does It Take to Be a Good AI Research Agent? Studying the Role of Ideation DiversityAI 연구 에이전트의 성능에 있어 아이디어 다양성(ideation diversity)이 핵심 병목 현상인지를 규명하고, 에이전트 궤적의 성공 또는 실패를 좌우하는 요인을 이해하는 것을 목표로 합니다.#Review#AI Research Agents#Ideation Diversity#MLE-bench#LLM Backbones#Agentic Scaffolds#Shannon Entropy#Machine Learning Engineering#Performance Metrics2025년 11월 19일댓글 수 로딩 중