[논문리뷰] How Do Agents Fail on AutoResearch: End-to-End Diagnostic Evaluation on 100 Real-World Frontier Research Tasks본 논문은 현재의 AutoResearch 에이전트가 연구 과정에서 어떻게 작동하고 어디서 실패하는지에 대한 체계적인 진단이 부재하다는 문제를 해결하고자 한다.#Review#AutoResearch#Agentic Scaffolds#Failure Taxonomy#Metacognitive Loop#Agent-as-a-Judge#Diagnostic Evaluation2026년 8월 17일댓글 수 로딩 중
[논문리뷰] TIDE: Trajectory-based Diagnostic Evaluation of Test-Time Improvement in LLM Agents본 논문은 LLM 에이전트의 Test-Time Improvement (TTI) 메커니즘이 성공하거나 실패하는 이유에 대한 이해 부족을 해결하고자 합니다.#Review#LLM Agents#Test-Time Improvement#Diagnostic Evaluation#Trajectory Analysis#Performance Metrics#Behavior Adaptation#Memory Management#POMDP2026년 2월 4일댓글 수 로딩 중