[논문리뷰] AgentCompass: A Unified Evaluation Infrastructure for Agent Capabilities본 논문은 LLM 기반 Agent의 성능을 평가하기 위한 인프라가 극도로 파편화되고 복잡하게 얽혀 있는 문제를 해결하고자 한다. 기존의 평가 방식은 특정 도메인에 고착화되어 있거나, 실행 환경과 평가 프로토콜이 강하게 결합되어 있어 재현성(Reproducibility)을 저해하고 반복적인 엔지니어링 비용을 발생시킨다 .#Review#LLM-based Agents#Evaluation Infrastructure#Benchmarking#Trajectory Analysis#Agentic Capabilities#Reproducibility2026년 7월 15일댓글 수 로딩 중