[논문리뷰] Benchmark Radar: A Living Database and Search Engine for AI Benchmarks and EvaluationAI 연구원 및 Large Language Models (LLMs) 개발자들은 관련 Evaluation을 찾아내고, Benchmark Dataset 및 Code를 확보하며, Reported Score 뒤에 숨겨진 Evaluation Settings를 이해하는 데 상당한 어려움을 겪고 있다.#Review#AI Benchmarks#LLM Evaluation#Living Database#Search Engine#Daily Discovery#Score Histories#Benchmark Saturation#Model Reports2026년 9월 13일댓글 수 로딩 중