[논문리뷰] Game Arena: Strategic LLM Evaluation in Competitive Environments현대 AI 연구에서 LLM 평가를 위해 사용되는 MMLU, GSM8K와 같은 정적 벤치마크는 데이터 오염과 성능 포화(saturation) 문제로 인해 모델 간의 변별력을 상실하고 있습니다.#Review#Large Language Models#Benchmarking#Competitive Games#Strategic Evaluation#Game Theory#Multi-agent Systems#Infrastructure2026년 9월 27일댓글 수 로딩 중