[논문리뷰] FM-Bench: A Benchmark for Long-Horizon Management with Competing Agents
링크: 논문 PDF로 바로 열기
메타데이터
저자: Tianyou Wang, Chongyang Gao, Kezhen Chen, Chen Dong, Yinghao He, Donghan Li, Wangcheng Xu, Hongjiu Zhang, Chi Li
1. Key Terms & Definitions (핵심 용어 및 정의)
- FM-Bench (Football Management Benchmark): 20년이라는 긴 시간 동안 축구 클럽을 운영하며 경쟁 에이전트와 상호작용하는 long-horizon 관리 능력을 측정하는 벤치마크 프레임워크입니다.
- Decision Stops: 에이전트가 26개의 도구를 사용하여 의사결정을 내리고 게임 상태가 진행되는 간헐적인 시점으로, 한 번의 20년 run 동안 약 340~400회 발생합니다.
- Notebook: 에이전트가 다음 decision stop으로 상태를 전달하기 위해 스스로 기록하는 메모리 모듈로, 에이전트의 전략적 의도와 계획을 유지하는 유일한 수단입니다.
- Counter-adaptive Environment: 에이전트의 행동에 따라 시장 가격이 변하거나 경쟁자들이 대응하여 전략적 우위가 시간에 따라 감쇄하는 동적 환경을 의미합니다.
- Solo Track vs. Arena: Solo Track은 단일 모델을 고정된 scripted world에서 평가하는 방식이며, Arena는 15개의 frontier 모델들이 동일한 공유 세계에서 20년 동안 실시간 경쟁하는 헤드 투 헤드 평가 방식입니다.
2. Motivation & Problem Statement (연구 배경 및 문제 정의)
본 논문은 기존의 LLM 에이전트 벤치마크가 단기적이고 고정된 환경의 작업에만 국한되어, 현실적인 '관리(Management)' 능력을 측정하지 못한다는 한계에서 출발합니다. 기존 연구들은 짧은 에피소드 내의 도구 호출 정확도나 단일 deliverable 생성에 집중하여, 초기 결정이 수년 후에 누적된 결과로 나타나는 long-horizon 의사결정의 복잡성을 간과하고 있습니다. 또한, 경쟁 에이전트 간의 상호작용이 존재하는 환경이라 하더라도 단순한 협력이나 단기적인 블러핑 테스트에 머물러 있는 경우가 많습니다. 저자들은 hidden information, cumulative consequences, counter-adaptive market, multi-objective pressure라는 4가지 핵심 요구 사항을 충족하는 진정한 의미의 관리 능력을 측정하기 위해 FM-Bench를 제안합니다 [Figure 1].
3. Method & Key Results (제안 방법론 및 핵심 결과)
본 연구는 20년 동안 지속되는 deterministic 축구 관리 환경을 구축하여 에이전트의 전략적 관리 능력을 정량적으로 평가합니다. 에이전트는 draft, transfer, contract negotiation, facility investment 등 다양한 도구를 사용하여 클럽을 운영하며, board의 평가를 받고 재정적/성적 목표를 달성해야 합니다. 주요 실험 결과로 claude-fable-5 모델이 Solo track과 Arena 양쪽 모두에서 가장 우수한 성능을 보였습니다 [Table 2]. 모델들의 점수 차이는 단순한 컴퓨팅 자원(token spend)이 아니라 managerial behavior, 즉 엔드게임 시 slow-payoff 투자 감소, 현금 운용의 효율성, 계약 갱신 타이밍 등의 행동 양식에서 발생함이 확인되었습니다. 특히 Arena 환경에서는 리그 타이틀이 10개의 모델 사이에서 순환하는 등 모델 간의 경쟁적 역학 관계가 뚜렷하게 관찰되었습니다. 반면, 인간 참가자들은 가장 뛰어난 경우에도 모델들의 점수 분포 하단에 머물러, 이 벤치마크가 단순한 인간 지능을 넘어선 장기 전략 수립 능력을 요구함을 입증했습니다 [Table 3].
4. Conclusion & Impact (결론 및 시사점)
본 논문은 long-horizon 환경에서 LLM 에이전트의 실질적인 관리 능력을 체계적으로 측정할 수 있는 최초의 대규모 다중 에이전트 벤치마크를 제공합니다. 연구 결과, 단순히 모델의 규모나 공급업체가 성능을 보장하지 않으며, 에이전트의 메모리 활용(notebook curation)과 복합적인 제약 조건 하에서의 의사결정 방식이 최종 성패를 결정짓는 핵심 요소임을 밝혀냈습니다. FM-Bench는 향후 복잡한 비즈니스 시뮬레이션 및 다중 에이전트 시스템의 자율적 관리 전략을 연구하는 학계와 산업계에 중요한 평가 척도로 활용될 것입니다.
Part 2: 중요 Figure 정보

Figure 1 — FM-Bench 실행 구조

Figure 2 — 모델별 시즌별 점수 추이
⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.
관련 포스트
- [논문리뷰] OmegaUse-OfficeVal: Benchmarking LLM Agents on Long-Horizon Office-Suite Tasks with Economic Grounding
- [논문리뷰] CoffeeBench: Benchmarking Long-Horizon LLM Agents in Heterogeneous Multi-Agent Economies
- [논문리뷰] LongDS-Bench: On the Failure of Long-Horizon Agentic Data Analysis
- [논문리뷰] E-Commerce Bench: Evaluating LLM Agents on Long-Horizon Autonomous Business Operation
- [논문리뷰] CAST: Critique-Aware Supervision for Training Reliable Long-Horizon Tool-Calling Agents
Review 의 다른글
- 이전글 [논문리뷰] Decision-Metric Alignment in Latent World Models: Diagnostics and Action-Conditioned Objectives for MPC Planning
- 현재글 : [논문리뷰] FM-Bench: A Benchmark for Long-Horizon Management with Competing Agents
- 다음글 [논문리뷰] Looped Language Models Improve Compositional Tool Calling
댓글