[논문리뷰] AI for Games in the Foundation Model Era
링크: 논문 PDF로 바로 열기
저자: Meng Luo, Yanlin Li, Hao Li, et al.
1. Key Terms & Definitions
- Foundation Models (FM): 게임 라이프사이클 전반에 걸쳐 다양한 역할을 수행할 수 있도록 광범위한 데이터로 사전 훈련된 Large-scale AI 모델을 지칭합니다.
- Game Lifecycle: 게임의 기획, 개발, 운영, 테스트 등 전 과정을 의미하며, 본 논문에서는 AI의 역할을 'Play and Act', 'Model Players and Games', 'Design Games', 'Build and Maintain Games', 'Generate and Adapt at Runtime', 'Test and Evaluate Games'의 여섯 가지로 분류합니다 [cite: 1, Figure 2].
- Generalist Agents: 특정 게임에 한정되지 않고 여러 게임 또는 시나리오에서 학습된 역량을 전이(Transfer)하여 다양한 태스크를 수행할 수 있는 AI 에이전트를 말합니다.
- Cross-Role Connections: AI 시스템의 출력이 게임 라이프사이클 내의 다른 AI 역할로 재사용되거나 전이되는 상호작용을 의미합니다.
- Runtime Adaptation: 게임 플레이 중 실시간으로 콘텐츠, 규칙, 난이도, 캐릭터 행동 등을 생성하거나 조정하여 플레이어 경험을 개인화하는 과정입니다.
2. Motivation & Problem Statement
본 논문은 Foundation Models 시대에 접어들면서 게임 AI의 역할이 단순 게임 플레이를 넘어 게임 라이프사이클 전반으로 확장되고 있음을 강조한다 [cite: 1, Figure 1]. 기존 연구들은 게임 플레이(Game Playing), 콘텐츠 생성(Content Generation), 플레이어 모델링(Player Modeling) 등 특정 AI 역할에 초점을 맞춰 개별적으로 발전해왔다. 이러한 개별적인 연구 경향으로 인해, 특정 게임, 엔진, 인터페이스 또는 플레이어 집단에 국한된 역량과 다양한 환경에 전이될 수 있는 범용적 역량을 구분하기 어렵다는 한계가 존재한다. 저자들은 이러한 문제 인식을 바탕으로, AI 출력이 즉각적으로 사용되는 방식에 따라 AI의 여섯 가지 핵심 역할을 정의하고 [cite: 1, Figure 2], 각 역할별 AI 시스템의 구조, 학습 및 생성 방식, 역량 전이(Capability Transfer) 및 아티팩트 재사용(Artifact Reuse) 가능성, 그리고 현재의 평가 증거가 지지하는 주장의 범위를 체계적으로 분석할 필요성을 제기한다. 이 연구는 복잡해지는 게임 개발 및 운영 환경에서 AI의 진정한 가치와 한계를 파악하고, 미래 연구 방향을 제시하는 데 기여하고자 한다.
3. Method & Key Results
저자들은 게임 AI의 역할을 AI that Plays and Acts, AI that Models Players and Games, AI that Designs Games, AI that Builds and Maintains Games, AI that Generates and Adapts at Runtime, AI that Tests and Evaluates Games의 여섯 가지로 분류하는 taxonomy를 제안한다 [cite: 1, Figure 2]. 각 역할에 대해 AI가 제공받는 게임 또는 워크플로우의 구조와 AI가 학습, 생성, 예측 또는 수정하는 요소를 심층적으로 분석한다.
AI that Plays and Acts 분야에서는 Generalist Agents의 발전이 두드러진다 [cite: 1, Figure 6]. 예를 들어, SIMA 2는 여러 상용 게임에서 Instruction Following과 Demonstration을 통해 학습된 Shared Policy를 사용하여 다양한 환경에서의 태스크를 수행한다. NitroGen은 1,000개 이상의 게임에서 40,000시간 이상의 Gameplay Data를 Behavioral Cloning과 Flow Matching에 활용하여 Held-out 게임 10개에서 30가지 태스크를 수행하는 Cross-Game Parameter Transfer 능력을 보여준다. 이는 게임별 특화된 학습(Per-Game Training)과 달리, Shared Policy를 통한 광범위한 재사용 가능성을 제시한다. 또한, Voyager는 Minecraft에서 Curriculum Learning과 Code Skills를 통해 Open-ended Acquisition과 API-mediated Control을 수행하며 장기적인 태스크 해결 능력을 입증했다.
AI that Models Players and Games 분야에서는 World Model의 Fidelity가 핵심 지표다. StatePlay는 Street Fighter III에서 Joint Frames 및 Health, Meters, Timers를 예측하여 0.06 미만의 Normalized State Error를 보고했으며, Mechanics Fidelity Judgments에서 Strongest Stateless Baseline 대비 18.6%p의 성능 향상을 달성했다. 이는 시각적 품질(Perceptual Quality)뿐만 아니라 게임 Mechanics의 정확한 예측이 중요함을 보여준다. Player Models의 경우, Maia4All은 Human Chess Moves 예측 태스크에서 800개의 포지션만으로 53.2%의 정확도를 달성하여 개별 플레이어 행동 예측의 효율성을 입증했다.
AI that Designs Games 분야에서는 MarioGPT가 37개의 Path-annotated Mario Level을 Fine-tuning하여 생성한 250개 레벨 중 88.4%가 A* 에이전트에 의해 해결 가능함을 보였다. 이는 Language-conditioned Generation이 Playable Content를 생성할 수 있음을 입증한다.
AI that Builds and Maintains Games 분야에서는 GameCraft-Bench가 15개 게임 가족의 140개 Godot 태스크에 대해 완전한 게임 프로젝트를 구현하는 능력을 평가했으며, Claude Opus 5 (xhigh) 모델이 68.44점의 종합 점수로 Core Mechanics 및 Functional Visuals 등에서 높은 성능을 보였다 [cite: 1, Table 10]. 이는 LLM 기반 에이전트가 실제 게임 엔진에서 End-to-End 개발 역량을 갖출 수 있음을 시사한다.
전반적으로, 논문은 Foundation Models이 게임 AI의 다양한 역할에 걸쳐 강력한 성능을 보여주지만, 각 역할 내에서 그리고 역할 간에 Transfer 및 Reuse가 발생하는 조건과 그 효과를 명확히 검증하는 것이 중요함을 강조한다. 특히 Generalization 및 Reliability 검증 시, 게임별 구조, 인터페이스, 플레이어 컨텍스트가 미치는 영향을 고려해야 함을 지적한다.
4. Conclusion & Impact
본 논문은 Foundation Models 시대의 게임 AI를 여섯 가지 핵심 역할(Playing & Acting, Modeling Players & Games, Designing Games, Building & Maintaining Games, Generating & Adapting at Runtime, Testing & Evaluating Games)로 분류하고 각 역할별 기술적 진보와 상호 연결성을 체계적으로 분석했다 [cite: 1, Figure 2]. 결론적으로, AI가 게임 라이프사이클 전반에 걸쳐 해석, 생성, 예측 및 수정 기능을 확장하고 있지만, 여전히 컨트롤, 규칙, 상태 표현, 엔진 인터페이스, 인간의 의사결정 등 명시적인 게임 구조에 의존한다는 점을 강조한다.
이 연구는 상호작용 트레이스(Interaction Traces), 학습된 환경(Learned Environments) 또는 상상된 경험(Imagined Experience), 사양 및 규칙(Specifications and Rules), 테스트 피드백(Test Feedback), 플레이어 모델(Player Models) 또는 프로파일(Profiles)의 재사용을 통해 역할 간 연결(Cross-Role Connections)이 발생함을 보여준다. 그러나 이러한 아티팩트 재사용이 곧 Capability Transfer를 의미하지는 않으며, 시스템이 평가되는 게임, 엔진, 인터페이스, 플레이어 집단 및 태스크의 조건에 따라 성능이 좌우된다는 한계를 명확히 지적한다. 이는 AI 시스템의 실제 적용 및 확장을 위한 검증의 중요성을 시사한다.
학계 및 산업계에 미치는 영향은 크다. 첫째, 기존의 파편화된 연구 분야들을 통합하는 Framework를 제공하여, 연구자들이 AI 시스템의 Generalization 및 Reliability를 더 명확하게 평가할 수 있는 기반을 마련했다. 둘째, Foundation Models의 잠재력과 함께 게임별 특수성(Game-Specific Structure)의 중요성을 강조함으로써, 단순히 더 큰 모델을 만드는 것을 넘어 Context-aware 및 Game-aware AI 개발의 필요성을 제시한다. 셋째, 지속적인 Runtime Adaptation, Long-term Software Project 유지보수, Cross-Session Consistency 등 아직 해결되지 않은 주요 도전 과제를 명확히 제시하여 미래 연구 방향을 구체화하는 데 기여한다. 궁극적으로, 이 연구는 개발자 제어(Developer Control), 게임 일관성(Game Consistency), 플레이어 관련성(Player Relevance)을 유지하면서 AI의 재사용 및 전이 역량을 확장하는 것이 게임 AI 발전의 핵심 과제임을 강조한다.

Figure 1 — 파운데이션 모델 시대의 게임 AI 조감도

Figure 2 — AI의 여섯 가지 핵심 역할

Figure 6 — AI 플레이 및 행동 연구 방향
⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.
관련 포스트
- [논문리뷰] NitroGen: An Open Foundation Model for Generalist Gaming Agents
- [논문리뷰] RayOrch: Programming and Executing Lineage-Controlled Multi-Grain Dataflows for Foundation-Model Data Preparation
- [논문리뷰] OmniEdu: Open Foundation Models for Learning and Teaching
- [논문리뷰] Grounded Action Model: 3D Grounding as a Foundation for Robotics
- [논문리뷰] Retention-Constrained Post-Training Quantization of Cellpose-SAM for Stem Cell Microscopy
Review 의 다른글
- 이전글 [논문리뷰] ZGCM-1: A Fully Open and Extremely Efficient Foundation Model for Math and Agentic Search
- 현재글 : [논문리뷰] AI for Games in the Foundation Model Era
- 다음글 [논문리뷰] Another Blueprint In The Wall: How to Ask Frontier AI Like a Kid?
댓글