본문으로 건너뛰기

[논문리뷰] Game2World Engine: Unlocking In-the-Wild Gameplay Videos for World Model Training

링크: 논문 PDF로 바로 열기

메타데이터

저자: Wenxuan Shen, Dongna Jin, Dongping Chen, et al.

1. Key Terms & Definitions (핵심 용어 및 정의)

  • GameUI-Taxonomy: 게임 인터페이스(HUD, 메뉴, 알림 등)를 기능적 역할과 렌더링 방식에 따라 분류한 체계적인 표준화 시스템입니다.
  • G2WEngine: 실제 게임 영상에서 UI 자산을 자동 추출하고 이를 클린 영상에 합성하여 학습용 데이터를 구축하는 풀스택 프레임워크입니다.
  • GameCleaner: 마스크 없이 게임 내 UI를 제거하고 배경을 복원하는 multimodal 기반 비디오 편집 모델입니다.
  • AAR (Artificial-Adjusted Removal): UI 제거 성능을 평가하기 위한 지표로, 성공적인 제거와 복원 품질을 종합적으로 반영합니다.

2. Motivation & Problem Statement (연구 배경 및 문제 정의)

본 논문은 다양한 환경과 상호작용 정보를 포함하는 게임 영상이 월드 모델 학습의 핵심 데이터임에도 불구하고, 화면에 포함된 HUD(Head-Up Display)와 같은 비물리적 요소가 학습에 방해가 된다는 문제를 해결합니다 [Figure 1]. 기존의 월드 모델 연구들은 게임 영상을 직접 학습 데이터로 사용하면서 UI를 제거하지 않아 게임 고유의 패턴이 비물리적 노이즈로 작용하는 한계가 있었습니다. 저자들은 UI를 제거한 영상으로 학습할 경우 비디오 보상 및 동작 일관성이 크게 향상됨을 확인하였으며, 이를 위해 정교한 UI 제거 및 데이터 엔진이 필요함을 입증했습니다 [Table 1], [Table 2].

Figure 1: G2WEngine 전체 아키텍처

Figure 1 — G2WEngine 전체 아키텍처

3. Method & Key Results (제안 방법론 및 핵심 결과)

저자들은 UI 이해와 제거를 위해 GameUI-Taxonomy를 정의하고, 이를 바탕으로 G2WEngine을 사용하여 96K개의 합성 영상과 1,079개의 실환경 영상을 포함한 Game2World 데이터셋을 구축했습니다 [Figure 2], [Figure 3]. 제안된 GameCleaner 모델은 MLLM 인코더를 결합한 비디오 diffusion transformer 아키텍처를 채택하여, 별도의 마스크 입력 없이도 시맨틱 이해를 통해 UI를 식별하고 시간적으로 일관된 배경 복원을 수행합니다 [Figure 5]. 실험 결과, GameCleaner는 합성 데이터셋에서 95.36의 AAR을 기록하며 기존 마스크 미사용 모델 대비 57.3% 향상된 성능을 보였습니다 [Table 4]. 또한, 실제 환경(In-the-Wild) 테스트에서도 80.05의 최고 AAR과 99.8%의 배경 보존율을 달성하며 월드 모델 데이터의 품질을 비약적으로 높였습니다 [Table 3].

Figure 2: GameUI-Taxonomy 개요

Figure 2 — GameUI-Taxonomy 개요

Figure 5: GameCleaner 모델 아키텍처

Figure 5 — GameCleaner 모델 아키텍처

4. Conclusion & Impact (결론 및 시사점)

본 논문은 게임 영상의 UI를 정교하게 분리하고 제거함으로써 월드 모델 학습 데이터의 가치를 극대화할 수 있음을 입증했습니다. G2WEngineGameCleaner를 통해 구축된 고품질의 클린 게임 영상 데이터는 향후 더 높은 일반화 성능을 가진 에이전트 및 시뮬레이션 환경 구축에 필수적인 토대가 될 것으로 기대됩니다. 이 연구는 단순히 비디오 편집 기술을 넘어, 인터넷상에 방대한 게임 데이터를 월드 모델 학습을 위한 정제된 자산으로 탈바꿈시켰다는 점에서 큰 학술적 의미를 가집니다.

⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.

댓글

관련 포스트

Review 의 다른글