본문으로 건너뛰기

[논문리뷰] VideoRAE: Taming Video Foundation Models for Generative Modeling via Representation Autoencoders

링크: 논문 PDF로 바로 열기

메타데이터

저자: Zhihao Xie, Junfeng Wu, Xinting Hu, Junchao Huang, Li Jiang, et al.


1. Key Terms & Definitions (핵심 용어 및 정의)

  • VideoRAE: 고정된 VFM(Video Foundation Model)을 인코더로 활용하여, 의미론적으로 풍부하고 생성을 위한 최적화된 latent space를 제공하는 비디오 오토인코더 프레임워크입니다.
  • VFM (Video Foundation Model): V-JEPA 2VideoMAEv2와 같이 방대한 데이터를 통해 학습된, 정교한 시공간적 특징 추출 능력을 갖춘 사전 학습 모델입니다.
  • REPA (Representation Alignment): 디코더와 VFM 교사 모델 간의 로컬 및 글로벌 의미론적 일치를 강제하여, KL-divergence 손실 없이도 latent space의 구조적 안정성을 유지하는 핵심 기법입니다.
  • Multi-Codebook SimVQ: 고차원 시맨틱 정보를 효과적으로 압축하고, 코드북 붕괴를 방지하면서도 생성 모델이 학습 가능한 이산적 latent 표현을 제공하는 양자화 전략입니다.

2. Motivation & Problem Statement (연구 배경 및 문제 정의)

본 논문은 기존의 3D-VAE 기반 비디오 토크나이저가 픽셀 단위의 복원(MSE)에 과도하게 최적화되어 고차원적인 의미론적 구조를 포착하지 못한다는 문제점을 해결하고자 합니다. 기존 방식은 픽셀 수준의 복원에 치중하여 시공간적 동역학이나 전역적 의미를 제대로 학습하지 못하며, 이로 인해 하위 생성 모델이 학습 과정에서 심각한 데이터 요구량과 복잡성에 직면하게 됩니다. 저자들은 사전 학습된 VFM을 단순한 이해(Understanding) 도구가 아닌, 고품질 생성을 위한 강력한 오토인코더의 기반으로 변환할 수 있는지를 탐구합니다 [Figure 1].

Figure 1: 기존 VAE와 VideoRAE의 구조 비교

Figure 1 — 기존 VAE와 VideoRAE의 구조 비교

3. Method & Key Results (제안 방법론 및 핵심 결과)

본 논문은 VFM에서 추출된 계층적 특징을 1D self-attention projector를 통해 압축하고, REPA를 통해 디코더를 정렬하는 VideoRAE 프레임워크를 제안합니다 [Figure 2]. VideoRAE는 연속적 잠재 공간(Diffusion Transformers용)과 이산적 잠재 공간(Autoregressive 모델용)을 단일 프레임워크 내에서 모두 지원합니다. 주요 실험 결과로 UCF-101 데이터셋에서 클래스-투-비디오 생성 시, ARDiT 생성기 각각에서 gFVD 40과 93이라는 SOTA 성능을 달성하였습니다 [Table 3, Table 4]. 또한, 기존 LTX-VAE 기반 시스템 대비 2B 규모의 텍스트-투-비디오 실험에서 더 빠른 수렴 속도와 우수한 VBench 성능을 기록했습니다 [Figure 8]. 이는 VideoRAE가 픽셀 수준의 Fidelity를 넘어, 의미론적으로 구조화된 잠재 공간을 통해 생성 모델의 학습 부담을 대폭 완화함을 입증합니다.

Figure 2: VideoRAE 전체 아키텍처

Figure 2 — VideoRAE 전체 아키텍처

4. Conclusion & Impact (결론 및 시사점)

본 연구는 사전 학습된 VFM이 비디오 생성 모델의 오토인코더로서 뛰어난 성능을 발휘할 수 있음을 체계적으로 증명하였습니다. REPA 기법을 통한 의미론적 일치는 KL-divergence 없이도 안정적인 latent manifold를 구축하는 혁신적인 접근법을 제시합니다. 이러한 발견은 시각적 이해와 생성을 분리해왔던 기존 패러다임을 통합하여, 생성 모델의 학습 효율성을 5배 이상 가속화하는 중요한 시사점을 제공합니다. 향후 VideoRAE는 비디오 생성 연구에서 VFM 기반 표현 학습의 표준으로 자리 잡을 것으로 기대됩니다.

⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.

댓글

관련 포스트

Review 의 다른글