[논문리뷰] Video Generation Models are General-Purpose Vision Learners
링크: 논문 PDF로 바로 열기
메타데이터
저자: Letian Wang, Chuhan Zhang, Rishabh Kabra, Jasper Uijlings, Steven Waslander, Andrew Zisserman, Joao Carreira, Kaiming He, Misha Andriluka, Eduard Gabriel Bazavan, Andrei Zanfir, Cristian Sminchisescu
1. Key Terms & Definitions (핵심 용어 및 정의)
- GenCeption: 사전 학습된 text-to-video generative diffusion model을 기반으로 구축된, 텍스트 명령에 따라 다양한 시각적 인식 과제를 수행하는 통합형 비전 일반 모델(Generalist Perception Model)입니다.
- Unified Task Representation: 다양한 Dense/Sparse 인식 과제들을 아키텍처 수정 없이 RGB ambient space나 learnable tokens로 변환하여 하나의 모델이 공통적으로 처리할 수 있게 하는 표현 방식입니다.
- Feed-Forward Reformulation: 확산 모델의 고비용 반복적 샘플링(Iterative Sampling) 과정을 단일 단계의 결정론적 피드포워드 추론으로 재구성하여 높은 추론 효율과 정확도를 달성하는 기술입니다.
- Rectified Flow: 모델의 학습 효율과 성능을 높이기 위해 기존의 노이즈 예측 대신 속도(velocity)를 예측하도록 설계된 최신 확산 학습 objective입니다.
2. Motivation & Problem Statement (연구 배경 및 문제 정의)
본 논문은 컴퓨터 비전 분야가 여전히 개별 과제에 특화된 모델(Specialized Model) 단계에 머물러 있는 문제를 해결하고자 합니다 [Figure 1]. 기존 연구들은 특정 과제(예: Depth, Segmentation)를 위해 아키텍처, 디코더, 손실 함수를 개별적으로 설계해야 하는 한계가 있으며, 이는 언어 모델(LLM)과 같은 통합된 일반 지능으로 나아가는 데 병목이 됩니다. 저자들은 4D 시공간 물리 법칙을 이해하고 풍부한 비전-언어 정렬을 내재한 대규모 text-to-video generation이 비전 분야의 차세대 범용 pre-training paradigm이 될 수 있음을 제안합니다. 이를 통해 연구진은 모델 아키텍처의 수정 없이 데이터 표현 방식만을 조정하여 확장 가능한 일반 비전 지능(Generalist Vision Intelligence)을 실현하고자 합니다.
3. Method & Key Results (제안 방법론 및 핵심 결과)
GenCeption은 기존의 text-to-video diffusion backbone을 활용하여 Dense Perception(Normal, Depth, Segmentation 등)과 Sparse Perception(Keypoint, Camera Pose) 과제를 단일 아키텍처 내에서 처리합니다 [Figure 1]. Dense 과제는 3채널 RGB 공간으로 변환하여 통일하고, Sparse 과제는 학습 가능한 토큰(learnable tokens)을 추가하여 처리하며, 모든 과정은 단일한 L2 loss만으로 최적화됩니다 [Figure 4]. 특히, 고해상도 합성을 위한 Rothko Raymap과 같은 혁신적인 데이터 매핑 기법을 적용하여 고차원 정보를 압축했습니다 [Figure 5]. 실험 결과, GenCeption은 DepthAnything3, SAM3, VGGT-Ω 등 최첨단 전문 모델들과 동등하거나 우수한 성능을 입증했습니다 [Figure 2]. 또한, V-JEPA나 VideoMAE 같은 기존 pre-training 방식 대비 훨씬 적은 데이터로도 우수한 성능을 보이며, 심지어 합성 데이터만으로 학습했음에도 실세계 영상 및 OOD(Out-of-Distribution) 객체에 대한 탁월한 일반화 능력을 확인하였습니다 [Table 1, Figure 2].
4. Conclusion & Impact (결론 및 시사점)
본 논문은 비디오 생성 모델이 단순히 영상을 합성하는 도구를 넘어, 강력한 시공간적 물리 priors를 학습한 범용 비전 학습 모델(General-Purpose Vision Learner)임을 증명합니다. GenCeption의 성공적인 구현은 비전 분야에서도 LLM과 같은 Generalist 모델로의 패러다임 전환이 가능함을 보여주며, 데이터 중심의 설계가 어떻게 모델의 복잡성을 줄이고 효율적으로 과제를 확장할 수 있는지 입증했습니다. 이는 향후 물리 세계를 이해하는 더욱 지능적이고 범용적인 시각 모델 개발에 중요한 토대가 될 것입니다.
⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.
관련 포스트
- [논문리뷰] MilliVid: Hierarchical Latents for Long-Range Consistency in Video Generation
- [논문리뷰] Latent Spatial Memory for Video World Models
- [논문리뷰] Physics in 2-Steps: Locking Motion Priors Before Visual Refinement Erases Them
- [논문리뷰] YoCausal: How Far is Video Generation from World Model? A Causality Perspective
- [논문리뷰] Geo-Align: Video Generation Alignment via Metric Geometry Reward
Review 의 다른글
- 이전글 [논문리뷰] VaseMuseum: Digital Intelligent Museum for Ancient Greek Pottery
- 현재글 : [논문리뷰] Video Generation Models are General-Purpose Vision Learners
- 다음글 [논문리뷰] 4D Human-Scene Reconstruction from Low-Overlap Captures
댓글