본문으로 건너뛰기

[논문리뷰] Keep-or-Drop? Adaptive Tokenizer for Compact Video Representation

링크: 논문 PDF로 바로 열기

메타데이터

저자: Yeonkyeong Lee, Hyunsung Go, Jongmin Kim, Sewoong Lim, Donghoon Lee


1. Key Terms & Definitions (핵심 용어 및 정의)

  • KATok: 비디오 콘텐츠의 복잡도에 따라 토큰을 선택적으로 유지하거나 제거하는 Adaptive Tokenizer로, 콘텐츠 기반의 데이터 의존적 압축을 수행합니다.
  • Gumbel–Softmax Relaxation: 모델이 토큰의 중요도를 학습하고 미분 가능한 방식으로 Keep-or-Drop 결정을 내릴 수 있도록 지원하는 확률적 게이팅 메커니즘입니다.
  • Cascaded Generation: 토큰의 위치(Position) 정보와 콘텐츠(Content)를 분리하여 생성하는 방식으로, sparse tokenization 상황에서의 공간적 불일치(Misalignment) 문제를 해결합니다.
  • rFVD (reconstructed Fréchet Video Distance): 재구성된 비디오의 품질을 평가하는 핵심 지표로, 원본 비디오와 모델 출력 간의 통계적 거리를 측정합니다.

2. Motivation & Problem Statement (연구 배경 및 문제 정의)

본 논문은 비디오 데이터의 강한 시공간적 중복성(Spatio-temporal redundancy)을 기존 VAE가 효율적으로 활용하지 못한다는 문제에서 출발합니다. 기존 OmniTokenizer와 같은 고정 길이 토큰화 방식은 영상의 복잡도와 무관하게 고정된 압축 비율을 사용하여 연산 자원을 낭비합니다. 또한, 최근의 가변 길이 토큰화 연구들은 사전에 정의된 토큰 버짓이나 추론 시점의 탐색 비용이 필요하다는 한계가 있습니다. 이러한 비효율성을 극복하기 위해 콘텐츠에 따라 토큰 수를 적응적으로 조정하면서도, 생성 모델 적용 시 발생하는 공간적 불일치 문제를 해결하는 새로운 프레임워크가 필요합니다 [Figure 1].

Figure 1: KATok 전체 아키텍처

Figure 1 — KATok 전체 아키텍처

3. Method & Key Results (제안 방법론 및 핵심 결과)

본 논문은 Gumbel–Softmax 기반의 Adaptive Token Selector를 통해 토큰 중요도를 학습하고 데이터에 의존적인 압축을 수행하는 KATok을 제안합니다. 토큰의 공간적 일관성을 유지하기 위해 학습 시 joint content–position generation을 수행하거나, 추론 시 cascaded mask-prior conditioning을 통해 마스크를 먼저 예측하고 토큰을 생성하는 방식을 채택합니다 [Figure 3]. 실험 결과, KATokPanda-70M 데이터셋에서 기존 Omni-VAE 대비 약 11배 적은 토큰을 사용하고도 우수한 성능을 달성했습니다. 정량적으로 256²×16 해상도에서 PSNR 31.24, rFVD 5.12를 기록하며 높은 압축 효율과 재구성 품질을 입증하였습니다 [Table 1]. 또한, 제안된 모델은 고정 길이 토큰 모델 대비 6.9배 빠른 학습3.2배 빠른 추론 속도를 달성하며 효율성을 극대화했습니다 [Figure 2].

Figure 2: 학습 시간 대비 생성 품질 비교

Figure 2 — 학습 시간 대비 생성 품질 비교

Figure 3: Sparse 콘텐츠 생성 전략

Figure 3 — Sparse 콘텐츠 생성 전략

4. Conclusion & Impact (결론 및 시사점)

본 논문은 비디오의 시공간적 복잡도를 고려하여 토큰의 유지 및 제거를 스스로 결정하는 KATok을 통해 비디오 표현 모델의 새로운 패러다임을 제시합니다. 이 연구는 고해상도 비디오 생성에서 필수적인 연산 효율성 문제를 해결하고, 생성 과정에서의 구조적 정합성을 확보하는 실질적인 해결책을 제공합니다. 향후 Latent Diffusion Models의 효율적인 대규모 학습 및 다양한 비디오 합성 태스크에서 중추적인 아키텍처로 활용될 것으로 기대됩니다.

⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.

댓글

관련 포스트

Review 의 다른글