[논문리뷰] Keep-or-Drop? Adaptive Tokenizer for Compact Video Representation본 논문은 비디오 데이터의 강한 시공간적 중복성(Spatio-temporal redundancy)을 기존 VAE가 효율적으로 활용하지 못한다는 문제에서 출발합니다. 기존 OmniTokenizer와 같은 고정 길이 토큰화 방식은 영상의 복잡도와 무관하게 고정된 압축 비율을 사용하여 연산 자원을 낭비합니다.#Review#VAE#Adaptive Tokenization#Video Diffusion Model#Token Sparsity#Cascaded Generation#Spatio-temporal Redundancy2026년 8월 31일댓글 수 로딩 중