[논문리뷰] Keep-or-Drop? Adaptive Tokenizer for Compact Video Representation본 논문은 비디오 데이터의 강한 시공간적 중복성(Spatio-temporal redundancy)을 기존 VAE가 효율적으로 활용하지 못한다는 문제에서 출발합니다. 기존 OmniTokenizer와 같은 고정 길이 토큰화 방식은 영상의 복잡도와 무관하게 고정된 압축 비율을 사용하여 연산 자원을 낭비합니다.#Review#VAE#Adaptive Tokenization#Video Diffusion Model#Token Sparsity#Cascaded Generation#Spatio-temporal Redundancy2026년 8월 31일댓글 수 로딩 중
[논문리뷰] A Frame is Worth One Token: Efficient Generative World Modeling with Delta Tokens저자들은 비디오 프레임 전체를 모델링하는 대신, 프레임 간의 '변화(Delta)'만을 압축하는 DeltaTok과 이를 기반으로 생성적 추론을 수행하는 DeltaWorld를 제안합니다. DeltaTok은 이전 프레임의 특징을 바탕으로 현재 프레임과의 차이를 단일 토큰으로 인코딩하여 비디오를 순수 시간적 시퀀스로 변환합니다 .#Review#Generative World Modeling#Delta Tokens#Visual Tokenization#Vision Foundation Models#Best-of-Many Training#Spatio-temporal Redundancy#Efficient Inference2026년 4월 8일댓글 수 로딩 중