[논문리뷰] VideoRAE: Taming Video Foundation Models for Generative Modeling via Representation Autoencoders본 논문은 기존의 3D-VAE 기반 비디오 토크나이저가 픽셀 단위의 복원(MSE)에 과도하게 최적화되어 고차원적인 의미론적 구조를 포착하지 못한다는 문제점을 해결하고자 합니다.#Review#Video Foundation Models#Representation Autoencoders#Generative Modeling#Representation Alignment#Latent Spaces#Diffusion Transformers#Autoregressive Models2026년 7월 19일댓글 수 로딩 중