[논문리뷰] VideoRAE: Taming Video Foundation Models for Generative Modeling via Representation Autoencoders본 논문은 기존의 3D-VAE 기반 비디오 토크나이저가 픽셀 단위의 복원(MSE)에 과도하게 최적화되어 고차원적인 의미론적 구조를 포착하지 못한다는 문제점을 해결하고자 합니다.#Review#Video Foundation Models#Representation Autoencoders#Generative Modeling#Representation Alignment#Latent Spaces#Diffusion Transformers#Autoregressive Models2026년 7월 19일댓글 수 로딩 중
[논문리뷰] DecQ: Detail-Condensing Queries for Enhanced Reconstruction and Generation in Representation Autoencoders본 논문은 RAE의 frozen VFM 인코더가 갖는 낮은 공간적 재구성 능력이 고품질 이미지 생성 및 세밀한 편집을 제한하는 문제를 해결하고자 합니다. 기존의 RAE 모델은 고수준의 의미론적 정보를 잘 유지하지만, VFM 학습 목적 상 색상이나 텍스처와 같은 저수준 세부 정보가 누락되는 경향이 있습니다 .#Review#Representation Autoencoders#Vision Foundation Models#Detail-Condensing Queries#Latent Diffusion Models#Image Tokenizer#Reconstruction-Generation Trade-off2026년 5월 21일댓글 수 로딩 중