[논문리뷰] UniSpace: Unified Visual Representation and Scalable Multimodal Modeling본 논문은 기존 Multimodal Model이 이해와 생성을 위해 분리된 시각적 표현 공간(주로 Semantic Encoder와 VAE Latent)을 사용하는 문제를 해결하고자 한다 .#Review#Multimodal Modeling#Patch Reparameterization#Unified Visual Representation#Flow Matching#Vision Transformer#Image Generation#Image Editing2026년 8월 23일댓글 수 로딩 중
[논문리뷰] MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities본 논문은 기존의 Any-to-Any 모델들이 Encoder-Decoder나 Diffusion 아키텍처에 의존하여 대규모 사전 학습된 Decoder-only 모델의 강력한 성능을 활용하지 못하는 한계를 해결하고자 합니다.#Review#Any-to-Any#Decoder-Only#Multimodal Generation#Flow Matching#Chained Generation#Unified Tokenization#Multimodal Modeling2026년 7월 28일댓글 수 로딩 중