[논문리뷰] MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities본 논문은 기존의 Any-to-Any 모델들이 Encoder-Decoder나 Diffusion 아키텍처에 의존하여 대규모 사전 학습된 Decoder-only 모델의 강력한 성능을 활용하지 못하는 한계를 해결하고자 합니다.#Review#Any-to-Any#Decoder-Only#Multimodal Generation#Flow Matching#Chained Generation#Unified Tokenization#Multimodal Modeling2026년 7월 28일댓글 수 로딩 중
[논문리뷰] AVTok: 1D Unified Tokenization for Holistic Audio-Video Generation본 논문은 기존 오디오-비디오(AV) 생성 모델들이 겪고 있는 고비용의 Dual-branch 아키텍처 문제와 모달리티 간 Representation Gap을 해결하고자 합니다 .#Review#Audio-Video Generation#Unified Tokenization#1D Latent Representation#Dual-stream Transformer#Hierarchical Training#Multimodal Learning2026년 6월 30일댓글 수 로딩 중