[논문리뷰] MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities본 논문은 기존의 Any-to-Any 모델들이 Encoder-Decoder나 Diffusion 아키텍처에 의존하여 대규모 사전 학습된 Decoder-only 모델의 강력한 성능을 활용하지 못하는 한계를 해결하고자 합니다.#Review#Any-to-Any#Decoder-Only#Multimodal Generation#Flow Matching#Chained Generation#Unified Tokenization#Multimodal Modeling2026년 7월 28일댓글 수 로딩 중
[논문리뷰] Omni-Diffusion: Unified Multimodal Understanding and Generation with Masked Discrete Diffusion본 논문은 기존 멀티모달 대규모 언어 모델(MLLM)이 주로 사용하는 자기회귀(autoregressive) 아키텍처 의 한계를 극복하고, 텍스트, 음성, 이미지 전반에 걸친 이해 및 생성을 통합할 수 있는 새로운 확률적 모델링 대안 을 탐색하는 것을 목표로 합니다.#Review#Multimodal AI#Discrete Diffusion Models#Masked Language Modeling#Unified Generative Models#Any-to-Any#Speech-to-Image#Visual Question Answering2026년 3월 10일댓글 수 로딩 중