[논문리뷰] Ex-Omni-2D: Expressive Omni-Modal Dialogue Models with Native Visual Presence본 논문은 기존의 omni-modal 대화 모델들이 텍스트와 음성 이해에는 능숙하지만, 시각적 실체가 결여된 'visually disembodied' 상태라는 문제를 해결하기 위해 Ex-Omni-2D를 제안합니다.#Review#Omni-modal Dialogue#Visual Thought Plan#Streaming Student#Multi-codebook Speech Units#Prefix Streaming#Audio-Video Generation2026년 8월 11일댓글 수 로딩 중