[논문리뷰] Ex-Omni-2D: Expressive Omni-Modal Dialogue Models with Native Visual Presence본 논문은 기존의 omni-modal 대화 모델들이 텍스트와 음성 이해에는 능숙하지만, 시각적 실체가 결여된 'visually disembodied' 상태라는 문제를 해결하기 위해 Ex-Omni-2D를 제안합니다.#Review#Omni-modal Dialogue#Visual Thought Plan#Streaming Student#Multi-codebook Speech Units#Prefix Streaming#Audio-Video Generation2026년 8월 11일댓글 수 로딩 중
[논문리뷰] OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation본 논문은 기존의 독립적인 오디오-비디오 VAE 학습 방식이 초래하는 교차 모달 정렬(cross-modal alignment) 부족 문제를 해결하고자 합니다.#Review#OmniVAE#Cross-modal Alignment#Audio-Video Generation#Latent Diffusion#Contrastive Learning#Semantic Distillation2026년 7월 27일댓글 수 로딩 중
[논문리뷰] AVTok: 1D Unified Tokenization for Holistic Audio-Video Generation본 논문은 기존 오디오-비디오(AV) 생성 모델들이 겪고 있는 고비용의 Dual-branch 아키텍처 문제와 모달리티 간 Representation Gap을 해결하고자 합니다 .#Review#Audio-Video Generation#Unified Tokenization#1D Latent Representation#Dual-stream Transformer#Hierarchical Training#Multimodal Learning2026년 6월 30일댓글 수 로딩 중
[논문리뷰] StreamChar: Long-Horizon Streaming Character Audio-Video Generation with Decoupled Orchestration본 논문은 실시간 streaming 환경에서 긴 호흡의(long-horizon) 캐릭터 오디오-비디오를 생성할 때 발생하는 transcript-audio 불일치와 시각적 품질 저하 문제를 해결합니다 .#Review#Streaming#Character Animation#Audio-Video Generation#Decoupled Orchestration#Diffusion Transformer#Knowledge Distillation#Long-Horizon Coherence2026년 6월 1일댓글 수 로딩 중
[논문리뷰] DreamID-Omni: Unified Framework for Controllable Human-Centric Audio-Video Generation레퍼런스 기반 오디오-비디오 생성(R2AV), 비디오 편집(RV2AV), 오디오 기반 비디오 애니메이션(RA2V)과 같은 인간 중심 태스크들을 개별적으로 처리하는 기존 모델의 한계를 극복하는 것을 목표로 합니다.#Review#Audio-Video Generation#Human-Centric AI#Diffusion Transformer#Multi-Task Learning#Identity Disentanglement#Controllable Generation#Speaker Confusion2026년 2월 25일댓글 수 로딩 중