[논문리뷰] OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation본 논문은 기존의 독립적인 오디오-비디오 VAE 학습 방식이 초래하는 교차 모달 정렬(cross-modal alignment) 부족 문제를 해결하고자 합니다.#Review#OmniVAE#Cross-modal Alignment#Audio-Video Generation#Latent Diffusion#Contrastive Learning#Semantic Distillation2026년 7월 27일댓글 수 로딩 중