[논문리뷰] Beyond Visual Similarity: Entity-Aligned Retrieval for Knowledge-Based Visual Question Answering본 연구는 기존 KB-VQA 파이프라인에서 사용하는 CLIP 스타일의 듀얼 인코더가 지닌 표면적 시각적 유사성(surface-level visual similarity) 기반 검색의 한계를 해결하고자 합니다.#Review#Knowledge-Based VQA#Retrieval Augmented Generation#Multimodal Large Language Models#Entity-Aligned Retrieval#Semantic Distillation#Hard Negative Sampling2026년 9월 2일댓글 수 로딩 중
[논문리뷰] OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation본 논문은 기존의 독립적인 오디오-비디오 VAE 학습 방식이 초래하는 교차 모달 정렬(cross-modal alignment) 부족 문제를 해결하고자 합니다.#Review#OmniVAE#Cross-modal Alignment#Audio-Video Generation#Latent Diffusion#Contrastive Learning#Semantic Distillation2026년 7월 27일댓글 수 로딩 중