[논문리뷰] FATE: Frame-Level Audio-Visual Temporal Embedding본 논문은 오디오-비주얼 모델에서 '무엇(what)'에 해당하는 의미적 정보와 '언제(when)'에 해당하는 시간적 정렬 정보가 효과적으로 결합되지 못하는 문제를 해결합니다.#Review#Audio-Visual Embedding#Temporal Alignment#Contrastive Learning#Event Localization#Cross-Modal Retrieval#Frame-Level Representation2026년 8월 9일댓글 수 로딩 중