#Audio-Visual Synthesis

1개의 포스트

[논문리뷰] ViSAudio: End-to-End Video-Driven Binaural Spatial Audio Generation

본 논문은 기존 비디오-오디오 생성 모델이 모노 출력에 국한되어 공간적 몰입감이 부족하며, 기존 바이노럴 접근 방식이 2단계 파이프라인(모노 생성 후 공간화)으로 인한 오류 누적과 시공간 불일치 문제를 겪는 한계를 해결하고자 합니다.

#Review #Binaural Audio Generation #Spatial Audio #Video-Driven #End-to-End #Conditional Flow Matching #Multimodal AI #Deep Learning #Audio-Visual Synthesis

2025년 12월 2일