[논문리뷰] OmniVChat: Synthesizing, Benchmarking, and Training for Native Audio-Visual Dialogue현재 audio-visual dialogue 연구는 데이터 가용성 및 평가라는 두 가지 핵심 제약에 직면해 있습니다. 첫째, 자신의 디바이스를 사용하는 사람들의 녹음 데이터가 매우 부족하며, 노이즈, 카메라 모션, 디바이스 자세 등으로 인해 입력 조건의 long tail 문제가 발생합니다.#Review#Audio-Visual Dialogue#Omni Models#Reinforcement Learning#Data Synthesis#Evaluation Benchmark#Multi-Agent System2026년 9월 20일댓글 수 로딩 중