[논문리뷰] OmniVChat: Synthesizing, Benchmarking, and Training for Native Audio-Visual Dialogue현재 audio-visual dialogue 연구는 데이터 가용성 및 평가라는 두 가지 핵심 제약에 직면해 있습니다. 첫째, 자신의 디바이스를 사용하는 사람들의 녹음 데이터가 매우 부족하며, 노이즈, 카메라 모션, 디바이스 자세 등으로 인해 입력 조건의 long tail 문제가 발생합니다.#Review#Audio-Visual Dialogue#Omni Models#Reinforcement Learning#Data Synthesis#Evaluation Benchmark#Multi-Agent System2026년 9월 20일댓글 수 로딩 중
[논문리뷰] InteractiveOmni: A Unified Omni-modal Model for Audio-Visual Multi-turn Dialogue본 논문은 기존 MLLM의 단일 턴 상호작용 및 제한적인 장기 기억 능력 한계를 극복하고자 합니다.#Review#Omni-modal LLM#Audio-Visual Dialogue#Multi-turn Interaction#Speech Generation#Long-term Memory#Multimodal Understanding#End-to-end Training2025년 10월 16일댓글 수 로딩 중