[논문리뷰] StepAudio 3 Realtime Technical Report본 논문은 실시간 음성 대화 시스템에서 발생하는 깊은 추론과 즉각적인 응답 사이의 상충 관계(Tension)를 해결하는 것을 목표로 합니다. 기존의 실시간 음성 모델들은 응답 속도를 위해 추론을 희생하거나, 반대로 깊은 추론을 위해 응답 지연을 초래하는 한계가 있었습니다.#Review#Audio-Language Model#Realtime Interaction#Full-Duplex#Think-While-Speaking#Conversational Intelligence#Speech Recognition2026년 9월 15일댓글 수 로딩 중
[논문리뷰] MiDashengLM: Efficient Audio Understanding with General Audio Captions본 논문은 기존 대규모 오디오 언어 모델(LALM)이 직면한 폐쇄형 데이터 의존성, 일반화 및 접근성 한계, 그리고 자동 음성 인식(ASR) 기반 사전 훈련의 비효율성을 해결하고자 합니다.#Review#Audio-Language Model#General Audio Captions#Audio Understanding#Speech Recognition#Efficient Inference#Public Datasets#Multimodality#Data Curation2025년 8월 7일댓글 수 로딩 중