#Speech Language Models

2개의 포스트

[논문리뷰] Sommelier: Scalable Open Multi-turn Audio Pre-processing for Full-duplex Speech Language Models

AI 패러다임이 Text-based LLMs에서 Speech Language Models (SLMs)로 전환됨에 따라, 실시간의 자연스러운 Human-Computer Interaction을 지원하는 Full-duplex system 에 대한 수요가 증가하고 있습니다.

#Review #Full-duplex Speech #Data Pre-processing #Speaker Diarization #Overlap Separation #ASR Ensemble #Speech Language Models

2026년 3월 29일

[논문리뷰] Do What I Say: A Spoken Prompt Dataset for Instruction-Following

현재 Speech Large Language Models (SLLMs) 평가 시 주로 사용되는 텍스트 프롬프트의 한계를 극복하고, 현실적인 음성 기반 명령어 환경 에서 SLLM의 성능을 평가할 수 있는 데이터셋을 구축하는 것이 목표입니다.

#Review #Speech Language Models #Instruction Following #Multilingual Dataset #Spoken Prompts #Benchmark #SLLM Evaluation #Prompt Diversity

2026년 3월 10일