[논문리뷰] VoiceMem: Streaming Dual-Brain Memory for Real-Time Interaction본 논문은 실시간 대화형 AI 시스템에서 필수적인 정보성 기억과 감정적 이해를 결합한 통합 메모리 프레임워크인 VoiceMem을 제안합니다 . 기존의 대화형 시스템은 정보 기억 능력은 갖추고 있으나, 실시간성(Real-Time)과 감정적·인격적 이해(Empathetic)를 동시에 만족하는 데 한계가 있었습니다.#Review#Speech Language Models#Streaming Memory#Dual-Brain Architecture#Real-Time Interaction#Persona Memory#Affective Attribution2026년 8월 26일댓글 수 로딩 중
[논문리뷰] Interleaved Speech Language Models Latently Work In Text본 논문은 Interleaved Speech-Text LMs의 내부 latent space에서 음성과 텍스트 모달리티가 어떻게 상호작용하는지에 대한 불투명성을 해결하고자 한다.#Review#Speech Language Models#Interleaved Training#Logit Lens#Implicit Transcription#Multimodal Latent Space#Cross-modal Alignment2026년 6월 29일댓글 수 로딩 중
[논문리뷰] Sommelier: Scalable Open Multi-turn Audio Pre-processing for Full-duplex Speech Language ModelsAI 패러다임이 Text-based LLMs에서 Speech Language Models (SLMs)로 전환됨에 따라, 실시간의 자연스러운 Human-Computer Interaction을 지원하는 Full-duplex system 에 대한 수요가 증가하고 있습니다.#Review#Full-duplex Speech#Data Pre-processing#Speaker Diarization#Overlap Separation#ASR Ensemble#Speech Language Models2026년 3월 29일댓글 수 로딩 중
[논문리뷰] Do What I Say: A Spoken Prompt Dataset for Instruction-Following현재 Speech Large Language Models (SLLMs) 평가 시 주로 사용되는 텍스트 프롬프트의 한계를 극복하고, 현실적인 음성 기반 명령어 환경 에서 SLLM의 성능을 평가할 수 있는 데이터셋을 구축하는 것이 목표입니다.#Review#Speech Language Models#Instruction Following#Multilingual Dataset#Spoken Prompts#Benchmark#SLLM Evaluation#Prompt Diversity2026년 3월 10일댓글 수 로딩 중