#Emotion Control

2개의 포스트

[논문리뷰] Step-Audio-EditX Technical Report

이 논문은 표현력이 풍부하고 반복적인 음성 편집(감정, 말하기 스타일, 운율 포함)과 강력한 제로샷 텍스트-음성 변환(TTS) 기능을 제공하는 최초의 오픈소스 LLM 기반 오디오 모델인 Step-Audio-EditX 를 제안합니다.

#Review #LLM-based Audio Model #Audio Editing #Text-to-Speech (TTS)#Zero-shot Learning #Large-Margin Data #Reinforcement Learning (RLHF)#Emotion Control #Speaking Style Transfer

2025년 11월 9일

[논문리뷰] Marco-Voice Technical Report

본 논문은 음성 복제(voice cloning)와 감정 제어(emotion control)를 통합한 다기능 음성 합성 시스템 인 Marco-Voice 를 개발하는 것을 목표로 합니다.

#Review #Speech Synthesis #Voice Cloning #Emotion Control #Text-to-Speech #Disentanglement #Contrastive Learning #Flow Matching #Emotional Speech Dataset

2025년 8월 8일