#LLM-based Audio Model

1개의 포스트

[논문리뷰] Step-Audio-EditX Technical Report

이 논문은 표현력이 풍부하고 반복적인 음성 편집(감정, 말하기 스타일, 운율 포함)과 강력한 제로샷 텍스트-음성 변환(TTS) 기능을 제공하는 최초의 오픈소스 LLM 기반 오디오 모델인 Step-Audio-EditX 를 제안합니다.

#Review #LLM-based Audio Model #Audio Editing #Text-to-Speech (TTS)#Zero-shot Learning #Large-Margin Data #Reinforcement Learning (RLHF)#Emotion Control #Speaking Style Transfer

2025년 11월 9일