[논문리뷰] StepAudio 3 Gen Technical Report기존 오디오 생성 연구는 Text-to-Speech (TTS), Text-to-Audio, Text-to-Music 등 개별 도메인에 특화되어 발전해 왔으며, 이는 다양한 종류의 오디오를 필요로 하는 애플리케이션에서 호환되지 않는 표현, 컨디셔닝 형식, 및 생성 파이프라인 문제를 야기했습니다.#Review#Audio Generation#Discrete Autoregressive Modeling#Residual Vector Quantization (RVQ)#Text-to-Speech (TTS)#Voice Design#Interference-aware Pretraining#RVQ Adaptor#Unified Audio Model2026년 9월 13일댓글 수 로딩 중