[논문리뷰] Building and Evaluating Fixed-Voice Thai TTS from Synthetic Speech
링크: 논문 PDF로 바로 열기
메타데이터
저자: Kunat Pipatanakul, Potsawee Manakul, Warit Sirichotedumrong, Sittipong Sripaisarnmongkol, Pakorn Nathong, Phatrasek Jirabovonvisut
1. Key Terms & Definitions (핵심 용어 및 정의)
- Zero-Shot Teacher: 대규모 generative voice-cloning 모델(예: OmniVoice)을 지칭하며, 짧은 reference audio를 통해 고품질의 합성 데이터를 생성하는 역할을 수행합니다.
- Fixed-Voice Student: Kokoro 82M backbone을 기반으로 한 소형 모델로, 고비용의 reference audio 없이 온디바이스(on-device) 환경에서 특정 목소리를 구현하는 TTS 모델입니다.
- CER (Character Error Rate): 태국어 등에서 합성된 음성의 문장 단위 전사 정확도를 측정하는 표준 지표입니다.
- Challenge-Set Keyword Accuracy: 일반적인 CER이 포착하지 못하는 고난도 표현(고유 명사, 코드 스위칭 등)의 발음 정확도를 별도의 1,531개 항목으로 평가하는 지표입니다.
- Prosody Pause Accuracy: 발화 중 pause가 언어적으로 적절한 위치(allowed position)에 존재하는지를 정량적으로 평가하는 지표입니다.
2. Motivation & Problem Statement (연구 배경 및 문제 정의)
본 연구는 자원이 제한적인 환경(low-resource)에서 고품질의 Thai TTS를 효율적으로 배포하기 위한 새로운 파이프라인을 구축하고자 합니다. 기존 방식은 대규모 generative 모델을 사용하는 고비용의 클라우드 서비스나, 특정 화자의 대규모 데이터를 요구하는 고정 화자 모델 중 하나를 선택해야 하는 한계가 있습니다. 특히 태국어는 불분명한 단어 경계, 성조, 외래어, 그리고 태국어-영어 코드 스위칭으로 인해 기존 TTS 모델이 발음이나 pause 배치에서 오류를 발생시키기 쉽습니다. 저자들은 대규모 Zero-Shot Teacher 모델로부터 지식 증류(Knowledge Distillation)를 통해 합성 데이터를 생성하고, 이를 활용해 고품질의 소형 Fixed-Voice Student 모델을 학습시키는 효율적인 방안을 제안합니다 [Figure 1].
3. Method & Key Results (제안 방법론 및 핵심 결과)
저자들은 태국어 텍스트 준비, OmniVoice 기반의 합성 음성 생성, 품질 필터링 및 재샘플링, 그리고 Kokoro 기반의 소형 모델 학습으로 구성된 파이프라인을 제안합니다. 특히, 품질 필터링 과정에서 Pronunciation, Prosody Pause, Speaking Rate 등을 엄격히 점검하며, 필터링에서 거절된 샘플을 재샘플링(rejection sampling)함으로써 훈련 데이터의 커버리지를 보존합니다 [Figure 1]. 최종 모델인 Wayu-Paxa-TTS-Edge는 82M 파라미터로 구축되었으며, 3.7%의 태국어 CER과 91.4%의 Pause Precision을 달성하였습니다. 또한, Gemini 3.1 대비 Challenge-Set Keyword Accuracy에서 85.5% 수준(68.2%)의 성능을 보였으며, 기존 교사 모델인 OmniVoice의 성능을 상회하는 발화 품질을 증명하였습니다. 성능 평가를 위해 CER뿐만 아니라 Challenge-Set Keyword Accuracy, Prosody Pause Accuracy 등 다차원적 평가 지표를 활용하였습니다 [Figure 2], [Figure 3].
4. Conclusion & Impact (결론 및 시사점)
본 논문은 대규모 생성 모델을 활용한 고품질 합성 데이터 구축 및 효율적인 학생 모델 학습 프레임워크를 통해, 저자원 언어인 태국어에서도 고성능의 Fixed-Voice TTS가 가능함을 입증하였습니다. 특히, 단순 CER 지표만으로는 파악하기 어려운 Prosody 및 고난도 표현의 발음 오류를 정확하게 측정하는 포괄적인 평가 프레임워크를 도입했다는 점에서 의의가 큽니다. 이러한 연구는 향후 다양한 언어 환경에서 온디바이스 TTS 배포를 위한 핵심 기술로서, 산업계의 IVR 시스템이나 개인 브랜드 음성 생성 서비스 구현에 중요한 토대를 마련할 것으로 기대됩니다.
⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.
관련 포스트
- [논문리뷰] The Tasteful Agent: Measuring and Improving Taste in Long-Horizon Tasks
- [논문리뷰] Calibrating Teacher--Student Discrepancy for On-Policy Distillation
- [논문리뷰] What Does Privileged Information Add to On-Policy Self-Distillation?
- [논문리뷰] What Did I Just Say? Self-Listening for Full-Duplex Speech Models
- [논문리뷰] One Symptom, Three Levers: A Critical Review of On-Policy Self-Distillation
Review 의 다른글
- 이전글 [논문리뷰] Breaking the Vision-Action Shortcut: Latent Interface Training for Generalizable Robotics Foundation Models
- 현재글 : [논문리뷰] Building and Evaluating Fixed-Voice Thai TTS from Synthetic Speech
- 다음글 [논문리뷰] COBRA-Skills: Contextual Bandit-Guided Evolution for Agent Skill Optimization
댓글