Phone-Level Prosody Modelling with GMM-Based MDN for Diverse and Controllable Speech Synthesis
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Du, Chenpeng, Yu, Kai |
|---|---|
| Format: | Preprint |
| Publié: |
2021
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
VQTTS: High-Fidelity Text-to-Speech Synthesis with Self-Supervised VQ Acoustic Feature
par: Du, Chenpeng, et autres
Publié: (2022)
par: Du, Chenpeng, et autres
Publié: (2022)
Acoustic BPE for Speech Generation with Discrete Tokens
par: Shen, Feiyu, et autres
Publié: (2023)
par: Shen, Feiyu, et autres
Publié: (2023)
Towards Expressive Zero-Shot Speech Synthesis with Hierarchical Prosody Modeling
par: Jiang, Yuepeng, et autres
Publié: (2024)
par: Jiang, Yuepeng, et autres
Publié: (2024)
Attention-Constrained Inference for Robust Decoder-Only Text-to-Speech
par: Wang, Hankun, et autres
Publié: (2024)
par: Wang, Hankun, et autres
Publié: (2024)
VALL-T: Decoder-Only Generative Transducer for Robust and Decoding-Controllable Text-to-Speech
par: Du, Chenpeng, et autres
Publié: (2024)
par: Du, Chenpeng, et autres
Publié: (2024)
Multi-Speaker Multi-Lingual VQTTS System for LIMMITS 2023 Challenge
par: Du, Chenpeng, et autres
Publié: (2023)
par: Du, Chenpeng, et autres
Publié: (2023)
Prosody Labeling with Phoneme-BERT and Speech Foundation Models
par: Koriyama, Tomoki
Publié: (2025)
par: Koriyama, Tomoki
Publié: (2025)
DiffProsody: Diffusion-based Latent Prosody Generation for Expressive Speech Synthesis with Prosody Conditional Adversarial Training
par: Oh, Hyung-Seok, et autres
Publié: (2023)
par: Oh, Hyung-Seok, et autres
Publié: (2023)
ProsodyFM: Unsupervised Phrasing and Intonation Control for Intelligible Speech Synthesis
par: He, Xiangheng, et autres
Publié: (2024)
par: He, Xiangheng, et autres
Publié: (2024)
UniCATS: A Unified Context-Aware Text-to-Speech Framework with Contextual VQ-Diffusion and Vocoding
par: Du, Chenpeng, et autres
Publié: (2023)
par: Du, Chenpeng, et autres
Publié: (2023)
Why Do Speech Language Models Fail to Generate Semantically Coherent Outputs? A Modality Evolving Perspective
par: Wang, Hankun, et autres
Publié: (2024)
par: Wang, Hankun, et autres
Publié: (2024)
Objective Evaluation of Prosody and Intelligibility in Speech Synthesis via Conditional Prediction of Discrete Tokens
par: Ulgen, Ismail Rasim, et autres
Publié: (2025)
par: Ulgen, Ismail Rasim, et autres
Publié: (2025)
Speech Diarization and ASR with GMM
par: Sharma, Aayush Kumar, et autres
Publié: (2023)
par: Sharma, Aayush Kumar, et autres
Publié: (2023)
LSCodec: Low-Bitrate and Speaker-Decoupled Discrete Speech Codec
par: Guo, Yiwei, et autres
Publié: (2024)
par: Guo, Yiwei, et autres
Publié: (2024)
Two-Path GMM-ResNet and GMM-SENet for ASV Spoofing Detection
par: Lei, Zhenchun, et autres
Publié: (2024)
par: Lei, Zhenchun, et autres
Publié: (2024)
Phone-purity Guided Discrete Tokens for Dysarthric Speech Recognition
par: Wang, Huimeng, et autres
Publié: (2025)
par: Wang, Huimeng, et autres
Publié: (2025)
GMM-ResNet2: Ensemble of Group ResNet Networks for Synthetic Speech Detection
par: Lei, Zhenchun, et autres
Publié: (2024)
par: Lei, Zhenchun, et autres
Publié: (2024)
Word-Level Emotional Expression Control in Zero-Shot Text-to-Speech Synthesis
par: Wang, Tianrui, et autres
Publié: (2025)
par: Wang, Tianrui, et autres
Publié: (2025)
Benchmarking Prosody Encoding in Discrete Speech Tokens
par: Onda, Kentaro, et autres
Publié: (2025)
par: Onda, Kentaro, et autres
Publié: (2025)
Stable-TTS: Stable Speaker-Adaptive Text-to-Speech Synthesis via Prosody Prompting
par: Han, Wooseok, et autres
Publié: (2024)
par: Han, Wooseok, et autres
Publié: (2024)
MiSTR: Multi-Modal iEEG-to-Speech Synthesis with Transformer-Based Prosody Prediction and Neural Phase Reconstruction
par: Al-Radhi, Mohammed Salah, et autres
Publié: (2025)
par: Al-Radhi, Mohammed Salah, et autres
Publié: (2025)
Phone Duration Modeling for Speaker Age Estimation in Children
par: Shivakumar, Prashanth Gurunath, et autres
Publié: (2021)
par: Shivakumar, Prashanth Gurunath, et autres
Publié: (2021)
DiffStyleTTS: Diffusion-based Hierarchical Prosody Modeling for Text-to-Speech with Diverse and Controllable Styles
par: Liu, Jiaxuan, et autres
Publié: (2024)
par: Liu, Jiaxuan, et autres
Publié: (2024)
Hierarchical Control of Emotion Rendering in Speech Synthesis
par: Inoue, Sho, et autres
Publié: (2024)
par: Inoue, Sho, et autres
Publié: (2024)
Combining Masked Language Modeling and Cross-Modal Contrastive Learning for Prosody-Aware TTS
par: Borodin, Kirill, et autres
Publié: (2026)
par: Borodin, Kirill, et autres
Publié: (2026)
DrawSpeech: Expressive Speech Synthesis Using Prosodic Sketches as Control Conditions
par: Chen, Weidong, et autres
Publié: (2025)
par: Chen, Weidong, et autres
Publié: (2025)
Enabling Beam Search for Language Model-Based Text-to-Speech Synthesis
par: Tu, Zehai, et autres
Publié: (2024)
par: Tu, Zehai, et autres
Publié: (2024)
Hierarchical Emotion Prediction and Control in Text-to-Speech Synthesis
par: Inoue, Sho, et autres
Publié: (2024)
par: Inoue, Sho, et autres
Publié: (2024)
FireRedTTS: A Foundation Text-To-Speech Framework for Industry-Level Generative Speech Applications
par: Guo, Hao-Han, et autres
Publié: (2024)
par: Guo, Hao-Han, et autres
Publié: (2024)
Speech is More Than Words: Do Speech-to-Text Translation Systems Leverage Prosody?
par: Tsiamas, Ioannis, et autres
Publié: (2024)
par: Tsiamas, Ioannis, et autres
Publié: (2024)
AutoProsody: A Prosodic Feature Extraction Tool for Indian Languages
par: Thinakaran, Preethi, et autres
Publié: (2025)
par: Thinakaran, Preethi, et autres
Publié: (2025)
VoiceFlow: Efficient Text-to-Speech with Rectified Flow Matching
par: Guo, Yiwei, et autres
Publié: (2023)
par: Guo, Yiwei, et autres
Publié: (2023)
A Multi-Stage Framework for Multimodal Controllable Speech Synthesis
par: Niu, Rui, et autres
Publié: (2025)
par: Niu, Rui, et autres
Publié: (2025)
DAIEN-TTS: Disentangled Audio Infilling for Environment-Aware Text-to-Speech Synthesis
par: Lu, Ye-Xin, et autres
Publié: (2025)
par: Lu, Ye-Xin, et autres
Publié: (2025)
Distinguishing Neural Speech Synthesis Models Through Fingerprints in Speech Waveforms
par: Zhang, Chu Yuan, et autres
Publié: (2023)
par: Zhang, Chu Yuan, et autres
Publié: (2023)
Balalaika: Data-Centric, Prosody-Aware Annotation Pipeline for Russian Speech
par: Borodin, Kirill, et autres
Publié: (2025)
par: Borodin, Kirill, et autres
Publié: (2025)
Vox-Profile: A Speech Foundation Model Benchmark for Characterizing Diverse Speaker and Speech Traits
par: Feng, Tiantian, et autres
Publié: (2025)
par: Feng, Tiantian, et autres
Publié: (2025)
SoCodec: A Semantic-Ordered Multi-Stream Speech Codec for Efficient Language Model Based Text-to-Speech Synthesis
par: Guo, Haohan, et autres
Publié: (2024)
par: Guo, Haohan, et autres
Publié: (2024)
Seed-ASR: Understanding Diverse Speech and Contexts with LLM-based Speech Recognition
par: Bai, Ye, et autres
Publié: (2024)
par: Bai, Ye, et autres
Publié: (2024)
Disentangling the Prosody and Semantic Information with Pre-trained Model for In-Context Learning based Zero-Shot Voice Conversion
par: Chen, Zhengyang, et autres
Publié: (2024)
par: Chen, Zhengyang, et autres
Publié: (2024)
Documents similaires
-
VQTTS: High-Fidelity Text-to-Speech Synthesis with Self-Supervised VQ Acoustic Feature
par: Du, Chenpeng, et autres
Publié: (2022) -
Acoustic BPE for Speech Generation with Discrete Tokens
par: Shen, Feiyu, et autres
Publié: (2023) -
Towards Expressive Zero-Shot Speech Synthesis with Hierarchical Prosody Modeling
par: Jiang, Yuepeng, et autres
Publié: (2024) -
Attention-Constrained Inference for Robust Decoder-Only Text-to-Speech
par: Wang, Hankun, et autres
Publié: (2024) -
VALL-T: Decoder-Only Generative Transducer for Robust and Decoding-Controllable Text-to-Speech
par: Du, Chenpeng, et autres
Publié: (2024)