DurIAN-E 2: Duration Informed Attention Network with Adaptive Variational Autoencoder and Adversarial Learning for Expressive Text-to-Speech Synthesis
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Gu, Yu, Zhu, Qiushi, Lei, Guangzhi, Weng, Chao, Su, Dan |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
DrawSpeech: Expressive Speech Synthesis Using Prosodic Sketches as Control Conditions
par: Chen, Weidong, et autres
Publié: (2025)
par: Chen, Weidong, et autres
Publié: (2025)
Accented Text-to-Speech Synthesis with a Conditional Variational Autoencoder
par: Melechovsky, Jan, et autres
Publié: (2022)
par: Melechovsky, Jan, et autres
Publié: (2022)
MSceneSpeech: A Multi-Scene Speech Dataset For Expressive Speech Synthesis
par: Yang, Qian, et autres
Publié: (2024)
par: Yang, Qian, et autres
Publié: (2024)
Adaptive Duration Model for Text Speech Alignment
par: Cao, Junjie
Publié: (2025)
par: Cao, Junjie
Publié: (2025)
Boosting Multi-Speaker Expressive Speech Synthesis with Semi-supervised Contrastive Learning
par: Zhu, Xinfa, et autres
Publié: (2023)
par: Zhu, Xinfa, et autres
Publié: (2023)
Towards Expressive Zero-Shot Speech Synthesis with Hierarchical Prosody Modeling
par: Jiang, Yuepeng, et autres
Publié: (2024)
par: Jiang, Yuepeng, et autres
Publié: (2024)
Variational Autoencoder for Personalized Pathological Speech Enhancement
par: Hou, Mingchi, et autres
Publié: (2025)
par: Hou, Mingchi, et autres
Publié: (2025)
MM-TTS: Multi-modal Prompt based Style Transfer for Expressive Text-to-Speech Synthesis
par: Guan, Wenhao, et autres
Publié: (2023)
par: Guan, Wenhao, et autres
Publié: (2023)
Learning Expressive Disentangled Speech Representations with Soft Speech Units and Adversarial Style Augmentation
par: Deng, Yimin, et autres
Publié: (2024)
par: Deng, Yimin, et autres
Publié: (2024)
DubWise: Video-Guided Speech Duration Control in Multimodal LLM-based Text-to-Speech for Dubbing
par: Sahipjohn, Neha, et autres
Publié: (2024)
par: Sahipjohn, Neha, et autres
Publié: (2024)
DurFlex-EVC: Duration-Flexible Emotional Voice Conversion Leveraging Discrete Representations without Text Alignment
par: Oh, Hyung-Seok, et autres
Publié: (2024)
par: Oh, Hyung-Seok, et autres
Publié: (2024)
NV-Bench: Benchmark of Nonverbal Vocalization Synthesis for Expressive Text-to-Speech Generation
par: Ni, Qinke, et autres
Publié: (2026)
par: Ni, Qinke, et autres
Publié: (2026)
Generative Expressive Conversational Speech Synthesis
par: Liu, Rui, et autres
Publié: (2024)
par: Liu, Rui, et autres
Publié: (2024)
Computational Narrative Understanding for Expressive Text-to-Speech
par: Michel, Gaspard, et autres
Publié: (2025)
par: Michel, Gaspard, et autres
Publié: (2025)
Multichannel AV-wav2vec2: A Framework for Learning Multichannel Multi-Modal Speech Representation
par: Zhu, Qiushi, et autres
Publié: (2024)
par: Zhu, Qiushi, et autres
Publié: (2024)
Semantic MIMO Systems for Speech-to-Text Transmission
par: Weng, Zhenzi, et autres
Publié: (2024)
par: Weng, Zhenzi, et autres
Publié: (2024)
RAF: Relativistic Adversarial Feedback For Universal Speech Synthesis
par: Lee, Yongjoon, et autres
Publié: (2026)
par: Lee, Yongjoon, et autres
Publié: (2026)
ParaStyleTTS: Toward Efficient and Robust Paralinguistic Style Control for Expressive Text-to-Speech Generation
par: Lou, Haowei, et autres
Publié: (2025)
par: Lou, Haowei, et autres
Publié: (2025)
DAIEN-TTS: Disentangled Audio Infilling for Environment-Aware Text-to-Speech Synthesis
par: Lu, Ye-Xin, et autres
Publié: (2025)
par: Lu, Ye-Xin, et autres
Publié: (2025)
Improving Language Model-Based Zero-Shot Text-to-Speech Synthesis with Multi-Scale Acoustic Prompts
par: Lei, Shun, et autres
Publié: (2023)
par: Lei, Shun, et autres
Publié: (2023)
Style Mixture of Experts for Expressive Text-To-Speech Synthesis
par: Jawaid, Ahad, et autres
Publié: (2024)
par: Jawaid, Ahad, et autres
Publié: (2024)
SAML: Speaker Adaptive Mixture of LoRA Experts for End-to-End ASR
par: Zhao, Qiuming, et autres
Publié: (2024)
par: Zhao, Qiuming, et autres
Publié: (2024)
Say More with Less: Variable-Frame-Rate Speech Tokenization via Adaptive Clustering and Implicit Duration Coding
par: Zheng, Rui-Chen, et autres
Publié: (2025)
par: Zheng, Rui-Chen, et autres
Publié: (2025)
Attention-Constrained Inference for Robust Decoder-Only Text-to-Speech
par: Wang, Hankun, et autres
Publié: (2024)
par: Wang, Hankun, et autres
Publié: (2024)
DiffProsody: Diffusion-based Latent Prosody Generation for Expressive Speech Synthesis with Prosody Conditional Adversarial Training
par: Oh, Hyung-Seok, et autres
Publié: (2023)
par: Oh, Hyung-Seok, et autres
Publié: (2023)
StoryTTS: A Highly Expressive Text-to-Speech Dataset with Rich Textual Expressiveness Annotations
par: Liu, Sen, et autres
Publié: (2024)
par: Liu, Sen, et autres
Publié: (2024)
Wav2Prompt: End-to-End Speech Prompt Generation and Tuning For LLM in Zero and Few-shot Learning
par: Deng, Keqi, et autres
Publié: (2024)
par: Deng, Keqi, et autres
Publié: (2024)
Hierarchical Emotion Prediction and Control in Text-to-Speech Synthesis
par: Inoue, Sho, et autres
Publié: (2024)
par: Inoue, Sho, et autres
Publié: (2024)
VoxInstruct: Expressive Human Instruction-to-Speech Generation with Unified Multilingual Codec Language Modelling
par: Zhou, Yixuan, et autres
Publié: (2024)
par: Zhou, Yixuan, et autres
Publié: (2024)
Training Data Augmentation for Dysarthric Automatic Speech Recognition by Text-to-Dysarthric-Speech Synthesis
par: Leung, Wing-Zin, et autres
Publié: (2024)
par: Leung, Wing-Zin, et autres
Publié: (2024)
Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis
par: Liao, Shijia, et autres
Publié: (2024)
par: Liao, Shijia, et autres
Publié: (2024)
Active Learning for Text-to-Speech Synthesis with Informative Sample Collection
par: Seki, Kentaro, et autres
Publié: (2025)
par: Seki, Kentaro, et autres
Publié: (2025)
Convolutional Variational Autoencoders for Spectrogram Compression in Automatic Speech Recognition
par: Iakovenko, Olga, et autres
Publié: (2024)
par: Iakovenko, Olga, et autres
Publié: (2024)
NanoVoice: Efficient Speaker-Adaptive Text-to-Speech for Multiple Speakers
par: Park, Nohil, et autres
Publié: (2024)
par: Park, Nohil, et autres
Publié: (2024)
IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech
par: Zhou, Siyi, et autres
Publié: (2025)
par: Zhou, Siyi, et autres
Publié: (2025)
Period Singer: Integrating Periodic and Aperiodic Variational Autoencoders for Natural-Sounding End-to-End Singing Voice Synthesis
par: Kim, Taewoo, et autres
Publié: (2024)
par: Kim, Taewoo, et autres
Publié: (2024)
Comprehend and Talk: Text to Speech Synthesis via Dual Language Modeling
par: Cao, Junjie, et autres
Publié: (2025)
par: Cao, Junjie, et autres
Publié: (2025)
Enabling Beam Search for Language Model-Based Text-to-Speech Synthesis
par: Tu, Zehai, et autres
Publié: (2024)
par: Tu, Zehai, et autres
Publié: (2024)
SSR-Speech: Towards Stable, Safe and Robust Zero-shot Text-based Speech Editing and Synthesis
par: Wang, Helin, et autres
Publié: (2024)
par: Wang, Helin, et autres
Publié: (2024)
Evaluating Text-to-Speech Synthesis from a Large Discrete Token-based Speech Language Model
par: Wang, Siyang, et autres
Publié: (2024)
par: Wang, Siyang, et autres
Publié: (2024)
Documents similaires
-
DrawSpeech: Expressive Speech Synthesis Using Prosodic Sketches as Control Conditions
par: Chen, Weidong, et autres
Publié: (2025) -
Accented Text-to-Speech Synthesis with a Conditional Variational Autoencoder
par: Melechovsky, Jan, et autres
Publié: (2022) -
MSceneSpeech: A Multi-Scene Speech Dataset For Expressive Speech Synthesis
par: Yang, Qian, et autres
Publié: (2024) -
Adaptive Duration Model for Text Speech Alignment
par: Cao, Junjie
Publié: (2025) -
Boosting Multi-Speaker Expressive Speech Synthesis with Semi-supervised Contrastive Learning
par: Zhu, Xinfa, et autres
Publié: (2023)