Expressive paragraph text-to-speech synthesis with multi-step variational autoencoder
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Xuyuan, Shang, Zengqiang, Shi, Peiyang, Hua, Hua, Li, Ta, Zhang, Pengyuan |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SF-Speech: Straightened Flow for Zero-Shot Voice Clone
par: Li, Xuyuan, et autres
Publié: (2024)
par: Li, Xuyuan, et autres
Publié: (2024)
Controlling your Attributes in Voice
par: Li, Xuyuan, et autres
Publié: (2025)
par: Li, Xuyuan, et autres
Publié: (2025)
Emilia: A Large-Scale, Extensive, Multilingual, and Diverse Dataset for Speech Generation
par: He, Haorui, et autres
Publié: (2025)
par: He, Haorui, et autres
Publié: (2025)
Improving Short Utterance Anti-Spoofing with AASIST2
par: Zhang, Yuxiang, et autres
Publié: (2023)
par: Zhang, Yuxiang, et autres
Publié: (2023)
End-to-end multi-channel speaker extraction and binaural speech synthesis
par: Chi, Cheng, et autres
Publié: (2024)
par: Chi, Cheng, et autres
Publié: (2024)
Voxtlm: unified decoder-only models for consolidating speech recognition/synthesis and speech/text continuation tasks
par: Maiti, Soumi, et autres
Publié: (2023)
par: Maiti, Soumi, et autres
Publié: (2023)
A multimodal dynamical variational autoencoder for audiovisual speech representation learning
par: Sadok, Samir, et autres
Publié: (2023)
par: Sadok, Samir, et autres
Publié: (2023)
STASE: A spatialized text-to-audio synthesis engine for music generation
par: Chi, Tutti, et autres
Publié: (2025)
par: Chi, Tutti, et autres
Publié: (2025)
Towards noise-robust speech inversion through multi-task learning with speech enhancement
par: Tabatabaee, Saba, et autres
Publié: (2026)
par: Tabatabaee, Saba, et autres
Publié: (2026)
A unified front-end framework for English text-to-speech synthesis
par: Ying, Zelin, et autres
Publié: (2023)
par: Ying, Zelin, et autres
Publié: (2023)
TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet
par: Jeong, Jaeseok, et autres
Publié: (2025)
par: Jeong, Jaeseok, et autres
Publié: (2025)
A two-step approach for speech enhancement in low-SNR scenarios using cyclostationary beamforming and DNNs
par: Bologni, Giovanni, et autres
Publié: (2026)
par: Bologni, Giovanni, et autres
Publié: (2026)
Graph-based multi-Feature fusion method for speech emotion recognition
par: Liu, Xueyu, et autres
Publié: (2024)
par: Liu, Xueyu, et autres
Publié: (2024)
On the effectiveness of enrollment speech augmentation for Target Speaker Extraction
par: Li, Junjie, et autres
Publié: (2024)
par: Li, Junjie, et autres
Publié: (2024)
CONTUNER: Singing Voice Beautifying with Pitch and Expressiveness Condition
par: Wang, Jianzong, et autres
Publié: (2024)
par: Wang, Jianzong, et autres
Publié: (2024)
Self-supervised speech representation and contextual text embedding for match-mismatch classification with EEG recording
par: Wang, Bo, et autres
Publié: (2024)
par: Wang, Bo, et autres
Publié: (2024)
$\text{M}^3\text{PDB}$: A Multimodal, Multi-Label, Multilingual Prompt Database for Speech Generation
par: Zhu, Boyu, et autres
Publié: (2025)
par: Zhu, Boyu, et autres
Publié: (2025)
Noise-robust zero-shot text-to-speech synthesis conditioned on self-supervised speech-representation model with adapters
par: Fujita, Kenichi, et autres
Publié: (2024)
par: Fujita, Kenichi, et autres
Publié: (2024)
Paraformer-v2: An improved non-autoregressive transformer for noise-robust speech recognition
par: An, Keyu, et autres
Publié: (2024)
par: An, Keyu, et autres
Publié: (2024)
DQR-TTS: Semi-supervised Text-to-speech Synthesis with Dynamic Quantized Representation
par: Wang, Jianzong, et autres
Publié: (2023)
par: Wang, Jianzong, et autres
Publié: (2023)
A vector quantized masked autoencoder for audiovisual speech emotion recognition
par: Sadok, Samir, et autres
Publié: (2023)
par: Sadok, Samir, et autres
Publié: (2023)
An efficient text augmentation approach for contextualized Mandarin speech recognition
par: Zheng, Naijun, et autres
Publié: (2024)
par: Zheng, Naijun, et autres
Publié: (2024)
Transferable speech-to-text large language model alignment module
par: Wu, Boyong, et autres
Publié: (2024)
par: Wu, Boyong, et autres
Publié: (2024)
FreeCodec: A disentangled neural speech codec with fewer tokens
par: Zheng, Youqiang, et autres
Publié: (2024)
par: Zheng, Youqiang, et autres
Publié: (2024)
MM-TTS: Multi-modal Prompt based Style Transfer for Expressive Text-to-Speech Synthesis
par: Guan, Wenhao, et autres
Publié: (2023)
par: Guan, Wenhao, et autres
Publié: (2023)
DrawSpeech: Expressive Speech Synthesis Using Prosodic Sketches as Control Conditions
par: Chen, Weidong, et autres
Publié: (2025)
par: Chen, Weidong, et autres
Publié: (2025)
An automatic mixing speech enhancement system for multi-track audio
par: Liu, Xiaojing, et autres
Publié: (2024)
par: Liu, Xiaojing, et autres
Publié: (2024)
Towards Expressive Zero-Shot Speech Synthesis with Hierarchical Prosody Modeling
par: Jiang, Yuepeng, et autres
Publié: (2024)
par: Jiang, Yuepeng, et autres
Publié: (2024)
Universal Preference-Score-based Pairwise Speech Quality Assessment
par: Shi, Yu-Fei, et autres
Publié: (2025)
par: Shi, Yu-Fei, et autres
Publié: (2025)
Phoneme-based speech recognition driven by large language models and sampling marginalization
par: Ma, Te, et autres
Publié: (2025)
par: Ma, Te, et autres
Publié: (2025)
Natural language guidance of high-fidelity text-to-speech with synthetic annotations
par: Lyth, Dan, et autres
Publié: (2024)
par: Lyth, Dan, et autres
Publié: (2024)
On the relationship between speech and hearing
par: Umesh, Srinivasan, et autres
Publié: (2024)
par: Umesh, Srinivasan, et autres
Publié: (2024)
Boosting Multi-Speaker Expressive Speech Synthesis with Semi-supervised Contrastive Learning
par: Zhu, Xinfa, et autres
Publié: (2023)
par: Zhu, Xinfa, et autres
Publié: (2023)
Robust fine-tuning of speech recognition models via model merging: application to disordered speech
par: Ducorroy, Alexandre, et autres
Publié: (2025)
par: Ducorroy, Alexandre, et autres
Publié: (2025)
Emilia: An Extensive, Multilingual, and Diverse Speech Dataset for Large-Scale Speech Generation
par: He, Haorui, et autres
Publié: (2024)
par: He, Haorui, et autres
Publié: (2024)
Semi-intrusive audio evaluation: Casting non-intrusive assessment as a multi-modal text prediction task
par: Coldenhoff, Jozef, et autres
Publié: (2024)
par: Coldenhoff, Jozef, et autres
Publié: (2024)
CTC-TTS: LLM-based dual-streaming text-to-speech with CTC alignment
par: Liu, Hanwen, et autres
Publié: (2026)
par: Liu, Hanwen, et autres
Publié: (2026)
Data-driven grapheme-to-phoneme representations for a lexicon-free text-to-speech
par: Garg, Abhinav, et autres
Publié: (2024)
par: Garg, Abhinav, et autres
Publié: (2024)
MSceneSpeech: A Multi-Scene Speech Dataset For Expressive Speech Synthesis
par: Yang, Qian, et autres
Publié: (2024)
par: Yang, Qian, et autres
Publié: (2024)
BFA: Real-time Multilingual Text-to-speech Forced Alignment
par: Rehman, Abdul, et autres
Publié: (2025)
par: Rehman, Abdul, et autres
Publié: (2025)
Documents similaires
-
SF-Speech: Straightened Flow for Zero-Shot Voice Clone
par: Li, Xuyuan, et autres
Publié: (2024) -
Controlling your Attributes in Voice
par: Li, Xuyuan, et autres
Publié: (2025) -
Emilia: A Large-Scale, Extensive, Multilingual, and Diverse Dataset for Speech Generation
par: He, Haorui, et autres
Publié: (2025) -
Improving Short Utterance Anti-Spoofing with AASIST2
par: Zhang, Yuxiang, et autres
Publié: (2023) -
End-to-end multi-channel speaker extraction and binaural speech synthesis
par: Chi, Cheng, et autres
Publié: (2024)