Expressive paragraph text-to-speech synthesis with multi-step variational autoencoder
Fuente:
arXiv
Guardado en:
| Autores principales: | Li, Xuyuan, Shang, Zengqiang, Shi, Peiyang, Hua, Hua, Li, Ta, Zhang, Pengyuan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2023
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
SF-Speech: Straightened Flow for Zero-Shot Voice Clone
por: Li, Xuyuan, et al.
Publicado: (2024)
por: Li, Xuyuan, et al.
Publicado: (2024)
Controlling your Attributes in Voice
por: Li, Xuyuan, et al.
Publicado: (2025)
por: Li, Xuyuan, et al.
Publicado: (2025)
Emilia: A Large-Scale, Extensive, Multilingual, and Diverse Dataset for Speech Generation
por: He, Haorui, et al.
Publicado: (2025)
por: He, Haorui, et al.
Publicado: (2025)
Improving Short Utterance Anti-Spoofing with AASIST2
por: Zhang, Yuxiang, et al.
Publicado: (2023)
por: Zhang, Yuxiang, et al.
Publicado: (2023)
End-to-end multi-channel speaker extraction and binaural speech synthesis
por: Chi, Cheng, et al.
Publicado: (2024)
por: Chi, Cheng, et al.
Publicado: (2024)
Voxtlm: unified decoder-only models for consolidating speech recognition/synthesis and speech/text continuation tasks
por: Maiti, Soumi, et al.
Publicado: (2023)
por: Maiti, Soumi, et al.
Publicado: (2023)
A multimodal dynamical variational autoencoder for audiovisual speech representation learning
por: Sadok, Samir, et al.
Publicado: (2023)
por: Sadok, Samir, et al.
Publicado: (2023)
STASE: A spatialized text-to-audio synthesis engine for music generation
por: Chi, Tutti, et al.
Publicado: (2025)
por: Chi, Tutti, et al.
Publicado: (2025)
Towards noise-robust speech inversion through multi-task learning with speech enhancement
por: Tabatabaee, Saba, et al.
Publicado: (2026)
por: Tabatabaee, Saba, et al.
Publicado: (2026)
A unified front-end framework for English text-to-speech synthesis
por: Ying, Zelin, et al.
Publicado: (2023)
por: Ying, Zelin, et al.
Publicado: (2023)
TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet
por: Jeong, Jaeseok, et al.
Publicado: (2025)
por: Jeong, Jaeseok, et al.
Publicado: (2025)
A two-step approach for speech enhancement in low-SNR scenarios using cyclostationary beamforming and DNNs
por: Bologni, Giovanni, et al.
Publicado: (2026)
por: Bologni, Giovanni, et al.
Publicado: (2026)
Graph-based multi-Feature fusion method for speech emotion recognition
por: Liu, Xueyu, et al.
Publicado: (2024)
por: Liu, Xueyu, et al.
Publicado: (2024)
On the effectiveness of enrollment speech augmentation for Target Speaker Extraction
por: Li, Junjie, et al.
Publicado: (2024)
por: Li, Junjie, et al.
Publicado: (2024)
CONTUNER: Singing Voice Beautifying with Pitch and Expressiveness Condition
por: Wang, Jianzong, et al.
Publicado: (2024)
por: Wang, Jianzong, et al.
Publicado: (2024)
Self-supervised speech representation and contextual text embedding for match-mismatch classification with EEG recording
por: Wang, Bo, et al.
Publicado: (2024)
por: Wang, Bo, et al.
Publicado: (2024)
$\text{M}^3\text{PDB}$: A Multimodal, Multi-Label, Multilingual Prompt Database for Speech Generation
por: Zhu, Boyu, et al.
Publicado: (2025)
por: Zhu, Boyu, et al.
Publicado: (2025)
Noise-robust zero-shot text-to-speech synthesis conditioned on self-supervised speech-representation model with adapters
por: Fujita, Kenichi, et al.
Publicado: (2024)
por: Fujita, Kenichi, et al.
Publicado: (2024)
Paraformer-v2: An improved non-autoregressive transformer for noise-robust speech recognition
por: An, Keyu, et al.
Publicado: (2024)
por: An, Keyu, et al.
Publicado: (2024)
DQR-TTS: Semi-supervised Text-to-speech Synthesis with Dynamic Quantized Representation
por: Wang, Jianzong, et al.
Publicado: (2023)
por: Wang, Jianzong, et al.
Publicado: (2023)
A vector quantized masked autoencoder for audiovisual speech emotion recognition
por: Sadok, Samir, et al.
Publicado: (2023)
por: Sadok, Samir, et al.
Publicado: (2023)
An efficient text augmentation approach for contextualized Mandarin speech recognition
por: Zheng, Naijun, et al.
Publicado: (2024)
por: Zheng, Naijun, et al.
Publicado: (2024)
Transferable speech-to-text large language model alignment module
por: Wu, Boyong, et al.
Publicado: (2024)
por: Wu, Boyong, et al.
Publicado: (2024)
FreeCodec: A disentangled neural speech codec with fewer tokens
por: Zheng, Youqiang, et al.
Publicado: (2024)
por: Zheng, Youqiang, et al.
Publicado: (2024)
MM-TTS: Multi-modal Prompt based Style Transfer for Expressive Text-to-Speech Synthesis
por: Guan, Wenhao, et al.
Publicado: (2023)
por: Guan, Wenhao, et al.
Publicado: (2023)
DrawSpeech: Expressive Speech Synthesis Using Prosodic Sketches as Control Conditions
por: Chen, Weidong, et al.
Publicado: (2025)
por: Chen, Weidong, et al.
Publicado: (2025)
An automatic mixing speech enhancement system for multi-track audio
por: Liu, Xiaojing, et al.
Publicado: (2024)
por: Liu, Xiaojing, et al.
Publicado: (2024)
Towards Expressive Zero-Shot Speech Synthesis with Hierarchical Prosody Modeling
por: Jiang, Yuepeng, et al.
Publicado: (2024)
por: Jiang, Yuepeng, et al.
Publicado: (2024)
Universal Preference-Score-based Pairwise Speech Quality Assessment
por: Shi, Yu-Fei, et al.
Publicado: (2025)
por: Shi, Yu-Fei, et al.
Publicado: (2025)
Phoneme-based speech recognition driven by large language models and sampling marginalization
por: Ma, Te, et al.
Publicado: (2025)
por: Ma, Te, et al.
Publicado: (2025)
Natural language guidance of high-fidelity text-to-speech with synthetic annotations
por: Lyth, Dan, et al.
Publicado: (2024)
por: Lyth, Dan, et al.
Publicado: (2024)
On the relationship between speech and hearing
por: Umesh, Srinivasan, et al.
Publicado: (2024)
por: Umesh, Srinivasan, et al.
Publicado: (2024)
Boosting Multi-Speaker Expressive Speech Synthesis with Semi-supervised Contrastive Learning
por: Zhu, Xinfa, et al.
Publicado: (2023)
por: Zhu, Xinfa, et al.
Publicado: (2023)
Robust fine-tuning of speech recognition models via model merging: application to disordered speech
por: Ducorroy, Alexandre, et al.
Publicado: (2025)
por: Ducorroy, Alexandre, et al.
Publicado: (2025)
Emilia: An Extensive, Multilingual, and Diverse Speech Dataset for Large-Scale Speech Generation
por: He, Haorui, et al.
Publicado: (2024)
por: He, Haorui, et al.
Publicado: (2024)
Semi-intrusive audio evaluation: Casting non-intrusive assessment as a multi-modal text prediction task
por: Coldenhoff, Jozef, et al.
Publicado: (2024)
por: Coldenhoff, Jozef, et al.
Publicado: (2024)
CTC-TTS: LLM-based dual-streaming text-to-speech with CTC alignment
por: Liu, Hanwen, et al.
Publicado: (2026)
por: Liu, Hanwen, et al.
Publicado: (2026)
Data-driven grapheme-to-phoneme representations for a lexicon-free text-to-speech
por: Garg, Abhinav, et al.
Publicado: (2024)
por: Garg, Abhinav, et al.
Publicado: (2024)
MSceneSpeech: A Multi-Scene Speech Dataset For Expressive Speech Synthesis
por: Yang, Qian, et al.
Publicado: (2024)
por: Yang, Qian, et al.
Publicado: (2024)
BFA: Real-time Multilingual Text-to-speech Forced Alignment
por: Rehman, Abdul, et al.
Publicado: (2025)
por: Rehman, Abdul, et al.
Publicado: (2025)
Ejemplares similares
-
SF-Speech: Straightened Flow for Zero-Shot Voice Clone
por: Li, Xuyuan, et al.
Publicado: (2024) -
Controlling your Attributes in Voice
por: Li, Xuyuan, et al.
Publicado: (2025) -
Emilia: A Large-Scale, Extensive, Multilingual, and Diverse Dataset for Speech Generation
por: He, Haorui, et al.
Publicado: (2025) -
Improving Short Utterance Anti-Spoofing with AASIST2
por: Zhang, Yuxiang, et al.
Publicado: (2023) -
End-to-end multi-channel speaker extraction and binaural speech synthesis
por: Chi, Cheng, et al.
Publicado: (2024)