Expressive paragraph text-to-speech synthesis with multi-step variational autoencoder
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Xuyuan, Shang, Zengqiang, Shi, Peiyang, Hua, Hua, Li, Ta, Zhang, Pengyuan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SF-Speech: Straightened Flow for Zero-Shot Voice Clone
di: Li, Xuyuan, et al.
Pubblicazione: (2024)
di: Li, Xuyuan, et al.
Pubblicazione: (2024)
Controlling your Attributes in Voice
di: Li, Xuyuan, et al.
Pubblicazione: (2025)
di: Li, Xuyuan, et al.
Pubblicazione: (2025)
Emilia: A Large-Scale, Extensive, Multilingual, and Diverse Dataset for Speech Generation
di: He, Haorui, et al.
Pubblicazione: (2025)
di: He, Haorui, et al.
Pubblicazione: (2025)
Improving Short Utterance Anti-Spoofing with AASIST2
di: Zhang, Yuxiang, et al.
Pubblicazione: (2023)
di: Zhang, Yuxiang, et al.
Pubblicazione: (2023)
End-to-end multi-channel speaker extraction and binaural speech synthesis
di: Chi, Cheng, et al.
Pubblicazione: (2024)
di: Chi, Cheng, et al.
Pubblicazione: (2024)
Voxtlm: unified decoder-only models for consolidating speech recognition/synthesis and speech/text continuation tasks
di: Maiti, Soumi, et al.
Pubblicazione: (2023)
di: Maiti, Soumi, et al.
Pubblicazione: (2023)
A multimodal dynamical variational autoencoder for audiovisual speech representation learning
di: Sadok, Samir, et al.
Pubblicazione: (2023)
di: Sadok, Samir, et al.
Pubblicazione: (2023)
STASE: A spatialized text-to-audio synthesis engine for music generation
di: Chi, Tutti, et al.
Pubblicazione: (2025)
di: Chi, Tutti, et al.
Pubblicazione: (2025)
Towards noise-robust speech inversion through multi-task learning with speech enhancement
di: Tabatabaee, Saba, et al.
Pubblicazione: (2026)
di: Tabatabaee, Saba, et al.
Pubblicazione: (2026)
A unified front-end framework for English text-to-speech synthesis
di: Ying, Zelin, et al.
Pubblicazione: (2023)
di: Ying, Zelin, et al.
Pubblicazione: (2023)
TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet
di: Jeong, Jaeseok, et al.
Pubblicazione: (2025)
di: Jeong, Jaeseok, et al.
Pubblicazione: (2025)
A two-step approach for speech enhancement in low-SNR scenarios using cyclostationary beamforming and DNNs
di: Bologni, Giovanni, et al.
Pubblicazione: (2026)
di: Bologni, Giovanni, et al.
Pubblicazione: (2026)
Graph-based multi-Feature fusion method for speech emotion recognition
di: Liu, Xueyu, et al.
Pubblicazione: (2024)
di: Liu, Xueyu, et al.
Pubblicazione: (2024)
On the effectiveness of enrollment speech augmentation for Target Speaker Extraction
di: Li, Junjie, et al.
Pubblicazione: (2024)
di: Li, Junjie, et al.
Pubblicazione: (2024)
CONTUNER: Singing Voice Beautifying with Pitch and Expressiveness Condition
di: Wang, Jianzong, et al.
Pubblicazione: (2024)
di: Wang, Jianzong, et al.
Pubblicazione: (2024)
Self-supervised speech representation and contextual text embedding for match-mismatch classification with EEG recording
di: Wang, Bo, et al.
Pubblicazione: (2024)
di: Wang, Bo, et al.
Pubblicazione: (2024)
$\text{M}^3\text{PDB}$: A Multimodal, Multi-Label, Multilingual Prompt Database for Speech Generation
di: Zhu, Boyu, et al.
Pubblicazione: (2025)
di: Zhu, Boyu, et al.
Pubblicazione: (2025)
Noise-robust zero-shot text-to-speech synthesis conditioned on self-supervised speech-representation model with adapters
di: Fujita, Kenichi, et al.
Pubblicazione: (2024)
di: Fujita, Kenichi, et al.
Pubblicazione: (2024)
Paraformer-v2: An improved non-autoregressive transformer for noise-robust speech recognition
di: An, Keyu, et al.
Pubblicazione: (2024)
di: An, Keyu, et al.
Pubblicazione: (2024)
DQR-TTS: Semi-supervised Text-to-speech Synthesis with Dynamic Quantized Representation
di: Wang, Jianzong, et al.
Pubblicazione: (2023)
di: Wang, Jianzong, et al.
Pubblicazione: (2023)
A vector quantized masked autoencoder for audiovisual speech emotion recognition
di: Sadok, Samir, et al.
Pubblicazione: (2023)
di: Sadok, Samir, et al.
Pubblicazione: (2023)
An efficient text augmentation approach for contextualized Mandarin speech recognition
di: Zheng, Naijun, et al.
Pubblicazione: (2024)
di: Zheng, Naijun, et al.
Pubblicazione: (2024)
Transferable speech-to-text large language model alignment module
di: Wu, Boyong, et al.
Pubblicazione: (2024)
di: Wu, Boyong, et al.
Pubblicazione: (2024)
FreeCodec: A disentangled neural speech codec with fewer tokens
di: Zheng, Youqiang, et al.
Pubblicazione: (2024)
di: Zheng, Youqiang, et al.
Pubblicazione: (2024)
MM-TTS: Multi-modal Prompt based Style Transfer for Expressive Text-to-Speech Synthesis
di: Guan, Wenhao, et al.
Pubblicazione: (2023)
di: Guan, Wenhao, et al.
Pubblicazione: (2023)
DrawSpeech: Expressive Speech Synthesis Using Prosodic Sketches as Control Conditions
di: Chen, Weidong, et al.
Pubblicazione: (2025)
di: Chen, Weidong, et al.
Pubblicazione: (2025)
An automatic mixing speech enhancement system for multi-track audio
di: Liu, Xiaojing, et al.
Pubblicazione: (2024)
di: Liu, Xiaojing, et al.
Pubblicazione: (2024)
Towards Expressive Zero-Shot Speech Synthesis with Hierarchical Prosody Modeling
di: Jiang, Yuepeng, et al.
Pubblicazione: (2024)
di: Jiang, Yuepeng, et al.
Pubblicazione: (2024)
Universal Preference-Score-based Pairwise Speech Quality Assessment
di: Shi, Yu-Fei, et al.
Pubblicazione: (2025)
di: Shi, Yu-Fei, et al.
Pubblicazione: (2025)
Phoneme-based speech recognition driven by large language models and sampling marginalization
di: Ma, Te, et al.
Pubblicazione: (2025)
di: Ma, Te, et al.
Pubblicazione: (2025)
Natural language guidance of high-fidelity text-to-speech with synthetic annotations
di: Lyth, Dan, et al.
Pubblicazione: (2024)
di: Lyth, Dan, et al.
Pubblicazione: (2024)
On the relationship between speech and hearing
di: Umesh, Srinivasan, et al.
Pubblicazione: (2024)
di: Umesh, Srinivasan, et al.
Pubblicazione: (2024)
Boosting Multi-Speaker Expressive Speech Synthesis with Semi-supervised Contrastive Learning
di: Zhu, Xinfa, et al.
Pubblicazione: (2023)
di: Zhu, Xinfa, et al.
Pubblicazione: (2023)
Robust fine-tuning of speech recognition models via model merging: application to disordered speech
di: Ducorroy, Alexandre, et al.
Pubblicazione: (2025)
di: Ducorroy, Alexandre, et al.
Pubblicazione: (2025)
Emilia: An Extensive, Multilingual, and Diverse Speech Dataset for Large-Scale Speech Generation
di: He, Haorui, et al.
Pubblicazione: (2024)
di: He, Haorui, et al.
Pubblicazione: (2024)
Semi-intrusive audio evaluation: Casting non-intrusive assessment as a multi-modal text prediction task
di: Coldenhoff, Jozef, et al.
Pubblicazione: (2024)
di: Coldenhoff, Jozef, et al.
Pubblicazione: (2024)
CTC-TTS: LLM-based dual-streaming text-to-speech with CTC alignment
di: Liu, Hanwen, et al.
Pubblicazione: (2026)
di: Liu, Hanwen, et al.
Pubblicazione: (2026)
Data-driven grapheme-to-phoneme representations for a lexicon-free text-to-speech
di: Garg, Abhinav, et al.
Pubblicazione: (2024)
di: Garg, Abhinav, et al.
Pubblicazione: (2024)
MSceneSpeech: A Multi-Scene Speech Dataset For Expressive Speech Synthesis
di: Yang, Qian, et al.
Pubblicazione: (2024)
di: Yang, Qian, et al.
Pubblicazione: (2024)
BFA: Real-time Multilingual Text-to-speech Forced Alignment
di: Rehman, Abdul, et al.
Pubblicazione: (2025)
di: Rehman, Abdul, et al.
Pubblicazione: (2025)
Documenti analoghi
-
SF-Speech: Straightened Flow for Zero-Shot Voice Clone
di: Li, Xuyuan, et al.
Pubblicazione: (2024) -
Controlling your Attributes in Voice
di: Li, Xuyuan, et al.
Pubblicazione: (2025) -
Emilia: A Large-Scale, Extensive, Multilingual, and Diverse Dataset for Speech Generation
di: He, Haorui, et al.
Pubblicazione: (2025) -
Improving Short Utterance Anti-Spoofing with AASIST2
di: Zhang, Yuxiang, et al.
Pubblicazione: (2023) -
End-to-end multi-channel speaker extraction and binaural speech synthesis
di: Chi, Cheng, et al.
Pubblicazione: (2024)