GTR-Voice: Articulatory Phonetics Informed Controllable Expressive Speech Synthesis
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Zehua Kcriss, Chen, Meiying Melissa, Zhong, Yi, Liu, Pinxin, Duan, Zhiyao |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
ControlVC: Zero-Shot Voice Conversion with Time-Varying Controls on Pitch and Speed
di: Chen, Meiying, et al.
Pubblicazione: (2022)
di: Chen, Meiying, et al.
Pubblicazione: (2022)
Generating Novel and Realistic Speakers for Voice Conversion
di: Chen, Meiying Melissa, et al.
Pubblicazione: (2025)
di: Chen, Meiying Melissa, et al.
Pubblicazione: (2025)
Generative Expressive Conversational Speech Synthesis
di: Liu, Rui, et al.
Pubblicazione: (2024)
di: Liu, Rui, et al.
Pubblicazione: (2024)
Phonetic Enhanced Language Modeling for Text-to-Speech Synthesis
di: Zhou, Kun, et al.
Pubblicazione: (2024)
di: Zhou, Kun, et al.
Pubblicazione: (2024)
Conan: A Chunkwise Online Network for Zero-Shot Adaptive Voice Conversion
di: Zhang, Yu, et al.
Pubblicazione: (2025)
di: Zhang, Yu, et al.
Pubblicazione: (2025)
Deep Speech Synthesis from Multimodal Articulatory Representations
di: Wu, Peter, et al.
Pubblicazione: (2024)
di: Wu, Peter, et al.
Pubblicazione: (2024)
Generating Data with Text-to-Speech and Large-Language Models for Conversational Speech Recognition
di: Cornell, Samuele, et al.
Pubblicazione: (2024)
di: Cornell, Samuele, et al.
Pubblicazione: (2024)
VoiceCraft-X: Unifying Multilingual, Voice-Cloning Speech Synthesis and Speech Editing
di: Zheng, Zhisheng, et al.
Pubblicazione: (2025)
di: Zheng, Zhisheng, et al.
Pubblicazione: (2025)
DrawSpeech: Expressive Speech Synthesis Using Prosodic Sketches as Control Conditions
di: Chen, Weidong, et al.
Pubblicazione: (2025)
di: Chen, Weidong, et al.
Pubblicazione: (2025)
StoryTTS: A Highly Expressive Text-to-Speech Dataset with Rich Textual Expressiveness Annotations
di: Liu, Sen, et al.
Pubblicazione: (2024)
di: Liu, Sen, et al.
Pubblicazione: (2024)
Tracking Articulatory Dynamics in Speech with a Fixed-Weight BiLSTM-CNN Architecture
di: Pillai, Leena G, et al.
Pubblicazione: (2025)
di: Pillai, Leena G, et al.
Pubblicazione: (2025)
Acoustic to Articulatory Inversion of Speech; Data Driven Approaches, Challenges, Applications, and Future Scope
di: Pillai, Leena G, et al.
Pubblicazione: (2025)
di: Pillai, Leena G, et al.
Pubblicazione: (2025)
Phonetic Segmentation of the UCLA Phonetics Lab Archive
di: Chodroff, Eleanor, et al.
Pubblicazione: (2024)
di: Chodroff, Eleanor, et al.
Pubblicazione: (2024)
The Third VoicePrivacy Challenge: Preserving Emotional Expressiveness and Linguistic Content in Voice Anonymization
di: Tomashenko, Natalia, et al.
Pubblicazione: (2026)
di: Tomashenko, Natalia, et al.
Pubblicazione: (2026)
Articulation-Informed ASR: Integrating Articulatory Features into ASR via Auxiliary Speech Inversion and Cross-Attention Fusion
di: Attia, Ahmed Adel, et al.
Pubblicazione: (2025)
di: Attia, Ahmed Adel, et al.
Pubblicazione: (2025)
EE-TTS: Emphatic Expressive TTS with Linguistic Information
di: Zhong, Yi, et al.
Pubblicazione: (2023)
di: Zhong, Yi, et al.
Pubblicazione: (2023)
Whistle: Data-Efficient Multilingual and Crosslingual Speech Recognition via Weakly Phonetic Supervision
di: Yusuyin, Saierdaer, et al.
Pubblicazione: (2024)
di: Yusuyin, Saierdaer, et al.
Pubblicazione: (2024)
MSceneSpeech: A Multi-Scene Speech Dataset For Expressive Speech Synthesis
di: Yang, Qian, et al.
Pubblicazione: (2024)
di: Yang, Qian, et al.
Pubblicazione: (2024)
An Empirical Study on Channel Effects for Synthetic Voice Spoofing Countermeasure Systems
di: Zhang, You, et al.
Pubblicazione: (2021)
di: Zhang, You, et al.
Pubblicazione: (2021)
Computational Narrative Understanding for Expressive Text-to-Speech
di: Michel, Gaspard, et al.
Pubblicazione: (2025)
di: Michel, Gaspard, et al.
Pubblicazione: (2025)
PAST: Phonetic-Acoustic Speech Tokenizer
di: Har-Tuv, Nadav, et al.
Pubblicazione: (2025)
di: Har-Tuv, Nadav, et al.
Pubblicazione: (2025)
(SimPhon Speech Test): A Data-Driven Method for In Silico Design and Validation of a Phonetically Balanced Speech Test
di: Bleeck, Stefan
Pubblicazione: (2025)
di: Bleeck, Stefan
Pubblicazione: (2025)
UR Channel-Robust Synthetic Speech Detection System for ASVspoof 2021
di: Chen, Xinhui, et al.
Pubblicazione: (2021)
di: Chen, Xinhui, et al.
Pubblicazione: (2021)
Pairwise Evaluation of Accent Similarity in Speech Synthesis
di: Zhong, Jinzuomu, et al.
Pubblicazione: (2025)
di: Zhong, Jinzuomu, et al.
Pubblicazione: (2025)
Textless Acoustic Model with Self-Supervised Distillation for Noise-Robust Expressive Speech-to-Speech Translation
di: Hwang, Min-Jae, et al.
Pubblicazione: (2024)
di: Hwang, Min-Jae, et al.
Pubblicazione: (2024)
DiffProsody: Diffusion-based Latent Prosody Generation for Expressive Speech Synthesis with Prosody Conditional Adversarial Training
di: Oh, Hyung-Seok, et al.
Pubblicazione: (2023)
di: Oh, Hyung-Seok, et al.
Pubblicazione: (2023)
Boosting Multi-Speaker Expressive Speech Synthesis with Semi-supervised Contrastive Learning
di: Zhu, Xinfa, et al.
Pubblicazione: (2023)
di: Zhu, Xinfa, et al.
Pubblicazione: (2023)
StyleSinger: Style Transfer for Out-of-Domain Singing Voice Synthesis
di: Zhang, Yu, et al.
Pubblicazione: (2023)
di: Zhang, Yu, et al.
Pubblicazione: (2023)
PartialEdit: Identifying Partial Deepfakes in the Era of Neural Speech Editing
di: Zhang, You, et al.
Pubblicazione: (2025)
di: Zhang, You, et al.
Pubblicazione: (2025)
Quantifying and Reducing Speaker Heterogeneity within the Common Voice Corpus for Phonetic Analysis
di: Zhang, Miao, et al.
Pubblicazione: (2025)
di: Zhang, Miao, et al.
Pubblicazione: (2025)
Style Mixture of Experts for Expressive Text-To-Speech Synthesis
di: Jawaid, Ahad, et al.
Pubblicazione: (2024)
di: Jawaid, Ahad, et al.
Pubblicazione: (2024)
Expressive Speech Retrieval using Natural Language Descriptions of Speaking Style
di: Kang, Wonjune, et al.
Pubblicazione: (2025)
di: Kang, Wonjune, et al.
Pubblicazione: (2025)
Voice Conversion for Likability Control via Automated Rating of Speech Synthesis Corpora
di: Suda, Hitoshi, et al.
Pubblicazione: (2025)
di: Suda, Hitoshi, et al.
Pubblicazione: (2025)
PhiNet: Speaker Verification with Phonetic Interpretability
di: Ma, Yi, et al.
Pubblicazione: (2026)
di: Ma, Yi, et al.
Pubblicazione: (2026)
GOAT-TTS: Expressive and Realistic Speech Generation via A Dual-Branch LLM
di: Song, Yaodong, et al.
Pubblicazione: (2025)
di: Song, Yaodong, et al.
Pubblicazione: (2025)
Rethinking Speech Representation Aggregation in Speech Enhancement: A Phonetic Mutual Information Perspective
di: Han, Seungu, et al.
Pubblicazione: (2026)
di: Han, Seungu, et al.
Pubblicazione: (2026)
ProsodyFM: Unsupervised Phrasing and Intonation Control for Intelligible Speech Synthesis
di: He, Xiangheng, et al.
Pubblicazione: (2024)
di: He, Xiangheng, et al.
Pubblicazione: (2024)
On the Impact of Voice Anonymization on Speech Diagnostic Applications: a Case Study on COVID-19 Detection
di: Zhu, Yi, et al.
Pubblicazione: (2023)
di: Zhu, Yi, et al.
Pubblicazione: (2023)
Towards Expressive Zero-Shot Speech Synthesis with Hierarchical Prosody Modeling
di: Jiang, Yuepeng, et al.
Pubblicazione: (2024)
di: Jiang, Yuepeng, et al.
Pubblicazione: (2024)
Multimodal Input Aids a Bayesian Model of Phonetic Learning
di: Zhi, Sophia, et al.
Pubblicazione: (2024)
di: Zhi, Sophia, et al.
Pubblicazione: (2024)
Documenti analoghi
-
ControlVC: Zero-Shot Voice Conversion with Time-Varying Controls on Pitch and Speed
di: Chen, Meiying, et al.
Pubblicazione: (2022) -
Generating Novel and Realistic Speakers for Voice Conversion
di: Chen, Meiying Melissa, et al.
Pubblicazione: (2025) -
Generative Expressive Conversational Speech Synthesis
di: Liu, Rui, et al.
Pubblicazione: (2024) -
Phonetic Enhanced Language Modeling for Text-to-Speech Synthesis
di: Zhou, Kun, et al.
Pubblicazione: (2024) -
Conan: A Chunkwise Online Network for Zero-Shot Adaptive Voice Conversion
di: Zhang, Yu, et al.
Pubblicazione: (2025)