Can we reconstruct a dysarthric voice with the large speech model Parler TTS?
Fuente:
arXiv
Guardado en:
| Autores principales: | Sanchez, Ariadna, King, Simon |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Can large audio language models understand child stuttering speech? speech summarization, and source separation
por: Okocha, Chibuzor, et al.
Publicado: (2025)
por: Okocha, Chibuzor, et al.
Publicado: (2025)
Beyond the binary: Limitations and possibilities of gender-related speech technology research
por: Sanchez, Ariadna, et al.
Publicado: (2024)
por: Sanchez, Ariadna, et al.
Publicado: (2024)
Natural language guidance of high-fidelity text-to-speech with synthetic annotations
por: Lyth, Dan, et al.
Publicado: (2024)
por: Lyth, Dan, et al.
Publicado: (2024)
TouchTTS: An Embarrassingly Simple TTS Framework that Everyone Can Touch
por: Song, Xingchen, et al.
Publicado: (2024)
por: Song, Xingchen, et al.
Publicado: (2024)
Transferable speech-to-text large language model alignment module
por: Wu, Boyong, et al.
Publicado: (2024)
por: Wu, Boyong, et al.
Publicado: (2024)
RepeaTTS: Towards Feature Discovery through Repeated Fine-Tuning
por: Sigurgeirsson, Atli, et al.
Publicado: (2025)
por: Sigurgeirsson, Atli, et al.
Publicado: (2025)
EE-TTS: Emphatic Expressive TTS with Linguistic Information
por: Zhong, Yi, et al.
Publicado: (2023)
por: Zhong, Yi, et al.
Publicado: (2023)
Can Whisper perform speech-based in-context learning?
por: Wang, Siyin, et al.
Publicado: (2023)
por: Wang, Siyin, et al.
Publicado: (2023)
emg2speech: Synthesizing speech from electromyography using self-supervised speech models
por: Gowda, Harshavardhana T., et al.
Publicado: (2025)
por: Gowda, Harshavardhana T., et al.
Publicado: (2025)
Automated speech audiometry: Can it work using open-source pre-trained Kaldi-NL automatic speech recognition?
por: Araiza-Illan, Gloria, et al.
Publicado: (2023)
por: Araiza-Illan, Gloria, et al.
Publicado: (2023)
Word-wise intonation model for cross-language TTS systems
por: A., Tomilov A., et al.
Publicado: (2024)
por: A., Tomilov A., et al.
Publicado: (2024)
Acoustic-to-articulatory inversion for dysarthric speech: Are pre-trained self-supervised representations favorable?
por: Maharana, Sarthak Kumar, et al.
Publicado: (2023)
por: Maharana, Sarthak Kumar, et al.
Publicado: (2023)
Qwen3-TTS Technical Report
por: Hu, Hangrui, et al.
Publicado: (2026)
por: Hu, Hangrui, et al.
Publicado: (2026)
Unsupervised lexicon learning from speech is limited by representations rather than clustering
por: Slabbert, Danel, et al.
Publicado: (2025)
por: Slabbert, Danel, et al.
Publicado: (2025)
Improving child speech recognition with augmented child-like speech
por: Zhang, Yuanyuan, et al.
Publicado: (2024)
por: Zhang, Yuanyuan, et al.
Publicado: (2024)
Do Discrete Self-Supervised Representations of Speech Capture Tone Distinctions?
por: Osakuade, Opeyemi, et al.
Publicado: (2024)
por: Osakuade, Opeyemi, et al.
Publicado: (2024)
Multi-interaction TTS toward professional recording reproduction
por: Kanagawa, Hiroki, et al.
Publicado: (2025)
por: Kanagawa, Hiroki, et al.
Publicado: (2025)
RWKVTTS: Yet another TTS based on RWKV-7
por: yueyu, Lin, et al.
Publicado: (2025)
por: yueyu, Lin, et al.
Publicado: (2025)
MunTTS: A Text-to-Speech System for Mundari
por: Gumma, Varun, et al.
Publicado: (2024)
por: Gumma, Varun, et al.
Publicado: (2024)
Llama-VITS: Enhancing TTS Synthesis with Semantic Awareness
por: Feng, Xincan, et al.
Publicado: (2024)
por: Feng, Xincan, et al.
Publicado: (2024)
DiaMoE-TTS: A Unified IPA-Based Dialect TTS Framework with Mixture-of-Experts and Parameter-Efficient Zero-Shot Adaptation
por: Chen, Ziqi, et al.
Publicado: (2025)
por: Chen, Ziqi, et al.
Publicado: (2025)
JoyTTS: LLM-based Spoken Chatbot With Voice Cloning
por: Zhou, Fangru, et al.
Publicado: (2025)
por: Zhou, Fangru, et al.
Publicado: (2025)
SP-MCQA: Evaluating Intelligibility of TTS Beyond the Word Level
por: Tee, Hitomi Jin Ling, et al.
Publicado: (2025)
por: Tee, Hitomi Jin Ling, et al.
Publicado: (2025)
An investigation of phrase break prediction in an End-to-End TTS system
por: Vadapalli, Anandaswarup
Publicado: (2023)
por: Vadapalli, Anandaswarup
Publicado: (2023)
A Language Modeling Approach to Diacritic-Free Hebrew TTS
por: Roth, Amit, et al.
Publicado: (2024)
por: Roth, Amit, et al.
Publicado: (2024)
Exploring the limits of decoder-only models trained on public speech recognition corpora
por: Gupta, Ankit, et al.
Publicado: (2024)
por: Gupta, Ankit, et al.
Publicado: (2024)
PRODIS -- a speech database and a phoneme-based language model for the study of predictability effects in Polish
por: Malisz, Zofia, et al.
Publicado: (2024)
por: Malisz, Zofia, et al.
Publicado: (2024)
Translating speech with just images
por: Oneata, Dan, et al.
Publicado: (2024)
por: Oneata, Dan, et al.
Publicado: (2024)
AfriHuBERT: A self-supervised speech representation model for African languages
por: Alabi, Jesujoba O., et al.
Publicado: (2024)
por: Alabi, Jesujoba O., et al.
Publicado: (2024)
Transfer the linguistic representations from TTS to accent conversion with non-parallel data
por: Chen, Xi, et al.
Publicado: (2024)
por: Chen, Xi, et al.
Publicado: (2024)
Daisy-TTS: Simulating Wider Spectrum of Emotions via Prosody Embedding Decomposition
por: Chevi, Rendi, et al.
Publicado: (2024)
por: Chevi, Rendi, et al.
Publicado: (2024)
SpeechCLIP+: Self-supervised multi-task representation learning for speech via CLIP and speech-image data
por: Wang, Hsuan-Fu, et al.
Publicado: (2024)
por: Wang, Hsuan-Fu, et al.
Publicado: (2024)
Training dynamic models using early exits for automatic speech recognition on resource-constrained devices
por: Wright, George August, et al.
Publicado: (2023)
por: Wright, George August, et al.
Publicado: (2023)
Strategies for improving low resource speech to text translation relying on pre-trained ASR models
por: Kesiraju, Santosh, et al.
Publicado: (2023)
por: Kesiraju, Santosh, et al.
Publicado: (2023)
The Greek podcast corpus: Competitive speech models for low-resourced languages with weakly supervised data
por: Paraskevopoulos, Georgios, et al.
Publicado: (2024)
por: Paraskevopoulos, Georgios, et al.
Publicado: (2024)
GOAT-TTS: Expressive and Realistic Speech Generation via A Dual-Branch LLM
por: Song, Yaodong, et al.
Publicado: (2025)
por: Song, Yaodong, et al.
Publicado: (2025)
GSA-TTS : Toward Zero-Shot Speech Synthesis based on Gradual Style Adaptor
por: Lee, Seokgi, et al.
Publicado: (2025)
por: Lee, Seokgi, et al.
Publicado: (2025)
Bailing-TTS: Chinese Dialectal Speech Synthesis Towards Human-like Spontaneous Representation
por: Di, Xinhan, et al.
Publicado: (2024)
por: Di, Xinhan, et al.
Publicado: (2024)
Leveraging the Interplay Between Syntactic and Acoustic Cues for Optimizing Korean TTS Pause Formation
por: Jeon, Yejin, et al.
Publicado: (2024)
por: Jeon, Yejin, et al.
Publicado: (2024)
Minimizing Modality Gap from the Input Side: Your Speech LLM Can Be a Prosody-Aware Text LLM
por: Cui, Wenqian, et al.
Publicado: (2026)
por: Cui, Wenqian, et al.
Publicado: (2026)
Ejemplares similares
-
Can large audio language models understand child stuttering speech? speech summarization, and source separation
por: Okocha, Chibuzor, et al.
Publicado: (2025) -
Beyond the binary: Limitations and possibilities of gender-related speech technology research
por: Sanchez, Ariadna, et al.
Publicado: (2024) -
Natural language guidance of high-fidelity text-to-speech with synthetic annotations
por: Lyth, Dan, et al.
Publicado: (2024) -
TouchTTS: An Embarrassingly Simple TTS Framework that Everyone Can Touch
por: Song, Xingchen, et al.
Publicado: (2024) -
Transferable speech-to-text large language model alignment module
por: Wu, Boyong, et al.
Publicado: (2024)