Lombard Speech Synthesis for Any Voice with Controllable Style Embeddings
Fuente:
arXiv
Salvato in:
| Autori principali: | Akti, Seymanur, Waibel, Alexander |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Streaming Non-Autoregressive Model for Accent Conversion and Pronunciation Improvement
di: Nguyen, Tuan-Nam, et al.
Pubblicazione: (2025)
di: Nguyen, Tuan-Nam, et al.
Pubblicazione: (2025)
Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion
di: Akti, Seymanur, et al.
Pubblicazione: (2025)
di: Akti, Seymanur, et al.
Pubblicazione: (2025)
Voice Conversion for Lombard Speaking Style with Implicit and Explicit Acoustic Feature Conditioning
di: Woszczyk, Dominika, et al.
Pubblicazione: (2025)
di: Woszczyk, Dominika, et al.
Pubblicazione: (2025)
Improving Pronunciation and Accent Conversion through Knowledge Distillation And Synthetic Ground-Truth from Native TTS
di: Nguyen, Tuan Nam, et al.
Pubblicazione: (2024)
di: Nguyen, Tuan Nam, et al.
Pubblicazione: (2024)
Cocktail-Party Audio-Visual Speech Recognition
di: Nguyen, Thai-Binh, et al.
Pubblicazione: (2025)
di: Nguyen, Thai-Binh, et al.
Pubblicazione: (2025)
KIT's Offline Speech Translation and Instruction Following Submission for IWSLT 2025
di: Koneru, Sai, et al.
Pubblicazione: (2025)
di: Koneru, Sai, et al.
Pubblicazione: (2025)
TCSinger: Zero-Shot Singing Voice Synthesis with Style Transfer and Multi-Level Style Control
di: Zhang, Yu, et al.
Pubblicazione: (2024)
di: Zhang, Yu, et al.
Pubblicazione: (2024)
Weight Factorization and Centralization for Continual Learning in Speech Recognition
di: Ugan, Enes Yavuz, et al.
Pubblicazione: (2025)
di: Ugan, Enes Yavuz, et al.
Pubblicazione: (2025)
StyleSinger: Style Transfer for Out-of-Domain Singing Voice Synthesis
di: Zhang, Yu, et al.
Pubblicazione: (2023)
di: Zhang, Yu, et al.
Pubblicazione: (2023)
VoiceCraft-X: Unifying Multilingual, Voice-Cloning Speech Synthesis and Speech Editing
di: Zheng, Zhisheng, et al.
Pubblicazione: (2025)
di: Zheng, Zhisheng, et al.
Pubblicazione: (2025)
Shared Latent Representation for Joint Text-to-Audio-Visual Synthesis
di: Yaman, Dogucan, et al.
Pubblicazione: (2025)
di: Yaman, Dogucan, et al.
Pubblicazione: (2025)
Adapting Language Balance in Code-Switching Speech
di: Ugan, Enes Yavuz, et al.
Pubblicazione: (2025)
di: Ugan, Enes Yavuz, et al.
Pubblicazione: (2025)
Predictive Speech Recognition and End-of-Utterance Detection Towards Spoken Dialog Systems
di: Zink, Oswald, et al.
Pubblicazione: (2024)
di: Zink, Oswald, et al.
Pubblicazione: (2024)
MSA-ASR: Efficient Multilingual Speaker Attribution with frozen ASR Models
di: Nguyen, Thai-Binh, et al.
Pubblicazione: (2024)
di: Nguyen, Thai-Binh, et al.
Pubblicazione: (2024)
Convoifilter: A case study of doing cocktail party speech recognition
di: Nguyen, Thai-Binh, et al.
Pubblicazione: (2023)
di: Nguyen, Thai-Binh, et al.
Pubblicazione: (2023)
Summarizing Speech: A Comprehensive Survey
di: Retkowski, Fabian, et al.
Pubblicazione: (2025)
di: Retkowski, Fabian, et al.
Pubblicazione: (2025)
Prototype-Based Disentanglement for Controllable Dysarthric Speech Synthesis
di: Wang, Haoshen, et al.
Pubblicazione: (2026)
di: Wang, Haoshen, et al.
Pubblicazione: (2026)
Beyond Transcripts: A Renewed Perspective on Audio Chaptering
di: Retkowski, Fabian, et al.
Pubblicazione: (2026)
di: Retkowski, Fabian, et al.
Pubblicazione: (2026)
Vevo2: A Unified and Controllable Framework for Speech and Singing Voice Generation
di: Zhang, Xueyao, et al.
Pubblicazione: (2025)
di: Zhang, Xueyao, et al.
Pubblicazione: (2025)
Towards continually learning new languages
di: Pham, Ngoc-Quan, et al.
Pubblicazione: (2022)
di: Pham, Ngoc-Quan, et al.
Pubblicazione: (2022)
Spontaneous Style Text-to-Speech Synthesis with Controllable Spontaneous Behaviors Based on Language Models
di: Li, Weiqin, et al.
Pubblicazione: (2024)
di: Li, Weiqin, et al.
Pubblicazione: (2024)
RephraseTTS: Dynamic Length Text based Speech Insertion with Speaker Style Transfer
di: Matiyali, Neeraj, et al.
Pubblicazione: (2025)
di: Matiyali, Neeraj, et al.
Pubblicazione: (2025)
DARS: Dysarthria-Aware Rhythm-Style Synthesis for ASR Enhancement
di: Wu, Minghui, et al.
Pubblicazione: (2026)
di: Wu, Minghui, et al.
Pubblicazione: (2026)
Style Mixture of Experts for Expressive Text-To-Speech Synthesis
di: Jawaid, Ahad, et al.
Pubblicazione: (2024)
di: Jawaid, Ahad, et al.
Pubblicazione: (2024)
Accent conversion using discrete units with parallel data synthesized from controllable accented TTS
di: Nguyen, Tuan Nam, et al.
Pubblicazione: (2024)
di: Nguyen, Tuan Nam, et al.
Pubblicazione: (2024)
GSA-TTS : Toward Zero-Shot Speech Synthesis based on Gradual Style Adaptor
di: Lee, Seokgi, et al.
Pubblicazione: (2025)
di: Lee, Seokgi, et al.
Pubblicazione: (2025)
GTR-Voice: Articulatory Phonetics Informed Controllable Expressive Speech Synthesis
di: Li, Zehua Kcriss, et al.
Pubblicazione: (2024)
di: Li, Zehua Kcriss, et al.
Pubblicazione: (2024)
MimicLM: Zero-Shot Voice Imitation through Autoregressive Modeling of Pseudo-Parallel Speech Corpora
di: Feng, Tao, et al.
Pubblicazione: (2026)
di: Feng, Tao, et al.
Pubblicazione: (2026)
Description-based Controllable Text-to-Speech with Cross-Lingual Voice Control
di: Yamamoto, Ryuichi, et al.
Pubblicazione: (2024)
di: Yamamoto, Ryuichi, et al.
Pubblicazione: (2024)
ArVoice: A Multi-Speaker Dataset for Arabic Speech Synthesis
di: Toyin, Hawau Olamide, et al.
Pubblicazione: (2025)
di: Toyin, Hawau Olamide, et al.
Pubblicazione: (2025)
BOOM: Beyond Only One Modality KIT's Multimodal Multilingual Lecture Companion
di: Koneru, Sai, et al.
Pubblicazione: (2025)
di: Koneru, Sai, et al.
Pubblicazione: (2025)
Muse: Towards Reproducible Long-Form Song Generation with Fine-Grained Style Control
di: Jiang, Changhao, et al.
Pubblicazione: (2026)
di: Jiang, Changhao, et al.
Pubblicazione: (2026)
DiffStyleTTS: Diffusion-based Hierarchical Prosody Modeling for Text-to-Speech with Diverse and Controllable Styles
di: Liu, Jiaxuan, et al.
Pubblicazione: (2024)
di: Liu, Jiaxuan, et al.
Pubblicazione: (2024)
TASTE-Streaming: Towards Streamable Text-Aligned Speech Tokenization and Embedding for Spoken Language Modeling
di: Tseng, Liang-Hsuan, et al.
Pubblicazione: (2026)
di: Tseng, Liang-Hsuan, et al.
Pubblicazione: (2026)
Elderly-Contextual Data Augmentation via Speech Synthesis for Elderly ASR
di: Lee, Minsik, et al.
Pubblicazione: (2026)
di: Lee, Minsik, et al.
Pubblicazione: (2026)
Finding My Voice: Generative Reconstruction of Disordered Speech for Automated Clinical Evaluation
di: Rosero, Karen, et al.
Pubblicazione: (2025)
di: Rosero, Karen, et al.
Pubblicazione: (2025)
Tibetan-TTS:Low-Resource Tibetan Speech Synthesis with Large Model Adaptation
di: He, Jiaxu, et al.
Pubblicazione: (2026)
di: He, Jiaxu, et al.
Pubblicazione: (2026)
DELULU: Discriminative Embedding Learning Using Latent Units for Speaker-Aware Self-Trained Speech Foundational Model
di: Baali, Massa, et al.
Pubblicazione: (2025)
di: Baali, Massa, et al.
Pubblicazione: (2025)
Style Amnesia: Investigating Speaking Style Degradation and Mitigation in Multi-Turn Spoken Language Models
di: Lin, Yu-Xiang, et al.
Pubblicazione: (2025)
di: Lin, Yu-Xiang, et al.
Pubblicazione: (2025)
The Voice Behind the Words: Quantifying Intersectional Bias in SpeechLLMs
di: Satish, Shree Harsha Bokkahalli, et al.
Pubblicazione: (2026)
di: Satish, Shree Harsha Bokkahalli, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Streaming Non-Autoregressive Model for Accent Conversion and Pronunciation Improvement
di: Nguyen, Tuan-Nam, et al.
Pubblicazione: (2025) -
Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion
di: Akti, Seymanur, et al.
Pubblicazione: (2025) -
Voice Conversion for Lombard Speaking Style with Implicit and Explicit Acoustic Feature Conditioning
di: Woszczyk, Dominika, et al.
Pubblicazione: (2025) -
Improving Pronunciation and Accent Conversion through Knowledge Distillation And Synthetic Ground-Truth from Native TTS
di: Nguyen, Tuan Nam, et al.
Pubblicazione: (2024) -
Cocktail-Party Audio-Visual Speech Recognition
di: Nguyen, Thai-Binh, et al.
Pubblicazione: (2025)