Style Mixture of Experts for Expressive Text-To-Speech Synthesis
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Jawaid, Ahad, Chandra, Shreeram Suresh, Lu, Junchen, Sisman, Berrak |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Text-to-Speech for Unseen Speakers via Low-Complexity Discrete Unit-Based Frame Selection
par: Ulgen, Ismail Rasim, et autres
Publié: (2024)
par: Ulgen, Ismail Rasim, et autres
Publié: (2024)
Objective Evaluation of Prosody and Intelligibility in Speech Synthesis via Conditional Prediction of Discrete Tokens
par: Ulgen, Ismail Rasim, et autres
Publié: (2025)
par: Ulgen, Ismail Rasim, et autres
Publié: (2025)
Accented Text-to-Speech Synthesis with a Conditional Variational Autoencoder
par: Melechovsky, Jan, et autres
Publié: (2022)
par: Melechovsky, Jan, et autres
Publié: (2022)
HuLA: Prosody-Aware Anti-Spoofing with Multi-Task Learning for Expressive and Emotional Synthetic Speech
par: Mahapatra, Aurosweta, et autres
Publié: (2025)
par: Mahapatra, Aurosweta, et autres
Publié: (2025)
Exploring speech style spaces with language models: Emotional TTS without emotion labels
par: Chandra, Shreeram Suresh, et autres
Publié: (2024)
par: Chandra, Shreeram Suresh, et autres
Publié: (2024)
Accent Conversion in Text-To-Speech Using Multi-Level VAE and Adversarial Training
par: Melechovsky, Jan, et autres
Publié: (2024)
par: Melechovsky, Jan, et autres
Publié: (2024)
NaturalVoices: A Large-Scale, Spontaneous and Emotional Podcast Dataset for Voice Conversion
par: Du, Zongyang, et autres
Publié: (2025)
par: Du, Zongyang, et autres
Publié: (2025)
Converting Anyone's Voice: End-to-End Expressive Voice Conversion with a Conditional Diffusion Model
par: Du, Zongyang, et autres
Publié: (2024)
par: Du, Zongyang, et autres
Publié: (2024)
Revealing Emotional Clusters in Speaker Embeddings: A Contrastive Learning Strategy for Speech Emotion Recognition
par: Ulgen, Ismail Rasim, et autres
Publié: (2024)
par: Ulgen, Ismail Rasim, et autres
Publié: (2024)
Enhancing Speech Emotion Recognition Through Differentiable Architecture Search
par: Rajapakshe, Thejan, et autres
Publié: (2023)
par: Rajapakshe, Thejan, et autres
Publié: (2023)
Spontaneous Style Text-to-Speech Synthesis with Controllable Spontaneous Behaviors Based on Language Models
par: Li, Weiqin, et autres
Publié: (2024)
par: Li, Weiqin, et autres
Publié: (2024)
Lightweight Zero-shot Text-to-Speech with Mixture of Adapters
par: Fujita, Kenichi, et autres
Publié: (2024)
par: Fujita, Kenichi, et autres
Publié: (2024)
Rasa: Building Expressive Speech Synthesis Systems for Indian Languages in Low-resource Settings
par: Varadhan, Praveen Srinivasa, et autres
Publié: (2024)
par: Varadhan, Praveen Srinivasa, et autres
Publié: (2024)
LibriTTS-P: A Corpus with Speaking Style and Speaker Identity Prompts for Text-to-Speech and Style Captioning
par: Kawamura, Masaya, et autres
Publié: (2024)
par: Kawamura, Masaya, et autres
Publié: (2024)
Discrete Unit based Masking for Improving Disentanglement in Voice Conversion
par: Lee, Philip H., et autres
Publié: (2024)
par: Lee, Philip H., et autres
Publié: (2024)
emoDARTS: Joint Optimisation of CNN & Sequential Neural Network Architectures for Superior Speech Emotion Recognition
par: Rajapakshe, Thejan, et autres
Publié: (2024)
par: Rajapakshe, Thejan, et autres
Publié: (2024)
Towards Emotionally Consistent Text-Based Speech Editing: Introducing EmoCorrector and The ECD-TSE Dataset
par: Liu, Rui, et autres
Publié: (2025)
par: Liu, Rui, et autres
Publié: (2025)
Comparative Evaluation of Expressive Japanese Character Text-to-Speech with VITS and Style-BERT-VITS2
par: Rackauckas, Zackary, et autres
Publié: (2025)
par: Rackauckas, Zackary, et autres
Publié: (2025)
Meta Learning Text-to-Speech Synthesis in over 7000 Languages
par: Lux, Florian, et autres
Publié: (2024)
par: Lux, Florian, et autres
Publié: (2024)
SNIPER Training: Single-Shot Sparse Training for Text-to-Speech
par: Lam, Perry, et autres
Publié: (2022)
par: Lam, Perry, et autres
Publié: (2022)
Generative Expressive Conversational Speech Synthesis
par: Liu, Rui, et autres
Publié: (2024)
par: Liu, Rui, et autres
Publié: (2024)
DiffAnon: Diffusion-based Prosody Control for Voice Anonymization
par: Ulgen, Ismail Rasim, et autres
Publié: (2026)
par: Ulgen, Ismail Rasim, et autres
Publié: (2026)
Expressive Speech Retrieval using Natural Language Descriptions of Speaking Style
par: Kang, Wonjune, et autres
Publié: (2025)
par: Kang, Wonjune, et autres
Publié: (2025)
Computational Narrative Understanding for Expressive Text-to-Speech
par: Michel, Gaspard, et autres
Publié: (2025)
par: Michel, Gaspard, et autres
Publié: (2025)
Scaling Rich Style-Prompted Text-to-Speech Datasets
par: Diwan, Anuj, et autres
Publié: (2025)
par: Diwan, Anuj, et autres
Publié: (2025)
GTR-Voice: Articulatory Phonetics Informed Controllable Expressive Speech Synthesis
par: Li, Zehua Kcriss, et autres
Publié: (2024)
par: Li, Zehua Kcriss, et autres
Publié: (2024)
Can Emotion Fool Anti-spoofing?
par: Mahapatra, Aurosweta, et autres
Publié: (2025)
par: Mahapatra, Aurosweta, et autres
Publié: (2025)
DART: Disentanglement of Accent and Speaker Representation in Multispeaker Text-to-Speech
par: Melechovsky, Jan, et autres
Publié: (2024)
par: Melechovsky, Jan, et autres
Publié: (2024)
TTSDS -- Text-to-Speech Distribution Score
par: Minixhofer, Christoph, et autres
Publié: (2024)
par: Minixhofer, Christoph, et autres
Publié: (2024)
StoryTTS: A Highly Expressive Text-to-Speech Dataset with Rich Textual Expressiveness Annotations
par: Liu, Sen, et autres
Publié: (2024)
par: Liu, Sen, et autres
Publié: (2024)
Coupling Speech Encoders with Downstream Text Models
par: Chelba, Ciprian, et autres
Publié: (2024)
par: Chelba, Ciprian, et autres
Publié: (2024)
Text to Speech System for Meitei Mayek Script
par: Irengbam, Gangular Singh, et autres
Publié: (2025)
par: Irengbam, Gangular Singh, et autres
Publié: (2025)
Omni-Router: Sharing Routing Decisions in Sparse Mixture-of-Experts for Speech Recognition
par: Gu, Zijin, et autres
Publié: (2025)
par: Gu, Zijin, et autres
Publié: (2025)
CoSTA: Code-Switched Speech Translation using Aligned Speech-Text Interleaving
par: Shankar, Bhavani, et autres
Publié: (2024)
par: Shankar, Bhavani, et autres
Publié: (2024)
On the Problem of Text-To-Speech Model Selection for Synthetic Data Generation in Automatic Speech Recognition
par: Rossenbach, Nick, et autres
Publié: (2024)
par: Rossenbach, Nick, et autres
Publié: (2024)
The ParlaSpeech Collection of Automatically Generated Speech and Text Datasets from Parliamentary Proceedings
par: Ljubešić, Nikola, et autres
Publié: (2024)
par: Ljubešić, Nikola, et autres
Publié: (2024)
Combining TF-GridNet and Mixture Encoder for Continuous Speech Separation for Meeting Transcription
par: Vieting, Peter, et autres
Publié: (2023)
par: Vieting, Peter, et autres
Publié: (2023)
SpeakStream: Streaming Text-to-Speech with Interleaved Data
par: Bai, Richard He, et autres
Publié: (2025)
par: Bai, Richard He, et autres
Publié: (2025)
On the Semantic Latent Space of Diffusion-Based Text-to-Speech Models
par: Varshavsky-Hassid, Miri, et autres
Publié: (2024)
par: Varshavsky-Hassid, Miri, et autres
Publié: (2024)
Rethinking MUSHRA: Addressing Modern Challenges in Text-to-Speech Evaluation
par: Varadhan, Praveen Srinivasa, et autres
Publié: (2024)
par: Varadhan, Praveen Srinivasa, et autres
Publié: (2024)
Documents similaires
-
Text-to-Speech for Unseen Speakers via Low-Complexity Discrete Unit-Based Frame Selection
par: Ulgen, Ismail Rasim, et autres
Publié: (2024) -
Objective Evaluation of Prosody and Intelligibility in Speech Synthesis via Conditional Prediction of Discrete Tokens
par: Ulgen, Ismail Rasim, et autres
Publié: (2025) -
Accented Text-to-Speech Synthesis with a Conditional Variational Autoencoder
par: Melechovsky, Jan, et autres
Publié: (2022) -
HuLA: Prosody-Aware Anti-Spoofing with Multi-Task Learning for Expressive and Emotional Synthetic Speech
par: Mahapatra, Aurosweta, et autres
Publié: (2025) -
Exploring speech style spaces with language models: Emotional TTS without emotion labels
par: Chandra, Shreeram Suresh, et autres
Publié: (2024)