MambaVoiceCloning: Efficient and Expressive Text-to-Speech via State-Space Modeling and Diffusion Control
Fuente:
arXiv
Guardado en:
| Autores principales: | Kumar, Sahil, Patel, Namrataben, Wang, Honggang, Zhang, Youshan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
OpenVoice: Versatile Instant Voice Cloning
por: Qin, Zengyi, et al.
Publicado: (2023)
por: Qin, Zengyi, et al.
Publicado: (2023)
Sample-Efficient Diffusion for Text-To-Speech Synthesis
por: Lovelace, Justin, et al.
Publicado: (2024)
por: Lovelace, Justin, et al.
Publicado: (2024)
GTR-Voice: Articulatory Phonetics Informed Controllable Expressive Speech Synthesis
por: Li, Zehua Kcriss, et al.
Publicado: (2024)
por: Li, Zehua Kcriss, et al.
Publicado: (2024)
Multi-modal Adversarial Training for Zero-Shot Voice Cloning
por: Janiczek, John, et al.
Publicado: (2024)
por: Janiczek, John, et al.
Publicado: (2024)
Voice "Cloning" is Style Transfer
por: Zhou, Kaitlyn, et al.
Publicado: (2026)
por: Zhou, Kaitlyn, et al.
Publicado: (2026)
Task Vector in TTS: Toward Emotionally Expressive Dialectal Speech Synthesis
por: Feng, Pengchao, et al.
Publicado: (2025)
por: Feng, Pengchao, et al.
Publicado: (2025)
TaDiCodec: Text-aware Diffusion Speech Tokenizer for Speech Language Modeling
por: Wang, Yuancheng, et al.
Publicado: (2025)
por: Wang, Yuancheng, et al.
Publicado: (2025)
Description-based Controllable Text-to-Speech with Cross-Lingual Voice Control
por: Yamamoto, Ryuichi, et al.
Publicado: (2024)
por: Yamamoto, Ryuichi, et al.
Publicado: (2024)
On the Semantic Latent Space of Diffusion-Based Text-to-Speech Models
por: Varshavsky-Hassid, Miri, et al.
Publicado: (2024)
por: Varshavsky-Hassid, Miri, et al.
Publicado: (2024)
Style Mixture of Experts for Expressive Text-To-Speech Synthesis
por: Jawaid, Ahad, et al.
Publicado: (2024)
por: Jawaid, Ahad, et al.
Publicado: (2024)
ControlSpeech: Towards Simultaneous and Independent Zero-shot Speaker Cloning and Zero-shot Language Style Control
por: Ji, Shengpeng, et al.
Publicado: (2024)
por: Ji, Shengpeng, et al.
Publicado: (2024)
TextrolSpeech: A Text Style Control Speech Corpus With Codec Language Text-to-Speech Models
por: Ji, Shengpeng, et al.
Publicado: (2023)
por: Ji, Shengpeng, et al.
Publicado: (2023)
Diffusion Synthesizer for Efficient Multilingual Speech to Speech Translation
por: Hirschkind, Nameer, et al.
Publicado: (2024)
por: Hirschkind, Nameer, et al.
Publicado: (2024)
Investigating the Design Space of Diffusion Models for Speech Enhancement
por: Gonzalez, Philippe, et al.
Publicado: (2023)
por: Gonzalez, Philippe, et al.
Publicado: (2023)
DiffuSpeech: Silent Thought, Spoken Answer via Unified Speech-Text Diffusion
por: Lou, Yuxuan, et al.
Publicado: (2026)
por: Lou, Yuxuan, et al.
Publicado: (2026)
Speech to Speech Synthesis for Voice Impersonation
por: Johnson, Bjorn, et al.
Publicado: (2026)
por: Johnson, Bjorn, et al.
Publicado: (2026)
Schrodinger Bridges Beat Diffusion Models on Text-to-Speech Synthesis
por: Chen, Zehua, et al.
Publicado: (2023)
por: Chen, Zehua, et al.
Publicado: (2023)
Vision Transformer Segmentation for Visual Bird Sound Denoising
por: Kumar, Sahil, et al.
Publicado: (2024)
por: Kumar, Sahil, et al.
Publicado: (2024)
Modulating State Space Model with SlowFast Framework for Compute-Efficient Ultra Low-Latency Speech Enhancement
por: Cheng, Longbiao, et al.
Publicado: (2024)
por: Cheng, Longbiao, et al.
Publicado: (2024)
DiffAnon: Diffusion-based Prosody Control for Voice Anonymization
por: Ulgen, Ismail Rasim, et al.
Publicado: (2026)
por: Ulgen, Ismail Rasim, et al.
Publicado: (2026)
SVSNet+: Enhancing Speaker Voice Similarity Assessment Models with Representations from Speech Foundation Models
por: Yin, Chun, et al.
Publicado: (2024)
por: Yin, Chun, et al.
Publicado: (2024)
VoiceCraft: Zero-Shot Speech Editing and Text-to-Speech in the Wild
por: Peng, Puyuan, et al.
Publicado: (2024)
por: Peng, Puyuan, et al.
Publicado: (2024)
Speech Slytherin: Examining the Performance and Efficiency of Mamba for Speech Separation, Recognition, and Synthesis
por: Jiang, Xilin, et al.
Publicado: (2024)
por: Jiang, Xilin, et al.
Publicado: (2024)
SafeSpeech: Robust and Universal Voice Protection Against Malicious Speech Synthesis
por: Zhang, Zhisheng, et al.
Publicado: (2025)
por: Zhang, Zhisheng, et al.
Publicado: (2025)
Cross-lingual Text-To-Speech with Flow-based Voice Conversion for Improved Pronunciation
por: Ellinas, Nikolaos, et al.
Publicado: (2022)
por: Ellinas, Nikolaos, et al.
Publicado: (2022)
EM-TTS: Efficiently Trained Low-Resource Mongolian Lightweight Text-to-Speech
por: Liang, Ziqi, et al.
Publicado: (2024)
por: Liang, Ziqi, et al.
Publicado: (2024)
NonverbalTTS: A Public English Corpus of Text-Aligned Nonverbal Vocalizations with Emotion Annotations for Text-to-Speech
por: Borisov, Maksim, et al.
Publicado: (2025)
por: Borisov, Maksim, et al.
Publicado: (2025)
DDTSE: Discriminative Diffusion Model for Target Speech Extraction
por: Zhang, Leying, et al.
Publicado: (2023)
por: Zhang, Leying, et al.
Publicado: (2023)
Mitigating Unauthorized Speech Synthesis for Voice Protection
por: Zhang, Zhisheng, et al.
Publicado: (2024)
por: Zhang, Zhisheng, et al.
Publicado: (2024)
SepMamba: State-space models for speaker separation using Mamba
por: Avenstrup, Thor Højhus, et al.
Publicado: (2024)
por: Avenstrup, Thor Højhus, et al.
Publicado: (2024)
SAMUeL: Efficient Vocal-Conditioned Music Generation via Soft Alignment Attention and Latent Diffusion
por: Cheung, Hei Shing, et al.
Publicado: (2025)
por: Cheung, Hei Shing, et al.
Publicado: (2025)
De-AntiFake: Rethinking the Protective Perturbations Against Voice Cloning Attacks
por: Fan, Wei, et al.
Publicado: (2025)
por: Fan, Wei, et al.
Publicado: (2025)
Generative Multi-modal Feedback for Singing Voice Synthesis Evaluation
por: Li, Xueyan, et al.
Publicado: (2025)
por: Li, Xueyan, et al.
Publicado: (2025)
WaveSSM: Multiscale State-Space Models for Non-stationary Signal Attention
por: Solozabal, Ruben, et al.
Publicado: (2026)
por: Solozabal, Ruben, et al.
Publicado: (2026)
Decoding the Ear: A Framework for Objectifying Expressiveness from Human Preference Through Efficient Alignment
por: Lin, Zhiyu, et al.
Publicado: (2025)
por: Lin, Zhiyu, et al.
Publicado: (2025)
SupertonicTTS: Towards Highly Efficient and Streamlined Text-to-Speech System
por: Kim, Hyeongju, et al.
Publicado: (2025)
por: Kim, Hyeongju, et al.
Publicado: (2025)
CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models
por: Du, Zhihao, et al.
Publicado: (2024)
por: Du, Zhihao, et al.
Publicado: (2024)
Schrödinger Bridge Mamba for One-Step Speech Enhancement
por: Yang, Jing, et al.
Publicado: (2025)
por: Yang, Jing, et al.
Publicado: (2025)
SpikCommander: A High-performance Spiking Transformer with Multi-view Learning for Efficient Speech Command Recognition
por: Wang, Jiaqi, et al.
Publicado: (2025)
por: Wang, Jiaqi, et al.
Publicado: (2025)
Low-Resource Cross-Domain Singing Voice Synthesis via Reduced Self-Supervised Speech Representations
por: Kakoulidis, Panos, et al.
Publicado: (2024)
por: Kakoulidis, Panos, et al.
Publicado: (2024)
Ejemplares similares
-
OpenVoice: Versatile Instant Voice Cloning
por: Qin, Zengyi, et al.
Publicado: (2023) -
Sample-Efficient Diffusion for Text-To-Speech Synthesis
por: Lovelace, Justin, et al.
Publicado: (2024) -
GTR-Voice: Articulatory Phonetics Informed Controllable Expressive Speech Synthesis
por: Li, Zehua Kcriss, et al.
Publicado: (2024) -
Multi-modal Adversarial Training for Zero-Shot Voice Cloning
por: Janiczek, John, et al.
Publicado: (2024) -
Voice "Cloning" is Style Transfer
por: Zhou, Kaitlyn, et al.
Publicado: (2026)