MAGIC-TTS: Fine-Grained Controllable Speech Synthesis with Explicit Local Duration and Pause Control
Fuente:
arXiv
Guardado en:
| Autores principales: | Mai, Jialong, Xing, Xiaofen, Xu, Xiangmin |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Parallel GPT: Harmonizing the Independence and Interdependence of Acoustic and Semantic Information for Zero-Shot Text-to-Speech
por: Xing, Jingyuan, et al.
Publicado: (2025)
por: Xing, Jingyuan, et al.
Publicado: (2025)
BridgeCode: A Dual Speech Representation Paradigm for Autoregressive Zero-Shot Text-to-Speech Synthesis
por: Xing, Jingyuan, et al.
Publicado: (2025)
por: Xing, Jingyuan, et al.
Publicado: (2025)
MNV-17: A High-Quality Performative Mandarin Dataset for Nonverbal Vocalization Recognition in Speech
por: Mai, Jialong, et al.
Publicado: (2025)
por: Mai, Jialong, et al.
Publicado: (2025)
HD-PPT: Hierarchical Decoding of Content- and Prompt-Preference Tokens for Instruction-based TTS
por: Nie, Sihang, et al.
Publicado: (2025)
por: Nie, Sihang, et al.
Publicado: (2025)
Long-Context Speech Synthesis with Context-Aware Memory
por: Li, Zhipeng, et al.
Publicado: (2025)
por: Li, Zhipeng, et al.
Publicado: (2025)
TED-TTS: Training-Free Intra-Utterance Emotion and Duration Control for Text-to-Speech Synthesis
por: Liang, Qifan, et al.
Publicado: (2026)
por: Liang, Qifan, et al.
Publicado: (2026)
Vesper: A Compact and Effective Pretrained Model for Speech Emotion Recognition
por: Chen, Weidong, et al.
Publicado: (2023)
por: Chen, Weidong, et al.
Publicado: (2023)
EMORL-TTS: Reinforcement Learning for Fine-Grained Emotion Control in LLM-based TTS
por: Li, Haoxun, et al.
Publicado: (2025)
por: Li, Haoxun, et al.
Publicado: (2025)
EmoSteer-TTS: Fine-Grained and Training-Free Emotion-Controllable Text-to-Speech via Activation Steering
por: Xie, Tianxin, et al.
Publicado: (2025)
por: Xie, Tianxin, et al.
Publicado: (2025)
VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation
por: Peng, Puyuan, et al.
Publicado: (2025)
por: Peng, Puyuan, et al.
Publicado: (2025)
S2SBench: A Benchmark for Quantifying Intelligence Degradation in Speech-to-Speech Large Language Models
por: Fang, Yuanbo, et al.
Publicado: (2025)
por: Fang, Yuanbo, et al.
Publicado: (2025)
DMP-TTS: Disentangled multi-modal Prompting for Controllable Text-to-Speech with Chained Guidance
por: Yin, Kang, et al.
Publicado: (2025)
por: Yin, Kang, et al.
Publicado: (2025)
ReStyle-TTS: Relative and Continuous Style Control for Zero-Shot Speech Synthesis
por: Li, Haitao, et al.
Publicado: (2026)
por: Li, Haitao, et al.
Publicado: (2026)
IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech
por: Zhou, Siyi, et al.
Publicado: (2025)
por: Zhou, Siyi, et al.
Publicado: (2025)
Prosodic Parameter Manipulation in TTS generated speech for Controlled Speech Generation
por: Chary, Podakanti Satyajith
Publicado: (2024)
por: Chary, Podakanti Satyajith
Publicado: (2024)
MF-Speech: Achieving Fine-Grained and Compositional Control in Speech Generation via Factor Disentanglement
por: Yu, Xinyue, et al.
Publicado: (2025)
por: Yu, Xinyue, et al.
Publicado: (2025)
Leveraging the Interplay Between Syntactic and Acoustic Cues for Optimizing Korean TTS Pause Formation
por: Jeon, Yejin, et al.
Publicado: (2024)
por: Jeon, Yejin, et al.
Publicado: (2024)
SegTune: Structured and Fine-Grained Control for Song Generation
por: Cai, Pengfei, et al.
Publicado: (2025)
por: Cai, Pengfei, et al.
Publicado: (2025)
Task Vector in TTS: Toward Emotionally Expressive Dialectal Speech Synthesis
por: Feng, Pengchao, et al.
Publicado: (2025)
por: Feng, Pengchao, et al.
Publicado: (2025)
EME-TTS: Unlocking the Emphasis and Emotion Link in Speech Synthesis
por: Li, Haoxun, et al.
Publicado: (2025)
por: Li, Haoxun, et al.
Publicado: (2025)
Cross-Lingual F5-TTS: Towards Language-Agnostic Voice Cloning and Speech Synthesis
por: Liu, Qingyu, et al.
Publicado: (2025)
por: Liu, Qingyu, et al.
Publicado: (2025)
SynTTS-Commands: A Public Dataset for On-Device KWS via TTS-Synthesized Multilingual Speech
por: Gan, Lu, et al.
Publicado: (2025)
por: Gan, Lu, et al.
Publicado: (2025)
Tibetan-TTS:Low-Resource Tibetan Speech Synthesis with Large Model Adaptation
por: He, Jiaxu, et al.
Publicado: (2026)
por: He, Jiaxu, et al.
Publicado: (2026)
LLaDA-TTS: Unifying Speech Synthesis and Zero-Shot Editing via Masked Diffusion Modeling
por: Fan, Xiaoyu, et al.
Publicado: (2026)
por: Fan, Xiaoyu, et al.
Publicado: (2026)
Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters
por: Abrassart, Mathilde, et al.
Publicado: (2025)
por: Abrassart, Mathilde, et al.
Publicado: (2025)
DubWise: Video-Guided Speech Duration Control in Multimodal LLM-based Text-to-Speech for Dubbing
por: Sahipjohn, Neha, et al.
Publicado: (2024)
por: Sahipjohn, Neha, et al.
Publicado: (2024)
MegaTTS 3: Sparse Alignment Enhanced Latent Diffusion Transformer for Zero-Shot Speech Synthesis
por: Jiang, Ziyue, et al.
Publicado: (2025)
por: Jiang, Ziyue, et al.
Publicado: (2025)
ParaStyleTTS: Toward Efficient and Robust Paralinguistic Style Control for Expressive Text-to-Speech Generation
por: Lou, Haowei, et al.
Publicado: (2025)
por: Lou, Haowei, et al.
Publicado: (2025)
Mega-TTS 2: Boosting Prompting Mechanisms for Zero-Shot Speech Synthesis
por: Jiang, Ziyue, et al.
Publicado: (2023)
por: Jiang, Ziyue, et al.
Publicado: (2023)
DAIEN-TTS: Disentangled Audio Infilling for Environment-Aware Text-to-Speech Synthesis
por: Lu, Ye-Xin, et al.
Publicado: (2025)
por: Lu, Ye-Xin, et al.
Publicado: (2025)
IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System
por: Deng, Wei, et al.
Publicado: (2025)
por: Deng, Wei, et al.
Publicado: (2025)
Inappropriate Pause Detection In Dysarthric Speech Using Large-Scale Speech Recognition
por: Lee, Jeehyun, et al.
Publicado: (2024)
por: Lee, Jeehyun, et al.
Publicado: (2024)
M3-TTS: Multi-modal DiT Alignment & Mel-latent for Zero-shot High-fidelity Speech Synthesis
por: Wang, Xiaopeng, et al.
Publicado: (2025)
por: Wang, Xiaopeng, et al.
Publicado: (2025)
ZMM-TTS: Zero-shot Multilingual and Multispeaker Speech Synthesis Conditioned on Self-supervised Discrete Speech Representations
por: Gong, Cheng, et al.
Publicado: (2023)
por: Gong, Cheng, et al.
Publicado: (2023)
FLY-TTS: Fast, Lightweight and High-Quality End-to-End Text-to-Speech Synthesis
por: Guo, Yinlin, et al.
Publicado: (2024)
por: Guo, Yinlin, et al.
Publicado: (2024)
CAST-TTS: A Simple Cross-Attention Framework for Unified Timbre Control in TTS
por: Zheng, Zihao, et al.
Publicado: (2026)
por: Zheng, Zihao, et al.
Publicado: (2026)
AutoStyle-TTS: Retrieval-Augmented Generation based Automatic Style Matching Text-to-Speech Synthesis
por: Luo, Dan, et al.
Publicado: (2025)
por: Luo, Dan, et al.
Publicado: (2025)
ViT-TTS: Visual Text-to-Speech with Scalable Diffusion Transformer
por: Liu, Huadai, et al.
Publicado: (2023)
por: Liu, Huadai, et al.
Publicado: (2023)
FlexiVoice: Enabling Flexible Style Control in Zero-Shot TTS with Natural Language Instructions
por: Chen, Dekun, et al.
Publicado: (2026)
por: Chen, Dekun, et al.
Publicado: (2026)
TTS-Transducer: End-to-End Speech Synthesis with Neural Transducer
por: Bataev, Vladimir, et al.
Publicado: (2025)
por: Bataev, Vladimir, et al.
Publicado: (2025)
Ejemplares similares
-
Parallel GPT: Harmonizing the Independence and Interdependence of Acoustic and Semantic Information for Zero-Shot Text-to-Speech
por: Xing, Jingyuan, et al.
Publicado: (2025) -
BridgeCode: A Dual Speech Representation Paradigm for Autoregressive Zero-Shot Text-to-Speech Synthesis
por: Xing, Jingyuan, et al.
Publicado: (2025) -
MNV-17: A High-Quality Performative Mandarin Dataset for Nonverbal Vocalization Recognition in Speech
por: Mai, Jialong, et al.
Publicado: (2025) -
HD-PPT: Hierarchical Decoding of Content- and Prompt-Preference Tokens for Instruction-based TTS
por: Nie, Sihang, et al.
Publicado: (2025) -
Long-Context Speech Synthesis with Context-Aware Memory
por: Li, Zhipeng, et al.
Publicado: (2025)