M3-TTS: Multi-modal DiT Alignment & Mel-latent for Zero-shot High-fidelity Speech Synthesis

Fuente: arXiv
Saved in:
Bibliographic Details
Main Authors: Wang, Xiaopeng, Qiang, Chunyu, Fu, Ruibo, Wen, Zhengqi, Liu, Xuefei, Liu, Yukun, Liang, Yuzhe, Yin, Kang, Xie, Yuankun, Xie, Heng, Li, Chenxing, Zhang, Chen, Li, Changsheng
Format: Preprint
Published: 2025
Subjects:
Online Access:
Tags: Add Tag
No Tags, Be the first to tag this record!