M3-TTS: Multi-modal DiT Alignment & Mel-latent for Zero-shot High-fidelity Speech Synthesis

Fuente: arXiv
Gespeichert in:
Bibliographische Detailangaben
Hauptverfasser: Wang, Xiaopeng, Qiang, Chunyu, Fu, Ruibo, Wen, Zhengqi, Liu, Xuefei, Liu, Yukun, Liang, Yuzhe, Yin, Kang, Xie, Yuankun, Xie, Heng, Li, Chenxing, Zhang, Chen, Li, Changsheng
Format: Preprint
Veröffentlicht: 2025
Schlagworte:
Online-Zugang:
Tags: Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!