IndexTTS 2.5 Technical Report
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Yunpei, Zhou, Xun, Wang, Jinchao, Wang, Lu, Wu, Yong, Zhou, Siyi, Zhou, Yiquan, Shu, Jingchen |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech
di: Zhou, Siyi, et al.
Pubblicazione: (2025)
di: Zhou, Siyi, et al.
Pubblicazione: (2025)
IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System
di: Deng, Wei, et al.
Pubblicazione: (2025)
di: Deng, Wei, et al.
Pubblicazione: (2025)
MOSS-TTS Technical Report
di: Gong, Yitian, et al.
Pubblicazione: (2026)
di: Gong, Yitian, et al.
Pubblicazione: (2026)
Controllable Singing Style Conversion with Boundary-Aware Information Bottleneck
di: Hu, Zhetao, et al.
Pubblicazione: (2026)
di: Hu, Zhetao, et al.
Pubblicazione: (2026)
TTS-1 Technical Report
di: Atamanenko, Oleg, et al.
Pubblicazione: (2025)
di: Atamanenko, Oleg, et al.
Pubblicazione: (2025)
Fish Audio S2 Technical Report
di: Liao, Shijia, et al.
Pubblicazione: (2026)
di: Liao, Shijia, et al.
Pubblicazione: (2026)
MOSS-Audio Technical Report
di: Yang, Chen, et al.
Pubblicazione: (2026)
di: Yang, Chen, et al.
Pubblicazione: (2026)
AutoStyle-TTS: Retrieval-Augmented Generation based Automatic Style Matching Text-to-Speech Synthesis
di: Luo, Dan, et al.
Pubblicazione: (2025)
di: Luo, Dan, et al.
Pubblicazione: (2025)
Tutti: Expressive Multi-Singer Synthesis via Structure-Level Timbre Control and Vocal Texture Modeling
di: Chen, Jiatao, et al.
Pubblicazione: (2026)
di: Chen, Jiatao, et al.
Pubblicazione: (2026)
GLM-TTS Technical Report
di: Cui, Jiayan, et al.
Pubblicazione: (2025)
di: Cui, Jiayan, et al.
Pubblicazione: (2025)
UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information
di: Wang, Rui, et al.
Pubblicazione: (2025)
di: Wang, Rui, et al.
Pubblicazione: (2025)
Robust TTS Training via Self-Purifying Flow Matching for the WildSpoof 2026 TTS Track
di: Yi, June Young, et al.
Pubblicazione: (2025)
di: Yi, June Young, et al.
Pubblicazione: (2025)
Prosodic Boundary-Aware Streaming Generation for LLM-Based TTS with Streaming Text Input
di: Liu, Changsong, et al.
Pubblicazione: (2026)
di: Liu, Changsong, et al.
Pubblicazione: (2026)
VIBEVOICE-ASR Technical Report
di: Peng, Zhiliang, et al.
Pubblicazione: (2026)
di: Peng, Zhiliang, et al.
Pubblicazione: (2026)
MOSS Transcribe Diarize Technical Report
di: AI, MOSI., et al.
Pubblicazione: (2026)
di: AI, MOSI., et al.
Pubblicazione: (2026)
On the Effectiveness of Acoustic BPE in Decoder-Only TTS
di: Li, Bohan, et al.
Pubblicazione: (2024)
di: Li, Bohan, et al.
Pubblicazione: (2024)
Prior-agnostic Multi-scale Contrastive Text-Audio Pre-training for Parallelized TTS Frontend Modeling
di: Wang, Quanxiu, et al.
Pubblicazione: (2024)
di: Wang, Quanxiu, et al.
Pubblicazione: (2024)
Mitigating Hallucinations in LM-Based TTS Models via Distribution Alignment Using GFlowNets
di: Liu, Chenlin, et al.
Pubblicazione: (2025)
di: Liu, Chenlin, et al.
Pubblicazione: (2025)
Fun-ASR Technical Report
di: An, Keyu, et al.
Pubblicazione: (2025)
di: An, Keyu, et al.
Pubblicazione: (2025)
Fun-Audio-Chat Technical Report
di: Tongyi Fun Team, et al.
Pubblicazione: (2025)
di: Tongyi Fun Team, et al.
Pubblicazione: (2025)
Towards Lightweight and Stable Zero-shot TTS with Self-distilled Representation Disentanglement
di: Chen, Qianniu, et al.
Pubblicazione: (2025)
di: Chen, Qianniu, et al.
Pubblicazione: (2025)
DPI-TTS: Directional Patch Interaction for Fast-Converging and Style Temporal Modeling in Text-to-Speech
di: Qi, Xin, et al.
Pubblicazione: (2024)
di: Qi, Xin, et al.
Pubblicazione: (2024)
Index-ASR Technical Report
di: Song, Zheshu, et al.
Pubblicazione: (2025)
di: Song, Zheshu, et al.
Pubblicazione: (2025)
Raon-Speech Technical Report
di: Kim, Beomsoo, et al.
Pubblicazione: (2026)
di: Kim, Beomsoo, et al.
Pubblicazione: (2026)
A2TTS: TTS for Low Resource Indian Languages
di: Bhadoriya, Ayush Singh, et al.
Pubblicazione: (2025)
di: Bhadoriya, Ayush Singh, et al.
Pubblicazione: (2025)
PTS-SNN: A Prompt-Tuned Temporal Shift Spiking Neural Networks for Efficient Speech Emotion Recognition
di: Su, Xun, et al.
Pubblicazione: (2026)
di: Su, Xun, et al.
Pubblicazione: (2026)
Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought
di: Li, Xuanchen, et al.
Pubblicazione: (2026)
di: Li, Xuanchen, et al.
Pubblicazione: (2026)
RRPO: Robust Reward Policy Optimization for LLM-based Emotional TTS
di: Wang, Cong, et al.
Pubblicazione: (2025)
di: Wang, Cong, et al.
Pubblicazione: (2025)
Back to Ear: Perceptually Driven High Fidelity Music Reconstruction
di: Wang, Kangdi, et al.
Pubblicazione: (2025)
di: Wang, Kangdi, et al.
Pubblicazione: (2025)
Generalizable Speech Deepfake Detection via Information Bottleneck Enhanced Adversarial Alignment
di: Huang, Pu, et al.
Pubblicazione: (2025)
di: Huang, Pu, et al.
Pubblicazione: (2025)
VibeVoice Technical Report
di: Peng, Zhiliang, et al.
Pubblicazione: (2025)
di: Peng, Zhiliang, et al.
Pubblicazione: (2025)
Flamed-TTS: Flow Matching Attention-Free Models for Efficient Generating and Dynamic Pacing Zero-shot Text-to-Speech
di: Huynh-Nguyen, Hieu-Nghia, et al.
Pubblicazione: (2025)
di: Huynh-Nguyen, Hieu-Nghia, et al.
Pubblicazione: (2025)
Beyond the Mouth: Upper-Face Affective Cues in Audiovisual Sentence Recognition under Acoustic Uncertainty
di: Yang, Zhou, et al.
Pubblicazione: (2026)
di: Yang, Zhou, et al.
Pubblicazione: (2026)
Expressive Prompting: Improving Emotion Intensity and Speaker Consistency in Zero-Shot TTS
di: Wang, Haoyu, et al.
Pubblicazione: (2024)
di: Wang, Haoyu, et al.
Pubblicazione: (2024)
AudioCodecBench: A Comprehensive Benchmark for Audio Codec Evaluation
di: Wang, Lu, et al.
Pubblicazione: (2025)
di: Wang, Lu, et al.
Pubblicazione: (2025)
SLM-SS: Speech Language Model for Generative Speech Separation
di: Li, Tianhua, et al.
Pubblicazione: (2026)
di: Li, Tianhua, et al.
Pubblicazione: (2026)
Explore the Reinforcement Learning for the LLM based ASR and TTS system
di: Gao, Changfeng, et al.
Pubblicazione: (2025)
di: Gao, Changfeng, et al.
Pubblicazione: (2025)
Qwen3-TTS Technical Report
di: Hu, Hangrui, et al.
Pubblicazione: (2026)
di: Hu, Hangrui, et al.
Pubblicazione: (2026)
MPE-TTS: Customized Emotion Zero-Shot Text-To-Speech Using Multi-Modal Prompt
di: Wu, Zhichao, et al.
Pubblicazione: (2025)
di: Wu, Zhichao, et al.
Pubblicazione: (2025)
Kimi-Audio Technical Report
di: KimiTeam, et al.
Pubblicazione: (2025)
di: KimiTeam, et al.
Pubblicazione: (2025)
Documenti analoghi
-
IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech
di: Zhou, Siyi, et al.
Pubblicazione: (2025) -
IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System
di: Deng, Wei, et al.
Pubblicazione: (2025) -
MOSS-TTS Technical Report
di: Gong, Yitian, et al.
Pubblicazione: (2026) -
Controllable Singing Style Conversion with Boundary-Aware Information Bottleneck
di: Hu, Zhetao, et al.
Pubblicazione: (2026) -
TTS-1 Technical Report
di: Atamanenko, Oleg, et al.
Pubblicazione: (2025)