GLM-TTS Technical Report
Fuente:
arXiv
Guardado en:
| Autores principales: | Cui, Jiayan, Yang, Zhihan, Li, Naihan, Tian, Jiankun, Ma, Xingyu, Zhang, Yi, Chen, Guangyu, Yang, Runxuan, Cheng, Yuqing, Zhou, Yizhi, Yu, Guochen, Gu, Xiaotao, Tang, Jie |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Modeling Music as a Time-Frequency Image: A 2D Tokenizer for Music Generation
por: Cheng, Yuqing, et al.
Publicado: (2026)
por: Cheng, Yuqing, et al.
Publicado: (2026)
MOSS-TTS Technical Report
por: Gong, Yitian, et al.
Publicado: (2026)
por: Gong, Yitian, et al.
Publicado: (2026)
Qwen3-TTS Technical Report
por: Hu, Hangrui, et al.
Publicado: (2026)
por: Hu, Hangrui, et al.
Publicado: (2026)
IndexTTS 2.5 Technical Report
por: Li, Yunpei, et al.
Publicado: (2026)
por: Li, Yunpei, et al.
Publicado: (2026)
TTS-1 Technical Report
por: Atamanenko, Oleg, et al.
Publicado: (2025)
por: Atamanenko, Oleg, et al.
Publicado: (2025)
EMORL-TTS: Reinforcement Learning for Fine-Grained Emotion Control in LLM-based TTS
por: Li, Haoxun, et al.
Publicado: (2025)
por: Li, Haoxun, et al.
Publicado: (2025)
Tibetan-TTS:Low-Resource Tibetan Speech Synthesis with Large Model Adaptation
por: He, Jiaxu, et al.
Publicado: (2026)
por: He, Jiaxu, et al.
Publicado: (2026)
QuarkAudio Technical Report
por: Liu, Chengwei, et al.
Publicado: (2025)
por: Liu, Chengwei, et al.
Publicado: (2025)
MOSS-Audio Technical Report
por: Yang, Chen, et al.
Publicado: (2026)
por: Yang, Chen, et al.
Publicado: (2026)
SponTTS: modeling and transferring spontaneous style for TTS
por: Li, Hanzhao, et al.
Publicado: (2023)
por: Li, Hanzhao, et al.
Publicado: (2023)
MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts
por: Xue, Heyang, et al.
Publicado: (2025)
por: Xue, Heyang, et al.
Publicado: (2025)
GLM-4-Voice: Towards Intelligent and Human-Like End-to-End Spoken Chatbot
por: Zeng, Aohan, et al.
Publicado: (2024)
por: Zeng, Aohan, et al.
Publicado: (2024)
Robust TTS Training via Self-Purifying Flow Matching for the WildSpoof 2026 TTS Track
por: Yi, June Young, et al.
Publicado: (2025)
por: Yi, June Young, et al.
Publicado: (2025)
E2 TTS: Embarrassingly Easy Fully Non-Autoregressive Zero-Shot TTS
por: Eskimez, Sefik Emre, et al.
Publicado: (2024)
por: Eskimez, Sefik Emre, et al.
Publicado: (2024)
GLM-OCR Technical Report
por: Duan, Shuaiqi, et al.
Publicado: (2026)
por: Duan, Shuaiqi, et al.
Publicado: (2026)
Enhancing Spectrogram Realism in Singing Voice Synthesis via Explicit Bandwidth Extension Prior to Vocoder
por: Yang, Runxuan, et al.
Publicado: (2025)
por: Yang, Runxuan, et al.
Publicado: (2025)
MM-TTS: Multi-modal Prompt based Style Transfer for Expressive Text-to-Speech Synthesis
por: Guan, Wenhao, et al.
Publicado: (2023)
por: Guan, Wenhao, et al.
Publicado: (2023)
SynTTS-Commands: A Public Dataset for On-Device KWS via TTS-Synthesized Multilingual Speech
por: Gan, Lu, et al.
Publicado: (2025)
por: Gan, Lu, et al.
Publicado: (2025)
Accent-VITS:accent transfer for end-to-end TTS
por: Ma, Linhan, et al.
Publicado: (2023)
por: Ma, Linhan, et al.
Publicado: (2023)
EE-TTS: Emphatic Expressive TTS with Linguistic Information
por: Zhong, Yi, et al.
Publicado: (2023)
por: Zhong, Yi, et al.
Publicado: (2023)
Index-ASR Technical Report
por: Song, Zheshu, et al.
Publicado: (2025)
por: Song, Zheshu, et al.
Publicado: (2025)
DAIEN-TTS: Disentangled Audio Infilling for Environment-Aware Text-to-Speech Synthesis
por: Lu, Ye-Xin, et al.
Publicado: (2025)
por: Lu, Ye-Xin, et al.
Publicado: (2025)
MOSS Transcribe Diarize Technical Report
por: AI, MOSI., et al.
Publicado: (2026)
por: AI, MOSI., et al.
Publicado: (2026)
OV-InstructTTS: Towards Open-Vocabulary Instruct Text-to-Speech
por: Ren, Yong, et al.
Publicado: (2026)
por: Ren, Yong, et al.
Publicado: (2026)
PFluxTTS: Hybrid Flow-Matching TTS with Robust Cross-Lingual Voice Cloning and Inference-Time Model Fusion
por: Pankov, Vikentii, et al.
Publicado: (2026)
por: Pankov, Vikentii, et al.
Publicado: (2026)
Time-Frequency-Based Attention Cache Memory Model for Real-Time Speech Separation
por: Chen, Guo, et al.
Publicado: (2025)
por: Chen, Guo, et al.
Publicado: (2025)
SPMamba: State-space model is all you need in speech separation
por: Li, Kai, et al.
Publicado: (2024)
por: Li, Kai, et al.
Publicado: (2024)
Mega-TTS 2: Boosting Prompting Mechanisms for Zero-Shot Speech Synthesis
por: Jiang, Ziyue, et al.
Publicado: (2023)
por: Jiang, Ziyue, et al.
Publicado: (2023)
A Fast and Lightweight Model for Causal Audio-Visual Speech Separation
por: Sang, Wendi, et al.
Publicado: (2025)
por: Sang, Wendi, et al.
Publicado: (2025)
E1 TTS: Simple and Fast Non-Autoregressive TTS
por: Liu, Zhijun, et al.
Publicado: (2024)
por: Liu, Zhijun, et al.
Publicado: (2024)
Step-Audio 2 Technical Report
por: Wu, Boyong, et al.
Publicado: (2025)
por: Wu, Boyong, et al.
Publicado: (2025)
I2TTS: Image-indicated Immersive Text-to-speech Synthesis with Spatial Perception
por: Zhang, Jiawei, et al.
Publicado: (2024)
por: Zhang, Jiawei, et al.
Publicado: (2024)
FlexiVoice: Enabling Flexible Style Control in Zero-Shot TTS with Natural Language Instructions
por: Chen, Dekun, et al.
Publicado: (2026)
por: Chen, Dekun, et al.
Publicado: (2026)
Cross-Lingual F5-TTS: Towards Language-Agnostic Voice Cloning and Speech Synthesis
por: Liu, Qingyu, et al.
Publicado: (2025)
por: Liu, Qingyu, et al.
Publicado: (2025)
Covo-Audio Technical Report
por: Wang, Wenfu, et al.
Publicado: (2026)
por: Wang, Wenfu, et al.
Publicado: (2026)
ED-TTS: Multi-Scale Emotion Modeling using Cross-Domain Emotion Diarization for Emotional Speech Synthesis
por: Tang, Haobin, et al.
Publicado: (2024)
por: Tang, Haobin, et al.
Publicado: (2024)
TouchTTS: An Embarrassingly Simple TTS Framework that Everyone Can Touch
por: Song, Xingchen, et al.
Publicado: (2024)
por: Song, Xingchen, et al.
Publicado: (2024)
FireRedTTS-1S: An Upgraded Streamable Foundation Text-to-Speech System
por: Guo, Hao-Han, et al.
Publicado: (2025)
por: Guo, Hao-Han, et al.
Publicado: (2025)
Perturbation Self-Supervised Representations for Cross-Lingual Emotion TTS: Stage-Wise Modeling of Emotion and Speaker
por: Gong, Cheng, et al.
Publicado: (2025)
por: Gong, Cheng, et al.
Publicado: (2025)
ManaTTS Persian: a recipe for creating TTS datasets for lower resource languages
por: Qharabagh, Mahta Fetrat, et al.
Publicado: (2024)
por: Qharabagh, Mahta Fetrat, et al.
Publicado: (2024)
Ejemplares similares
-
Modeling Music as a Time-Frequency Image: A 2D Tokenizer for Music Generation
por: Cheng, Yuqing, et al.
Publicado: (2026) -
MOSS-TTS Technical Report
por: Gong, Yitian, et al.
Publicado: (2026) -
Qwen3-TTS Technical Report
por: Hu, Hangrui, et al.
Publicado: (2026) -
IndexTTS 2.5 Technical Report
por: Li, Yunpei, et al.
Publicado: (2026) -
TTS-1 Technical Report
por: Atamanenko, Oleg, et al.
Publicado: (2025)