FireRedTTS-1S: An Upgraded Streamable Foundation Text-to-Speech System
Fuente:
arXiv
Guardado en:
| Autores principales: | Guo, Hao-Han, Hu, Yao, Shen, Fei-Yu, Tang, Xu, Wu, Yi-Chen, Xie, Feng-Long, Xie, Kun |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
FireRedTTS: A Foundation Text-To-Speech Framework for Industry-Level Generative Speech Applications
por: Guo, Hao-Han, et al.
Publicado: (2024)
por: Guo, Hao-Han, et al.
Publicado: (2024)
FireRedTTS-2: Towards Long Conversational Speech Generation for Podcast and Chatbot
por: Xie, Kun, et al.
Publicado: (2025)
por: Xie, Kun, et al.
Publicado: (2025)
FireRedASR: Open-Source Industrial-Grade Mandarin Speech Recognition Models from Encoder-Decoder to LLM Integration
por: Xu, Kai-Tuo, et al.
Publicado: (2025)
por: Xu, Kai-Tuo, et al.
Publicado: (2025)
FireRedASR2S: A State-of-the-Art Industrial-Grade All-in-One Automatic Speech Recognition System
por: Xu, Kaituo, et al.
Publicado: (2026)
por: Xu, Kaituo, et al.
Publicado: (2026)
OV-InstructTTS: Towards Open-Vocabulary Instruct Text-to-Speech
por: Ren, Yong, et al.
Publicado: (2026)
por: Ren, Yong, et al.
Publicado: (2026)
ReFlow-TTS: A Rectified Flow Model for High-fidelity Text-to-Speech
por: Guan, Wenhao, et al.
Publicado: (2023)
por: Guan, Wenhao, et al.
Publicado: (2023)
ParaStyleTTS: Toward Efficient and Robust Paralinguistic Style Control for Expressive Text-to-Speech Generation
por: Lou, Haowei, et al.
Publicado: (2025)
por: Lou, Haowei, et al.
Publicado: (2025)
SoCodec: A Semantic-Ordered Multi-Stream Speech Codec for Efficient Language Model Based Text-to-Speech Synthesis
por: Guo, Haohan, et al.
Publicado: (2024)
por: Guo, Haohan, et al.
Publicado: (2024)
DAIEN-TTS: Disentangled Audio Infilling for Environment-Aware Text-to-Speech Synthesis
por: Lu, Ye-Xin, et al.
Publicado: (2025)
por: Lu, Ye-Xin, et al.
Publicado: (2025)
StoryTTS: A Highly Expressive Text-to-Speech Dataset with Rich Textual Expressiveness Annotations
por: Liu, Sen, et al.
Publicado: (2024)
por: Liu, Sen, et al.
Publicado: (2024)
Diffusion-based Generative Modeling with Discriminative Guidance for Streamable Speech Enhancement
por: Li, Chenda, et al.
Publicado: (2024)
por: Li, Chenda, et al.
Publicado: (2024)
FLY-TTS: Fast, Lightweight and High-Quality End-to-End Text-to-Speech Synthesis
por: Guo, Yinlin, et al.
Publicado: (2024)
por: Guo, Yinlin, et al.
Publicado: (2024)
ViT-TTS: Visual Text-to-Speech with Scalable Diffusion Transformer
por: Liu, Huadai, et al.
Publicado: (2023)
por: Liu, Huadai, et al.
Publicado: (2023)
ASRRL-TTS: Agile Speaker Representation Reinforcement Learning for Text-to-Speech Speaker Adaptation
por: Fu, Ruibo, et al.
Publicado: (2024)
por: Fu, Ruibo, et al.
Publicado: (2024)
SponTTS: modeling and transferring spontaneous style for TTS
por: Li, Hanzhao, et al.
Publicado: (2023)
por: Li, Hanzhao, et al.
Publicado: (2023)
MM-TTS: Multi-modal Prompt based Style Transfer for Expressive Text-to-Speech Synthesis
por: Guan, Wenhao, et al.
Publicado: (2023)
por: Guan, Wenhao, et al.
Publicado: (2023)
StreamVoice: Streamable Context-Aware Language Modeling for Real-time Zero-Shot Voice Conversion
por: Wang, Zhichao, et al.
Publicado: (2024)
por: Wang, Zhichao, et al.
Publicado: (2024)
Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens
por: Wang, Xinsheng, et al.
Publicado: (2025)
por: Wang, Xinsheng, et al.
Publicado: (2025)
Muyan-TTS: A Trainable Text-to-Speech Model Optimized for Podcast Scenarios with a $50K Budget
por: Li, Xin, et al.
Publicado: (2025)
por: Li, Xin, et al.
Publicado: (2025)
Leveraging Speech PTM, Text LLM, and Emotional TTS for Speech Emotion Recognition
por: Ma, Ziyang, et al.
Publicado: (2023)
por: Ma, Ziyang, et al.
Publicado: (2023)
MPO: Multidimensional Preference Optimization for Language Model-based Text-to-Speech
por: Xia, Kangxiang, et al.
Publicado: (2025)
por: Xia, Kangxiang, et al.
Publicado: (2025)
F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching
por: Chen, Yushen, et al.
Publicado: (2024)
por: Chen, Yushen, et al.
Publicado: (2024)
EME-TTS: Unlocking the Emphasis and Emotion Link in Speech Synthesis
por: Li, Haoxun, et al.
Publicado: (2025)
por: Li, Haoxun, et al.
Publicado: (2025)
MINT-Bench: A Comprehensive Multilingual Benchmark for Instruction-Following Text-to-Speech
por: Chen, Huakang, et al.
Publicado: (2026)
por: Chen, Huakang, et al.
Publicado: (2026)
VECL-TTS: Voice identity and Emotional style controllable Cross-Lingual Text-to-Speech
por: Gudmalwar, Ashishkumar, et al.
Publicado: (2024)
por: Gudmalwar, Ashishkumar, et al.
Publicado: (2024)
StyleTTS-ZS: Efficient High-Quality Zero-Shot Text-to-Speech Synthesis with Distilled Time-Varying Style Diffusion
por: Li, Yinghao Aaron, et al.
Publicado: (2024)
por: Li, Yinghao Aaron, et al.
Publicado: (2024)
MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts
por: Xue, Heyang, et al.
Publicado: (2025)
por: Xue, Heyang, et al.
Publicado: (2025)
Fine-grained Preference Optimization Improves Zero-shot Text-to-Speech
por: Yao, Jixun, et al.
Publicado: (2025)
por: Yao, Jixun, et al.
Publicado: (2025)
Accent-VITS:accent transfer for end-to-end TTS
por: Ma, Linhan, et al.
Publicado: (2023)
por: Ma, Linhan, et al.
Publicado: (2023)
CLaM-TTS: Improving Neural Codec Language Model for Zero-Shot Text-to-Speech
por: Kim, Jaehyeon, et al.
Publicado: (2024)
por: Kim, Jaehyeon, et al.
Publicado: (2024)
EmoSteer-TTS: Fine-Grained and Training-Free Emotion-Controllable Text-to-Speech via Activation Steering
por: Xie, Tianxin, et al.
Publicado: (2025)
por: Xie, Tianxin, et al.
Publicado: (2025)
VQTTS: High-Fidelity Text-to-Speech Synthesis with Self-Supervised VQ Acoustic Feature
por: Du, Chenpeng, et al.
Publicado: (2022)
por: Du, Chenpeng, et al.
Publicado: (2022)
DPI-TTS: Directional Patch Interaction for Fast-Converging and Style Temporal Modeling in Text-to-Speech
por: Qi, Xin, et al.
Publicado: (2024)
por: Qi, Xin, et al.
Publicado: (2024)
Mixture of LoRA Experts with Multi-Modal and Multi-Granularity LLM Generative Error Correction for Accented Speech Recognition
por: Mu, Bingshen, et al.
Publicado: (2025)
por: Mu, Bingshen, et al.
Publicado: (2025)
Attention-Constrained Inference for Robust Decoder-Only Text-to-Speech
por: Wang, Hankun, et al.
Publicado: (2024)
por: Wang, Hankun, et al.
Publicado: (2024)
MunTTS: A Text-to-Speech System for Mundari
por: Gumma, Varun, et al.
Publicado: (2024)
por: Gumma, Varun, et al.
Publicado: (2024)
On the Effectiveness of Acoustic BPE in Decoder-Only TTS
por: Li, Bohan, et al.
Publicado: (2024)
por: Li, Bohan, et al.
Publicado: (2024)
HAM-TTS: Hierarchical Acoustic Modeling for Token-Based Zero-Shot Text-to-Speech with Model and Data Scaling
por: Wang, Chunhui, et al.
Publicado: (2024)
por: Wang, Chunhui, et al.
Publicado: (2024)
F5R-TTS: Improving Flow-Matching based Text-to-Speech with Group Relative Policy Optimization
por: Sun, Xiaohui, et al.
Publicado: (2025)
por: Sun, Xiaohui, et al.
Publicado: (2025)
Stable-TTS: Stable Speaker-Adaptive Text-to-Speech Synthesis via Prosody Prompting
por: Han, Wooseok, et al.
Publicado: (2024)
por: Han, Wooseok, et al.
Publicado: (2024)
Ejemplares similares
-
FireRedTTS: A Foundation Text-To-Speech Framework for Industry-Level Generative Speech Applications
por: Guo, Hao-Han, et al.
Publicado: (2024) -
FireRedTTS-2: Towards Long Conversational Speech Generation for Podcast and Chatbot
por: Xie, Kun, et al.
Publicado: (2025) -
FireRedASR: Open-Source Industrial-Grade Mandarin Speech Recognition Models from Encoder-Decoder to LLM Integration
por: Xu, Kai-Tuo, et al.
Publicado: (2025) -
FireRedASR2S: A State-of-the-Art Industrial-Grade All-in-One Automatic Speech Recognition System
por: Xu, Kaituo, et al.
Publicado: (2026) -
OV-InstructTTS: Towards Open-Vocabulary Instruct Text-to-Speech
por: Ren, Yong, et al.
Publicado: (2026)