VoxCPM: Tokenizer-Free TTS for Context-Aware Speech Generation and True-to-Life Voice Cloning
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhou, Yixuan, Zeng, Guoyang, Liu, Xin, Li, Xiang, Yu, Renjie, Wang, Ziyang, Ye, Runchuan, Sun, Weiyue, Gui, Jiancheng, Li, Kehan, Wu, Zhiyong, Liu, Zhiyuan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
A Scalable Pipeline for Enabling Non-Verbal Speech Generation and Understanding
por: Ye, Runchuan, et al.
Publicado: (2025)
por: Ye, Runchuan, et al.
Publicado: (2025)
Cross-Lingual F5-TTS: Towards Language-Agnostic Voice Cloning and Speech Synthesis
por: Liu, Qingyu, et al.
Publicado: (2025)
por: Liu, Qingyu, et al.
Publicado: (2025)
JaiTTS: A Thai Voice Cloning Model
por: Karnjanaekarin, Jullajak, et al.
Publicado: (2026)
por: Karnjanaekarin, Jullajak, et al.
Publicado: (2026)
JoyTTS: LLM-based Spoken Chatbot With Voice Cloning
por: Zhou, Fangru, et al.
Publicado: (2025)
por: Zhou, Fangru, et al.
Publicado: (2025)
The Codec Language Model-based Zero-Shot Spontaneous Style TTS System for CoVoC Challenge 2024
por: Zhou, Shuoyi, et al.
Publicado: (2024)
por: Zhou, Shuoyi, et al.
Publicado: (2024)
MiniCPM-o 4.5: Towards Real-Time Full-Duplex Omni-Modal Interaction
por: Cui, Junbo, et al.
Publicado: (2026)
por: Cui, Junbo, et al.
Publicado: (2026)
VoiceCraft-X: Unifying Multilingual, Voice-Cloning Speech Synthesis and Speech Editing
por: Zheng, Zhisheng, et al.
Publicado: (2025)
por: Zheng, Zhisheng, et al.
Publicado: (2025)
LoSATok: Low-dimensional Semantic-Acoustic Tokenizer for Cross-Domain Audio Understanding and Generation
por: Zhang, Zhisheng, et al.
Publicado: (2026)
por: Zhang, Zhisheng, et al.
Publicado: (2026)
SF-Speech: Straightened Flow for Zero-Shot Voice Clone
por: Li, Xuyuan, et al.
Publicado: (2024)
por: Li, Xuyuan, et al.
Publicado: (2024)
PFluxTTS: Hybrid Flow-Matching TTS with Robust Cross-Lingual Voice Cloning and Inference-Time Model Fusion
por: Pankov, Vikentii, et al.
Publicado: (2026)
por: Pankov, Vikentii, et al.
Publicado: (2026)
The THU-HCSI Multi-Speaker Multi-Lingual Few-Shot Voice Cloning System for LIMMITS'24 Challenge
por: Zhou, Yixuan, et al.
Publicado: (2024)
por: Zhou, Yixuan, et al.
Publicado: (2024)
WearVox: An Egocentric Multichannel Voice Assistant Benchmark for Wearables
por: Lin, Zhaojiang, et al.
Publicado: (2025)
por: Lin, Zhaojiang, et al.
Publicado: (2025)
Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens
por: Wang, Xinsheng, et al.
Publicado: (2025)
por: Wang, Xinsheng, et al.
Publicado: (2025)
VoxInstruct: Expressive Human Instruction-to-Speech Generation with Unified Multilingual Codec Language Modelling
por: Zhou, Yixuan, et al.
Publicado: (2024)
por: Zhou, Yixuan, et al.
Publicado: (2024)
CloneShield: A Framework for Universal Perturbation Against Zero-Shot Voice Cloning
por: Li, Renyuan, et al.
Publicado: (2025)
por: Li, Renyuan, et al.
Publicado: (2025)
VoiceMark: Zero-Shot Voice Cloning-Resistant Watermarking Approach Leveraging Speaker-Specific Latents
por: Li, Haiyun, et al.
Publicado: (2025)
por: Li, Haiyun, et al.
Publicado: (2025)
One Voice, Many Tongues: Cross-Lingual Voice Cloning for Scientific Speech
por: Abebe, Amanuel Gizachew, et al.
Publicado: (2026)
por: Abebe, Amanuel Gizachew, et al.
Publicado: (2026)
Vox-Evaluator: Enhancing Stability and Fidelity for Zero-shot TTS with A Multi-Level Evaluator
por: Wang, Hualei, et al.
Publicado: (2025)
por: Wang, Hualei, et al.
Publicado: (2025)
VoxRole: A Comprehensive Benchmark for Evaluating Speech-Based Role-Playing Agents
por: Wu, Weihao, et al.
Publicado: (2025)
por: Wu, Weihao, et al.
Publicado: (2025)
MiniCPM-SALA: Hybridizing Sparse and Linear Attention for Efficient Long-Context Modeling
por: MiniCPM Team, et al.
Publicado: (2026)
por: MiniCPM Team, et al.
Publicado: (2026)
Fairness in Dysarthric Speech Synthesis: Understanding Intrinsic Bias in Dysarthric Speech Cloning using F5-TTS
por: Anuprabha, M, et al.
Publicado: (2025)
por: Anuprabha, M, et al.
Publicado: (2025)
SOVA-Bench: Benchmarking the Speech Conversation Ability for LLM-based Voice Assistant
por: Hou, Yixuan, et al.
Publicado: (2025)
por: Hou, Yixuan, et al.
Publicado: (2025)
EmoSteer-TTS: Fine-Grained and Training-Free Emotion-Controllable Text-to-Speech via Activation Steering
por: Xie, Tianxin, et al.
Publicado: (2025)
por: Xie, Tianxin, et al.
Publicado: (2025)
HAM-TTS: Hierarchical Acoustic Modeling for Token-Based Zero-Shot Text-to-Speech with Model and Data Scaling
por: Wang, Chunhui, et al.
Publicado: (2024)
por: Wang, Chunhui, et al.
Publicado: (2024)
Voice Cloning for Dysarthric Speech Synthesis: Addressing Data Scarcity in Speech-Language Pathology
por: Moell, Birger, et al.
Publicado: (2025)
por: Moell, Birger, et al.
Publicado: (2025)
AgentCPM-Report: Interleaving Drafting and Deepening for Open-Ended Deep Research
por: Li, Yishan, et al.
Publicado: (2026)
por: Li, Yishan, et al.
Publicado: (2026)
Spoken Language Corpora Augmentation with Domain-Specific Voice-Cloned Speech
por: Czyżnikiewicz, Mateusz, et al.
Publicado: (2024)
por: Czyżnikiewicz, Mateusz, et al.
Publicado: (2024)
Task Vector in TTS: Toward Emotionally Expressive Dialectal Speech Synthesis
por: Feng, Pengchao, et al.
Publicado: (2025)
por: Feng, Pengchao, et al.
Publicado: (2025)
Towards Flow-Matching-based TTS without Classifier-Free Guidance
por: Liang, Yuzhe, et al.
Publicado: (2025)
por: Liang, Yuzhe, et al.
Publicado: (2025)
MiniCPM-V: A GPT-4V Level MLLM on Your Phone
por: Yao, Yuan, et al.
Publicado: (2024)
por: Yao, Yuan, et al.
Publicado: (2024)
Leveraging Speech PTM, Text LLM, and Emotional TTS for Speech Emotion Recognition
por: Ma, Ziyang, et al.
Publicado: (2023)
por: Ma, Ziyang, et al.
Publicado: (2023)
MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies
por: Hu, Shengding, et al.
Publicado: (2024)
por: Hu, Shengding, et al.
Publicado: (2024)
OpenVoice: Versatile Instant Voice Cloning
por: Qin, Zengyi, et al.
Publicado: (2023)
por: Qin, Zengyi, et al.
Publicado: (2023)
SpeechPrune: Context-aware Token Pruning for Speech Information Retrieval
por: Lin, Yueqian, et al.
Publicado: (2024)
por: Lin, Yueqian, et al.
Publicado: (2024)
Muyan-TTS: A Trainable Text-to-Speech Model Optimized for Podcast Scenarios with a $50K Budget
por: Li, Xin, et al.
Publicado: (2025)
por: Li, Xin, et al.
Publicado: (2025)
DPI-TTS: Directional Patch Interaction for Fast-Converging and Style Temporal Modeling in Text-to-Speech
por: Qi, Xin, et al.
Publicado: (2024)
por: Qi, Xin, et al.
Publicado: (2024)
Voice "Cloning" is Style Transfer
por: Zhou, Kaitlyn, et al.
Publicado: (2026)
por: Zhou, Kaitlyn, et al.
Publicado: (2026)
Voice Cloning: Comprehensive Survey
por: Azzuni, Hussam, et al.
Publicado: (2025)
por: Azzuni, Hussam, et al.
Publicado: (2025)
VECL-TTS: Voice identity and Emotional style controllable Cross-Lingual Text-to-Speech
por: Gudmalwar, Ashishkumar, et al.
Publicado: (2024)
por: Gudmalwar, Ashishkumar, et al.
Publicado: (2024)
AutoStyle-TTS: Retrieval-Augmented Generation based Automatic Style Matching Text-to-Speech Synthesis
por: Luo, Dan, et al.
Publicado: (2025)
por: Luo, Dan, et al.
Publicado: (2025)
Ejemplares similares
-
A Scalable Pipeline for Enabling Non-Verbal Speech Generation and Understanding
por: Ye, Runchuan, et al.
Publicado: (2025) -
Cross-Lingual F5-TTS: Towards Language-Agnostic Voice Cloning and Speech Synthesis
por: Liu, Qingyu, et al.
Publicado: (2025) -
JaiTTS: A Thai Voice Cloning Model
por: Karnjanaekarin, Jullajak, et al.
Publicado: (2026) -
JoyTTS: LLM-based Spoken Chatbot With Voice Cloning
por: Zhou, Fangru, et al.
Publicado: (2025) -
The Codec Language Model-based Zero-Shot Spontaneous Style TTS System for CoVoC Challenge 2024
por: Zhou, Shuoyi, et al.
Publicado: (2024)