JoyTTS: LLM-based Spoken Chatbot With Voice Cloning
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhou, Fangru, Zhao, Jun, Wang, Guoxin |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
GLM-4-Voice: Towards Intelligent and Human-Like End-to-End Spoken Chatbot
por: Zeng, Aohan, et al.
Publicado: (2024)
por: Zeng, Aohan, et al.
Publicado: (2024)
FlashLabs Chroma 1.0: A Real-Time End-to-End Spoken Dialogue Model with Personalized Voice Cloning
por: Chen, Tanyu, et al.
Publicado: (2026)
por: Chen, Tanyu, et al.
Publicado: (2026)
VoiceCraft-X: Unifying Multilingual, Voice-Cloning Speech Synthesis and Speech Editing
por: Zheng, Zhisheng, et al.
Publicado: (2025)
por: Zheng, Zhisheng, et al.
Publicado: (2025)
LLaMA-Omni2: LLM-based Real-time Spoken Chatbot with Autoregressive Streaming Speech Synthesis
por: Fang, Qingkai, et al.
Publicado: (2025)
por: Fang, Qingkai, et al.
Publicado: (2025)
Voice Conversion Improves Cross-Domain Robustness for Spoken Arabic Dialect Identification
por: Abdullah, Badr M., et al.
Publicado: (2025)
por: Abdullah, Badr M., et al.
Publicado: (2025)
TouchTTS: An Embarrassingly Simple TTS Framework that Everyone Can Touch
por: Song, Xingchen, et al.
Publicado: (2024)
por: Song, Xingchen, et al.
Publicado: (2024)
VStyle: A Benchmark for Voice Style Adaptation with Spoken Instructions
por: Zhan, Jun, et al.
Publicado: (2025)
por: Zhan, Jun, et al.
Publicado: (2025)
Hard-Synth: Synthesizing Diverse Hard Samples for ASR using Zero-Shot TTS and LLM
por: Yu, Jiawei, et al.
Publicado: (2024)
por: Yu, Jiawei, et al.
Publicado: (2024)
EE-TTS: Emphatic Expressive TTS with Linguistic Information
por: Zhong, Yi, et al.
Publicado: (2023)
por: Zhong, Yi, et al.
Publicado: (2023)
GOAT-TTS: Expressive and Realistic Speech Generation via A Dual-Branch LLM
por: Song, Yaodong, et al.
Publicado: (2025)
por: Song, Yaodong, et al.
Publicado: (2025)
Praxy Voice: Voice-Prompt Recovery + BUPS for Commercial-Class Indic TTS from a Frozen Non-Indic Base at Zero Commercial-Training-Data Cost
por: Menta, Venkata Pushpak Teja
Publicado: (2026)
por: Menta, Venkata Pushpak Teja
Publicado: (2026)
Voice Impression Control in Zero-Shot TTS
por: Fujita, Kenichi, et al.
Publicado: (2025)
por: Fujita, Kenichi, et al.
Publicado: (2025)
RWKVTTS: Yet another TTS based on RWKV-7
por: yueyu, Lin, et al.
Publicado: (2025)
por: yueyu, Lin, et al.
Publicado: (2025)
Qwen3-TTS Technical Report
por: Hu, Hangrui, et al.
Publicado: (2026)
por: Hu, Hangrui, et al.
Publicado: (2026)
Analyzing Error Propagation in Korean Spoken QA with ASR-LLM Cascades
por: Jung, Donghyuk, et al.
Publicado: (2026)
por: Jung, Donghyuk, et al.
Publicado: (2026)
SLIDE: Integrating Speech Language Model with LLM for Spontaneous Spoken Dialogue Generation
por: Lu, Haitian, et al.
Publicado: (2025)
por: Lu, Haitian, et al.
Publicado: (2025)
SD-Eval: A Benchmark Dataset for Spoken Dialogue Understanding Beyond Words
por: Ao, Junyi, et al.
Publicado: (2024)
por: Ao, Junyi, et al.
Publicado: (2024)
BERT-LID: Leveraging BERT to Improve Spoken Language Identification
por: Nie, Yuting, et al.
Publicado: (2022)
por: Nie, Yuting, et al.
Publicado: (2022)
DiaMoE-TTS: A Unified IPA-Based Dialect TTS Framework with Mixture-of-Experts and Parameter-Efficient Zero-Shot Adaptation
por: Chen, Ziqi, et al.
Publicado: (2025)
por: Chen, Ziqi, et al.
Publicado: (2025)
Joint Speech and Text Training for LLM-Based End-to-End Spoken Dialogue State Tracking
por: Vendrame, Katia, et al.
Publicado: (2025)
por: Vendrame, Katia, et al.
Publicado: (2025)
J-CHAT: Japanese Large-scale Spoken Dialogue Corpus for Spoken Dialogue Language Modeling
por: Nakata, Wataru, et al.
Publicado: (2024)
por: Nakata, Wataru, et al.
Publicado: (2024)
SP-MCQA: Evaluating Intelligibility of TTS Beyond the Word Level
por: Tee, Hitomi Jin Ling, et al.
Publicado: (2025)
por: Tee, Hitomi Jin Ling, et al.
Publicado: (2025)
GSA-TTS : Toward Zero-Shot Speech Synthesis based on Gradual Style Adaptor
por: Lee, Seokgi, et al.
Publicado: (2025)
por: Lee, Seokgi, et al.
Publicado: (2025)
Accompanied Singing Voice Synthesis with Fully Text-controlled Melody
por: Li, Ruiqi, et al.
Publicado: (2024)
por: Li, Ruiqi, et al.
Publicado: (2024)
Multi-interaction TTS toward professional recording reproduction
por: Kanagawa, Hiroki, et al.
Publicado: (2025)
por: Kanagawa, Hiroki, et al.
Publicado: (2025)
MunTTS: A Text-to-Speech System for Mundari
por: Gumma, Varun, et al.
Publicado: (2024)
por: Gumma, Varun, et al.
Publicado: (2024)
Llama-VITS: Enhancing TTS Synthesis with Semantic Awareness
por: Feng, Xincan, et al.
Publicado: (2024)
por: Feng, Xincan, et al.
Publicado: (2024)
JoyVoice: Long-Context Conditioning for Anthropomorphic Multi-Speaker Conversational Synthesis
por: Yu, Fan, et al.
Publicado: (2025)
por: Yu, Fan, et al.
Publicado: (2025)
Word-wise intonation model for cross-language TTS systems
por: A., Tomilov A., et al.
Publicado: (2024)
por: A., Tomilov A., et al.
Publicado: (2024)
An investigation of phrase break prediction in an End-to-End TTS system
por: Vadapalli, Anandaswarup
Publicado: (2023)
por: Vadapalli, Anandaswarup
Publicado: (2023)
A Language Modeling Approach to Diacritic-Free Hebrew TTS
por: Roth, Amit, et al.
Publicado: (2024)
por: Roth, Amit, et al.
Publicado: (2024)
On The Landscape of Spoken Language Models: A Comprehensive Survey
por: Arora, Siddhant, et al.
Publicado: (2025)
por: Arora, Siddhant, et al.
Publicado: (2025)
Bailing-TTS: Chinese Dialectal Speech Synthesis Towards Human-like Spontaneous Representation
por: Di, Xinhan, et al.
Publicado: (2024)
por: Di, Xinhan, et al.
Publicado: (2024)
Spirit LM: Interleaved Spoken and Written Language Model
por: Nguyen, Tu Anh, et al.
Publicado: (2024)
por: Nguyen, Tu Anh, et al.
Publicado: (2024)
On the Evaluation of Speech Foundation Models for Spoken Language Understanding
por: Arora, Siddhant, et al.
Publicado: (2024)
por: Arora, Siddhant, et al.
Publicado: (2024)
Long-Form Speech Generation with Spoken Language Models
por: Park, Se Jin, et al.
Publicado: (2024)
por: Park, Se Jin, et al.
Publicado: (2024)
Fed-PISA: Federated Voice Cloning via Personalized Identity-Style Adaptation
por: Wang, Qi, et al.
Publicado: (2025)
por: Wang, Qi, et al.
Publicado: (2025)
Marco-Voice Technical Report
por: Tian, Fengping, et al.
Publicado: (2025)
por: Tian, Fengping, et al.
Publicado: (2025)
TCSinger 2: Customizable Multilingual Zero-shot Singing Voice Synthesis
por: Zhang, Yu, et al.
Publicado: (2025)
por: Zhang, Yu, et al.
Publicado: (2025)
MMSU: A Massive Multi-task Spoken Language Understanding and Reasoning Benchmark
por: Wang, Dingdong, et al.
Publicado: (2025)
por: Wang, Dingdong, et al.
Publicado: (2025)
Ejemplares similares
-
GLM-4-Voice: Towards Intelligent and Human-Like End-to-End Spoken Chatbot
por: Zeng, Aohan, et al.
Publicado: (2024) -
FlashLabs Chroma 1.0: A Real-Time End-to-End Spoken Dialogue Model with Personalized Voice Cloning
por: Chen, Tanyu, et al.
Publicado: (2026) -
VoiceCraft-X: Unifying Multilingual, Voice-Cloning Speech Synthesis and Speech Editing
por: Zheng, Zhisheng, et al.
Publicado: (2025) -
LLaMA-Omni2: LLM-based Real-time Spoken Chatbot with Autoregressive Streaming Speech Synthesis
por: Fang, Qingkai, et al.
Publicado: (2025) -
Voice Conversion Improves Cross-Domain Robustness for Spoken Arabic Dialect Identification
por: Abdullah, Badr M., et al.
Publicado: (2025)