GLM-4-Voice: Towards Intelligent and Human-Like End-to-End Spoken Chatbot
Fuente:
arXiv
Salvato in:
| Autori principali: | Zeng, Aohan, Du, Zhengxiao, Liu, Mingdao, Wang, Kedong, Jiang, Shengmin, Zhao, Lei, Dong, Yuxiao, Tang, Jie |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Scaling Speech-Text Pre-training with Synthetic Interleaved Data
di: Zeng, Aohan, et al.
Pubblicazione: (2024)
di: Zeng, Aohan, et al.
Pubblicazione: (2024)
Converting Anyone's Voice: End-to-End Expressive Voice Conversion with a Conditional Diffusion Model
di: Du, Zongyang, et al.
Pubblicazione: (2024)
di: Du, Zongyang, et al.
Pubblicazione: (2024)
SynthVC: Leveraging Synthetic Data for End-to-End Low Latency Streaming Voice Conversion
di: Guo, Zhao, et al.
Pubblicazione: (2025)
di: Guo, Zhao, et al.
Pubblicazione: (2025)
VISinger2+: End-to-End Singing Voice Synthesis Augmented by Self-Supervised Learning Representation
di: Yu, Yifeng, et al.
Pubblicazione: (2024)
di: Yu, Yifeng, et al.
Pubblicazione: (2024)
StreamVoice+: Evolving into End-to-end Streaming Zero-shot Voice Conversion
di: Wang, Zhichao, et al.
Pubblicazione: (2024)
di: Wang, Zhichao, et al.
Pubblicazione: (2024)
End-to-End Zero-Shot Voice Conversion with Location-Variable Convolutions
di: Kang, Wonjune, et al.
Pubblicazione: (2022)
di: Kang, Wonjune, et al.
Pubblicazione: (2022)
JoyTTS: LLM-based Spoken Chatbot With Voice Cloning
di: Zhou, Fangru, et al.
Pubblicazione: (2025)
di: Zhou, Fangru, et al.
Pubblicazione: (2025)
PRoDeliberation: Parallel Robust Deliberation for End-to-End Spoken Language Understanding
di: Le, Trang, et al.
Pubblicazione: (2024)
di: Le, Trang, et al.
Pubblicazione: (2024)
FlashLabs Chroma 1.0: A Real-Time End-to-End Spoken Dialogue Model with Personalized Voice Cloning
di: Chen, Tanyu, et al.
Pubblicazione: (2026)
di: Chen, Tanyu, et al.
Pubblicazione: (2026)
Scaling and Prompting for Improved End-to-End Spoken Grammatical Error Correction
di: Qian, Mengjie, et al.
Pubblicazione: (2025)
di: Qian, Mengjie, et al.
Pubblicazione: (2025)
Period Singer: Integrating Periodic and Aperiodic Variational Autoencoders for Natural-Sounding End-to-End Singing Voice Synthesis
di: Kim, Taewoo, et al.
Pubblicazione: (2024)
di: Kim, Taewoo, et al.
Pubblicazione: (2024)
End-to-End Integration of Speech Emotion Recognition with Voice Activity Detection using Self-Supervised Learning Features
di: Yamashita, Natsuo, et al.
Pubblicazione: (2024)
di: Yamashita, Natsuo, et al.
Pubblicazione: (2024)
End-to-End Spoken Grammatical Error Correction
di: Qian, Mengjie, et al.
Pubblicazione: (2025)
di: Qian, Mengjie, et al.
Pubblicazione: (2025)
Predictive Speech Recognition and End-of-Utterance Detection Towards Spoken Dialog Systems
di: Zink, Oswald, et al.
Pubblicazione: (2024)
di: Zink, Oswald, et al.
Pubblicazione: (2024)
Chain-of-Thought Reasoning in Streaming Full-Duplex End-to-End Spoken Dialogue Systems
di: Arora, Siddhant, et al.
Pubblicazione: (2025)
di: Arora, Siddhant, et al.
Pubblicazione: (2025)
VoxEval: Benchmarking the Knowledge Understanding Capabilities of End-to-End Spoken Language Models
di: Cui, Wenqian, et al.
Pubblicazione: (2025)
di: Cui, Wenqian, et al.
Pubblicazione: (2025)
An Investigation on Speaker Augmentation for End-to-End Speaker Extraction
di: You, Zhenghai, et al.
Pubblicazione: (2025)
di: You, Zhenghai, et al.
Pubblicazione: (2025)
RawBMamba: End-to-End Bidirectional State Space Model for Audio Deepfake Detection
di: Chen, Yujie, et al.
Pubblicazione: (2024)
di: Chen, Yujie, et al.
Pubblicazione: (2024)
Joint Speech and Text Training for LLM-Based End-to-End Spoken Dialogue State Tracking
di: Vendrame, Katia, et al.
Pubblicazione: (2025)
di: Vendrame, Katia, et al.
Pubblicazione: (2025)
Retrieval Augmented End-to-End Spoken Dialog Models
di: Wang, Mingqiu, et al.
Pubblicazione: (2024)
di: Wang, Mingqiu, et al.
Pubblicazione: (2024)
SpeechDPR: End-to-End Spoken Passage Retrieval for Open-Domain Spoken Question Answering
di: Lin, Chyi-Jiunn, et al.
Pubblicazione: (2024)
di: Lin, Chyi-Jiunn, et al.
Pubblicazione: (2024)
VoxCog: Towards End-to-End Multilingual Cognitive Impairment Classification through Dialectal Knowledge
di: Feng, Tiantian, et al.
Pubblicazione: (2026)
di: Feng, Tiantian, et al.
Pubblicazione: (2026)
PAVITS: Exploring Prosody-aware VITS for End-to-End Emotional Voice Conversion
di: Qi, Tianhua, et al.
Pubblicazione: (2024)
di: Qi, Tianhua, et al.
Pubblicazione: (2024)
SpeechRefiner: Towards Perceptual Quality Refinement for Front-End Algorithms
di: Li, Sirui, et al.
Pubblicazione: (2025)
di: Li, Sirui, et al.
Pubblicazione: (2025)
Neural Scoring: A Refreshed End-to-End Approach for Speaker Recognition in Complex Conditions
di: Lin, Wan, et al.
Pubblicazione: (2024)
di: Lin, Wan, et al.
Pubblicazione: (2024)
SiFiSinger: A High-Fidelity End-to-End Singing Voice Synthesizer based on Source-filter Model
di: Cui, Jianwei, et al.
Pubblicazione: (2024)
di: Cui, Jianwei, et al.
Pubblicazione: (2024)
Zero-Shot End-To-End Spoken Question Answering In Medical Domain
di: Labrak, Yanis, et al.
Pubblicazione: (2024)
di: Labrak, Yanis, et al.
Pubblicazione: (2024)
End-to-End Diarization utilizing Attractor Deep Clustering
di: Palzer, David, et al.
Pubblicazione: (2025)
di: Palzer, David, et al.
Pubblicazione: (2025)
Speaker Adaptation for Quantised End-to-End ASR Models
di: Zhao, Qiuming, et al.
Pubblicazione: (2024)
di: Zhao, Qiuming, et al.
Pubblicazione: (2024)
Dissecting the Segmentation Model of End-to-End Diarization with Vector Clustering
di: Plaquet, Alexis, et al.
Pubblicazione: (2025)
di: Plaquet, Alexis, et al.
Pubblicazione: (2025)
Zero-Shot End-to-End Spoken Language Understanding via Cross-Modal Selective Self-Training
di: He, Jianfeng, et al.
Pubblicazione: (2023)
di: He, Jianfeng, et al.
Pubblicazione: (2023)
Quality-Aware End-to-End Audio-Visual Neural Speaker Diarization
di: He, Mao-Kui, et al.
Pubblicazione: (2024)
di: He, Mao-Kui, et al.
Pubblicazione: (2024)
An End-to-End Approach for Chord-Conditioned Song Generation
di: Gao, Shuochen, et al.
Pubblicazione: (2024)
di: Gao, Shuochen, et al.
Pubblicazione: (2024)
Speaker-Smoothed kNN Speaker Adaptation for End-to-End ASR
di: Li, Shaojun, et al.
Pubblicazione: (2024)
di: Li, Shaojun, et al.
Pubblicazione: (2024)
DiaPer: End-to-End Neural Diarization with Perceiver-Based Attractors
di: Landini, Federico, et al.
Pubblicazione: (2023)
di: Landini, Federico, et al.
Pubblicazione: (2023)
End-to-End Integration of Speech Separation and Voice Activity Detection for Low-Latency Diarization of Telephone Conversations
di: Morrone, Giovanni, et al.
Pubblicazione: (2023)
di: Morrone, Giovanni, et al.
Pubblicazione: (2023)
WMCodec: End-to-End Neural Speech Codec with Deep Watermarking for Authenticity Verification
di: Zhou, Junzuo, et al.
Pubblicazione: (2024)
di: Zhou, Junzuo, et al.
Pubblicazione: (2024)
Central Kurdish Text-to-Speech Synthesis with Novel End-to-End Transformer Training
di: Ahmad, Hawraz A., et al.
Pubblicazione: (2024)
di: Ahmad, Hawraz A., et al.
Pubblicazione: (2024)
End-to-End Amp Modeling: From Data to Controllable Guitar Amplifier Models
di: Juvela, Lauri, et al.
Pubblicazione: (2024)
di: Juvela, Lauri, et al.
Pubblicazione: (2024)
Diff-SAGe: End-to-End Spatial Audio Generation Using Diffusion Models
di: Kushwaha, Saksham Singh, et al.
Pubblicazione: (2024)
di: Kushwaha, Saksham Singh, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Scaling Speech-Text Pre-training with Synthetic Interleaved Data
di: Zeng, Aohan, et al.
Pubblicazione: (2024) -
Converting Anyone's Voice: End-to-End Expressive Voice Conversion with a Conditional Diffusion Model
di: Du, Zongyang, et al.
Pubblicazione: (2024) -
SynthVC: Leveraging Synthetic Data for End-to-End Low Latency Streaming Voice Conversion
di: Guo, Zhao, et al.
Pubblicazione: (2025) -
VISinger2+: End-to-End Singing Voice Synthesis Augmented by Self-Supervised Learning Representation
di: Yu, Yifeng, et al.
Pubblicazione: (2024) -
StreamVoice+: Evolving into End-to-end Streaming Zero-shot Voice Conversion
di: Wang, Zhichao, et al.
Pubblicazione: (2024)