FlashLabs Chroma 1.0: A Real-Time End-to-End Spoken Dialogue Model with Personalized Voice Cloning
Fuente:
arXiv
Guardado en:
| Autores principales: | Chen, Tanyu, Chen, Tairan, Shen, Kai, Bao, Zhenghua, Zhang, Zhihui, Yuan, Man, Shi, Yi |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Chain-of-Thought Reasoning in Streaming Full-Duplex End-to-End Spoken Dialogue Systems
por: Arora, Siddhant, et al.
Publicado: (2025)
por: Arora, Siddhant, et al.
Publicado: (2025)
GLM-4-Voice: Towards Intelligent and Human-Like End-to-End Spoken Chatbot
por: Zeng, Aohan, et al.
Publicado: (2024)
por: Zeng, Aohan, et al.
Publicado: (2024)
Joint Speech and Text Training for LLM-Based End-to-End Spoken Dialogue State Tracking
por: Vendrame, Katia, et al.
Publicado: (2025)
por: Vendrame, Katia, et al.
Publicado: (2025)
VISinger2+: End-to-End Singing Voice Synthesis Augmented by Self-Supervised Learning Representation
por: Yu, Yifeng, et al.
Publicado: (2024)
por: Yu, Yifeng, et al.
Publicado: (2024)
Converting Anyone's Voice: End-to-End Expressive Voice Conversion with a Conditional Diffusion Model
por: Du, Zongyang, et al.
Publicado: (2024)
por: Du, Zongyang, et al.
Publicado: (2024)
JoyTTS: LLM-based Spoken Chatbot With Voice Cloning
por: Zhou, Fangru, et al.
Publicado: (2025)
por: Zhou, Fangru, et al.
Publicado: (2025)
StreamVoice+: Evolving into End-to-end Streaming Zero-shot Voice Conversion
por: Wang, Zhichao, et al.
Publicado: (2024)
por: Wang, Zhichao, et al.
Publicado: (2024)
End-to-End Zero-Shot Voice Conversion with Location-Variable Convolutions
por: Kang, Wonjune, et al.
Publicado: (2022)
por: Kang, Wonjune, et al.
Publicado: (2022)
SF-Speech: Straightened Flow for Zero-Shot Voice Clone
por: Li, Xuyuan, et al.
Publicado: (2024)
por: Li, Xuyuan, et al.
Publicado: (2024)
Scaling and Prompting for Improved End-to-End Spoken Grammatical Error Correction
por: Qian, Mengjie, et al.
Publicado: (2025)
por: Qian, Mengjie, et al.
Publicado: (2025)
SynthVC: Leveraging Synthetic Data for End-to-End Low Latency Streaming Voice Conversion
por: Guo, Zhao, et al.
Publicado: (2025)
por: Guo, Zhao, et al.
Publicado: (2025)
PRoDeliberation: Parallel Robust Deliberation for End-to-End Spoken Language Understanding
por: Le, Trang, et al.
Publicado: (2024)
por: Le, Trang, et al.
Publicado: (2024)
Period Singer: Integrating Periodic and Aperiodic Variational Autoencoders for Natural-Sounding End-to-End Singing Voice Synthesis
por: Kim, Taewoo, et al.
Publicado: (2024)
por: Kim, Taewoo, et al.
Publicado: (2024)
End-to-End Integration of Speech Emotion Recognition with Voice Activity Detection using Self-Supervised Learning Features
por: Yamashita, Natsuo, et al.
Publicado: (2024)
por: Yamashita, Natsuo, et al.
Publicado: (2024)
End-to-End Spoken Grammatical Error Correction
por: Qian, Mengjie, et al.
Publicado: (2025)
por: Qian, Mengjie, et al.
Publicado: (2025)
E-chat: Emotion-sensitive Spoken Dialogue System with Large Language Models
por: Xue, Hongfei, et al.
Publicado: (2023)
por: Xue, Hongfei, et al.
Publicado: (2023)
VoxEval: Benchmarking the Knowledge Understanding Capabilities of End-to-End Spoken Language Models
por: Cui, Wenqian, et al.
Publicado: (2025)
por: Cui, Wenqian, et al.
Publicado: (2025)
Retrieval Augmented End-to-End Spoken Dialog Models
por: Wang, Mingqiu, et al.
Publicado: (2024)
por: Wang, Mingqiu, et al.
Publicado: (2024)
Semantic-Aware Interruption Detection in Spoken Dialogue Systems: Benchmark, Metric, and Model
por: Xia, Kangxiang, et al.
Publicado: (2026)
por: Xia, Kangxiang, et al.
Publicado: (2026)
SpeechDPR: End-to-End Spoken Passage Retrieval for Open-Domain Spoken Question Answering
por: Lin, Chyi-Jiunn, et al.
Publicado: (2024)
por: Lin, Chyi-Jiunn, et al.
Publicado: (2024)
IKFST: IOO and KOO Algorithms for Accelerated and Precise WFST-based End-to-End Automatic Speech Recognition
por: Zhuang, Zhuoran, et al.
Publicado: (2026)
por: Zhuang, Zhuoran, et al.
Publicado: (2026)
Representation Purification for End-to-End Speech Translation
por: Zhang, Chengwei, et al.
Publicado: (2024)
por: Zhang, Chengwei, et al.
Publicado: (2024)
PAVITS: Exploring Prosody-aware VITS for End-to-End Emotional Voice Conversion
por: Qi, Tianhua, et al.
Publicado: (2024)
por: Qi, Tianhua, et al.
Publicado: (2024)
Neural Scoring: A Refreshed End-to-End Approach for Speaker Recognition in Complex Conditions
por: Lin, Wan, et al.
Publicado: (2024)
por: Lin, Wan, et al.
Publicado: (2024)
Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models
por: Hsiao, Chi-Yuan, et al.
Publicado: (2025)
por: Hsiao, Chi-Yuan, et al.
Publicado: (2025)
CloneShield: A Framework for Universal Perturbation Against Zero-Shot Voice Cloning
por: Li, Renyuan, et al.
Publicado: (2025)
por: Li, Renyuan, et al.
Publicado: (2025)
SiFiSinger: A High-Fidelity End-to-End Singing Voice Synthesizer based on Source-filter Model
por: Cui, Jianwei, et al.
Publicado: (2024)
por: Cui, Jianwei, et al.
Publicado: (2024)
Zero-Shot End-To-End Spoken Question Answering In Medical Domain
por: Labrak, Yanis, et al.
Publicado: (2024)
por: Labrak, Yanis, et al.
Publicado: (2024)
RawBMamba: End-to-End Bidirectional State Space Model for Audio Deepfake Detection
por: Chen, Yujie, et al.
Publicado: (2024)
por: Chen, Yujie, et al.
Publicado: (2024)
An Efficient End-to-End Approach to Noise Invariant Speech Features via Multi-Task Learning
por: Guimarães, Heitor R., et al.
Publicado: (2024)
por: Guimarães, Heitor R., et al.
Publicado: (2024)
End-to-End Diarization utilizing Attractor Deep Clustering
por: Palzer, David, et al.
Publicado: (2025)
por: Palzer, David, et al.
Publicado: (2025)
Speaker Adaptation for Quantised End-to-End ASR Models
por: Zhao, Qiuming, et al.
Publicado: (2024)
por: Zhao, Qiuming, et al.
Publicado: (2024)
An Investigation on Speaker Augmentation for End-to-End Speaker Extraction
por: You, Zhenghai, et al.
Publicado: (2025)
por: You, Zhenghai, et al.
Publicado: (2025)
OpenVoice: Versatile Instant Voice Cloning
por: Qin, Zengyi, et al.
Publicado: (2023)
por: Qin, Zengyi, et al.
Publicado: (2023)
J-CHAT: Japanese Large-scale Spoken Dialogue Corpus for Spoken Dialogue Language Modeling
por: Nakata, Wataru, et al.
Publicado: (2024)
por: Nakata, Wataru, et al.
Publicado: (2024)
Fed-PISA: Federated Voice Cloning via Personalized Identity-Style Adaptation
por: Wang, Qi, et al.
Publicado: (2025)
por: Wang, Qi, et al.
Publicado: (2025)
Voice Cloning: Comprehensive Survey
por: Azzuni, Hussam, et al.
Publicado: (2025)
por: Azzuni, Hussam, et al.
Publicado: (2025)
Dissecting the Segmentation Model of End-to-End Diarization with Vector Clustering
por: Plaquet, Alexis, et al.
Publicado: (2025)
por: Plaquet, Alexis, et al.
Publicado: (2025)
Predictive Speech Recognition and End-of-Utterance Detection Towards Spoken Dialog Systems
por: Zink, Oswald, et al.
Publicado: (2024)
por: Zink, Oswald, et al.
Publicado: (2024)
CosyEdit: Unlocking End-to-End Speech Editing Capability from Zero-Shot Text-to-Speech Models
por: Chen, Junyang, et al.
Publicado: (2026)
por: Chen, Junyang, et al.
Publicado: (2026)
Ejemplares similares
-
Chain-of-Thought Reasoning in Streaming Full-Duplex End-to-End Spoken Dialogue Systems
por: Arora, Siddhant, et al.
Publicado: (2025) -
GLM-4-Voice: Towards Intelligent and Human-Like End-to-End Spoken Chatbot
por: Zeng, Aohan, et al.
Publicado: (2024) -
Joint Speech and Text Training for LLM-Based End-to-End Spoken Dialogue State Tracking
por: Vendrame, Katia, et al.
Publicado: (2025) -
VISinger2+: End-to-End Singing Voice Synthesis Augmented by Self-Supervised Learning Representation
por: Yu, Yifeng, et al.
Publicado: (2024) -
Converting Anyone's Voice: End-to-End Expressive Voice Conversion with a Conditional Diffusion Model
por: Du, Zongyang, et al.
Publicado: (2024)