OmniChat: Enhancing Spoken Dialogue Systems with Scalable Synthetic Data for Diverse Scenarios
Fuente:
arXiv
Guardado en:
| Autores principales: | Cheng, Xize, Fu, Dongjie, Yang, Xiaoda, Fang, Minghui, Hu, Ruofan, Lu, Jingyu, Jionghao, Bai, Wang, Zehan, Ji, Shengpeng, Huang, Rongjie, Li, Linjun, Chen, Yu, Jin, Tao, Zhao, Zhou |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
WavChat: A Survey of Spoken Dialogue Models
por: Ji, Shengpeng, et al.
Publicado: (2024)
por: Ji, Shengpeng, et al.
Publicado: (2024)
OmniSep: Unified Omni-Modality Sound Separation with Query-Mixup
por: Cheng, Xize, et al.
Publicado: (2024)
por: Cheng, Xize, et al.
Publicado: (2024)
J-CHAT: Japanese Large-scale Spoken Dialogue Corpus for Spoken Dialogue Language Modeling
por: Nakata, Wataru, et al.
Publicado: (2024)
por: Nakata, Wataru, et al.
Publicado: (2024)
Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching
por: Zuo, Jialong, et al.
Publicado: (2025)
por: Zuo, Jialong, et al.
Publicado: (2025)
DeepDialogue: A Multi-Turn Emotionally-Rich Spoken Dialogue Dataset
por: Koudounas, Alkis, et al.
Publicado: (2025)
por: Koudounas, Alkis, et al.
Publicado: (2025)
ESPnet-SDS: Unified Toolkit and Demo for Spoken Dialogue Systems
por: Arora, Siddhant, et al.
Publicado: (2025)
por: Arora, Siddhant, et al.
Publicado: (2025)
On the Evaluation of Speech Foundation Models for Spoken Language Understanding
por: Arora, Siddhant, et al.
Publicado: (2024)
por: Arora, Siddhant, et al.
Publicado: (2024)
SLIDE: Integrating Speech Language Model with LLM for Spontaneous Spoken Dialogue Generation
por: Lu, Haitian, et al.
Publicado: (2025)
por: Lu, Haitian, et al.
Publicado: (2025)
Chain-of-Thought Training for Open E2E Spoken Dialogue Systems
por: Arora, Siddhant, et al.
Publicado: (2025)
por: Arora, Siddhant, et al.
Publicado: (2025)
SD-Eval: A Benchmark Dataset for Spoken Dialogue Understanding Beyond Words
por: Ao, Junyi, et al.
Publicado: (2024)
por: Ao, Junyi, et al.
Publicado: (2024)
Stream RAG: Instant and Accurate Spoken Dialogue Systems with Streaming Tool Usage
por: Arora, Siddhant, et al.
Publicado: (2025)
por: Arora, Siddhant, et al.
Publicado: (2025)
WavReward: Spoken Dialogue Models With Generalist Reward Evaluators
por: Ji, Shengpeng, et al.
Publicado: (2025)
por: Ji, Shengpeng, et al.
Publicado: (2025)
TELEVAL: A Dynamic Benchmark Designed for Spoken Language Models in Chinese Interactive Scenarios
por: Li, Zehan, et al.
Publicado: (2025)
por: Li, Zehan, et al.
Publicado: (2025)
Chain-of-Thought Reasoning in Streaming Full-Duplex End-to-End Spoken Dialogue Systems
por: Arora, Siddhant, et al.
Publicado: (2025)
por: Arora, Siddhant, et al.
Publicado: (2025)
Joint Speech and Text Training for LLM-Based End-to-End Spoken Dialogue State Tracking
por: Vendrame, Katia, et al.
Publicado: (2025)
por: Vendrame, Katia, et al.
Publicado: (2025)
Leveraging Chain of Thought towards Empathetic Spoken Dialogue without Corresponding Question-Answering Data
por: Xie, Jingran, et al.
Publicado: (2025)
por: Xie, Jingran, et al.
Publicado: (2025)
From Turn-Taking to Synchronous Dialogue: A Survey of Full-Duplex Spoken Language Models
por: Chen, Yuxuan, et al.
Publicado: (2025)
por: Chen, Yuxuan, et al.
Publicado: (2025)
BERT-LID: Leveraging BERT to Improve Spoken Language Identification
por: Nie, Yuting, et al.
Publicado: (2022)
por: Nie, Yuting, et al.
Publicado: (2022)
WavRAG: Audio-Integrated Retrieval Augmented Generation for Spoken Dialogue Models
por: Chen, Yifu, et al.
Publicado: (2025)
por: Chen, Yifu, et al.
Publicado: (2025)
Aligning Spoken Dialogue Models from User Interactions
por: Wu, Anne, et al.
Publicado: (2025)
por: Wu, Anne, et al.
Publicado: (2025)
UniverSLU: Universal Spoken Language Understanding for Diverse Tasks with Natural Language Instructions
por: Arora, Siddhant, et al.
Publicado: (2023)
por: Arora, Siddhant, et al.
Publicado: (2023)
T2A-Feedback: Improving Basic Capabilities of Text-to-Audio Generation via Fine-grained AI Feedback
por: Wang, Zehan, et al.
Publicado: (2025)
por: Wang, Zehan, et al.
Publicado: (2025)
MuVi: Video-to-Music Generation with Semantic Alignment and Rhythmic Synchronization
por: Li, Ruiqi, et al.
Publicado: (2024)
por: Li, Ruiqi, et al.
Publicado: (2024)
FlashLabs Chroma 1.0: A Real-Time End-to-End Spoken Dialogue Model with Personalized Voice Cloning
por: Chen, Tanyu, et al.
Publicado: (2026)
por: Chen, Tanyu, et al.
Publicado: (2026)
ControlSpeech: Towards Simultaneous and Independent Zero-shot Speaker Cloning and Zero-shot Language Style Control
por: Ji, Shengpeng, et al.
Publicado: (2024)
por: Ji, Shengpeng, et al.
Publicado: (2024)
Enhancing Expressive Voice Conversion with Discrete Pitch-Conditioned Flow Matching Model
por: Zuo, Jialong, et al.
Publicado: (2025)
por: Zuo, Jialong, et al.
Publicado: (2025)
TurnGuide: Enhancing Meaningful Full Duplex Spoken Interactions via Dynamic Turn-Level Text-Speech Interleaving
por: Cui, Wenqian, et al.
Publicado: (2025)
por: Cui, Wenqian, et al.
Publicado: (2025)
LLaMA-Omni2: LLM-based Real-time Spoken Chatbot with Autoregressive Streaming Speech Synthesis
por: Fang, Qingkai, et al.
Publicado: (2025)
por: Fang, Qingkai, et al.
Publicado: (2025)
Speech-to-Speech Translation with Discrete-Unit-Based Style Transfer
por: Wang, Yongqi, et al.
Publicado: (2023)
por: Wang, Yongqi, et al.
Publicado: (2023)
The ICASSP 2026 HumDial Challenge: Benchmarking Human-like Spoken Dialogue Systems in the LLM Era
por: Zhao, Zhixian, et al.
Publicado: (2026)
por: Zhao, Zhixian, et al.
Publicado: (2026)
On The Landscape of Spoken Language Models: A Comprehensive Survey
por: Arora, Siddhant, et al.
Publicado: (2025)
por: Arora, Siddhant, et al.
Publicado: (2025)
Spirit LM: Interleaved Spoken and Written Language Model
por: Nguyen, Tu Anh, et al.
Publicado: (2024)
por: Nguyen, Tu Anh, et al.
Publicado: (2024)
Long-Form Speech Generation with Spoken Language Models
por: Park, Se Jin, et al.
Publicado: (2024)
por: Park, Se Jin, et al.
Publicado: (2024)
WavTokenizer: an Efficient Acoustic Discrete Codec Tokenizer for Audio Language Modeling
por: Ji, Shengpeng, et al.
Publicado: (2024)
por: Ji, Shengpeng, et al.
Publicado: (2024)
Kanade: A Simple Disentangled Tokenizer for Spoken Language Modeling
por: Huang, Zhijie, et al.
Publicado: (2026)
por: Huang, Zhijie, et al.
Publicado: (2026)
Implicit Self-supervised Language Representation for Spoken Language Diarization
por: Mishra, Jagabandhu, et al.
Publicado: (2023)
por: Mishra, Jagabandhu, et al.
Publicado: (2023)
JoyTTS: LLM-based Spoken Chatbot With Voice Cloning
por: Zhou, Fangru, et al.
Publicado: (2025)
por: Zhou, Fangru, et al.
Publicado: (2025)
Semantic-Aware Interruption Detection in Spoken Dialogue Systems: Benchmark, Metric, and Model
por: Xia, Kangxiang, et al.
Publicado: (2026)
por: Xia, Kangxiang, et al.
Publicado: (2026)
E-chat: Emotion-sensitive Spoken Dialogue System with Large Language Models
por: Xue, Hongfei, et al.
Publicado: (2023)
por: Xue, Hongfei, et al.
Publicado: (2023)
Audio Dialogues: Dialogues dataset for audio and music understanding
por: Goel, Arushi, et al.
Publicado: (2024)
por: Goel, Arushi, et al.
Publicado: (2024)
Ejemplares similares
-
WavChat: A Survey of Spoken Dialogue Models
por: Ji, Shengpeng, et al.
Publicado: (2024) -
OmniSep: Unified Omni-Modality Sound Separation with Query-Mixup
por: Cheng, Xize, et al.
Publicado: (2024) -
J-CHAT: Japanese Large-scale Spoken Dialogue Corpus for Spoken Dialogue Language Modeling
por: Nakata, Wataru, et al.
Publicado: (2024) -
Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching
por: Zuo, Jialong, et al.
Publicado: (2025) -
DeepDialogue: A Multi-Turn Emotionally-Rich Spoken Dialogue Dataset
por: Koudounas, Alkis, et al.
Publicado: (2025)