How Should LLMs Listen While Speaking? A Study of User-Stream Routing in Full-Duplex Spoken Dialogue
Fuente:
arXiv
Guardado en:
| Autores principales: | Lu, Hui, Chen, Xueyuan, Wang, Huimeng, Peng, Shuhai, Kang, Shiyin, Wu, Xixin, Wu, Zhiyong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
SemaVoice: Semantic-Aware Continuous Autoregressive Speech Synthesis
por: Wang, Huimeng, et al.
Publicado: (2026)
por: Wang, Huimeng, et al.
Publicado: (2026)
FD-Bench: A Full-Duplex Benchmarking Pipeline Designed for Full Duplex Spoken Dialogue Systems
por: Peng, Yizhou, et al.
Publicado: (2025)
por: Peng, Yizhou, et al.
Publicado: (2025)
LLM-Enhanced Dialogue Management for Full-Duplex Spoken Dialogue Systems
por: Zhang, Hao, et al.
Publicado: (2025)
por: Zhang, Hao, et al.
Publicado: (2025)
Chain-of-Thought Reasoning in Streaming Full-Duplex End-to-End Spoken Dialogue Systems
por: Arora, Siddhant, et al.
Publicado: (2025)
por: Arora, Siddhant, et al.
Publicado: (2025)
DuplexSLA: A Full-Duplex Spoken Language Model with Synchronized Speech, Language, and Action
por: Zhang, Haoyang, et al.
Publicado: (2026)
por: Zhang, Haoyang, et al.
Publicado: (2026)
Leveraging Chain of Thought towards Empathetic Spoken Dialogue without Corresponding Question-Answering Data
por: Xie, Jingran, et al.
Publicado: (2025)
por: Xie, Jingran, et al.
Publicado: (2025)
Full-Duplex Interaction in Spoken Dialogue Systems: A Comprehensive Study from the ICASSP 2026 HumDial Challenge
por: Wang, Chengyou, et al.
Publicado: (2026)
por: Wang, Chengyou, et al.
Publicado: (2026)
Full-Duplex-Bench: A Benchmark to Evaluate Full-duplex Spoken Dialogue Models on Turn-taking Capabilities
por: Lin, Guan-Ting, et al.
Publicado: (2025)
por: Lin, Guan-Ting, et al.
Publicado: (2025)
From Turn-Taking to Synchronous Dialogue: A Survey of Full-Duplex Spoken Language Models
por: Chen, Yuxuan, et al.
Publicado: (2025)
por: Chen, Yuxuan, et al.
Publicado: (2025)
DialogueSidon: Recovering Full-Duplex Dialogue Tracks from In-the-Wild Dialogue Audio
por: Nakata, Wataru, et al.
Publicado: (2026)
por: Nakata, Wataru, et al.
Publicado: (2026)
Exploiting Audio-Visual Features with Pretrained AV-HuBERT for Multi-Modal Dysarthric Speech Reconstruction
por: Chen, Xueyuan, et al.
Publicado: (2024)
por: Chen, Xueyuan, et al.
Publicado: (2024)
DiffDSR: Dysarthric Speech Reconstruction Using Latent Diffusion Model
por: Chen, Xueyuan, et al.
Publicado: (2025)
por: Chen, Xueyuan, et al.
Publicado: (2025)
Full-Duplex-Bench-v2: A Multi-Turn Evaluation Framework for Duplex Dialogue Systems with an Automated Examiner
por: Lin, Guan-Ting, et al.
Publicado: (2025)
por: Lin, Guan-Ting, et al.
Publicado: (2025)
Target Speech Extraction with Pre-trained AV-HuBERT and Mask-And-Recover Strategy
por: Wu, Wenxuan, et al.
Publicado: (2024)
por: Wu, Wenxuan, et al.
Publicado: (2024)
Phoenix-VAD: Streaming Semantic Endpoint Detection for Full-Duplex Speech Interaction
por: Wu, Weijie, et al.
Publicado: (2025)
por: Wu, Weijie, et al.
Publicado: (2025)
Disambiguation of Chinese Polyphones in an End-to-End Framework with Semantic Features Extracted by Pre-trained BERT
por: Dai, Dongyang, et al.
Publicado: (2025)
por: Dai, Dongyang, et al.
Publicado: (2025)
MiLorE-SSL: Scaling Multilingual Capabilities in Self-Supervised Models without Forgetting
por: Xu, Jing, et al.
Publicado: (2026)
por: Xu, Jing, et al.
Publicado: (2026)
Lamer-SSL: Layer-aware Mixture of LoRA Experts for Continual Multilingual Expansion of Self-supervised Models without Forgetting
por: Xu, Jing, et al.
Publicado: (2026)
por: Xu, Jing, et al.
Publicado: (2026)
Towards a Japanese Full-duplex Spoken Dialogue System
por: Ohashi, Atsumoto, et al.
Publicado: (2025)
por: Ohashi, Atsumoto, et al.
Publicado: (2025)
Language Model Can Listen While Speaking
por: Ma, Ziyang, et al.
Publicado: (2024)
por: Ma, Ziyang, et al.
Publicado: (2024)
Aligning Spoken Dialogue Models from User Interactions
por: Wu, Anne, et al.
Publicado: (2025)
por: Wu, Anne, et al.
Publicado: (2025)
SoulX-Duplug: Plug-and-Play Streaming State Prediction Module for Realtime Full-Duplex Speech Conversation
por: Yan, Ruiqi, et al.
Publicado: (2026)
por: Yan, Ruiqi, et al.
Publicado: (2026)
CoLM-DSR: Leveraging Neural Codec Language Modeling for Multi-Modal Dysarthric Speech Reconstruction
por: Chen, Xueyuan, et al.
Publicado: (2024)
por: Chen, Xueyuan, et al.
Publicado: (2024)
Full-Duplex-Bench v1.5: Evaluating Overlap Handling for Full-Duplex Speech Models
por: Lin, Guan-Ting, et al.
Publicado: (2025)
por: Lin, Guan-Ting, et al.
Publicado: (2025)
Improving Language Model-Based Zero-Shot Text-to-Speech Synthesis with Multi-Scale Acoustic Prompts
por: Lei, Shun, et al.
Publicado: (2023)
por: Lei, Shun, et al.
Publicado: (2023)
Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training
por: Udupa, Sathvik, et al.
Publicado: (2025)
por: Udupa, Sathvik, et al.
Publicado: (2025)
Beyond Turn-Based Interfaces: Synchronous LLMs as Full-Duplex Dialogue Agents
por: Veluri, Bandhav, et al.
Publicado: (2024)
por: Veluri, Bandhav, et al.
Publicado: (2024)
Stream RAG: Instant and Accurate Spoken Dialogue Systems with Streaming Tool Usage
por: Arora, Siddhant, et al.
Publicado: (2025)
por: Arora, Siddhant, et al.
Publicado: (2025)
AudioComposer: Towards Fine-grained Audio Generation with Natural Language Descriptions
por: Wang, Yuanyuan, et al.
Publicado: (2024)
por: Wang, Yuanyuan, et al.
Publicado: (2024)
SimpleSpeech: Towards Simple and Efficient Text-to-Speech with Scalar Latent Transformer Diffusion Models
por: Yang, Dongchao, et al.
Publicado: (2024)
por: Yang, Dongchao, et al.
Publicado: (2024)
Towards General Auditory Intelligence: Large Multimodal Models for Machine Listening and Speaking
por: Wang, Siyin, et al.
Publicado: (2025)
por: Wang, Siyin, et al.
Publicado: (2025)
Speaking from Coarse to Fine: Improving Neural Codec Language Model via Multi-Scale Speech Coding and Generation
por: Guo, Haohan, et al.
Publicado: (2024)
por: Guo, Haohan, et al.
Publicado: (2024)
Privacy-Preserving End-to-End Full-Duplex Speech Dialogue Models
por: Kuzmin, Nikita, et al.
Publicado: (2026)
por: Kuzmin, Nikita, et al.
Publicado: (2026)
SCNet: Sparse Compression Network for Music Source Separation
por: Tong, Weinan, et al.
Publicado: (2024)
por: Tong, Weinan, et al.
Publicado: (2024)
TurnGuide: Enhancing Meaningful Full Duplex Spoken Interactions via Dynamic Turn-Level Text-Speech Interleaving
por: Cui, Wenqian, et al.
Publicado: (2025)
por: Cui, Wenqian, et al.
Publicado: (2025)
MMedFD: A Real-world Healthcare Benchmark for Multi-turn Full-Duplex Automatic Speech Recognition
por: Chen, Hongzhao, et al.
Publicado: (2025)
por: Chen, Hongzhao, et al.
Publicado: (2025)
UniSRM: A Unified Speech Reward Model for Reasoning-Based Fine-grained Assessment
por: Wang, Yuanyuan, et al.
Publicado: (2026)
por: Wang, Yuanyuan, et al.
Publicado: (2026)
J-CHAT: Japanese Large-scale Spoken Dialogue Corpus for Spoken Dialogue Language Modeling
por: Nakata, Wataru, et al.
Publicado: (2024)
por: Nakata, Wataru, et al.
Publicado: (2024)
Enhancing Generalization of Speech Large Language Models with Multi-Task Behavior Imitation and Speech-Text Interleaving
por: Xie, Jingran, et al.
Publicado: (2025)
por: Xie, Jingran, et al.
Publicado: (2025)
Full-Duplex-Bench-v3: Benchmarking Tool Use for Full-Duplex Voice Agents Under Real-World Disfluency
por: Lin, Guan-Ting, et al.
Publicado: (2026)
por: Lin, Guan-Ting, et al.
Publicado: (2026)
Ejemplares similares
-
SemaVoice: Semantic-Aware Continuous Autoregressive Speech Synthesis
por: Wang, Huimeng, et al.
Publicado: (2026) -
FD-Bench: A Full-Duplex Benchmarking Pipeline Designed for Full Duplex Spoken Dialogue Systems
por: Peng, Yizhou, et al.
Publicado: (2025) -
LLM-Enhanced Dialogue Management for Full-Duplex Spoken Dialogue Systems
por: Zhang, Hao, et al.
Publicado: (2025) -
Chain-of-Thought Reasoning in Streaming Full-Duplex End-to-End Spoken Dialogue Systems
por: Arora, Siddhant, et al.
Publicado: (2025) -
DuplexSLA: A Full-Duplex Spoken Language Model with Synchronized Speech, Language, and Action
por: Zhang, Haoyang, et al.
Publicado: (2026)