TurnGuide: Enhancing Meaningful Full Duplex Spoken Interactions via Dynamic Turn-Level Text-Speech Interleaving
Fuente:
arXiv
Salvato in:
| Autori principali: | Cui, Wenqian, Zhu, Lei, Li, Xiaohui, Guo, Zhihan, Bai, Haoli, Hou, Lu, King, Irwin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
From Turn-Taking to Synchronous Dialogue: A Survey of Full-Duplex Spoken Language Models
di: Chen, Yuxuan, et al.
Pubblicazione: (2025)
di: Chen, Yuxuan, et al.
Pubblicazione: (2025)
MTR-DuplexBench: Towards a Comprehensive Evaluation of Multi-Round Conversations for Full-Duplex Speech Language Models
di: Zhang, He, et al.
Pubblicazione: (2025)
di: Zhang, He, et al.
Pubblicazione: (2025)
VoxEval: Benchmarking the Knowledge Understanding Capabilities of End-to-End Spoken Language Models
di: Cui, Wenqian, et al.
Pubblicazione: (2025)
di: Cui, Wenqian, et al.
Pubblicazione: (2025)
Minimizing Modality Gap from the Input Side: Your Speech LLM Can Be a Prosody-Aware Text LLM
di: Cui, Wenqian, et al.
Pubblicazione: (2026)
di: Cui, Wenqian, et al.
Pubblicazione: (2026)
Phoenix-VAD: Streaming Semantic Endpoint Detection for Full-Duplex Speech Interaction
di: Wu, Weijie, et al.
Pubblicazione: (2025)
di: Wu, Weijie, et al.
Pubblicazione: (2025)
UAF: A Unified Audio Front-end LLM for Full-Duplex Speech Interaction
di: Li, Yadong, et al.
Pubblicazione: (2026)
di: Li, Yadong, et al.
Pubblicazione: (2026)
Beyond Turn-Based Interfaces: Synchronous LLMs as Full-Duplex Dialogue Agents
di: Veluri, Bandhav, et al.
Pubblicazione: (2024)
di: Veluri, Bandhav, et al.
Pubblicazione: (2024)
NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction
di: Wang, Qichao, et al.
Pubblicazione: (2025)
di: Wang, Qichao, et al.
Pubblicazione: (2025)
LALM-as-a-Judge: Benchmarking Large Audio-Language Models for Safety Evaluation in Multi-Turn Spoken Dialogues
di: Ivry, Amir, et al.
Pubblicazione: (2026)
di: Ivry, Amir, et al.
Pubblicazione: (2026)
FastTurn: Unifying Acoustic and Streaming Semantic Cues for Low-Latency and Robust Turn Detection
di: Wang, Chengyou, et al.
Pubblicazione: (2026)
di: Wang, Chengyou, et al.
Pubblicazione: (2026)
Chain-of-Thought Reasoning in Streaming Full-Duplex End-to-End Spoken Dialogue Systems
di: Arora, Siddhant, et al.
Pubblicazione: (2025)
di: Arora, Siddhant, et al.
Pubblicazione: (2025)
Recent Advances in Speech Language Models: A Survey
di: Cui, Wenqian, et al.
Pubblicazione: (2024)
di: Cui, Wenqian, et al.
Pubblicazione: (2024)
DeepDialogue: A Multi-Turn Emotionally-Rich Spoken Dialogue Dataset
di: Koudounas, Alkis, et al.
Pubblicazione: (2025)
di: Koudounas, Alkis, et al.
Pubblicazione: (2025)
DualTurn: Learning Turn-Taking from Dual-Channel Generative Speech Pretraining
di: Rajaa, Shangeth
Pubblicazione: (2026)
di: Rajaa, Shangeth
Pubblicazione: (2026)
A Small-footprint Acoustic Echo Cancellation Solution for Mobile Full-Duplex Speech Interactions
di: Jiang, Yiheng, et al.
Pubblicazione: (2025)
di: Jiang, Yiheng, et al.
Pubblicazione: (2025)
Scaling Speech-Text Pre-training with Synthetic Interleaved Data
di: Zeng, Aohan, et al.
Pubblicazione: (2024)
di: Zeng, Aohan, et al.
Pubblicazione: (2024)
Prompt-Guided Turn-Taking Prediction
di: Inoue, Koji, et al.
Pubblicazione: (2025)
di: Inoue, Koji, et al.
Pubblicazione: (2025)
Scheduled Interleaved Speech-Text Training for Speech-to-Speech Translation with LLMs
di: Futami, Hayato, et al.
Pubblicazione: (2025)
di: Futami, Hayato, et al.
Pubblicazione: (2025)
In This Environment, As That Speaker: A Text-Driven Framework for Multi-Attribute Speech Conversion
di: Jin, Jiawei, et al.
Pubblicazione: (2025)
di: Jin, Jiawei, et al.
Pubblicazione: (2025)
Spirit LM: Interleaved Spoken and Written Language Model
di: Nguyen, Tu Anh, et al.
Pubblicazione: (2024)
di: Nguyen, Tu Anh, et al.
Pubblicazione: (2024)
Scaling Analysis of Interleaved Speech-Text Language Models
di: Maimon, Gallil, et al.
Pubblicazione: (2025)
di: Maimon, Gallil, et al.
Pubblicazione: (2025)
SpeakStream: Streaming Text-to-Speech with Interleaved Data
di: Bai, Richard He, et al.
Pubblicazione: (2025)
di: Bai, Richard He, et al.
Pubblicazione: (2025)
SALM-Duplex: Efficient and Direct Duplex Modeling for Speech-to-Speech Language Model
di: Hu, Ke, et al.
Pubblicazione: (2025)
di: Hu, Ke, et al.
Pubblicazione: (2025)
DialogueSidon: Recovering Full-Duplex Dialogue Tracks from In-the-Wild Dialogue Audio
di: Nakata, Wataru, et al.
Pubblicazione: (2026)
di: Nakata, Wataru, et al.
Pubblicazione: (2026)
MULTI-Bench: A Multi-Turn Interactive Benchmark for Assessing Emotional Intelligence ability of Spoken Dialogue Models
di: Deng, Yayue, et al.
Pubblicazione: (2025)
di: Deng, Yayue, et al.
Pubblicazione: (2025)
Talking Turns: Benchmarking Audio Foundation Models on Turn-Taking Dynamics
di: Arora, Siddhant, et al.
Pubblicazione: (2025)
di: Arora, Siddhant, et al.
Pubblicazione: (2025)
Speaker-Reasoner: Scaling Interaction Turns and Reasoning Patterns for Timestamped Speaker-Attributed ASR
di: Lin, Zhennan, et al.
Pubblicazione: (2026)
di: Lin, Zhennan, et al.
Pubblicazione: (2026)
TASTE: Text-Aligned Speech Tokenization and Embedding for Spoken Language Modeling
di: Tseng, Liang-Hsuan, et al.
Pubblicazione: (2025)
di: Tseng, Liang-Hsuan, et al.
Pubblicazione: (2025)
HumDial-EIBench: A Human-Recorded Multi-Turn Emotional Intelligence Benchmark for Audio Language Models
di: Wang, Shuiyuan, et al.
Pubblicazione: (2026)
di: Wang, Shuiyuan, et al.
Pubblicazione: (2026)
WHISMA: A Speech-LLM to Perform Zero-shot Spoken Language Understanding
di: Li, Mohan, et al.
Pubblicazione: (2024)
di: Li, Mohan, et al.
Pubblicazione: (2024)
TraceableSpeech: Towards Proactively Traceable Text-to-Speech with Watermarking
di: Zhou, Junzuo, et al.
Pubblicazione: (2024)
di: Zhou, Junzuo, et al.
Pubblicazione: (2024)
Beyond Speaker Identity: Text Guided Target Speech Extraction
di: Huo, Mingyue, et al.
Pubblicazione: (2025)
di: Huo, Mingyue, et al.
Pubblicazione: (2025)
Enhancing Generalization of Speech Large Language Models with Multi-Task Behavior Imitation and Speech-Text Interleaving
di: Xie, Jingran, et al.
Pubblicazione: (2025)
di: Xie, Jingran, et al.
Pubblicazione: (2025)
Enabling Beam Search for Language Model-Based Text-to-Speech Synthesis
di: Tu, Zehai, et al.
Pubblicazione: (2024)
di: Tu, Zehai, et al.
Pubblicazione: (2024)
MoodLoopGP: Generating Emotion-Conditioned Loop Tablature Music with Multi-Granular Features
di: Cui, Wenqian, et al.
Pubblicazione: (2024)
di: Cui, Wenqian, et al.
Pubblicazione: (2024)
FireRedTTS: A Foundation Text-To-Speech Framework for Industry-Level Generative Speech Applications
di: Guo, Hao-Han, et al.
Pubblicazione: (2024)
di: Guo, Hao-Han, et al.
Pubblicazione: (2024)
Inter-Speaker Relative Cues for Text-Guided Target Speech Extraction
di: Dai, Wang, et al.
Pubblicazione: (2025)
di: Dai, Wang, et al.
Pubblicazione: (2025)
Why Can't They Remember? Uncovering Representation and Retrieval Bottlenecks in Multi-Turn Acoustic Memory
di: Xiao, Yang, et al.
Pubblicazione: (2026)
di: Xiao, Yang, et al.
Pubblicazione: (2026)
ASPIRin: Action Space Projection for Interactivity-Optimized Reinforcement Learning in Full-Duplex Speech Language Models
di: Hsiao, Chi-Yuan, et al.
Pubblicazione: (2026)
di: Hsiao, Chi-Yuan, et al.
Pubblicazione: (2026)
DubWise: Video-Guided Speech Duration Control in Multimodal LLM-based Text-to-Speech for Dubbing
di: Sahipjohn, Neha, et al.
Pubblicazione: (2024)
di: Sahipjohn, Neha, et al.
Pubblicazione: (2024)
Documenti analoghi
-
From Turn-Taking to Synchronous Dialogue: A Survey of Full-Duplex Spoken Language Models
di: Chen, Yuxuan, et al.
Pubblicazione: (2025) -
MTR-DuplexBench: Towards a Comprehensive Evaluation of Multi-Round Conversations for Full-Duplex Speech Language Models
di: Zhang, He, et al.
Pubblicazione: (2025) -
VoxEval: Benchmarking the Knowledge Understanding Capabilities of End-to-End Spoken Language Models
di: Cui, Wenqian, et al.
Pubblicazione: (2025) -
Minimizing Modality Gap from the Input Side: Your Speech LLM Can Be a Prosody-Aware Text LLM
di: Cui, Wenqian, et al.
Pubblicazione: (2026) -
Phoenix-VAD: Streaming Semantic Endpoint Detection for Full-Duplex Speech Interaction
di: Wu, Weijie, et al.
Pubblicazione: (2025)