DuplexCascade: Full-Duplex Speech-to-Speech Dialogue with VAD-Free Cascaded ASR-LLM-TTS Pipeline and Micro-Turn Optimization
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yang, Jianing, Fujita, Yusuke, Sudo, Yui |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Synchronization and Turn-Taking in Full-Duplex Speech Dialogue Models
par: Riera, Pablo, et autres
Publié: (2026)
par: Riera, Pablo, et autres
Publié: (2026)
Enabling Conversational Behavior Reasoning Capabilities in Full-Duplex Speech
par: Pan, Shuchang, et autres
Publié: (2025)
par: Pan, Shuchang, et autres
Publié: (2025)
Easy Turn: Integrating Acoustic and Linguistic Modalities for Robust Turn-Taking in Full-Duplex Spoken Dialogue Systems
par: Li, Guojian, et autres
Publié: (2025)
par: Li, Guojian, et autres
Publié: (2025)
Chronological Thinking in Full-Duplex Spoken Dialogue Language Models
par: Wu, Donghang, et autres
Publié: (2025)
par: Wu, Donghang, et autres
Publié: (2025)
JAL-Turn: Joint Acoustic-Linguistic Modeling for Real-Time and Robust Turn-Taking Detection in Full-Duplex Spoken Dialogue Systems
par: Yang, Guangzhao, et autres
Publié: (2026)
par: Yang, Guangzhao, et autres
Publié: (2026)
The Cascade Equivalence Hypothesis: When Do Speech LLMs Behave Like ASR$\rightarrow$LLM Pipelines?
par: Billa, Jayadev
Publié: (2026)
par: Billa, Jayadev
Publié: (2026)
MTR-DuplexBench: Towards a Comprehensive Evaluation of Multi-Round Conversations for Full-Duplex Speech Language Models
par: Zhang, He, et autres
Publié: (2025)
par: Zhang, He, et autres
Publié: (2025)
Serialized Output Prompting for Large Language Model-based Multi-Talker Speech Recognition
par: Shi, Hao, et autres
Publié: (2025)
par: Shi, Hao, et autres
Publié: (2025)
Unit-Based Agent for Semi-Cascaded Full-Duplex Dialogue Systems
par: Yu, Haoyuan, et autres
Publié: (2026)
par: Yu, Haoyuan, et autres
Publié: (2026)
ASPIRin: Action Space Projection for Interactivity-Optimized Reinforcement Learning in Full-Duplex Speech Language Models
par: Hsiao, Chi-Yuan, et autres
Publié: (2026)
par: Hsiao, Chi-Yuan, et autres
Publié: (2026)
FD-Bench: A Full-Duplex Benchmarking Pipeline Designed for Full Duplex Spoken Dialogue Systems
par: Peng, Yizhou, et autres
Publié: (2025)
par: Peng, Yizhou, et autres
Publié: (2025)
PersonaKit (PK): A Plug-and-Play Platform for User Testing Diverse Roles in Full-Duplex Dialogue
par: Jeon, Hyunbae, et autres
Publié: (2026)
par: Jeon, Hyunbae, et autres
Publié: (2026)
Privacy-Preserving End-to-End Full-Duplex Speech Dialogue Models
par: Kuzmin, Nikita, et autres
Publié: (2026)
par: Kuzmin, Nikita, et autres
Publié: (2026)
Blending LLMs into Cascaded Speech Translation: KIT's Offline Speech Translation System for IWSLT 2024
par: Koneru, Sai, et autres
Publié: (2024)
par: Koneru, Sai, et autres
Publié: (2024)
FlexDuo: A Pluggable System for Enabling Full-Duplex Capabilities in Speech Dialogue Systems
par: Liao, Borui, et autres
Publié: (2025)
par: Liao, Borui, et autres
Publié: (2025)
Speech-Worthy Alignment for Japanese SpeechLLMs via Direct Preference Optimization
par: Zhao, Mengjie, et autres
Publié: (2026)
par: Zhao, Mengjie, et autres
Publié: (2026)
From Signal to Turn: Interactional Friction in Modular Speech-to-Speech Pipelines
par: Mairittha, Tittaya, et autres
Publié: (2025)
par: Mairittha, Tittaya, et autres
Publié: (2025)
MTalk-Bench: Evaluating Speech-to-Speech Models in Multi-Turn Dialogues via Arena-style and Rubrics Protocols
par: Du, Yuhao, et autres
Publié: (2025)
par: Du, Yuhao, et autres
Publié: (2025)
OWSM-Biasing: Contextualizing Open Whisper-Style Speech Models for Automatic Speech Recognition with Dynamic Vocabulary
par: Sudo, Yui, et autres
Publié: (2025)
par: Sudo, Yui, et autres
Publié: (2025)
FLM-Audio: Natural Monologues Improves Native Full-Duplex Chatbots via Dual Training
par: Yao, Yiqun, et autres
Publié: (2025)
par: Yao, Yiqun, et autres
Publié: (2025)
Leveraging Speech PTM, Text LLM, and Emotional TTS for Speech Emotion Recognition
par: Ma, Ziyang, et autres
Publié: (2023)
par: Ma, Ziyang, et autres
Publié: (2023)
LLM-Enhanced Dialogue Management for Full-Duplex Spoken Dialogue Systems
par: Zhang, Hao, et autres
Publié: (2025)
par: Zhang, Hao, et autres
Publié: (2025)
DuplexMamba: Enhancing Real-time Speech Conversations with Duplex and Streaming Capabilities
par: Lu, Xiangyu, et autres
Publié: (2025)
par: Lu, Xiangyu, et autres
Publié: (2025)
SALM-Duplex: Efficient and Direct Duplex Modeling for Speech-to-Speech Language Model
par: Hu, Ke, et autres
Publié: (2025)
par: Hu, Ke, et autres
Publié: (2025)
CascadeDebate: Multi-Agent Deliberation for Cost-Aware LLM Cascades
par: Chang, Raeyoung, et autres
Publié: (2026)
par: Chang, Raeyoung, et autres
Publié: (2026)
AC/DC: LLM-based Audio Comprehension via Dialogue Continuation
par: Fujita, Yusuke, et autres
Publié: (2025)
par: Fujita, Yusuke, et autres
Publié: (2025)
Human-1 by Josh Talks: A Full-Duplex Conversational Modeling Framework in Hindi using Real-World Conversations
par: Singh, Bhaskar, et autres
Publié: (2026)
par: Singh, Bhaskar, et autres
Publié: (2026)
EchoChain: A Full-Duplex Benchmark for State-Update Reasoning Under Interruptions
par: Modi, Smit Nautambhai, et autres
Publié: (2026)
par: Modi, Smit Nautambhai, et autres
Publié: (2026)
Beyond Turn-Based Interfaces: Synchronous LLMs as Full-Duplex Dialogue Agents
par: Veluri, Bandhav, et autres
Publié: (2024)
par: Veluri, Bandhav, et autres
Publié: (2024)
Overcoming Latency Bottlenecks in On-Device Speech Translation: A Cascaded Approach with Alignment-Based Streaming MT
par: Ahmed, Zeeshan, et autres
Publié: (2025)
par: Ahmed, Zeeshan, et autres
Publié: (2025)
TurnGuide: Enhancing Meaningful Full Duplex Spoken Interactions via Dynamic Turn-Level Text-Speech Interleaving
par: Cui, Wenqian, et autres
Publié: (2025)
par: Cui, Wenqian, et autres
Publié: (2025)
UAF: A Unified Audio Front-end LLM for Full-Duplex Speech Interaction
par: Li, Yadong, et autres
Publié: (2026)
par: Li, Yadong, et autres
Publié: (2026)
PersonaPlex: Voice and Role Control for Full Duplex Conversational Speech Models
par: Roy, Rajarshi, et autres
Publié: (2026)
par: Roy, Rajarshi, et autres
Publié: (2026)
MEDSAGE: Enhancing Robustness of Medical Dialogue Summarization to ASR Errors with LLM-generated Synthetic Dialogues
par: Binici, Kuluhan, et autres
Publié: (2024)
par: Binici, Kuluhan, et autres
Publié: (2024)
Vividh-ASR: A Complexity-Tiered Benchmark and Optimization Dynamics for Robust Indic Speech Recognition
par: Juvekar, Kush, et autres
Publié: (2026)
par: Juvekar, Kush, et autres
Publié: (2026)
LLM-Driven Multi-Turn Task-Oriented Dialogue Synthesis for Realistic Reasoning
par: Zhu, Yu, et autres
Publié: (2026)
par: Zhu, Yu, et autres
Publié: (2026)
Streaming Translation and Transcription Through Speech-to-Text Causal Alignment
par: Koshkin, Roman, et autres
Publié: (2026)
par: Koshkin, Roman, et autres
Publié: (2026)
Full-Duplex-Bench: A Benchmark to Evaluate Full-duplex Spoken Dialogue Models on Turn-taking Capabilities
par: Lin, Guan-Ting, et autres
Publié: (2025)
par: Lin, Guan-Ting, et autres
Publié: (2025)
TMD-TTS: A Unified Tibetan Multi-Dialect Text-to-Speech Framework for Ü-Tsang, Amdo and Kham Speech Dataset Generation
par: Liu, Yutong, et autres
Publié: (2025)
par: Liu, Yutong, et autres
Publié: (2025)
SALMONN-omni: A Standalone Speech LLM without Codec Injection for Full-duplex Conversation
par: Yu, Wenyi, et autres
Publié: (2025)
par: Yu, Wenyi, et autres
Publié: (2025)
Documents similaires
-
Synchronization and Turn-Taking in Full-Duplex Speech Dialogue Models
par: Riera, Pablo, et autres
Publié: (2026) -
Enabling Conversational Behavior Reasoning Capabilities in Full-Duplex Speech
par: Pan, Shuchang, et autres
Publié: (2025) -
Easy Turn: Integrating Acoustic and Linguistic Modalities for Robust Turn-Taking in Full-Duplex Spoken Dialogue Systems
par: Li, Guojian, et autres
Publié: (2025) -
Chronological Thinking in Full-Duplex Spoken Dialogue Language Models
par: Wu, Donghang, et autres
Publié: (2025) -
JAL-Turn: Joint Acoustic-Linguistic Modeling for Real-Time and Robust Turn-Taking Detection in Full-Duplex Spoken Dialogue Systems
par: Yang, Guangzhao, et autres
Publié: (2026)