MoshiRAG: Asynchronous Knowledge Retrieval for Full-Duplex Speech Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Chien, Chung-Ming, Orsini, Manu, Kharitonov, Eugene, Zeghidour, Neil, Livescu, Karen, Défossez, Alexandre |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Continuous Audio Language Models
di: Rouard, Simon, et al.
Pubblicazione: (2025)
di: Rouard, Simon, et al.
Pubblicazione: (2025)
Moshi: a speech-text foundation model for real-time dialogue
di: Défossez, Alexandre, et al.
Pubblicazione: (2024)
di: Défossez, Alexandre, et al.
Pubblicazione: (2024)
MAD Speech: Measures of Acoustic Diversity of Speech
di: Futeral, Matthieu, et al.
Pubblicazione: (2024)
di: Futeral, Matthieu, et al.
Pubblicazione: (2024)
Simultaneous Speech-to-Speech Translation Without Aligned Data
di: Labiausse, Tom, et al.
Pubblicazione: (2026)
di: Labiausse, Tom, et al.
Pubblicazione: (2026)
High-Fidelity Simultaneous Speech-To-Speech Translation
di: Labiausse, Tom, et al.
Pubblicazione: (2025)
di: Labiausse, Tom, et al.
Pubblicazione: (2025)
Aligning Spoken Dialogue Models from User Interactions
di: Wu, Anne, et al.
Pubblicazione: (2025)
di: Wu, Anne, et al.
Pubblicazione: (2025)
AV2Wav: Diffusion-Based Re-synthesis from Continuous Self-supervised Features for Audio-Visual Speech Enhancement
di: Chou, Ju-Chieh, et al.
Pubblicazione: (2023)
di: Chou, Ju-Chieh, et al.
Pubblicazione: (2023)
What Do Self-Supervised Speech Models Know About Words?
di: Pasad, Ankita, et al.
Pubblicazione: (2023)
di: Pasad, Ankita, et al.
Pubblicazione: (2023)
DuplexSLA: A Full-Duplex Spoken Language Model with Synchronized Speech, Language, and Action
di: Zhang, Haoyang, et al.
Pubblicazione: (2026)
di: Zhang, Haoyang, et al.
Pubblicazione: (2026)
Full-Duplex-Bench v1.5: Evaluating Overlap Handling for Full-Duplex Speech Models
di: Lin, Guan-Ting, et al.
Pubblicazione: (2025)
di: Lin, Guan-Ting, et al.
Pubblicazione: (2025)
MMedFD: A Real-world Healthcare Benchmark for Multi-turn Full-Duplex Automatic Speech Recognition
di: Chen, Hongzhao, et al.
Pubblicazione: (2025)
di: Chen, Hongzhao, et al.
Pubblicazione: (2025)
SoulX-Duplug: Plug-and-Play Streaming State Prediction Module for Realtime Full-Duplex Speech Conversation
di: Yan, Ruiqi, et al.
Pubblicazione: (2026)
di: Yan, Ruiqi, et al.
Pubblicazione: (2026)
On the Evaluation of Speech Foundation Models for Spoken Language Understanding
di: Arora, Siddhant, et al.
Pubblicazione: (2024)
di: Arora, Siddhant, et al.
Pubblicazione: (2024)
Phoenix-VAD: Streaming Semantic Endpoint Detection for Full-Duplex Speech Interaction
di: Wu, Weijie, et al.
Pubblicazione: (2025)
di: Wu, Weijie, et al.
Pubblicazione: (2025)
Speech Recognition for Analysis of Police Radio Communication
di: Srivastava, Tejes, et al.
Pubblicazione: (2024)
di: Srivastava, Tejes, et al.
Pubblicazione: (2024)
SALM-Duplex: Efficient and Direct Duplex Modeling for Speech-to-Speech Language Model
di: Hu, Ke, et al.
Pubblicazione: (2025)
di: Hu, Ke, et al.
Pubblicazione: (2025)
MTR-DuplexBench: Towards a Comprehensive Evaluation of Multi-Round Conversations for Full-Duplex Speech Language Models
di: Zhang, He, et al.
Pubblicazione: (2025)
di: Zhang, He, et al.
Pubblicazione: (2025)
Full-Duplex-Bench-v2: A Multi-Turn Evaluation Framework for Duplex Dialogue Systems with an Automated Examiner
di: Lin, Guan-Ting, et al.
Pubblicazione: (2025)
di: Lin, Guan-Ting, et al.
Pubblicazione: (2025)
FD-Bench: A Full-Duplex Benchmarking Pipeline Designed for Full Duplex Spoken Dialogue Systems
di: Peng, Yizhou, et al.
Pubblicazione: (2025)
di: Peng, Yizhou, et al.
Pubblicazione: (2025)
SpeechT-RAG: Reliable Depression Detection in LLMs with Retrieval-Augmented Generation Using Speech Timing Information
di: Zhang, Xiangyu, et al.
Pubblicazione: (2025)
di: Zhang, Xiangyu, et al.
Pubblicazione: (2025)
DiscreteSLU: A Large Language Model with Self-Supervised Discrete Speech Units for Spoken Language Understanding
di: Shon, Suwon, et al.
Pubblicazione: (2024)
di: Shon, Suwon, et al.
Pubblicazione: (2024)
Privacy-Preserving End-to-End Full-Duplex Speech Dialogue Models
di: Kuzmin, Nikita, et al.
Pubblicazione: (2026)
di: Kuzmin, Nikita, et al.
Pubblicazione: (2026)
On The Landscape of Spoken Language Models: A Comprehensive Survey
di: Arora, Siddhant, et al.
Pubblicazione: (2025)
di: Arora, Siddhant, et al.
Pubblicazione: (2025)
Full-Duplex-Bench-v3: Benchmarking Tool Use for Full-Duplex Voice Agents Under Real-World Disfluency
di: Lin, Guan-Ting, et al.
Pubblicazione: (2026)
di: Lin, Guan-Ting, et al.
Pubblicazione: (2026)
UAF: A Unified Audio Front-end LLM for Full-Duplex Speech Interaction
di: Li, Yadong, et al.
Pubblicazione: (2026)
di: Li, Yadong, et al.
Pubblicazione: (2026)
On the Effects of Heterogeneous Data Sources on Speech-to-Text Foundation Models
di: Tian, Jinchuan, et al.
Pubblicazione: (2024)
di: Tian, Jinchuan, et al.
Pubblicazione: (2024)
CTC-DRO: Robust Optimization for Reducing Language Disparities in Speech Recognition
di: Bartelds, Martijn, et al.
Pubblicazione: (2025)
di: Bartelds, Martijn, et al.
Pubblicazione: (2025)
A Small-footprint Acoustic Echo Cancellation Solution for Mobile Full-Duplex Speech Interactions
di: Jiang, Yiheng, et al.
Pubblicazione: (2025)
di: Jiang, Yiheng, et al.
Pubblicazione: (2025)
Audio Conditioning for Music Generation via Discrete Bottleneck Features
di: Rouard, Simon, et al.
Pubblicazione: (2024)
di: Rouard, Simon, et al.
Pubblicazione: (2024)
ASPIRin: Action Space Projection for Interactivity-Optimized Reinforcement Learning in Full-Duplex Speech Language Models
di: Hsiao, Chi-Yuan, et al.
Pubblicazione: (2026)
di: Hsiao, Chi-Yuan, et al.
Pubblicazione: (2026)
DialogueSidon: Recovering Full-Duplex Dialogue Tracks from In-the-Wild Dialogue Audio
di: Nakata, Wataru, et al.
Pubblicazione: (2026)
di: Nakata, Wataru, et al.
Pubblicazione: (2026)
Distributed Asynchronous Device Speech Enhancement via Windowed Cross-Attention
di: Yang, Gene-Ping, et al.
Pubblicazione: (2025)
di: Yang, Gene-Ping, et al.
Pubblicazione: (2025)
Self-Supervised Speech Representations are More Phonetic than Semantic
di: Choi, Kwanghee, et al.
Pubblicazione: (2024)
di: Choi, Kwanghee, et al.
Pubblicazione: (2024)
Full-Duplex Interaction in Spoken Dialogue Systems: A Comprehensive Study from the ICASSP 2026 HumDial Challenge
di: Wang, Chengyou, et al.
Pubblicazione: (2026)
di: Wang, Chengyou, et al.
Pubblicazione: (2026)
LLM-Enhanced Dialogue Management for Full-Duplex Spoken Dialogue Systems
di: Zhang, Hao, et al.
Pubblicazione: (2025)
di: Zhang, Hao, et al.
Pubblicazione: (2025)
RAG-Boost: Retrieval-Augmented Generation Enhanced LLM-based Speech Recognition
di: Wang, Pengcheng, et al.
Pubblicazione: (2025)
di: Wang, Pengcheng, et al.
Pubblicazione: (2025)
TurnGuide: Enhancing Meaningful Full Duplex Spoken Interactions via Dynamic Turn-Level Text-Speech Interleaving
di: Cui, Wenqian, et al.
Pubblicazione: (2025)
di: Cui, Wenqian, et al.
Pubblicazione: (2025)
Full-Duplex-Bench: A Benchmark to Evaluate Full-duplex Spoken Dialogue Models on Turn-taking Capabilities
di: Lin, Guan-Ting, et al.
Pubblicazione: (2025)
di: Lin, Guan-Ting, et al.
Pubblicazione: (2025)
From Turn-Taking to Synchronous Dialogue: A Survey of Full-Duplex Spoken Language Models
di: Chen, Yuxuan, et al.
Pubblicazione: (2025)
di: Chen, Yuxuan, et al.
Pubblicazione: (2025)
Learning Fine-Grained Controllability on Speech Generation via Efficient Fine-Tuning
di: Chien, Chung-Ming, et al.
Pubblicazione: (2024)
di: Chien, Chung-Ming, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Continuous Audio Language Models
di: Rouard, Simon, et al.
Pubblicazione: (2025) -
Moshi: a speech-text foundation model for real-time dialogue
di: Défossez, Alexandre, et al.
Pubblicazione: (2024) -
MAD Speech: Measures of Acoustic Diversity of Speech
di: Futeral, Matthieu, et al.
Pubblicazione: (2024) -
Simultaneous Speech-to-Speech Translation Without Aligned Data
di: Labiausse, Tom, et al.
Pubblicazione: (2026) -
High-Fidelity Simultaneous Speech-To-Speech Translation
di: Labiausse, Tom, et al.
Pubblicazione: (2025)