ESPnet-SDS: Unified Toolkit and Demo for Spoken Dialogue Systems
Fuente:
arXiv
Guardado en:
| Autores principales: | Arora, Siddhant, Peng, Yifan, Shi, Jiatong, Tian, Jinchuan, Chen, William, Bharadwaj, Shikhar, Futami, Hayato, Kashiwagi, Yosuke, Tsunoo, Emiru, Shimizu, Shuichiro, Srivastav, Vaibhav, Watanabe, Shinji |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Chain-of-Thought Reasoning in Streaming Full-Duplex End-to-End Spoken Dialogue Systems
por: Arora, Siddhant, et al.
Publicado: (2025)
por: Arora, Siddhant, et al.
Publicado: (2025)
Optimizing Conversational Quality in Spoken Dialogue Systems with Reinforcement Learning from AI Feedback
por: Arora, Siddhant, et al.
Publicado: (2026)
por: Arora, Siddhant, et al.
Publicado: (2026)
Finding Task-specific Subnetworks in Multi-task Spoken Language Understanding Model
por: Futami, Hayato, et al.
Publicado: (2024)
por: Futami, Hayato, et al.
Publicado: (2024)
Chain-of-Thought Training for Open E2E Spoken Dialogue Systems
por: Arora, Siddhant, et al.
Publicado: (2025)
por: Arora, Siddhant, et al.
Publicado: (2025)
Spiralformer: Low Latency Encoder for Streaming Speech Recognition with Circular Layer Skipping and Early Exiting
por: Tsunoo, Emiru, et al.
Publicado: (2025)
por: Tsunoo, Emiru, et al.
Publicado: (2025)
Rapid Language Adaptation for Multilingual E2E Speech Recognition Using Encoder Prompting
por: Kashiwagi, Yosuke, et al.
Publicado: (2024)
por: Kashiwagi, Yosuke, et al.
Publicado: (2024)
Decoder-only Architecture for Speech Recognition with CTC Prompts and Text Data Augmentation
por: Tsunoo, Emiru, et al.
Publicado: (2023)
por: Tsunoo, Emiru, et al.
Publicado: (2023)
Hypothesis Clustering and Merging: Novel MultiTalker Speech Recognition with Speaker Tokens
por: Kashiwagi, Yosuke, et al.
Publicado: (2024)
por: Kashiwagi, Yosuke, et al.
Publicado: (2024)
Decoder-only Architecture for Streaming End-to-end Speech Recognition
por: Tsunoo, Emiru, et al.
Publicado: (2024)
por: Tsunoo, Emiru, et al.
Publicado: (2024)
Scheduled Interleaved Speech-Text Training for Speech-to-Speech Translation with LLMs
por: Futami, Hayato, et al.
Publicado: (2025)
por: Futami, Hayato, et al.
Publicado: (2025)
Phonological Tokenizer: Prosody-Aware Phonetic Token via Multi-Objective Fine-Tuning with Differentiable K-Means
por: Onda, Kentaro, et al.
Publicado: (2026)
por: Onda, Kentaro, et al.
Publicado: (2026)
Differentiable K-means for Fully-optimized Discrete Token-based ASR
por: Onda, Kentaro, et al.
Publicado: (2025)
por: Onda, Kentaro, et al.
Publicado: (2025)
UniverSLU: Universal Spoken Language Understanding for Diverse Tasks with Natural Language Instructions
por: Arora, Siddhant, et al.
Publicado: (2023)
por: Arora, Siddhant, et al.
Publicado: (2023)
Whale: Large-Scale multilingual ASR model with w2v-BERT and E-Branchformer with large speech data
por: Kashiwagi, Yosuke, et al.
Publicado: (2025)
por: Kashiwagi, Yosuke, et al.
Publicado: (2025)
Task Arithmetic for Language Expansion in Speech Translation
por: Cheng, Yao-Fei, et al.
Publicado: (2024)
por: Cheng, Yao-Fei, et al.
Publicado: (2024)
ESPnet-EZ: Python-only ESPnet for Easy Fine-tuning and Integration
por: Someki, Masao, et al.
Publicado: (2024)
por: Someki, Masao, et al.
Publicado: (2024)
ESPnet-SpeechLM: An Open Speech Language Model Toolkit
por: Tian, Jinchuan, et al.
Publicado: (2025)
por: Tian, Jinchuan, et al.
Publicado: (2025)
SingingSDS: A Singing-Capable Spoken Dialogue System for Conversational Roleplay Applications
por: Han, Jionghao, et al.
Publicado: (2025)
por: Han, Jionghao, et al.
Publicado: (2025)
Muskits-ESPnet: A Comprehensive Toolkit for Singing Voice Synthesis in New Paradigm
por: Wu, Yuning, et al.
Publicado: (2024)
por: Wu, Yuning, et al.
Publicado: (2024)
OpusLM: A Family of Open Unified Speech Language Models
por: Tian, Jinchuan, et al.
Publicado: (2025)
por: Tian, Jinchuan, et al.
Publicado: (2025)
DialogueSidon: Recovering Full-Duplex Dialogue Tracks from In-the-Wild Dialogue Audio
por: Nakata, Wataru, et al.
Publicado: (2026)
por: Nakata, Wataru, et al.
Publicado: (2026)
EmoNews: A Spoken Dialogue System for Expressive News Conversations
por: Matsuura, Ryuki, et al.
Publicado: (2025)
por: Matsuura, Ryuki, et al.
Publicado: (2025)
Benchmarking Training Paradigms, Dataset Composition, and Model Scaling for Child ASR in ESPnet
por: Ying, Anyu, et al.
Publicado: (2025)
por: Ying, Anyu, et al.
Publicado: (2025)
ARECHO: Autoregressive Evaluation via Chain-Based Hypothesis Optimization for Speech Multi-Metric Estimation
por: Shi, Jiatong, et al.
Publicado: (2025)
por: Shi, Jiatong, et al.
Publicado: (2025)
ESPnet-Codec: Comprehensive Training and Evaluation of Neural Codecs for Audio, Music, and Speech
por: Shi, Jiatong, et al.
Publicado: (2024)
por: Shi, Jiatong, et al.
Publicado: (2024)
LALM-as-a-Judge: Benchmarking Large Audio-Language Models for Safety Evaluation in Multi-Turn Spoken Dialogues
por: Ivry, Amir, et al.
Publicado: (2026)
por: Ivry, Amir, et al.
Publicado: (2026)
Full-Duplex-Bench-v2: A Multi-Turn Evaluation Framework for Duplex Dialogue Systems with an Automated Examiner
por: Lin, Guan-Ting, et al.
Publicado: (2025)
por: Lin, Guan-Ting, et al.
Publicado: (2025)
On The Landscape of Spoken Language Models: A Comprehensive Survey
por: Arora, Siddhant, et al.
Publicado: (2025)
por: Arora, Siddhant, et al.
Publicado: (2025)
ESPnet-SPK: full pipeline speaker embedding toolkit with reproducible recipes, self-supervised front-ends, and off-the-shelf models
por: Jung, Jee-weon, et al.
Publicado: (2024)
por: Jung, Jee-weon, et al.
Publicado: (2024)
VERSA: A Versatile Evaluation Toolkit for Speech, Audio, and Music
por: Shi, Jiatong, et al.
Publicado: (2024)
por: Shi, Jiatong, et al.
Publicado: (2024)
Do Neural Codecs Generalize? A Controlled Study Across Unseen Languages and Non-Speech Tasks
por: Wang, Shih-Heng, et al.
Publicado: (2026)
por: Wang, Shih-Heng, et al.
Publicado: (2026)
Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training
por: Udupa, Sathvik, et al.
Publicado: (2025)
por: Udupa, Sathvik, et al.
Publicado: (2025)
Semi-Autoregressive Streaming ASR With Label Context
por: Arora, Siddhant, et al.
Publicado: (2023)
por: Arora, Siddhant, et al.
Publicado: (2023)
Causal Speech Enhancement with Predicting Semantics based on Quantized Self-supervised Learning Features
por: Tsunoo, Emiru, et al.
Publicado: (2024)
por: Tsunoo, Emiru, et al.
Publicado: (2024)
OWSM v3.1: Better and Faster Open Whisper-Style Speech Models based on E-Branchformer
por: Peng, Yifan, et al.
Publicado: (2024)
por: Peng, Yifan, et al.
Publicado: (2024)
Stream RAG: Instant and Accurate Spoken Dialogue Systems with Streaming Tool Usage
por: Arora, Siddhant, et al.
Publicado: (2025)
por: Arora, Siddhant, et al.
Publicado: (2025)
BSCodec: A Band-Split Neural Codec for High-Quality Universal Audio Reconstruction
por: Wang, Haoran, et al.
Publicado: (2025)
por: Wang, Haoran, et al.
Publicado: (2025)
Joint Beam Search Integrating CTC, Attention, and Transducer Decoders
por: Sudo, Yui, et al.
Publicado: (2024)
por: Sudo, Yui, et al.
Publicado: (2024)
LibriTTS-VI: A Public Corpus and Novel Methods for Efficient Voice Impression Control
por: Ohmura, Junki, et al.
Publicado: (2025)
por: Ohmura, Junki, et al.
Publicado: (2025)
Preference Alignment Improves Language Model-Based TTS
por: Tian, Jinchuan, et al.
Publicado: (2024)
por: Tian, Jinchuan, et al.
Publicado: (2024)
Ejemplares similares
-
Chain-of-Thought Reasoning in Streaming Full-Duplex End-to-End Spoken Dialogue Systems
por: Arora, Siddhant, et al.
Publicado: (2025) -
Optimizing Conversational Quality in Spoken Dialogue Systems with Reinforcement Learning from AI Feedback
por: Arora, Siddhant, et al.
Publicado: (2026) -
Finding Task-specific Subnetworks in Multi-task Spoken Language Understanding Model
por: Futami, Hayato, et al.
Publicado: (2024) -
Chain-of-Thought Training for Open E2E Spoken Dialogue Systems
por: Arora, Siddhant, et al.
Publicado: (2025) -
Spiralformer: Low Latency Encoder for Streaming Speech Recognition with Circular Layer Skipping and Early Exiting
por: Tsunoo, Emiru, et al.
Publicado: (2025)