Chain-of-Thought Training for Open E2E Spoken Dialogue Systems
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Arora, Siddhant, Tian, Jinchuan, Futami, Hayato, Jung, Jee-weon, Shi, Jiatong, Kashiwagi, Yosuke, Tsunoo, Emiru, Watanabe, Shinji |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Chain-of-Thought Reasoning in Streaming Full-Duplex End-to-End Spoken Dialogue Systems
par: Arora, Siddhant, et autres
Publié: (2025)
par: Arora, Siddhant, et autres
Publié: (2025)
Rapid Language Adaptation for Multilingual E2E Speech Recognition Using Encoder Prompting
par: Kashiwagi, Yosuke, et autres
Publié: (2024)
par: Kashiwagi, Yosuke, et autres
Publié: (2024)
Decoder-only Architecture for Speech Recognition with CTC Prompts and Text Data Augmentation
par: Tsunoo, Emiru, et autres
Publié: (2023)
par: Tsunoo, Emiru, et autres
Publié: (2023)
Spiralformer: Low Latency Encoder for Streaming Speech Recognition with Circular Layer Skipping and Early Exiting
par: Tsunoo, Emiru, et autres
Publié: (2025)
par: Tsunoo, Emiru, et autres
Publié: (2025)
Hypothesis Clustering and Merging: Novel MultiTalker Speech Recognition with Speaker Tokens
par: Kashiwagi, Yosuke, et autres
Publié: (2024)
par: Kashiwagi, Yosuke, et autres
Publié: (2024)
UniverSLU: Universal Spoken Language Understanding for Diverse Tasks with Natural Language Instructions
par: Arora, Siddhant, et autres
Publié: (2023)
par: Arora, Siddhant, et autres
Publié: (2023)
ESPnet-SDS: Unified Toolkit and Demo for Spoken Dialogue Systems
par: Arora, Siddhant, et autres
Publié: (2025)
par: Arora, Siddhant, et autres
Publié: (2025)
Finding Task-specific Subnetworks in Multi-task Spoken Language Understanding Model
par: Futami, Hayato, et autres
Publié: (2024)
par: Futami, Hayato, et autres
Publié: (2024)
Differentiable K-means for Fully-optimized Discrete Token-based ASR
par: Onda, Kentaro, et autres
Publié: (2025)
par: Onda, Kentaro, et autres
Publié: (2025)
Scheduled Interleaved Speech-Text Training for Speech-to-Speech Translation with LLMs
par: Futami, Hayato, et autres
Publié: (2025)
par: Futami, Hayato, et autres
Publié: (2025)
Decoder-only Architecture for Streaming End-to-end Speech Recognition
par: Tsunoo, Emiru, et autres
Publié: (2024)
par: Tsunoo, Emiru, et autres
Publié: (2024)
Optimizing Conversational Quality in Spoken Dialogue Systems with Reinforcement Learning from AI Feedback
par: Arora, Siddhant, et autres
Publié: (2026)
par: Arora, Siddhant, et autres
Publié: (2026)
Whale: Large-Scale multilingual ASR model with w2v-BERT and E-Branchformer with large speech data
par: Kashiwagi, Yosuke, et autres
Publié: (2025)
par: Kashiwagi, Yosuke, et autres
Publié: (2025)
Improving Design of Input Condition Invariant Speech Enhancement
par: Zhang, Wangyou, et autres
Publié: (2024)
par: Zhang, Wangyou, et autres
Publié: (2024)
DialogueSidon: Recovering Full-Duplex Dialogue Tracks from In-the-Wild Dialogue Audio
par: Nakata, Wataru, et autres
Publié: (2026)
par: Nakata, Wataru, et autres
Publié: (2026)
On the Evaluation of Speech Foundation Models for Spoken Language Understanding
par: Arora, Siddhant, et autres
Publié: (2024)
par: Arora, Siddhant, et autres
Publié: (2024)
Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training
par: Udupa, Sathvik, et autres
Publié: (2025)
par: Udupa, Sathvik, et autres
Publié: (2025)
ARECHO: Autoregressive Evaluation via Chain-Based Hypothesis Optimization for Speech Multi-Metric Estimation
par: Shi, Jiatong, et autres
Publié: (2025)
par: Shi, Jiatong, et autres
Publié: (2025)
Beyond Performance Plateaus: A Comprehensive Study on Scalability in Speech Enhancement
par: Zhang, Wangyou, et autres
Publié: (2024)
par: Zhang, Wangyou, et autres
Publié: (2024)
Phonological Tokenizer: Prosody-Aware Phonetic Token via Multi-Objective Fine-Tuning with Differentiable K-Means
par: Onda, Kentaro, et autres
Publié: (2026)
par: Onda, Kentaro, et autres
Publié: (2026)
LALM-as-a-Judge: Benchmarking Large Audio-Language Models for Safety Evaluation in Multi-Turn Spoken Dialogues
par: Ivry, Amir, et autres
Publié: (2026)
par: Ivry, Amir, et autres
Publié: (2026)
Causal Speech Enhancement with Predicting Semantics based on Quantized Self-supervised Learning Features
par: Tsunoo, Emiru, et autres
Publié: (2024)
par: Tsunoo, Emiru, et autres
Publié: (2024)
Beyond Silence: Bias Analysis through Loss and Asymmetric Approach in Audio Anti-Spoofing
par: Shim, Hye-jin, et autres
Publié: (2024)
par: Shim, Hye-jin, et autres
Publié: (2024)
EFFUSE: Efficient Self-Supervised Feature Fusion for E2E ASR in Low Resource and Multilingual Scenarios
par: Srivastava, Tejes, et autres
Publié: (2023)
par: Srivastava, Tejes, et autres
Publié: (2023)
Improving Audio Captioning Models with Fine-grained Audio Features, Text Embedding Supervision, and LLM Mix-up Augmentation
par: Wu, Shih-Lun, et autres
Publié: (2023)
par: Wu, Shih-Lun, et autres
Publié: (2023)
OpusLM: A Family of Open Unified Speech Language Models
par: Tian, Jinchuan, et autres
Publié: (2025)
par: Tian, Jinchuan, et autres
Publié: (2025)
Voxtlm: unified decoder-only models for consolidating speech recognition/synthesis and speech/text continuation tasks
par: Maiti, Soumi, et autres
Publié: (2023)
par: Maiti, Soumi, et autres
Publié: (2023)
ESPnet-SPK: full pipeline speaker embedding toolkit with reproducible recipes, self-supervised front-ends, and off-the-shelf models
par: Jung, Jee-weon, et autres
Publié: (2024)
par: Jung, Jee-weon, et autres
Publié: (2024)
LibriTTS-VI: A Public Corpus and Novel Methods for Efficient Voice Impression Control
par: Ohmura, Junki, et autres
Publié: (2025)
par: Ohmura, Junki, et autres
Publié: (2025)
ESPnet-Codec: Comprehensive Training and Evaluation of Neural Codecs for Audio, Music, and Speech
par: Shi, Jiatong, et autres
Publié: (2024)
par: Shi, Jiatong, et autres
Publié: (2024)
PURE Codec: Progressive Unfolding of Residual Entropy for Speech Codec Learning
par: Shi, Jiatong, et autres
Publié: (2025)
par: Shi, Jiatong, et autres
Publié: (2025)
Do Neural Codecs Generalize? A Controlled Study Across Unseen Languages and Non-Speech Tasks
par: Wang, Shih-Heng, et autres
Publié: (2026)
par: Wang, Shih-Heng, et autres
Publié: (2026)
Semi-Autoregressive Streaming ASR With Label Context
par: Arora, Siddhant, et autres
Publié: (2023)
par: Arora, Siddhant, et autres
Publié: (2023)
Stream RAG: Instant and Accurate Spoken Dialogue Systems with Streaming Tool Usage
par: Arora, Siddhant, et autres
Publié: (2025)
par: Arora, Siddhant, et autres
Publié: (2025)
OWSM v3.1: Better and Faster Open Whisper-Style Speech Models based on E-Branchformer
par: Peng, Yifan, et autres
Publié: (2024)
par: Peng, Yifan, et autres
Publié: (2024)
Uni-VERSA: Versatile Speech Assessment with a Unified Network
par: Shi, Jiatong, et autres
Publié: (2025)
par: Shi, Jiatong, et autres
Publié: (2025)
Can you Remove the Downstream Model for Speaker Recognition with Self-Supervised Speech Features?
par: Aldeneh, Zakaria, et autres
Publié: (2024)
par: Aldeneh, Zakaria, et autres
Publié: (2024)
Speaker-IPL: Unsupervised Learning of Speaker Characteristics with i-Vector based Pseudo-Labels
par: Aldeneh, Zakaria, et autres
Publié: (2024)
par: Aldeneh, Zakaria, et autres
Publié: (2024)
Disentangled Representation Learning for Environment-agnostic Speaker Recognition
par: Nam, KiHyun, et autres
Publié: (2024)
par: Nam, KiHyun, et autres
Publié: (2024)
On The Landscape of Spoken Language Models: A Comprehensive Survey
par: Arora, Siddhant, et autres
Publié: (2025)
par: Arora, Siddhant, et autres
Publié: (2025)
Documents similaires
-
Chain-of-Thought Reasoning in Streaming Full-Duplex End-to-End Spoken Dialogue Systems
par: Arora, Siddhant, et autres
Publié: (2025) -
Rapid Language Adaptation for Multilingual E2E Speech Recognition Using Encoder Prompting
par: Kashiwagi, Yosuke, et autres
Publié: (2024) -
Decoder-only Architecture for Speech Recognition with CTC Prompts and Text Data Augmentation
par: Tsunoo, Emiru, et autres
Publié: (2023) -
Spiralformer: Low Latency Encoder for Streaming Speech Recognition with Circular Layer Skipping and Early Exiting
par: Tsunoo, Emiru, et autres
Publié: (2025) -
Hypothesis Clustering and Merging: Novel MultiTalker Speech Recognition with Speaker Tokens
par: Kashiwagi, Yosuke, et autres
Publié: (2024)