Enregistré dans:
| Auteurs principaux: | Arora, Siddhant, Lu, Zhiyun, Chiu, Chung-Cheng, Pang, Ruoming, Watanabe, Shinji |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2503.01174 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Prompt-Guided Turn-Taking Prediction
par: Inoue, Koji, et autres
Publié: (2025)
par: Inoue, Koji, et autres
Publié: (2025)
Semi-Autoregressive Streaming ASR With Label Context
par: Arora, Siddhant, et autres
Publié: (2023)
par: Arora, Siddhant, et autres
Publié: (2023)
LALM-as-a-Judge: Benchmarking Large Audio-Language Models for Safety Evaluation in Multi-Turn Spoken Dialogues
par: Ivry, Amir, et autres
Publié: (2026)
par: Ivry, Amir, et autres
Publié: (2026)
Spiralformer: Low Latency Encoder for Streaming Speech Recognition with Circular Layer Skipping and Early Exiting
par: Tsunoo, Emiru, et autres
Publié: (2025)
par: Tsunoo, Emiru, et autres
Publié: (2025)
Rapid Language Adaptation for Multilingual E2E Speech Recognition Using Encoder Prompting
par: Kashiwagi, Yosuke, et autres
Publié: (2024)
par: Kashiwagi, Yosuke, et autres
Publié: (2024)
Hypothesis Clustering and Merging: Novel MultiTalker Speech Recognition with Speaker Tokens
par: Kashiwagi, Yosuke, et autres
Publié: (2024)
par: Kashiwagi, Yosuke, et autres
Publié: (2024)
DualTurn: Learning Turn-Taking from Dual-Channel Generative Speech Pretraining
par: Rajaa, Shangeth
Publié: (2026)
par: Rajaa, Shangeth
Publié: (2026)
On the Evaluation of Speech Foundation Models for Spoken Language Understanding
par: Arora, Siddhant, et autres
Publié: (2024)
par: Arora, Siddhant, et autres
Publié: (2024)
Chain-of-Thought Reasoning in Streaming Full-Duplex End-to-End Spoken Dialogue Systems
par: Arora, Siddhant, et autres
Publié: (2025)
par: Arora, Siddhant, et autres
Publié: (2025)
Scheduled Interleaved Speech-Text Training for Speech-to-Speech Translation with LLMs
par: Futami, Hayato, et autres
Publié: (2025)
par: Futami, Hayato, et autres
Publié: (2025)
From Turn-Taking to Synchronous Dialogue: A Survey of Full-Duplex Spoken Language Models
par: Chen, Yuxuan, et autres
Publié: (2025)
par: Chen, Yuxuan, et autres
Publié: (2025)
On The Landscape of Spoken Language Models: A Comprehensive Survey
par: Arora, Siddhant, et autres
Publié: (2025)
par: Arora, Siddhant, et autres
Publié: (2025)
TurnGuide: Enhancing Meaningful Full Duplex Spoken Interactions via Dynamic Turn-Level Text-Speech Interleaving
par: Cui, Wenqian, et autres
Publié: (2025)
par: Cui, Wenqian, et autres
Publié: (2025)
Chain-of-Thought Training for Open E2E Spoken Dialogue Systems
par: Arora, Siddhant, et autres
Publié: (2025)
par: Arora, Siddhant, et autres
Publié: (2025)
UniverSLU: Universal Spoken Language Understanding for Diverse Tasks with Natural Language Instructions
par: Arora, Siddhant, et autres
Publié: (2023)
par: Arora, Siddhant, et autres
Publié: (2023)
OWSM-CTC: An Open Encoder-Only Speech Foundation Model for Speech Recognition, Translation, and Language Identification
par: Peng, Yifan, et autres
Publié: (2024)
par: Peng, Yifan, et autres
Publié: (2024)
OpusLM: A Family of Open Unified Speech Language Models
par: Tian, Jinchuan, et autres
Publié: (2025)
par: Tian, Jinchuan, et autres
Publié: (2025)
On the Effects of Heterogeneous Data Sources on Speech-to-Text Foundation Models
par: Tian, Jinchuan, et autres
Publié: (2024)
par: Tian, Jinchuan, et autres
Publié: (2024)
YODAS: Youtube-Oriented Dataset for Audio and Speech
par: Li, Xinjian, et autres
Publié: (2024)
par: Li, Xinjian, et autres
Publié: (2024)
Lla-VAP: LSTM Ensemble of Llama and VAP for Turn-Taking Prediction
par: Jeon, Hyunbae, et autres
Publié: (2024)
par: Jeon, Hyunbae, et autres
Publié: (2024)
ESPnet-SDS: Unified Toolkit and Demo for Spoken Dialogue Systems
par: Arora, Siddhant, et autres
Publié: (2025)
par: Arora, Siddhant, et autres
Publié: (2025)
Decoder-only Architecture for Speech Recognition with CTC Prompts and Text Data Augmentation
par: Tsunoo, Emiru, et autres
Publié: (2023)
par: Tsunoo, Emiru, et autres
Publié: (2023)
Multilingual Turn-taking Prediction Using Voice Activity Projection
par: Inoue, Koji, et autres
Publié: (2024)
par: Inoue, Koji, et autres
Publié: (2024)
Visual Cues Support Robust Turn-taking Prediction in Noise
par: Russell, Sam O'Connor, et autres
Publié: (2025)
par: Russell, Sam O'Connor, et autres
Publié: (2025)
BLAB: Brutally Long Audio Bench
par: Ahia, Orevaoghene, et autres
Publié: (2025)
par: Ahia, Orevaoghene, et autres
Publié: (2025)
Contextualized Automatic Speech Recognition with Dynamic Vocabulary
par: Sudo, Yui, et autres
Publié: (2024)
par: Sudo, Yui, et autres
Publié: (2024)
ESPnet-SpeechLM: An Open Speech Language Model Toolkit
par: Tian, Jinchuan, et autres
Publié: (2025)
par: Tian, Jinchuan, et autres
Publié: (2025)
Generating Data with Text-to-Speech and Large-Language Models for Conversational Speech Recognition
par: Cornell, Samuele, et autres
Publié: (2024)
par: Cornell, Samuele, et autres
Publié: (2024)
Improving Multilingual Speech Models on ML-SUPERB 2.0: Fine-tuning with Data Augmentation and LID-Aware CTC
par: Wang, Qingzheng, et autres
Publié: (2025)
par: Wang, Qingzheng, et autres
Publié: (2025)
DeepDialogue: A Multi-Turn Emotionally-Rich Spoken Dialogue Dataset
par: Koudounas, Alkis, et autres
Publié: (2025)
par: Koudounas, Alkis, et autres
Publié: (2025)
AudioBench: A Universal Benchmark for Audio Large Language Models
par: Wang, Bin, et autres
Publié: (2024)
par: Wang, Bin, et autres
Publié: (2024)
ML-SUPERB: Multilingual Speech Universal PERformance Benchmark
par: Shi, Jiatong, et autres
Publié: (2023)
par: Shi, Jiatong, et autres
Publié: (2023)
Speaker-Reasoner: Scaling Interaction Turns and Reasoning Patterns for Timestamped Speaker-Attributed ASR
par: Lin, Zhennan, et autres
Publié: (2026)
par: Lin, Zhennan, et autres
Publié: (2026)
DYNAC: Dynamic Vocabulary based Non-Autoregressive Contextualization for Speech Recognition
par: Sudo, Yui, et autres
Publié: (2025)
par: Sudo, Yui, et autres
Publié: (2025)
Contextualized End-to-end Automatic Speech Recognition with Intermediate Biasing Loss
par: Shakeel, Muhammad, et autres
Publié: (2024)
par: Shakeel, Muhammad, et autres
Publié: (2024)
Joint Optimization of Streaming and Non-Streaming Automatic Speech Recognition with Multi-Decoder and Knowledge Distillation
par: Shakeel, Muhammad, et autres
Publié: (2024)
par: Shakeel, Muhammad, et autres
Publié: (2024)
Improving Multilingual ASR in the Wild Using Simple N-best Re-ranking
par: Yan, Brian, et autres
Publié: (2024)
par: Yan, Brian, et autres
Publié: (2024)
CALM: Joint Contextual Acoustic-Linguistic Modeling for Personalization of Multi-Speaker ASR
par: Shakeel, Muhammad, et autres
Publié: (2026)
par: Shakeel, Muhammad, et autres
Publié: (2026)
Hallucination Benchmark for Speech Foundation Models
par: Koudounas, Alkis, et autres
Publié: (2025)
par: Koudounas, Alkis, et autres
Publié: (2025)
ML-SUPERB 2.0: Benchmarking Multilingual Speech Models Across Modeling Constraints, Languages, and Datasets
par: Shi, Jiatong, et autres
Publié: (2024)
par: Shi, Jiatong, et autres
Publié: (2024)
Documents similaires
-
Prompt-Guided Turn-Taking Prediction
par: Inoue, Koji, et autres
Publié: (2025) -
Semi-Autoregressive Streaming ASR With Label Context
par: Arora, Siddhant, et autres
Publié: (2023) -
LALM-as-a-Judge: Benchmarking Large Audio-Language Models for Safety Evaluation in Multi-Turn Spoken Dialogues
par: Ivry, Amir, et autres
Publié: (2026) -
Spiralformer: Low Latency Encoder for Streaming Speech Recognition with Circular Layer Skipping and Early Exiting
par: Tsunoo, Emiru, et autres
Publié: (2025) -
Rapid Language Adaptation for Multilingual E2E Speech Recognition Using Encoder Prompting
par: Kashiwagi, Yosuke, et autres
Publié: (2024)