Interactive ASR: Towards Human-Like Interaction and Semantic Coherence Evaluation for Agentic Speech Recognition
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Peng, Zhu, Yanqiao, Jiang, Zixuan, Chen, Qinyuan, Zhao, Xingjian, Qiu, Xipeng, Wang, Wupeng, Gao, Zhifu, Li, Xiangang, Yu, Kai, Chen, Xie |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Explore the Reinforcement Learning for the LLM based ASR and TTS system
par: Gao, Changfeng, et autres
Publié: (2025)
par: Gao, Changfeng, et autres
Publié: (2025)
RAS: a Reliability Oriented Metric for Automatic Speech Recognition
par: Huang, Wenbin, et autres
Publié: (2026)
par: Huang, Wenbin, et autres
Publié: (2026)
Fun-ASR Technical Report
par: An, Keyu, et autres
Publié: (2025)
par: An, Keyu, et autres
Publié: (2025)
Seed-ASR: Understanding Diverse Speech and Contexts with LLM-based Speech Recognition
par: Bai, Ye, et autres
Publié: (2024)
par: Bai, Ye, et autres
Publié: (2024)
ZO-ASR: Zeroth-Order Fine-Tuning of Speech Foundation Models without Back-Propagation
par: Peng, Yuezhang, et autres
Publié: (2025)
par: Peng, Yuezhang, et autres
Publié: (2025)
XY-Tokenizer: Mitigating the Semantic-Acoustic Conflict in Low-Bitrate Speech Codecs
par: Gong, Yitian, et autres
Publié: (2025)
par: Gong, Yitian, et autres
Publié: (2025)
WESR: Scaling and Evaluating Word-level Event-Speech Recognition
par: Yang, Chenchen, et autres
Publié: (2026)
par: Yang, Chenchen, et autres
Publié: (2026)
ContextASR-Bench: A Massive Contextual Speech Recognition Benchmark
par: Wang, He, et autres
Publié: (2025)
par: Wang, He, et autres
Publié: (2025)
Speech Emotion Recognition with ASR Integration
par: Li, Yuanchao
Publié: (2026)
par: Li, Yuanchao
Publié: (2026)
Edge-ASR: Towards Low-Bit Quantization of Automatic Speech Recognition Models
par: Feng, Chen, et autres
Publié: (2025)
par: Feng, Chen, et autres
Publié: (2025)
SpeechAlign: Aligning Speech Generation to Human Preferences
par: Zhang, Dong, et autres
Publié: (2024)
par: Zhang, Dong, et autres
Publié: (2024)
Context-Aware Two-Step Training Scheme for Domain Invariant Speech Separation
par: Wang, Wupeng, et autres
Publié: (2025)
par: Wang, Wupeng, et autres
Publié: (2025)
Self-supervised ASR Models and Features For Dysarthric and Elderly Speech Recognition
par: Hu, Shujie, et autres
Publié: (2024)
par: Hu, Shujie, et autres
Publié: (2024)
CodecBench: A Comprehensive Benchmark for Acoustic and Semantic Evaluation
par: Deng, Ruifan, et autres
Publié: (2025)
par: Deng, Ruifan, et autres
Publié: (2025)
X-Talk: On the Underestimated Potential of Modular Speech-to-Speech Dialogue System
par: Liu, Zhanxun, et autres
Publié: (2025)
par: Liu, Zhanxun, et autres
Publié: (2025)
ICMC-ASR: The ICASSP 2024 In-Car Multi-Channel Automatic Speech Recognition Challenge
par: Wang, He, et autres
Publié: (2024)
par: Wang, He, et autres
Publié: (2024)
FireRedASR2S: A State-of-the-Art Industrial-Grade All-in-One Automatic Speech Recognition System
par: Xu, Kaituo, et autres
Publié: (2026)
par: Xu, Kaituo, et autres
Publié: (2026)
Human or Machine? A Preliminary Turing Test for Speech-to-Speech Interaction
par: Li, Xiang, et autres
Publié: (2026)
par: Li, Xiang, et autres
Publié: (2026)
NIM4-ASR: Towards Efficient, Robust, and Customizable Real-Time LLM-Based ASR
par: Xie, Yuan, et autres
Publié: (2026)
par: Xie, Yuan, et autres
Publié: (2026)
UniVocal: Unified Speech-Singing Code-Switching Synthesis
par: Shi, Yufei, et autres
Publié: (2026)
par: Shi, Yufei, et autres
Publié: (2026)
When Tone and Words Disagree: Towards Robust Speech Emotion Recognition under Acoustic-Semantic Conflict
par: Huang, Dawei, et autres
Publié: (2026)
par: Huang, Dawei, et autres
Publié: (2026)
FireRedASR: Open-Source Industrial-Grade Mandarin Speech Recognition Models from Encoder-Decoder to LLM Integration
par: Xu, Kai-Tuo, et autres
Publié: (2025)
par: Xu, Kai-Tuo, et autres
Publié: (2025)
Phoenix-VAD: Streaming Semantic Endpoint Detection for Full-Duplex Speech Interaction
par: Wu, Weijie, et autres
Publié: (2025)
par: Wu, Weijie, et autres
Publié: (2025)
Elevating Robust Multi-Talker ASR by Decoupling Speaker Separation and Speech Recognition
par: Yang, Yufeng, et autres
Publié: (2025)
par: Yang, Yufeng, et autres
Publié: (2025)
Causal Self-supervised Pretrained Frontend with Predictive Code for Speech Separation
par: Wang, Wupeng, et autres
Publié: (2025)
par: Wang, Wupeng, et autres
Publié: (2025)
Speech Separation with Pretrained Frontend to Minimize Domain Mismatch
par: Wang, Wupeng, et autres
Publié: (2024)
par: Wang, Wupeng, et autres
Publié: (2024)
Towards Robust Dysarthric Speech Recognition: LLM-Agent Post-ASR Correction Beyond WER
par: Zheng, Xiuwen, et autres
Publié: (2026)
par: Zheng, Xiuwen, et autres
Publié: (2026)
dLLM-ASR: A Faster Diffusion LLM-based Framework for Speech Recognition
par: Tian, Wenjie, et autres
Publié: (2026)
par: Tian, Wenjie, et autres
Publié: (2026)
Towards Decoupling Frontend Enhancement and Backend Recognition in Monaural Robust ASR
par: Yang, Yufeng, et autres
Publié: (2024)
par: Yang, Yufeng, et autres
Publié: (2024)
Speaker-Reasoner: Scaling Interaction Turns and Reasoning Patterns for Timestamped Speaker-Attributed ASR
par: Lin, Zhennan, et autres
Publié: (2026)
par: Lin, Zhennan, et autres
Publié: (2026)
Selective Invocation for Multilingual ASR: A Cost-effective Approach Adapting to Speech Recognition Difficulty
par: Xue, Hongfei, et autres
Publié: (2025)
par: Xue, Hongfei, et autres
Publié: (2025)
SpecASR: Accelerating LLM-based Automatic Speech Recognition via Speculative Decoding
par: Wei, Linye, et autres
Publié: (2025)
par: Wei, Linye, et autres
Publié: (2025)
SpeechJudge: Towards Human-Level Judgment for Speech Naturalness
par: Zhang, Xueyao, et autres
Publié: (2025)
par: Zhang, Xueyao, et autres
Publié: (2025)
CLiFT-ASR: A Cross-Lingual Fine-Tuning Framework for Low-Resource Taiwanese Hokkien Speech Recognition
par: Sung, Hung-Yang, et autres
Publié: (2025)
par: Sung, Hung-Yang, et autres
Publié: (2025)
Multi-Channel Speech Enhancement for Cocktail Party Speech Emotion Recognition
par: Chen, Youjun, et autres
Publié: (2026)
par: Chen, Youjun, et autres
Publié: (2026)
DCIM-AVSR : Efficient Audio-Visual Speech Recognition via Dual Conformer Interaction Module
par: Wang, Xinyu, et autres
Publié: (2024)
par: Wang, Xinyu, et autres
Publié: (2024)
Cross-Lingual F5-TTS: Towards Language-Agnostic Voice Cloning and Speech Synthesis
par: Liu, Qingyu, et autres
Publié: (2025)
par: Liu, Qingyu, et autres
Publié: (2025)
InstructTTSEval: Benchmarking Complex Natural-Language Instruction Following in Text-to-Speech Systems
par: Huang, Kexin, et autres
Publié: (2025)
par: Huang, Kexin, et autres
Publié: (2025)
VietASR: Achieving Industry-level Vietnamese ASR with 50-hour labeled data and Large-Scale Speech Pretraining
par: Zhuo, Jianheng, et autres
Publié: (2025)
par: Zhuo, Jianheng, et autres
Publié: (2025)
CLAR: CIF-Localized Alignment for Retrieval-Augmented Speech LLM-Based Contextual ASR
par: Huang, Shangkun, et autres
Publié: (2026)
par: Huang, Shangkun, et autres
Publié: (2026)
Documents similaires
-
Explore the Reinforcement Learning for the LLM based ASR and TTS system
par: Gao, Changfeng, et autres
Publié: (2025) -
RAS: a Reliability Oriented Metric for Automatic Speech Recognition
par: Huang, Wenbin, et autres
Publié: (2026) -
Fun-ASR Technical Report
par: An, Keyu, et autres
Publié: (2025) -
Seed-ASR: Understanding Diverse Speech and Contexts with LLM-based Speech Recognition
par: Bai, Ye, et autres
Publié: (2024) -
ZO-ASR: Zeroth-Order Fine-Tuning of Speech Foundation Models without Back-Propagation
par: Peng, Yuezhang, et autres
Publié: (2025)