Identifying and Calibrating Overconfidence in Noisy Speech Recognition
Fuente:
arXiv
Salvato in:
| Autori principali: | Huo, Mingyue, Zhang, Yuheng, Tang, Yan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
TagSpeech: End-to-End Multi-Speaker ASR and Diarization with Fine-Grained Temporal Grounding
di: Huo, Mingyue, et al.
Pubblicazione: (2026)
di: Huo, Mingyue, et al.
Pubblicazione: (2026)
Continual Test-time Adaptation for End-to-end Speech Recognition on Noisy Speech
di: Lin, Guan-Ting, et al.
Pubblicazione: (2024)
di: Lin, Guan-Ting, et al.
Pubblicazione: (2024)
Auden-Voice: General-Purpose Voice Encoder for Speech and Language Understanding
di: Huo, Mingyue, et al.
Pubblicazione: (2025)
di: Huo, Mingyue, et al.
Pubblicazione: (2025)
Noisy Disentanglement with Tri-stage Training for Noise-Robust Speech Recognition
di: Chen, Shuangyuan, et al.
Pubblicazione: (2025)
di: Chen, Shuangyuan, et al.
Pubblicazione: (2025)
Visual-Aware Speech Recognition for Noisy Scenarios
di: Balaji, Lakshmipathi, et al.
Pubblicazione: (2025)
di: Balaji, Lakshmipathi, et al.
Pubblicazione: (2025)
Speech Emotion Recognition Via CNN-Transformer and Multidimensional Attention Mechanism
di: Tang, Xiaoyu, et al.
Pubblicazione: (2024)
di: Tang, Xiaoyu, et al.
Pubblicazione: (2024)
End-to-End DOA-Guided Speech Extraction in Noisy Multi-Talker Scenarios
di: Jing, Kangqi, et al.
Pubblicazione: (2025)
di: Jing, Kangqi, et al.
Pubblicazione: (2025)
A Semi-spontaneous Dutch Speech Dataset for Speech Enhancement and Speech Recognition
di: de Groot, Dimme, et al.
Pubblicazione: (2026)
di: de Groot, Dimme, et al.
Pubblicazione: (2026)
Aligning Speech to Languages to Enhance Code-switching Speech Recognition
di: Liu, Hexin, et al.
Pubblicazione: (2024)
di: Liu, Hexin, et al.
Pubblicazione: (2024)
Beyond Speaker Identity: Text Guided Target Speech Extraction
di: Huo, Mingyue, et al.
Pubblicazione: (2025)
di: Huo, Mingyue, et al.
Pubblicazione: (2025)
Multilingual Speech Recognition Using Discrete Tokens with a Two-step Training Strategy
di: Li, Zehan, et al.
Pubblicazione: (2025)
di: Li, Zehan, et al.
Pubblicazione: (2025)
CEC: A Noisy Label Detection Method for Speaker Recognition
di: Shen, Yao, et al.
Pubblicazione: (2024)
di: Shen, Yao, et al.
Pubblicazione: (2024)
Fairness of Automatic Speech Recognition in Cleft Lip and Palate Speech
di: Bhattacharjee, Susmita, et al.
Pubblicazione: (2025)
di: Bhattacharjee, Susmita, et al.
Pubblicazione: (2025)
Adapting Speech Foundation Models for Unified Multimodal Speech Recognition with Large Language Models
di: Zhang, Jing-Xuan, et al.
Pubblicazione: (2025)
di: Zhang, Jing-Xuan, et al.
Pubblicazione: (2025)
Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models
di: Lin, Yuke, et al.
Pubblicazione: (2025)
di: Lin, Yuke, et al.
Pubblicazione: (2025)
Multi-Scale Temporal Transformer For Speech Emotion Recognition
di: Li, Zhipeng, et al.
Pubblicazione: (2024)
di: Li, Zhipeng, et al.
Pubblicazione: (2024)
AS-ASR: A Lightweight Framework for Aphasia-Specific Automatic Speech Recognition
di: Bao, Chen, et al.
Pubblicazione: (2025)
di: Bao, Chen, et al.
Pubblicazione: (2025)
Chunkwise Aligners for Streaming Speech Recognition
di: Teo, Wen Shen, et al.
Pubblicazione: (2026)
di: Teo, Wen Shen, et al.
Pubblicazione: (2026)
Coverage-Guaranteed Speech Emotion Recognition via Calibrated Uncertainty-Adaptive Prediction Sets
di: Jia, Zijun, et al.
Pubblicazione: (2025)
di: Jia, Zijun, et al.
Pubblicazione: (2025)
Speech-dependent Data Augmentation for Own Voice Reconstruction with Hearable Microphones in Noisy Environments
di: Ohlenbusch, Mattes, et al.
Pubblicazione: (2024)
di: Ohlenbusch, Mattes, et al.
Pubblicazione: (2024)
Exploiting Noise Inseparability for Weakly-Supervised Discriminative Speech Denoising Using Noisy Targets
di: Maciejewski, Matthew, et al.
Pubblicazione: (2026)
di: Maciejewski, Matthew, et al.
Pubblicazione: (2026)
Speaker Attributed Automatic Speech Recognition Using Speech Aware LLMS
di: Aronowitz, Hagai, et al.
Pubblicazione: (2026)
di: Aronowitz, Hagai, et al.
Pubblicazione: (2026)
Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems
di: Cui, Mingyu, et al.
Pubblicazione: (2025)
di: Cui, Mingyu, et al.
Pubblicazione: (2025)
Code-switching Speech Recognition Under the Lens: Model- and Data-Centric Perspectives
di: Liu, Hexin, et al.
Pubblicazione: (2025)
di: Liu, Hexin, et al.
Pubblicazione: (2025)
Group Relative Policy Optimization for Speech Recognition
di: Shivakumar, Prashanth Gurunath, et al.
Pubblicazione: (2025)
di: Shivakumar, Prashanth Gurunath, et al.
Pubblicazione: (2025)
DiTReducio: A Training-Free Acceleration for DiT-Based TTS via Progressive Calibration
di: Huo, Yanru, et al.
Pubblicazione: (2025)
di: Huo, Yanru, et al.
Pubblicazione: (2025)
Reasoning Beyond Majority Vote: An Explainable SpeechLM Framework for Speech Emotion Recognition
di: Su, Bo-Hao, et al.
Pubblicazione: (2025)
di: Su, Bo-Hao, et al.
Pubblicazione: (2025)
In-Materia Speech Recognition
di: Zolfagharinejad, Mohamadreza, et al.
Pubblicazione: (2024)
di: Zolfagharinejad, Mohamadreza, et al.
Pubblicazione: (2024)
Interpreting the Role of Visemes in Audio-Visual Speech Recognition
di: Papadopoulos, Aristeidis, et al.
Pubblicazione: (2025)
di: Papadopoulos, Aristeidis, et al.
Pubblicazione: (2025)
Unsupervised Online Continual Learning for Automatic Speech Recognition
di: Eeckt, Steven Vander, et al.
Pubblicazione: (2024)
di: Eeckt, Steven Vander, et al.
Pubblicazione: (2024)
Using Songs to Improve Kazakh Automatic Speech Recognition
di: Yeshpanov, Rustem
Pubblicazione: (2026)
di: Yeshpanov, Rustem
Pubblicazione: (2026)
Leveraging Content and Acoustic Representations for Speech Emotion Recognition
di: Dutta, Soumya, et al.
Pubblicazione: (2024)
di: Dutta, Soumya, et al.
Pubblicazione: (2024)
HYFuse: Aligning Heterogeneous Speech Pre-Trained Representations in Hyperbolic Space for Speech Emotion Recognition
di: Phukan, Orchid Chetia, et al.
Pubblicazione: (2025)
di: Phukan, Orchid Chetia, et al.
Pubblicazione: (2025)
Too Good to Be True: A Study on Modern Automatic Speech Recognition for the Evaluation of Speech Enhancement
di: de Oliveira, Danilo, et al.
Pubblicazione: (2026)
di: de Oliveira, Danilo, et al.
Pubblicazione: (2026)
Selective Invocation for Multilingual ASR: A Cost-effective Approach Adapting to Speech Recognition Difficulty
di: Xue, Hongfei, et al.
Pubblicazione: (2025)
di: Xue, Hongfei, et al.
Pubblicazione: (2025)
Transcription-Free Fine-Tuning of Speech Separation Models for Noisy and Reverberant Multi-Speaker Automatic Speech Recognition
di: Ravenscroft, William, et al.
Pubblicazione: (2024)
di: Ravenscroft, William, et al.
Pubblicazione: (2024)
PartialEdit: Identifying Partial Deepfakes in the Era of Neural Speech Editing
di: Zhang, You, et al.
Pubblicazione: (2025)
di: Zhang, You, et al.
Pubblicazione: (2025)
Few-shot Personalization via In-Context Learning for Speech Emotion Recognition based on Speech-Language Model
di: Ihori, Mana, et al.
Pubblicazione: (2025)
di: Ihori, Mana, et al.
Pubblicazione: (2025)
Disentangled-Transformer: An Explainable End-to-End Automatic Speech Recognition Model with Speech Content-Context Separation
di: Wang, Pu, et al.
Pubblicazione: (2024)
di: Wang, Pu, et al.
Pubblicazione: (2024)
Non-Intrusive Automatic Speech Recognition Refinement: A Survey
di: Peyghan, Mohammad Reza, et al.
Pubblicazione: (2025)
di: Peyghan, Mohammad Reza, et al.
Pubblicazione: (2025)
Documenti analoghi
-
TagSpeech: End-to-End Multi-Speaker ASR and Diarization with Fine-Grained Temporal Grounding
di: Huo, Mingyue, et al.
Pubblicazione: (2026) -
Continual Test-time Adaptation for End-to-end Speech Recognition on Noisy Speech
di: Lin, Guan-Ting, et al.
Pubblicazione: (2024) -
Auden-Voice: General-Purpose Voice Encoder for Speech and Language Understanding
di: Huo, Mingyue, et al.
Pubblicazione: (2025) -
Noisy Disentanglement with Tri-stage Training for Noise-Robust Speech Recognition
di: Chen, Shuangyuan, et al.
Pubblicazione: (2025) -
Visual-Aware Speech Recognition for Noisy Scenarios
di: Balaji, Lakshmipathi, et al.
Pubblicazione: (2025)