On the Robust Approximation of ASR Metrics
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Waheed, Abdul, Atwany, Hanin, Singh, Rita, Raj, Bhiksha |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
What Do Speech Foundation Models Not Learn About Speech?
par: Waheed, Abdul, et autres
Publié: (2024)
par: Waheed, Abdul, et autres
Publié: (2024)
Lost in Transcription, Found in Distribution Shift: Demystifying Hallucination in Speech Foundation Models
par: Atwany, Hanin, et autres
Publié: (2025)
par: Atwany, Hanin, et autres
Publié: (2025)
Revisiting Acoustic Features for Robust ASR
par: Shah, Muhammad A., et autres
Publié: (2024)
par: Shah, Muhammad A., et autres
Publié: (2024)
uDistil-Whisper: Label-Free Data Filtering for Knowledge Distillation in Low-Data Regimes
par: Waheed, Abdul, et autres
Publié: (2024)
par: Waheed, Abdul, et autres
Publié: (2024)
DELULU: Discriminative Embedding Learning Using Latent Units for Speaker-Aware Self-Trained Speech Foundational Model
par: Baali, Massa, et autres
Publié: (2025)
par: Baali, Massa, et autres
Publié: (2025)
VideoJudge: Bootstrapping Enables Scalable Supervision of MLLM-as-a-Judge for Video Understanding
par: Waheed, Abdul, et autres
Publié: (2025)
par: Waheed, Abdul, et autres
Publié: (2025)
Less is More Tokens: Efficient Math Reasoning via Difficulty-Aware Chain-of-Thought Distillation
par: Waheed, Abdul, et autres
Publié: (2025)
par: Waheed, Abdul, et autres
Publié: (2025)
What and When to Learn: CURriculum Ranking Loss for Large-Scale Speaker Verification
par: Baali, Massa, et autres
Publié: (2026)
par: Baali, Massa, et autres
Publié: (2026)
SVeritas: Benchmark for Robust Speaker Verification under Diverse Conditions
par: Baali, Massa, et autres
Publié: (2025)
par: Baali, Massa, et autres
Publié: (2025)
On the Diversity of Synthetic Data and its Impact on Training Large Language Models
par: Chen, Hao, et autres
Publié: (2024)
par: Chen, Hao, et autres
Publié: (2024)
CAARMA: Class Augmentation with Adversarial Mixup Regularization
par: Baali, Massa, et autres
Publié: (2025)
par: Baali, Massa, et autres
Publié: (2025)
PDAF: A Phonetic Debiasing Attention Framework For Speaker Verification
par: Baali, Massa, et autres
Publié: (2024)
par: Baali, Massa, et autres
Publié: (2024)
Token Prediction as Implicit Classification to Identify LLM-Generated Text
par: Chen, Yutian, et autres
Publié: (2023)
par: Chen, Yutian, et autres
Publié: (2023)
No Encore: Unlearning as Opt-Out in Music Generation
par: Kim, Jinju, et autres
Publié: (2025)
par: Kim, Jinju, et autres
Publié: (2025)
To Distill or Not to Distill? On the Robustness of Robust Knowledge Distillation
par: Waheed, Abdul, et autres
Publié: (2024)
par: Waheed, Abdul, et autres
Publié: (2024)
CoLMbo: Speaker Language Model for Descriptive Profiling
par: Baali, Massa, et autres
Publié: (2025)
par: Baali, Massa, et autres
Publié: (2025)
Speech vs. Transcript: Does It Matter for Human Annotators in Speech Summarization?
par: Sharma, Roshan, et autres
Publié: (2024)
par: Sharma, Roshan, et autres
Publié: (2024)
PhoniTale: Phonologically Grounded Mnemonic Generation for Typologically Distant Language Pairs
par: Kang, Sana, et autres
Publié: (2025)
par: Kang, Sana, et autres
Publié: (2025)
JEEM: Vision-Language Understanding in Four Arabic Dialects
par: Kadaoui, Karima, et autres
Publié: (2025)
par: Kadaoui, Karima, et autres
Publié: (2025)
WhisperRT -- Turning Whisper into a Causal Streaming Model
par: Krichli, Tomer, et autres
Publié: (2025)
par: Krichli, Tomer, et autres
Publié: (2025)
On Code-Induced Reasoning in LLMs
par: Waheed, Abdul, et autres
Publié: (2025)
par: Waheed, Abdul, et autres
Publié: (2025)
Speech Robust Bench: A Robustness Benchmark For Speech Recognition
par: Shah, Muhammad A., et autres
Publié: (2024)
par: Shah, Muhammad A., et autres
Publié: (2024)
OleSpeech-IV: A Large-Scale Multispeaker and Multilingual Conversational Speech Dataset with Diverse Topics
par: Chu, Wei, et autres
Publié: (2025)
par: Chu, Wei, et autres
Publié: (2025)
Human Voice is Unique
par: Singh, Rita, et autres
Publié: (2025)
par: Singh, Rita, et autres
Publié: (2025)
Towards Zero-Shot Text-To-Speech for Arabic Dialects
par: Doan, Khai Duy, et autres
Publié: (2024)
par: Doan, Khai Duy, et autres
Publié: (2024)
Zero-Shot Context-Aware ASR for Diverse Arabic Varieties
par: Talafha, Bashar, et autres
Publié: (2025)
par: Talafha, Bashar, et autres
Publié: (2025)
LaMini-LM: A Diverse Herd of Distilled Models from Large-Scale Instructions
par: Wu, Minghao, et autres
Publié: (2023)
par: Wu, Minghao, et autres
Publié: (2023)
ASR Under Noise: Exploring Robustness for Sundanese and Javanese
par: Pranida, Salsabila Zahirah, et autres
Publié: (2025)
par: Pranida, Salsabila Zahirah, et autres
Publié: (2025)
AugSumm: towards generalizable speech summarization using synthetic labels from large language model
par: Jung, Jee-weon, et autres
Publié: (2024)
par: Jung, Jee-weon, et autres
Publié: (2024)
Explainable Disentanglement on Discrete Speech Representations for Noise-Robust ASR
par: Gopal, Shreyas, et autres
Publié: (2025)
par: Gopal, Shreyas, et autres
Publié: (2025)
AutoPRM: Automating Procedural Supervision for Multi-Step Reasoning via Controllable Question Decomposition
par: Chen, Zhaorun, et autres
Publié: (2024)
par: Chen, Zhaorun, et autres
Publié: (2024)
Building Robust and Scalable Multilingual ASR for Indian Languages
par: Gangwar, Arjun, et autres
Publié: (2025)
par: Gangwar, Arjun, et autres
Publié: (2025)
On Fairness of Unified Multimodal Large Language Model for Image Generation
par: Liu, Ming, et autres
Publié: (2025)
par: Liu, Ming, et autres
Publié: (2025)
LAHAJA: A Robust Multi-accent Benchmark for Evaluating Hindi ASR Systems
par: Javed, Tahir, et autres
Publié: (2024)
par: Javed, Tahir, et autres
Publié: (2024)
Evaluating and Improving Continual Learning in Spoken Language Understanding
par: Yang, Muqiao, et autres
Publié: (2024)
par: Yang, Muqiao, et autres
Publié: (2024)
NIM4-ASR: Towards Efficient, Robust, and Customizable Real-Time LLM-Based ASR
par: Xie, Yuan, et autres
Publié: (2026)
par: Xie, Yuan, et autres
Publié: (2026)
Robust ASR Error Correction with Conservative Data Filtering
par: Udagawa, Takuma, et autres
Publié: (2024)
par: Udagawa, Takuma, et autres
Publié: (2024)
Towards Pretraining Robust ASR Foundation Model with Acoustic-Aware Data Augmentation
par: Liu, Dancheng, et autres
Publié: (2025)
par: Liu, Dancheng, et autres
Publié: (2025)
Can We Trust LLMs for Mental Health Screening? Consistency, ASR Robustness, and Evidence Faithfulness
par: Loweimi, Erfan, et autres
Publié: (2026)
par: Loweimi, Erfan, et autres
Publié: (2026)
QDFormer: Towards Robust Audiovisual Segmentation in Complex Environments with Quantization-based Semantic Decomposition
par: Li, Xiang, et autres
Publié: (2023)
par: Li, Xiang, et autres
Publié: (2023)
Documents similaires
-
What Do Speech Foundation Models Not Learn About Speech?
par: Waheed, Abdul, et autres
Publié: (2024) -
Lost in Transcription, Found in Distribution Shift: Demystifying Hallucination in Speech Foundation Models
par: Atwany, Hanin, et autres
Publié: (2025) -
Revisiting Acoustic Features for Robust ASR
par: Shah, Muhammad A., et autres
Publié: (2024) -
uDistil-Whisper: Label-Free Data Filtering for Knowledge Distillation in Low-Data Regimes
par: Waheed, Abdul, et autres
Publié: (2024) -
DELULU: Discriminative Embedding Learning Using Latent Units for Speaker-Aware Self-Trained Speech Foundational Model
par: Baali, Massa, et autres
Publié: (2025)