On the Robust Approximation of ASR Metrics
Fuente:
arXiv
Guardado en:
| Autores principales: | Waheed, Abdul, Atwany, Hanin, Singh, Rita, Raj, Bhiksha |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
What Do Speech Foundation Models Not Learn About Speech?
por: Waheed, Abdul, et al.
Publicado: (2024)
por: Waheed, Abdul, et al.
Publicado: (2024)
Lost in Transcription, Found in Distribution Shift: Demystifying Hallucination in Speech Foundation Models
por: Atwany, Hanin, et al.
Publicado: (2025)
por: Atwany, Hanin, et al.
Publicado: (2025)
Revisiting Acoustic Features for Robust ASR
por: Shah, Muhammad A., et al.
Publicado: (2024)
por: Shah, Muhammad A., et al.
Publicado: (2024)
uDistil-Whisper: Label-Free Data Filtering for Knowledge Distillation in Low-Data Regimes
por: Waheed, Abdul, et al.
Publicado: (2024)
por: Waheed, Abdul, et al.
Publicado: (2024)
DELULU: Discriminative Embedding Learning Using Latent Units for Speaker-Aware Self-Trained Speech Foundational Model
por: Baali, Massa, et al.
Publicado: (2025)
por: Baali, Massa, et al.
Publicado: (2025)
VideoJudge: Bootstrapping Enables Scalable Supervision of MLLM-as-a-Judge for Video Understanding
por: Waheed, Abdul, et al.
Publicado: (2025)
por: Waheed, Abdul, et al.
Publicado: (2025)
Less is More Tokens: Efficient Math Reasoning via Difficulty-Aware Chain-of-Thought Distillation
por: Waheed, Abdul, et al.
Publicado: (2025)
por: Waheed, Abdul, et al.
Publicado: (2025)
What and When to Learn: CURriculum Ranking Loss for Large-Scale Speaker Verification
por: Baali, Massa, et al.
Publicado: (2026)
por: Baali, Massa, et al.
Publicado: (2026)
SVeritas: Benchmark for Robust Speaker Verification under Diverse Conditions
por: Baali, Massa, et al.
Publicado: (2025)
por: Baali, Massa, et al.
Publicado: (2025)
On the Diversity of Synthetic Data and its Impact on Training Large Language Models
por: Chen, Hao, et al.
Publicado: (2024)
por: Chen, Hao, et al.
Publicado: (2024)
CAARMA: Class Augmentation with Adversarial Mixup Regularization
por: Baali, Massa, et al.
Publicado: (2025)
por: Baali, Massa, et al.
Publicado: (2025)
PDAF: A Phonetic Debiasing Attention Framework For Speaker Verification
por: Baali, Massa, et al.
Publicado: (2024)
por: Baali, Massa, et al.
Publicado: (2024)
Token Prediction as Implicit Classification to Identify LLM-Generated Text
por: Chen, Yutian, et al.
Publicado: (2023)
por: Chen, Yutian, et al.
Publicado: (2023)
No Encore: Unlearning as Opt-Out in Music Generation
por: Kim, Jinju, et al.
Publicado: (2025)
por: Kim, Jinju, et al.
Publicado: (2025)
To Distill or Not to Distill? On the Robustness of Robust Knowledge Distillation
por: Waheed, Abdul, et al.
Publicado: (2024)
por: Waheed, Abdul, et al.
Publicado: (2024)
CoLMbo: Speaker Language Model for Descriptive Profiling
por: Baali, Massa, et al.
Publicado: (2025)
por: Baali, Massa, et al.
Publicado: (2025)
Speech vs. Transcript: Does It Matter for Human Annotators in Speech Summarization?
por: Sharma, Roshan, et al.
Publicado: (2024)
por: Sharma, Roshan, et al.
Publicado: (2024)
PhoniTale: Phonologically Grounded Mnemonic Generation for Typologically Distant Language Pairs
por: Kang, Sana, et al.
Publicado: (2025)
por: Kang, Sana, et al.
Publicado: (2025)
JEEM: Vision-Language Understanding in Four Arabic Dialects
por: Kadaoui, Karima, et al.
Publicado: (2025)
por: Kadaoui, Karima, et al.
Publicado: (2025)
WhisperRT -- Turning Whisper into a Causal Streaming Model
por: Krichli, Tomer, et al.
Publicado: (2025)
por: Krichli, Tomer, et al.
Publicado: (2025)
On Code-Induced Reasoning in LLMs
por: Waheed, Abdul, et al.
Publicado: (2025)
por: Waheed, Abdul, et al.
Publicado: (2025)
Speech Robust Bench: A Robustness Benchmark For Speech Recognition
por: Shah, Muhammad A., et al.
Publicado: (2024)
por: Shah, Muhammad A., et al.
Publicado: (2024)
OleSpeech-IV: A Large-Scale Multispeaker and Multilingual Conversational Speech Dataset with Diverse Topics
por: Chu, Wei, et al.
Publicado: (2025)
por: Chu, Wei, et al.
Publicado: (2025)
Human Voice is Unique
por: Singh, Rita, et al.
Publicado: (2025)
por: Singh, Rita, et al.
Publicado: (2025)
Towards Zero-Shot Text-To-Speech for Arabic Dialects
por: Doan, Khai Duy, et al.
Publicado: (2024)
por: Doan, Khai Duy, et al.
Publicado: (2024)
Zero-Shot Context-Aware ASR for Diverse Arabic Varieties
por: Talafha, Bashar, et al.
Publicado: (2025)
por: Talafha, Bashar, et al.
Publicado: (2025)
LaMini-LM: A Diverse Herd of Distilled Models from Large-Scale Instructions
por: Wu, Minghao, et al.
Publicado: (2023)
por: Wu, Minghao, et al.
Publicado: (2023)
ASR Under Noise: Exploring Robustness for Sundanese and Javanese
por: Pranida, Salsabila Zahirah, et al.
Publicado: (2025)
por: Pranida, Salsabila Zahirah, et al.
Publicado: (2025)
AugSumm: towards generalizable speech summarization using synthetic labels from large language model
por: Jung, Jee-weon, et al.
Publicado: (2024)
por: Jung, Jee-weon, et al.
Publicado: (2024)
Explainable Disentanglement on Discrete Speech Representations for Noise-Robust ASR
por: Gopal, Shreyas, et al.
Publicado: (2025)
por: Gopal, Shreyas, et al.
Publicado: (2025)
AutoPRM: Automating Procedural Supervision for Multi-Step Reasoning via Controllable Question Decomposition
por: Chen, Zhaorun, et al.
Publicado: (2024)
por: Chen, Zhaorun, et al.
Publicado: (2024)
Building Robust and Scalable Multilingual ASR for Indian Languages
por: Gangwar, Arjun, et al.
Publicado: (2025)
por: Gangwar, Arjun, et al.
Publicado: (2025)
On Fairness of Unified Multimodal Large Language Model for Image Generation
por: Liu, Ming, et al.
Publicado: (2025)
por: Liu, Ming, et al.
Publicado: (2025)
LAHAJA: A Robust Multi-accent Benchmark for Evaluating Hindi ASR Systems
por: Javed, Tahir, et al.
Publicado: (2024)
por: Javed, Tahir, et al.
Publicado: (2024)
Evaluating and Improving Continual Learning in Spoken Language Understanding
por: Yang, Muqiao, et al.
Publicado: (2024)
por: Yang, Muqiao, et al.
Publicado: (2024)
NIM4-ASR: Towards Efficient, Robust, and Customizable Real-Time LLM-Based ASR
por: Xie, Yuan, et al.
Publicado: (2026)
por: Xie, Yuan, et al.
Publicado: (2026)
Robust ASR Error Correction with Conservative Data Filtering
por: Udagawa, Takuma, et al.
Publicado: (2024)
por: Udagawa, Takuma, et al.
Publicado: (2024)
Towards Pretraining Robust ASR Foundation Model with Acoustic-Aware Data Augmentation
por: Liu, Dancheng, et al.
Publicado: (2025)
por: Liu, Dancheng, et al.
Publicado: (2025)
Can We Trust LLMs for Mental Health Screening? Consistency, ASR Robustness, and Evidence Faithfulness
por: Loweimi, Erfan, et al.
Publicado: (2026)
por: Loweimi, Erfan, et al.
Publicado: (2026)
QDFormer: Towards Robust Audiovisual Segmentation in Complex Environments with Quantization-based Semantic Decomposition
por: Li, Xiang, et al.
Publicado: (2023)
por: Li, Xiang, et al.
Publicado: (2023)
Ejemplares similares
-
What Do Speech Foundation Models Not Learn About Speech?
por: Waheed, Abdul, et al.
Publicado: (2024) -
Lost in Transcription, Found in Distribution Shift: Demystifying Hallucination in Speech Foundation Models
por: Atwany, Hanin, et al.
Publicado: (2025) -
Revisiting Acoustic Features for Robust ASR
por: Shah, Muhammad A., et al.
Publicado: (2024) -
uDistil-Whisper: Label-Free Data Filtering for Knowledge Distillation in Low-Data Regimes
por: Waheed, Abdul, et al.
Publicado: (2024) -
DELULU: Discriminative Embedding Learning Using Latent Units for Speaker-Aware Self-Trained Speech Foundational Model
por: Baali, Massa, et al.
Publicado: (2025)