Lost in Transcription, Found in Distribution Shift: Demystifying Hallucination in Speech Foundation Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Atwany, Hanin, Waheed, Abdul, Singh, Rita, Choudhury, Monojit, Raj, Bhiksha |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
What Do Speech Foundation Models Not Learn About Speech?
par: Waheed, Abdul, et autres
Publié: (2024)
par: Waheed, Abdul, et autres
Publié: (2024)
On the Robust Approximation of ASR Metrics
par: Waheed, Abdul, et autres
Publié: (2025)
par: Waheed, Abdul, et autres
Publié: (2025)
DELULU: Discriminative Embedding Learning Using Latent Units for Speaker-Aware Self-Trained Speech Foundational Model
par: Baali, Massa, et autres
Publié: (2025)
par: Baali, Massa, et autres
Publié: (2025)
Speech vs. Transcript: Does It Matter for Human Annotators in Speech Summarization?
par: Sharma, Roshan, et autres
Publié: (2024)
par: Sharma, Roshan, et autres
Publié: (2024)
uDistil-Whisper: Label-Free Data Filtering for Knowledge Distillation in Low-Data Regimes
par: Waheed, Abdul, et autres
Publié: (2024)
par: Waheed, Abdul, et autres
Publié: (2024)
VideoJudge: Bootstrapping Enables Scalable Supervision of MLLM-as-a-Judge for Video Understanding
par: Waheed, Abdul, et autres
Publié: (2025)
par: Waheed, Abdul, et autres
Publié: (2025)
Less is More Tokens: Efficient Math Reasoning via Difficulty-Aware Chain-of-Thought Distillation
par: Waheed, Abdul, et autres
Publié: (2025)
par: Waheed, Abdul, et autres
Publié: (2025)
What and When to Learn: CURriculum Ranking Loss for Large-Scale Speaker Verification
par: Baali, Massa, et autres
Publié: (2026)
par: Baali, Massa, et autres
Publié: (2026)
On the Diversity of Synthetic Data and its Impact on Training Large Language Models
par: Chen, Hao, et autres
Publié: (2024)
par: Chen, Hao, et autres
Publié: (2024)
User Behavior Prediction as a Generic, Robust, Scalable, and Low-Cost Evaluation Strategy for Estimating Generalization in LLMs
par: Saha, Sougata, et autres
Publié: (2025)
par: Saha, Sougata, et autres
Publié: (2025)
CAARMA: Class Augmentation with Adversarial Mixup Regularization
par: Baali, Massa, et autres
Publié: (2025)
par: Baali, Massa, et autres
Publié: (2025)
PDAF: A Phonetic Debiasing Attention Framework For Speaker Verification
par: Baali, Massa, et autres
Publié: (2024)
par: Baali, Massa, et autres
Publié: (2024)
CoLMbo: Speaker Language Model for Descriptive Profiling
par: Baali, Massa, et autres
Publié: (2025)
par: Baali, Massa, et autres
Publié: (2025)
OleSpeech-IV: A Large-Scale Multispeaker and Multilingual Conversational Speech Dataset with Diverse Topics
par: Chu, Wei, et autres
Publié: (2025)
par: Chu, Wei, et autres
Publié: (2025)
Token Prediction as Implicit Classification to Identify LLM-Generated Text
par: Chen, Yutian, et autres
Publié: (2023)
par: Chen, Yutian, et autres
Publié: (2023)
[WIP] Jailbreak Paradox: The Achilles' Heel of LLMs
par: Rao, Abhinav, et autres
Publié: (2024)
par: Rao, Abhinav, et autres
Publié: (2024)
No Encore: Unlearning as Opt-Out in Music Generation
par: Kim, Jinju, et autres
Publié: (2025)
par: Kim, Jinju, et autres
Publié: (2025)
Evaluating Large Language Models for Health-related Queries with Presuppositions
par: Kaur, Navreet, et autres
Publié: (2023)
par: Kaur, Navreet, et autres
Publié: (2023)
SVeritas: Benchmark for Robust Speaker Verification under Diverse Conditions
par: Baali, Massa, et autres
Publié: (2025)
par: Baali, Massa, et autres
Publié: (2025)
Hallucination Benchmark for Speech Foundation Models
par: Koudounas, Alkis, et autres
Publié: (2025)
par: Koudounas, Alkis, et autres
Publié: (2025)
Towards Zero-Shot Text-To-Speech for Arabic Dialects
par: Doan, Khai Duy, et autres
Publié: (2024)
par: Doan, Khai Duy, et autres
Publié: (2024)
To Generate or Discriminate? Methodological Considerations for Measuring Cultural Alignment in LLMs
par: Pandey, Saurabh Kumar, et autres
Publié: (2026)
par: Pandey, Saurabh Kumar, et autres
Publié: (2026)
Lost in Transcription: Identifying and Quantifying the Accuracy Biases of Automatic Speech Recognition Systems Against Disfluent Speech
par: Mujtaba, Dena, et autres
Publié: (2024)
par: Mujtaba, Dena, et autres
Publié: (2024)
Mark My Words: A Robust Multilingual Model for Punctuation in Text and Speech Transcripts
par: Pulipaka, Sidharth, et autres
Publié: (2025)
par: Pulipaka, Sidharth, et autres
Publié: (2025)
Demystifying ChatGPT: How It Masters Genre Recognition
par: Raj, Subham, et autres
Publié: (2025)
par: Raj, Subham, et autres
Publié: (2025)
DiffuGuard: How Intrinsic Safety is Lost and Found in Diffusion Large Language Models
par: Li, Zherui, et autres
Publié: (2025)
par: Li, Zherui, et autres
Publié: (2025)
Meta-Cultural Competence: Climbing the Right Hill of Cultural Awareness
par: Saha, Sougata, et autres
Publié: (2025)
par: Saha, Sougata, et autres
Publié: (2025)
PhoniTale: Phonologically Grounded Mnemonic Generation for Typologically Distant Language Pairs
par: Kang, Sana, et autres
Publié: (2025)
par: Kang, Sana, et autres
Publié: (2025)
Litmus (Re)Agent: A Benchmark and Agentic System for Predictive Evaluation of Multilingual Models
par: Mittal, Avni, et autres
Publié: (2026)
par: Mittal, Avni, et autres
Publié: (2026)
Revisiting Acoustic Features for Robust ASR
par: Shah, Muhammad A., et autres
Publié: (2024)
par: Shah, Muhammad A., et autres
Publié: (2024)
Hallucinations in Neural Automatic Speech Recognition: Identifying Errors and Hallucinatory Models
par: Frieske, Rita, et autres
Publié: (2024)
par: Frieske, Rita, et autres
Publié: (2024)
Sacred or Synthetic? Evaluating LLM Reliability and Abstention for Religious Questions
par: Atif, Farah, et autres
Publié: (2025)
par: Atif, Farah, et autres
Publié: (2025)
WhisperRT -- Turning Whisper into a Causal Streaming Model
par: Krichli, Tomer, et autres
Publié: (2025)
par: Krichli, Tomer, et autres
Publié: (2025)
Lost in Phonation: Voice Quality Variation as an Evaluation Dimension for Speech Foundation Models
par: Lameris, Harm, et autres
Publié: (2025)
par: Lameris, Harm, et autres
Publié: (2025)
Do Moral Judgment and Reasoning Capability of LLMs Change with Language? A Study using the Multilingual Defining Issues Test
par: Khandelwal, Aditi, et autres
Publié: (2024)
par: Khandelwal, Aditi, et autres
Publié: (2024)
Ethical Reasoning and Moral Value Alignment of LLMs Depend on the Language we Prompt them in
par: Agarwal, Utkarsh, et autres
Publié: (2024)
par: Agarwal, Utkarsh, et autres
Publié: (2024)
Speech Robust Bench: A Robustness Benchmark For Speech Recognition
par: Shah, Muhammad A., et autres
Publié: (2024)
par: Shah, Muhammad A., et autres
Publié: (2024)
Women, Infamous, and Exotic Beings: A Comparative Study of Honorific Usages in Wikipedia and LLMs for Bengali and Hindi
par: Mukherjee, Sourabrata, et autres
Publié: (2025)
par: Mukherjee, Sourabrata, et autres
Publié: (2025)
Tricking LLMs into Disobedience: Formalizing, Analyzing, and Detecting Jailbreaks
par: Rao, Abhinav, et autres
Publié: (2023)
par: Rao, Abhinav, et autres
Publié: (2023)
Impact of Noisy Supervision in Foundation Model Learning
par: Chen, Hao, et autres
Publié: (2024)
par: Chen, Hao, et autres
Publié: (2024)
Documents similaires
-
What Do Speech Foundation Models Not Learn About Speech?
par: Waheed, Abdul, et autres
Publié: (2024) -
On the Robust Approximation of ASR Metrics
par: Waheed, Abdul, et autres
Publié: (2025) -
DELULU: Discriminative Embedding Learning Using Latent Units for Speaker-Aware Self-Trained Speech Foundational Model
par: Baali, Massa, et autres
Publié: (2025) -
Speech vs. Transcript: Does It Matter for Human Annotators in Speech Summarization?
par: Sharma, Roshan, et autres
Publié: (2024) -
uDistil-Whisper: Label-Free Data Filtering for Knowledge Distillation in Low-Data Regimes
par: Waheed, Abdul, et autres
Publié: (2024)