Towards measuring fairness in speech recognition: Fair-Speech dataset
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Veliche, Irina-Elena, Huang, Zhuangqun, Kochaniyan, Vineeth Ayyat, Peng, Fuchun, Kalinli, Ozlem, Seltzer, Michael L. |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Faster Speech-LLaMA Inference with Multi-token Prediction
par: Raj, Desh, et autres
Publié: (2024)
par: Raj, Desh, et autres
Publié: (2024)
Effective Text Adaptation for LLM-based ASR through Soft Prompt Fine-Tuning
par: Ma, Yingyi, et autres
Publié: (2024)
par: Ma, Yingyi, et autres
Publié: (2024)
CJST: CTC Compressor based Joint Speech and Text Training for Decoder-Only ASR
par: Zhou, Wei, et autres
Publié: (2024)
par: Zhou, Wei, et autres
Publié: (2024)
Toward Fair Speech Technologies: A Comprehensive Survey of Bias and Fairness in Speech AI
par: Lin, Yi-Cheng, et autres
Publié: (2026)
par: Lin, Yi-Cheng, et autres
Publié: (2026)
M-BEST-RQ: A Multi-Channel Speech Foundation Model for Smart Glasses
par: Yang, Yufeng, et autres
Publié: (2024)
par: Yang, Yufeng, et autres
Publié: (2024)
AS-70: A Mandarin stuttered speech dataset for automatic speech recognition and stuttering event detection
par: Gong, Rong, et autres
Publié: (2024)
par: Gong, Rong, et autres
Publié: (2024)
Towards Energy-Efficient and Low-Latency Voice-Controlled Smart Homes: A Proposal for Offline Speech Recognition and IoT Integration
par: Huang, Peng, et autres
Publié: (2025)
par: Huang, Peng, et autres
Publié: (2025)
Phoneme-based speech recognition driven by large language models and sampling marginalization
par: Ma, Te, et autres
Publié: (2025)
par: Ma, Te, et autres
Publié: (2025)
Robust fine-tuning of speech recognition models via model merging: application to disordered speech
par: Ducorroy, Alexandre, et autres
Publié: (2025)
par: Ducorroy, Alexandre, et autres
Publié: (2025)
Token-Weighted RNN-T for Learning from Flawed Data
par: Keren, Gil, et autres
Publié: (2024)
par: Keren, Gil, et autres
Publié: (2024)
Graph-based multi-Feature fusion method for speech emotion recognition
par: Liu, Xueyu, et autres
Publié: (2024)
par: Liu, Xueyu, et autres
Publié: (2024)
Language model integration based on memory control for sequence to sequence speech recognition
par: Cho, Jaejin, et autres
Publié: (2018)
par: Cho, Jaejin, et autres
Publié: (2018)
Improving child speech recognition with augmented child-like speech
par: Zhang, Yuanyuan, et autres
Publié: (2024)
par: Zhang, Yuanyuan, et autres
Publié: (2024)
Paraformer-v2: An improved non-autoregressive transformer for noise-robust speech recognition
par: An, Keyu, et autres
Publié: (2024)
par: An, Keyu, et autres
Publié: (2024)
Voxtlm: unified decoder-only models for consolidating speech recognition/synthesis and speech/text continuation tasks
par: Maiti, Soumi, et autres
Publié: (2023)
par: Maiti, Soumi, et autres
Publié: (2023)
Thinking in cocktail party: Chain-of-Thought and reinforcement learning for target speaker automatic speech recognition
par: Zhang, Yiru, et autres
Publié: (2025)
par: Zhang, Yiru, et autres
Publié: (2025)
Charting 15 years of progress in deep learning for speech emotion recognition: A replication study
par: Triantafyllopoulos, Andreas, et autres
Publié: (2025)
par: Triantafyllopoulos, Andreas, et autres
Publié: (2025)
PROCTER: PROnunciation-aware ConTextual adaptER for personalized speech recognition in neural transducers
par: Pandey, Rahul, et autres
Publié: (2023)
par: Pandey, Rahul, et autres
Publié: (2023)
LLM-based phoneme-to-grapheme for phoneme-based speech recognition
par: Ma, Te, et autres
Publié: (2025)
par: Ma, Te, et autres
Publié: (2025)
Enhancing CTC-based speech recognition with diverse modeling units
par: Han, Shiyi, et autres
Publié: (2024)
par: Han, Shiyi, et autres
Publié: (2024)
Explainable speech emotion recognition through attentive pooling: insights from attention-based temporal localization
par: Leygue, Tahitoa, et autres
Publié: (2025)
par: Leygue, Tahitoa, et autres
Publié: (2025)
Towards noise-robust speech inversion through multi-task learning with speech enhancement
par: Tabatabaee, Saba, et autres
Publié: (2026)
par: Tabatabaee, Saba, et autres
Publié: (2026)
Frozen Large Language Models Can Perceive Paralinguistic Aspects of Speech
par: Kang, Wonjune, et autres
Publié: (2024)
par: Kang, Wonjune, et autres
Publié: (2024)
Prosodic Parameter Manipulation in TTS generated speech for Controlled Speech Generation
par: Chary, Podakanti Satyajith
Publié: (2024)
par: Chary, Podakanti Satyajith
Publié: (2024)
Adversarial speech for voice privacy protection from Personalized Speech generation
par: Chen, Shihao, et autres
Publié: (2024)
par: Chen, Shihao, et autres
Publié: (2024)
LRS-VoxMM: A benchmark for in-the-wild audio-visual speech recognition
par: Kwak, Doyeop, et autres
Publié: (2026)
par: Kwak, Doyeop, et autres
Publié: (2026)
Heterogeneous bimodal attention fusion for speech emotion recognition
par: Luo, Jiachen, et autres
Publié: (2025)
par: Luo, Jiachen, et autres
Publié: (2025)
Learnings from curating a trustworthy, well-annotated, and useful dataset of disordered English speech
par: Jiang, Pan-Pan, et autres
Publié: (2024)
par: Jiang, Pan-Pan, et autres
Publié: (2024)
Introduction to speech recognition
par: Dauphin, Gabriel
Publié: (2024)
par: Dauphin, Gabriel
Publié: (2024)
A dataset and model for auditory scene recognition for hearing devices: AHEAD-DS and OpenYAMNet
par: Zhong, Henry, et autres
Publié: (2025)
par: Zhong, Henry, et autres
Publié: (2025)
Efficient Streaming LLM for Speech Recognition
par: Jia, Junteng, et autres
Publié: (2024)
par: Jia, Junteng, et autres
Publié: (2024)
Advancing LLM-based phoneme-to-grapheme for multilingual speech recognition
par: Dong, Lukuang, et autres
Publié: (2026)
par: Dong, Lukuang, et autres
Publié: (2026)
Zipformer: A faster and better encoder for automatic speech recognition
par: Yao, Zengwei, et autres
Publié: (2023)
par: Yao, Zengwei, et autres
Publié: (2023)
Self-consistent context aware conformer transducer for speech recognition
par: Kolokolov, Konstantin, et autres
Publié: (2024)
par: Kolokolov, Konstantin, et autres
Publié: (2024)
An efficient text augmentation approach for contextualized Mandarin speech recognition
par: Zheng, Naijun, et autres
Publié: (2024)
par: Zheng, Naijun, et autres
Publié: (2024)
CR-CTC: Consistency regularization on CTC for improved speech recognition
par: Yao, Zengwei, et autres
Publié: (2024)
par: Yao, Zengwei, et autres
Publié: (2024)
Robustifying automatic speech recognition by extracting slowly varying features
par: Pizarro, Matías, et autres
Publié: (2021)
par: Pizarro, Matías, et autres
Publié: (2021)
Best Practices and Considerations for Child Speech Corpus Collection and Curation in Educational, Clinical, and Forensic Scenarios
par: Hansen, John, et autres
Publié: (2025)
par: Hansen, John, et autres
Publié: (2025)
Throat and acoustic paired speech dataset for deep learning-based speech enhancement
par: Kim, Yunsik, et autres
Publié: (2025)
par: Kim, Yunsik, et autres
Publié: (2025)
Advancing automatic speech recognition using feature fusion with self-supervised learning features: A case study on Fearless Steps Apollo corpus
par: Chen, Szu-Jui, et autres
Publié: (2026)
par: Chen, Szu-Jui, et autres
Publié: (2026)
Documents similaires
-
Faster Speech-LLaMA Inference with Multi-token Prediction
par: Raj, Desh, et autres
Publié: (2024) -
Effective Text Adaptation for LLM-based ASR through Soft Prompt Fine-Tuning
par: Ma, Yingyi, et autres
Publié: (2024) -
CJST: CTC Compressor based Joint Speech and Text Training for Decoder-Only ASR
par: Zhou, Wei, et autres
Publié: (2024) -
Toward Fair Speech Technologies: A Comprehensive Survey of Bias and Fairness in Speech AI
par: Lin, Yi-Cheng, et autres
Publié: (2026) -
M-BEST-RQ: A Multi-Channel Speech Foundation Model for Smart Glasses
par: Yang, Yufeng, et autres
Publié: (2024)