DENOASR: Debiasing ASRs through Selective Denoising
Fuente:
arXiv
Salvato in:
| Autori principali: | Rai, Anand Kumar, Jaiswal, Siddharth D, Prakash, Shubham, Sree, Bendi Pragnya, Mukherjee, Animesh |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
ASR-FAIRBENCH: Measuring and Benchmarking Equity Across Speech Recognition Systems
di: Rai, Anand, et al.
Pubblicazione: (2025)
di: Rai, Anand, et al.
Pubblicazione: (2025)
ASR Under the Stethoscope: Evaluating Biases in Clinical Speech Recognition across Indian Languages
di: Kumar, Subham, et al.
Pubblicazione: (2025)
di: Kumar, Subham, et al.
Pubblicazione: (2025)
Next Tokens Denoising for Speech Synthesis
di: Liu, Yanqing, et al.
Pubblicazione: (2025)
di: Liu, Yanqing, et al.
Pubblicazione: (2025)
Diffusion Gaussian Mixture Audio Denoise
di: Wang, Pu, et al.
Pubblicazione: (2024)
di: Wang, Pu, et al.
Pubblicazione: (2024)
Efficient Data Selection for Domain Adaptation of ASR Using Pseudo-Labels and Multi-Stage Filtering
di: Rangappa, Pradeep, et al.
Pubblicazione: (2025)
di: Rangappa, Pradeep, et al.
Pubblicazione: (2025)
DiffAR: Denoising Diffusion Autoregressive Model for Raw Speech Waveform Generation
di: Benita, Roi, et al.
Pubblicazione: (2023)
di: Benita, Roi, et al.
Pubblicazione: (2023)
Cross-Modal Denoising: A Novel Training Paradigm for Enhancing Speech-Image Retrieval
di: Zhou, Lifeng, et al.
Pubblicazione: (2024)
di: Zhou, Lifeng, et al.
Pubblicazione: (2024)
LastResort at SemEval-2024 Task 3: Exploring Multimodal Emotion Cause Pair Extraction as Sequence Labelling Task
di: Mathur, Suyash Vardhan, et al.
Pubblicazione: (2024)
di: Mathur, Suyash Vardhan, et al.
Pubblicazione: (2024)
Are Paralinguistic Representations all that is needed for Speech Emotion Recognition?
di: Phukan, Orchid Chetia, et al.
Pubblicazione: (2024)
di: Phukan, Orchid Chetia, et al.
Pubblicazione: (2024)
A Comprehensive Study of the Current State-of-the-Art in Nepali Automatic Speech Recognition Systems
di: Ghimire, Rupak Raj, et al.
Pubblicazione: (2024)
di: Ghimire, Rupak Raj, et al.
Pubblicazione: (2024)
Spelling Correction through Rewriting of Non-Autoregressive ASR Lattices
di: Velikovich, Leonid, et al.
Pubblicazione: (2024)
di: Velikovich, Leonid, et al.
Pubblicazione: (2024)
Custom Data Augmentation for low resource ASR using Bark and Retrieval-Based Voice Conversion
di: Kamble, Anand, et al.
Pubblicazione: (2023)
di: Kamble, Anand, et al.
Pubblicazione: (2023)
ChildGuard: A Specialized Dataset for Combatting Child-Targeted Hate Speech
di: Kashyap, Gautam Siddharth, et al.
Pubblicazione: (2025)
di: Kashyap, Gautam Siddharth, et al.
Pubblicazione: (2025)
Idiosyncratic Versus Normative Modeling of Atypical Speech Recognition: Dysarthric Case Studies
di: Raja, Vishnu, et al.
Pubblicazione: (2025)
di: Raja, Vishnu, et al.
Pubblicazione: (2025)
Better Semi-supervised Learning for Multi-domain ASR Through Incremental Retraining and Data Filtering
di: Carofilis, Andres, et al.
Pubblicazione: (2025)
di: Carofilis, Andres, et al.
Pubblicazione: (2025)
A two-stage transliteration approach to improve performance of a multilingual ASR
di: Kumar, Rohit
Pubblicazione: (2024)
di: Kumar, Rohit
Pubblicazione: (2024)
Streaming Sequence Transduction through Dynamic Compression
di: Tan, Weiting, et al.
Pubblicazione: (2024)
di: Tan, Weiting, et al.
Pubblicazione: (2024)
Multimodal Consistency-Guided Reference-Free Data Selection for ASR Accent Adaptation
di: Lei, Ligong, et al.
Pubblicazione: (2026)
di: Lei, Ligong, et al.
Pubblicazione: (2026)
AutoMode-ASR: Learning to Select ASR Systems for Better Quality and Cost
di: Gündüz, Ahmet, et al.
Pubblicazione: (2024)
di: Gündüz, Ahmet, et al.
Pubblicazione: (2024)
Efficient Interleaved Speech Modeling through Knowledge Distillation
di: Nouriborji, Mohammadmahdi, et al.
Pubblicazione: (2025)
di: Nouriborji, Mohammadmahdi, et al.
Pubblicazione: (2025)
Children's Speech Recognition through Discrete Token Enhancement
di: Sukhadia, Vrunda N., et al.
Pubblicazione: (2024)
di: Sukhadia, Vrunda N., et al.
Pubblicazione: (2024)
Selective Attention Merging for low resource tasks: A case study of Child ASR
di: Shankar, Natarajan Balaji, et al.
Pubblicazione: (2025)
di: Shankar, Natarajan Balaji, et al.
Pubblicazione: (2025)
Efficient Speech Translation through Model Compression and Knowledge Distillation
di: Moslem, Yasmin
Pubblicazione: (2025)
di: Moslem, Yasmin
Pubblicazione: (2025)
VOX-KRIKRI: Unifying Speech and Language through Continuous Fusion
di: Damianos, Dimitrios, et al.
Pubblicazione: (2025)
di: Damianos, Dimitrios, et al.
Pubblicazione: (2025)
HarmoniFuse: A Component-Selective and Prompt-Adaptive Framework for Multi-Task Speech Language Modeling
di: Si, Yuke, et al.
Pubblicazione: (2025)
di: Si, Yuke, et al.
Pubblicazione: (2025)
Advancing African-Accented Speech Recognition: Epistemic Uncertainty-Driven Data Selection for Generalizable ASR Models
di: Dossou, Bonaventure F. P.
Pubblicazione: (2023)
di: Dossou, Bonaventure F. P.
Pubblicazione: (2023)
A cost minimization approach to fix the vocabulary size in a tokenizer for an End-to-End ASR system
di: Kopparapu, Sunil Kumar, et al.
Pubblicazione: (2024)
di: Kopparapu, Sunil Kumar, et al.
Pubblicazione: (2024)
End-to-End Speech-to-Text Translation: A Survey
di: Sethiya, Nivedita, et al.
Pubblicazione: (2023)
di: Sethiya, Nivedita, et al.
Pubblicazione: (2023)
Improving Speech Emotion Recognition in Under-Resourced Languages via Speech-to-Speech Translation with Bootstrapping Data Selection
di: Lin, Hsi-Che, et al.
Pubblicazione: (2024)
di: Lin, Hsi-Che, et al.
Pubblicazione: (2024)
Adapting Whisper for Code-Switching through Encoding Refining and Language-Aware Decoding
di: Zhao, Jiahui, et al.
Pubblicazione: (2024)
di: Zhao, Jiahui, et al.
Pubblicazione: (2024)
Enhancing Multimodal Emotion Recognition through Multi-Granularity Cross-Modal Alignment
di: Wang, Xuechen, et al.
Pubblicazione: (2024)
di: Wang, Xuechen, et al.
Pubblicazione: (2024)
Effective Text Adaptation for LLM-based ASR through Soft Prompt Fine-Tuning
di: Ma, Yingyi, et al.
Pubblicazione: (2024)
di: Ma, Yingyi, et al.
Pubblicazione: (2024)
Improving Acoustic Word Embeddings through Correspondence Training of Self-supervised Speech Representations
di: Meghanani, Amit, et al.
Pubblicazione: (2024)
di: Meghanani, Amit, et al.
Pubblicazione: (2024)
LAMA-UT: Language Agnostic Multilingual ASR through Orthography Unification and Language-Specific Transliteration
di: Lee, Sangmin, et al.
Pubblicazione: (2024)
di: Lee, Sangmin, et al.
Pubblicazione: (2024)
High-precision medical speech recognition through synthetic data and semantic correction: UNITED-MEDASR
di: Banerjee, Sourav, et al.
Pubblicazione: (2024)
di: Banerjee, Sourav, et al.
Pubblicazione: (2024)
Hidden in the Noise: Unveiling Backdoors in Audio LLMs Alignment through Latent Acoustic Pattern Triggers
di: Lin, Liang, et al.
Pubblicazione: (2025)
di: Lin, Liang, et al.
Pubblicazione: (2025)
Direct Speech-to-Speech Neural Machine Translation: A Survey
di: Gupta, Mahendra, et al.
Pubblicazione: (2024)
di: Gupta, Mahendra, et al.
Pubblicazione: (2024)
Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion
di: Tripathi, Kumud, et al.
Pubblicazione: (2025)
di: Tripathi, Kumud, et al.
Pubblicazione: (2025)
Deep Learning for Assessment of Oral Reading Fluency
di: Vaidya, Mithilesh, et al.
Pubblicazione: (2024)
di: Vaidya, Mithilesh, et al.
Pubblicazione: (2024)
Enhancing Few-shot Keyword Spotting Performance through Pre-Trained Self-supervised Speech Models
di: Gok, Alican, et al.
Pubblicazione: (2025)
di: Gok, Alican, et al.
Pubblicazione: (2025)
Documenti analoghi
-
ASR-FAIRBENCH: Measuring and Benchmarking Equity Across Speech Recognition Systems
di: Rai, Anand, et al.
Pubblicazione: (2025) -
ASR Under the Stethoscope: Evaluating Biases in Clinical Speech Recognition across Indian Languages
di: Kumar, Subham, et al.
Pubblicazione: (2025) -
Next Tokens Denoising for Speech Synthesis
di: Liu, Yanqing, et al.
Pubblicazione: (2025) -
Diffusion Gaussian Mixture Audio Denoise
di: Wang, Pu, et al.
Pubblicazione: (2024) -
Efficient Data Selection for Domain Adaptation of ASR Using Pseudo-Labels and Multi-Stage Filtering
di: Rangappa, Pradeep, et al.
Pubblicazione: (2025)