Recognizing Every Voice: Towards Inclusive ASR for Rural Bhojpuri Women
Fuente:
arXiv
Salvato in:
| Autori principali: | Joshi, Sakshi, George, Eldho Ittan, Javed, Tahir, Bhogale, Kaushal, Narasimhan, Nikhil, Khapra, Mitesh M. |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Empowering Low-Resource Language ASR via Large-Scale Pseudo Labeling
di: Bhogale, Kaushal Santosh, et al.
Pubblicazione: (2024)
di: Bhogale, Kaushal Santosh, et al.
Pubblicazione: (2024)
Voice of India: A Large-Scale Benchmark for Real-World Speech Recognition in India
di: Bhogale, Kaushal, et al.
Pubblicazione: (2026)
di: Bhogale, Kaushal, et al.
Pubblicazione: (2026)
LAHAJA: A Robust Multi-accent Benchmark for Evaluating Hindi ASR Systems
di: Javed, Tahir, et al.
Pubblicazione: (2024)
di: Javed, Tahir, et al.
Pubblicazione: (2024)
Towards Inclusive ASR: Investigating Voice Conversion for Dysarthric Speech Recognition in Low-Resource Languages
di: Li, Chin-Jou, et al.
Pubblicazione: (2025)
di: Li, Chin-Jou, et al.
Pubblicazione: (2025)
ELAICHI: Enhancing Low-resource TTS by Addressing Infrequent and Low-frequency Character Bigrams
di: Anand, Srija, et al.
Pubblicazione: (2024)
di: Anand, Srija, et al.
Pubblicazione: (2024)
IIITH-BUT system for IWSLT 2025 low-resource Bhojpuri to Hindi speech translation
di: Akkiraju, Bhavana, et al.
Pubblicazione: (2025)
di: Akkiraju, Bhavana, et al.
Pubblicazione: (2025)
The ML-SUPERB 2.0 Challenge: Towards Inclusive ASR Benchmarking for All Language Varieties
di: Chen, William, et al.
Pubblicazione: (2025)
di: Chen, William, et al.
Pubblicazione: (2025)
Jointly Recognizing Speech and Singing Voices Based on Multi-Task Audio Source Separation
di: Bai, Ye, et al.
Pubblicazione: (2024)
di: Bai, Ye, et al.
Pubblicazione: (2024)
Phir Hera Fairy: An English Fairytaler is a Strong Faker of Fluent Speech in Low-Resource Indian Languages
di: Varadhan, Praveen Srinivasa, et al.
Pubblicazione: (2025)
di: Varadhan, Praveen Srinivasa, et al.
Pubblicazione: (2025)
Rasa: Building Expressive Speech Synthesis Systems for Indian Languages in Low-resource Settings
di: Varadhan, Praveen Srinivasa, et al.
Pubblicazione: (2024)
di: Varadhan, Praveen Srinivasa, et al.
Pubblicazione: (2024)
NLE: Non-autoregressive LLM-based ASR by Transcript Editing
di: Dekel, Avihu, et al.
Pubblicazione: (2026)
di: Dekel, Avihu, et al.
Pubblicazione: (2026)
Towards a Single ASR Model That Generalizes to Disordered Speech
di: Tobin, Jimmy, et al.
Pubblicazione: (2024)
di: Tobin, Jimmy, et al.
Pubblicazione: (2024)
Towards Naturalistic Voice Conversion: NaturalVoices Dataset with an Automatic Processing Pipeline
di: Salman, Ali N., et al.
Pubblicazione: (2024)
di: Salman, Ali N., et al.
Pubblicazione: (2024)
UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models
di: Guan, Wenhao, et al.
Pubblicazione: (2025)
di: Guan, Wenhao, et al.
Pubblicazione: (2025)
Self-Speculative Decoding for LLM-based ASR with CTC Encoder Drafts
di: Saon, George, et al.
Pubblicazione: (2026)
di: Saon, George, et al.
Pubblicazione: (2026)
Precision-Varying Prediction (PVP): Robustifying ASR systems against adversarial attacks
di: Pizarro, Matías, et al.
Pubblicazione: (2026)
di: Pizarro, Matías, et al.
Pubblicazione: (2026)
Contextual Biasing for ASR in Speech LLM with Common Word Cues and Bias Word Position Prediction
di: Novitasari, Sashi, et al.
Pubblicazione: (2026)
di: Novitasari, Sashi, et al.
Pubblicazione: (2026)
DM-ASR: Diarization-aware Multi-speaker ASR with Large Language Models
di: Li, Li, et al.
Pubblicazione: (2026)
di: Li, Li, et al.
Pubblicazione: (2026)
Enhancing Out-of-Vocabulary Performance of Indian TTS Systems for Practical Applications through Low-Effort Data Strategies
di: Anand, Srija, et al.
Pubblicazione: (2024)
di: Anand, Srija, et al.
Pubblicazione: (2024)
DuRep: Dual-Mode Speech Representation Learning via ASR-Aware Distillation
di: Male, Prabash Reddy, et al.
Pubblicazione: (2025)
di: Male, Prabash Reddy, et al.
Pubblicazione: (2025)
NIRANTAR: Continual Learning with New Languages and Domains on Real-world Speech Data
di: Javed, Tahir, et al.
Pubblicazione: (2025)
di: Javed, Tahir, et al.
Pubblicazione: (2025)
MDM-ASR: Bridging Accuracy and Efficiency in ASR with Diffusion-Based Non-Autoregressive Decoding
di: Yen, Hao, et al.
Pubblicazione: (2026)
di: Yen, Hao, et al.
Pubblicazione: (2026)
First Steps Towards Voice Anonymization for Code-Switching Speech
di: Meyer, Sarina, et al.
Pubblicazione: (2025)
di: Meyer, Sarina, et al.
Pubblicazione: (2025)
All-in-One ASR: Unifying Encoder-Decoder Models of CTC, Attention, and Transducer in Dual-Mode ASR
di: Moriya, Takafumi, et al.
Pubblicazione: (2025)
di: Moriya, Takafumi, et al.
Pubblicazione: (2025)
The State Of TTS: A Case Study with Human Fooling Rates
di: Varadhan, Praveen Srinivasa, et al.
Pubblicazione: (2025)
di: Varadhan, Praveen Srinivasa, et al.
Pubblicazione: (2025)
Building English ASR model with regional language support
di: Agrawal, Purvi, et al.
Pubblicazione: (2025)
di: Agrawal, Purvi, et al.
Pubblicazione: (2025)
Towards Decoupling Frontend Enhancement and Backend Recognition in Monaural Robust ASR
di: Yang, Yufeng, et al.
Pubblicazione: (2024)
di: Yang, Yufeng, et al.
Pubblicazione: (2024)
Towards Reliable Objective Evaluation Metrics for Generative Singing Voice Separation Models
di: Bereuter, Paul A., et al.
Pubblicazione: (2025)
di: Bereuter, Paul A., et al.
Pubblicazione: (2025)
Emotion-Aware Prefix: Towards Explicit Emotion Control in Voice Conversion Models
di: Yang, Haoyuan, et al.
Pubblicazione: (2026)
di: Yang, Haoyuan, et al.
Pubblicazione: (2026)
VoiceSculptor: Your Voice, Designed By You
di: Hu, Jingbin, et al.
Pubblicazione: (2026)
di: Hu, Jingbin, et al.
Pubblicazione: (2026)
DreamVoice: Text-Guided Voice Conversion
di: Hai, Jiarui, et al.
Pubblicazione: (2024)
di: Hai, Jiarui, et al.
Pubblicazione: (2024)
Towards Effective and Efficient Non-autoregressive decoders for Conformer and LLM-based ASR using Block-based Attention Mask
di: Wang, Tianzi, et al.
Pubblicazione: (2025)
di: Wang, Tianzi, et al.
Pubblicazione: (2025)
Inverse-Hessian Regularization for Continual Learning in ASR
di: Eeckt, Steven Vander, et al.
Pubblicazione: (2026)
di: Eeckt, Steven Vander, et al.
Pubblicazione: (2026)
OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion
di: Wang, Zhichao, et al.
Pubblicazione: (2026)
di: Wang, Zhichao, et al.
Pubblicazione: (2026)
SOT Triggered Neural Clustering for Speaker Attributed ASR
di: Zheng, Xianrui, et al.
Pubblicazione: (2024)
di: Zheng, Xianrui, et al.
Pubblicazione: (2024)
DNCASR: End-to-End Training for Speaker-Attributed ASR
di: Zheng, Xianrui, et al.
Pubblicazione: (2025)
di: Zheng, Xianrui, et al.
Pubblicazione: (2025)
An investigation of modularity for noise robustness in conformer-based ASR
di: de Gibson, Louise Coppieters, et al.
Pubblicazione: (2024)
di: de Gibson, Louise Coppieters, et al.
Pubblicazione: (2024)
The VoicePrivacy 2022 Challenge: Progress and Perspectives in Voice Anonymisation
di: Panariello, Michele, et al.
Pubblicazione: (2024)
di: Panariello, Michele, et al.
Pubblicazione: (2024)
Granite-speech: open-source speech-aware LLMs with strong English ASR capabilities
di: Saon, George, et al.
Pubblicazione: (2025)
di: Saon, George, et al.
Pubblicazione: (2025)
Towards scalable efficient on-device ASR with transfer learning
di: Pandey, Laxmi, et al.
Pubblicazione: (2024)
di: Pandey, Laxmi, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Empowering Low-Resource Language ASR via Large-Scale Pseudo Labeling
di: Bhogale, Kaushal Santosh, et al.
Pubblicazione: (2024) -
Voice of India: A Large-Scale Benchmark for Real-World Speech Recognition in India
di: Bhogale, Kaushal, et al.
Pubblicazione: (2026) -
LAHAJA: A Robust Multi-accent Benchmark for Evaluating Hindi ASR Systems
di: Javed, Tahir, et al.
Pubblicazione: (2024) -
Towards Inclusive ASR: Investigating Voice Conversion for Dysarthric Speech Recognition in Low-Resource Languages
di: Li, Chin-Jou, et al.
Pubblicazione: (2025) -
ELAICHI: Enhancing Low-resource TTS by Addressing Infrequent and Low-frequency Character Bigrams
di: Anand, Srija, et al.
Pubblicazione: (2024)