Enregistré dans:
| Auteurs principaux: | Amooie, Reihaneh, de Vries, Wietse, Hao, Yun, Dijkstra, Jelske, Coler, Matt, Wieling, Martijn |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2502.04883 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Overcoming Data Scarcity in Multi-Dialectal Arabic ASR via Whisper Fine-Tuning
par: Özyilmaz, Ömer Tarik, et autres
Publié: (2025)
par: Özyilmaz, Ömer Tarik, et autres
Publié: (2025)
Breaking the Transcription Bottleneck: Fine-tuning ASR Models for Extremely Low-Resource Fieldwork Languages
par: Liang, Siyu, et autres
Publié: (2025)
par: Liang, Siyu, et autres
Publié: (2025)
A Unified Denoising and Adaptation Framework for Self-Supervised Bengali Dialectal ASR
par: Biswas, Swadhin, et autres
Publié: (2025)
par: Biswas, Swadhin, et autres
Publié: (2025)
Performance Analysis of Speech Encoders for Low-Resource SLU and ASR in Tunisian Dialect
par: Mdhaffar, Salima, et autres
Publié: (2024)
par: Mdhaffar, Salima, et autres
Publié: (2024)
Enhancing Pre-trained ASR System Fine-tuning for Dysarthric Speech Recognition using Adversarial Data Augmentation
par: Wang, Huimeng, et autres
Publié: (2024)
par: Wang, Huimeng, et autres
Publié: (2024)
Relationship between objective and subjective perceptual measures of speech in individuals with head and neck cancer
par: Halpern, Bence Mark, et autres
Publié: (2025)
par: Halpern, Bence Mark, et autres
Publié: (2025)
Leveraging Large Language Models for Sarcastic Speech Annotation in Sarcasm Detection
par: Li, Zhu, et autres
Publié: (2025)
par: Li, Zhu, et autres
Publié: (2025)
Modeling Sarcastic Speech: Semantic and Prosodic Cues in a Speech Synthesis Framework
par: Li, Zhu, et autres
Publié: (2025)
par: Li, Zhu, et autres
Publié: (2025)
A Functional Trade-off between Prosodic and Semantic Cues in Conveying Sarcasm
par: Li, Zhu, et autres
Publié: (2024)
par: Li, Zhu, et autres
Publié: (2024)
LUPET: Incorporating Hierarchical Information Path into Multilingual ASR
par: Liu, Wei, et autres
Publié: (2024)
par: Liu, Wei, et autres
Publié: (2024)
EFFUSE: Efficient Self-Supervised Feature Fusion for E2E ASR in Low Resource and Multilingual Scenarios
par: Srivastava, Tejes, et autres
Publié: (2023)
par: Srivastava, Tejes, et autres
Publié: (2023)
Romanization Encoding For Multilingual ASR
par: Ding, Wen, et autres
Publié: (2024)
par: Ding, Wen, et autres
Publié: (2024)
Exploring the Impact of Data Quantity on ASR in Extremely Low-resource Languages
par: Cheng, Yao-Fei, et autres
Publié: (2024)
par: Cheng, Yao-Fei, et autres
Publié: (2024)
Complexity boosted adaptive training for better low resource ASR performance
par: Lu, Hongxuan, et autres
Publié: (2024)
par: Lu, Hongxuan, et autres
Publié: (2024)
OLMoASR: Open Models and Data for Training Robust Speech Recognition Models
par: Ngo, Huong, et autres
Publié: (2025)
par: Ngo, Huong, et autres
Publié: (2025)
VoxCog: Towards End-to-End Multilingual Cognitive Impairment Classification through Dialectal Knowledge
par: Feng, Tiantian, et autres
Publié: (2026)
par: Feng, Tiantian, et autres
Publié: (2026)
Improving Multilingual ASR in the Wild Using Simple N-best Re-ranking
par: Yan, Brian, et autres
Publié: (2024)
par: Yan, Brian, et autres
Publié: (2024)
MSA-ASR: Efficient Multilingual Speaker Attribution with frozen ASR Models
par: Nguyen, Thai-Binh, et autres
Publié: (2024)
par: Nguyen, Thai-Binh, et autres
Publié: (2024)
Voice Conversion Improves Cross-Domain Robustness for Spoken Arabic Dialect Identification
par: Abdullah, Badr M., et autres
Publié: (2025)
par: Abdullah, Badr M., et autres
Publié: (2025)
Improving Multilingual Speech Models on ML-SUPERB 2.0: Fine-tuning with Data Augmentation and LID-Aware CTC
par: Wang, Qingzheng, et autres
Publié: (2025)
par: Wang, Qingzheng, et autres
Publié: (2025)
Multistage Fine-tuning Strategies for Automatic Speech Recognition in Low-resource Languages
par: Pillai, Leena G, et autres
Publié: (2024)
par: Pillai, Leena G, et autres
Publié: (2024)
Exploring SSL Discrete Tokens for Multilingual ASR
par: Cui, Mingyu, et autres
Publié: (2024)
par: Cui, Mingyu, et autres
Publié: (2024)
Configurable Multilingual ASR with Speech Summary Representations
par: Zhu, Harrison, et autres
Publié: (2024)
par: Zhu, Harrison, et autres
Publié: (2024)
Selective Invocation for Multilingual ASR: A Cost-effective Approach Adapting to Speech Recognition Difficulty
par: Xue, Hongfei, et autres
Publié: (2025)
par: Xue, Hongfei, et autres
Publié: (2025)
Fine-Tuning ASR for Stuttered Speech: Personalized vs. Generalized Approaches
par: Mujtaba, Dena, et autres
Publié: (2025)
par: Mujtaba, Dena, et autres
Publié: (2025)
Cross-Dialect Bird Species Recognition with Dialect-Calibrated Augmentation
par: Ding, Jiani, et autres
Publié: (2025)
par: Ding, Jiani, et autres
Publié: (2025)
Extending Whisper with prompt tuning to target-speaker ASR
par: Ma, Hao, et autres
Publié: (2023)
par: Ma, Hao, et autres
Publié: (2023)
Advocating Character Error Rate for Multilingual ASR Evaluation
par: K, Thennal D, et autres
Publié: (2024)
par: K, Thennal D, et autres
Publié: (2024)
Fine-tune the pretrained ATST model for sound event detection
par: Shao, Nian, et autres
Publié: (2023)
par: Shao, Nian, et autres
Publié: (2023)
SCORE: Self-supervised Correspondence Fine-tuning for Improved Content Representations
par: Meghanani, Amit, et autres
Publié: (2024)
par: Meghanani, Amit, et autres
Publié: (2024)
Delayed-KD: Delayed Knowledge Distillation based CTC for Low-Latency Streaming ASR
par: Li, Longhao, et autres
Publié: (2025)
par: Li, Longhao, et autres
Publié: (2025)
Continual Learning Optimizations for Auto-regressive Decoder of Multilingual ASR systems
par: Kwok, Chin Yuen, et autres
Publié: (2024)
par: Kwok, Chin Yuen, et autres
Publié: (2024)
Efficient Multilingual ASR Finetuning via LoRA Language Experts
par: Li, Jiahong, et autres
Publié: (2025)
par: Li, Jiahong, et autres
Publié: (2025)
Improving Acoustic Scene Classification in Low-Resource Conditions
par: Chen, Zhi, et autres
Publié: (2024)
par: Chen, Zhi, et autres
Publié: (2024)
Anatomy of Industrial Scale Multilingual ASR
par: Ramirez, Francis McCann, et autres
Publié: (2024)
par: Ramirez, Francis McCann, et autres
Publié: (2024)
SOA: Reducing Domain Mismatch in SSL Pipeline by Speech Only Adaptation for Low Resource ASR
par: Shankar, Natarajan Balaji, et autres
Publié: (2024)
par: Shankar, Natarajan Balaji, et autres
Publié: (2024)
Target Speaker ASR with Whisper
par: Polok, Alexander, et autres
Publié: (2024)
par: Polok, Alexander, et autres
Publié: (2024)
Index-ASR Technical Report
par: Song, Zheshu, et autres
Publié: (2025)
par: Song, Zheshu, et autres
Publié: (2025)
Improving noisy student training for low-resource languages in End-to-End ASR using CycleGAN and inter-domain losses
par: Li, Chia-Yu, et autres
Publié: (2024)
par: Li, Chia-Yu, et autres
Publié: (2024)
Improving Spoken Language Modeling with Phoneme Classification: A Simple Fine-tuning Approach
par: Poli, Maxime, et autres
Publié: (2024)
par: Poli, Maxime, et autres
Publié: (2024)
Documents similaires
-
Overcoming Data Scarcity in Multi-Dialectal Arabic ASR via Whisper Fine-Tuning
par: Özyilmaz, Ömer Tarik, et autres
Publié: (2025) -
Breaking the Transcription Bottleneck: Fine-tuning ASR Models for Extremely Low-Resource Fieldwork Languages
par: Liang, Siyu, et autres
Publié: (2025) -
A Unified Denoising and Adaptation Framework for Self-Supervised Bengali Dialectal ASR
par: Biswas, Swadhin, et autres
Publié: (2025) -
Performance Analysis of Speech Encoders for Low-Resource SLU and ASR in Tunisian Dialect
par: Mdhaffar, Salima, et autres
Publié: (2024) -
Enhancing Pre-trained ASR System Fine-tuning for Dysarthric Speech Recognition using Adversarial Data Augmentation
par: Wang, Huimeng, et autres
Publié: (2024)