Efficient infusion of self-supervised representations in Automatic Speech Recognition
Fuente:
arXiv
Salvato in:
| Autori principali: | Prabhu, Darshan, Mirishkar, Sai Ganesh, Wasnik, Pankaj |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Enhancing Entertainment Translation for Indian Languages using Adaptive Context, Style and LLMs
di: Singh, Pratik Rakesh, et al.
Pubblicazione: (2024)
di: Singh, Pratik Rakesh, et al.
Pubblicazione: (2024)
Sustainable self-supervised learning for speech representations
di: Lugo, Luis, et al.
Pubblicazione: (2024)
di: Lugo, Luis, et al.
Pubblicazione: (2024)
Enhancing Whisper's Accuracy and Speed for Indian Languages through Prompt-Tuning and Tokenization
di: Tripathi, Kumud, et al.
Pubblicazione: (2024)
di: Tripathi, Kumud, et al.
Pubblicazione: (2024)
Faster Machine Translation Ensembling with Reinforcement Learning and Competitive Correction
di: Prasad, Kritarth, et al.
Pubblicazione: (2025)
di: Prasad, Kritarth, et al.
Pubblicazione: (2025)
SSHR: Leveraging Self-supervised Hierarchical Representations for Multilingual Automatic Speech Recognition
di: Xue, Hongfei, et al.
Pubblicazione: (2023)
di: Xue, Hongfei, et al.
Pubblicazione: (2023)
Automatic Speech Recognition for the Ika Language
di: Nzenwata, Uchenna, et al.
Pubblicazione: (2024)
di: Nzenwata, Uchenna, et al.
Pubblicazione: (2024)
Emergent morpho-phonological representations in self-supervised speech models
di: Gauthier, Jon, et al.
Pubblicazione: (2025)
di: Gauthier, Jon, et al.
Pubblicazione: (2025)
In-Domain African Languages Translation Using LLMs and Multi-armed Bandits
di: Singh, Pratik Rakesh, et al.
Pubblicazione: (2025)
di: Singh, Pratik Rakesh, et al.
Pubblicazione: (2025)
Graph-Assisted Culturally Adaptable Idiomatic Translation for Indic Languages
di: Singh, Pratik Rakesh, et al.
Pubblicazione: (2025)
di: Singh, Pratik Rakesh, et al.
Pubblicazione: (2025)
Improving Self-supervised Pre-training using Accent-Specific Codebooks
di: Prabhu, Darshan, et al.
Pubblicazione: (2024)
di: Prabhu, Darshan, et al.
Pubblicazione: (2024)
Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion
di: Tripathi, Kumud, et al.
Pubblicazione: (2025)
di: Tripathi, Kumud, et al.
Pubblicazione: (2025)
Probing self-attention in self-supervised speech models for cross-linguistic differences
di: Gopinath, Sai, et al.
Pubblicazione: (2024)
di: Gopinath, Sai, et al.
Pubblicazione: (2024)
Responsible Benchmarking of Fairness for Automatic Speech Recognition
di: Herron, Felix, et al.
Pubblicazione: (2026)
di: Herron, Felix, et al.
Pubblicazione: (2026)
Vietnamese Automatic Speech Recognition: A Revisit
di: Vu, Thi, et al.
Pubblicazione: (2026)
di: Vu, Thi, et al.
Pubblicazione: (2026)
Orthogonality and isotropy of speaker and phonetic information in self-supervised speech representations
di: Mohamed, Mukhtar, et al.
Pubblicazione: (2024)
di: Mohamed, Mukhtar, et al.
Pubblicazione: (2024)
Automatic Speech Recognition for Hindi
di: Saha, Anish, et al.
Pubblicazione: (2024)
di: Saha, Anish, et al.
Pubblicazione: (2024)
Quantifying the Role of Textual Predictability in Automatic Speech Recognition
di: Robertson, Sean, et al.
Pubblicazione: (2024)
di: Robertson, Sean, et al.
Pubblicazione: (2024)
Automatic Speech Recognition Advancements for Indigenous Languages of the Americas
di: Romero, Monica, et al.
Pubblicazione: (2024)
di: Romero, Monica, et al.
Pubblicazione: (2024)
WST: Weakly Supervised Transducer for Automatic Speech Recognition
di: Gao, Dongji, et al.
Pubblicazione: (2025)
di: Gao, Dongji, et al.
Pubblicazione: (2025)
Stuttering-Aware Automatic Speech Recognition for Indonesian Language
di: Muhammad, Fadhil, et al.
Pubblicazione: (2026)
di: Muhammad, Fadhil, et al.
Pubblicazione: (2026)
Where Are We At with Automatic Speech Recognition for the Bambara Language?
di: Diallo, Seydou, et al.
Pubblicazione: (2026)
di: Diallo, Seydou, et al.
Pubblicazione: (2026)
Syllabic-Structure Decoder for Automatic Speech Recognition in Vietnamese
di: Nguyen, Nghia Hieu, et al.
Pubblicazione: (2026)
di: Nguyen, Nghia Hieu, et al.
Pubblicazione: (2026)
Speech-Aware Long Context Pruning and Integration for Contextualized Automatic Speech Recognition
di: Rong, Yiming, et al.
Pubblicazione: (2025)
di: Rong, Yiming, et al.
Pubblicazione: (2025)
ViSpeechFormer: A Phonemic Approach for Vietnamese Automatic Speech Recognition
di: Nguyen, Khoa Anh, et al.
Pubblicazione: (2026)
di: Nguyen, Khoa Anh, et al.
Pubblicazione: (2026)
End-to-end Automatic Speech Recognition and Speech Translation: Integration of Speech Foundational Models and LLMs
di: Luu, Nam, et al.
Pubblicazione: (2025)
di: Luu, Nam, et al.
Pubblicazione: (2025)
Automatic Speech Recognition for Sanskrit with Transfer Learning
di: Sadhukhan, Bidit, et al.
Pubblicazione: (2025)
di: Sadhukhan, Bidit, et al.
Pubblicazione: (2025)
Automatic Speech Recognition for Greek Medical Dictation
di: Georgilas, Vardis, et al.
Pubblicazione: (2025)
di: Georgilas, Vardis, et al.
Pubblicazione: (2025)
Dynamic Multi-Expert Projectors with Stabilized Routing for Multilingual Speech Recognition
di: Pandey, Isha, et al.
Pubblicazione: (2026)
di: Pandey, Isha, et al.
Pubblicazione: (2026)
Bilevel Joint Unsupervised and Supervised Training for Automatic Speech Recognition
di: Cui, Xiaodong, et al.
Pubblicazione: (2024)
di: Cui, Xiaodong, et al.
Pubblicazione: (2024)
Qualitative Evaluation of Language Model Rescoring in Automatic Speech Recognition
di: Bañeras-Roux, Thibault, et al.
Pubblicazione: (2026)
di: Bañeras-Roux, Thibault, et al.
Pubblicazione: (2026)
WhisperPipe: A Resource-Efficient Streaming Architecture for Real-Time Automatic Speech Recognition
di: Ramezani, Erfan, et al.
Pubblicazione: (2026)
di: Ramezani, Erfan, et al.
Pubblicazione: (2026)
PhoWhisper: Automatic Speech Recognition for Vietnamese
di: Le, Thanh-Thien, et al.
Pubblicazione: (2024)
di: Le, Thanh-Thien, et al.
Pubblicazione: (2024)
Augmenting Automatic Speech Recognition Models with Disfluency Detection
di: Amann, Robin, et al.
Pubblicazione: (2024)
di: Amann, Robin, et al.
Pubblicazione: (2024)
Continuously Learning New Words in Automatic Speech Recognition
di: Huber, Christian, et al.
Pubblicazione: (2024)
di: Huber, Christian, et al.
Pubblicazione: (2024)
Algorithms For Automatic Accentuation And Transcription Of Russian Texts In Speech Recognition Systems
di: Iakovenko, Olga, et al.
Pubblicazione: (2024)
di: Iakovenko, Olga, et al.
Pubblicazione: (2024)
Evaluation of Automatic Speech Recognition Using Generative Large Language Models
di: Bañeras-Roux, Thibault, et al.
Pubblicazione: (2026)
di: Bañeras-Roux, Thibault, et al.
Pubblicazione: (2026)
Federated Heterogeneous Language Model Optimization for Hybrid Automatic Speech Recognition
di: Hong, Mengze, et al.
Pubblicazione: (2026)
di: Hong, Mengze, et al.
Pubblicazione: (2026)
Dynamic Data Pruning for Automatic Speech Recognition
di: Xiao, Qiao, et al.
Pubblicazione: (2024)
di: Xiao, Qiao, et al.
Pubblicazione: (2024)
Contextualized Automatic Speech Recognition with Dynamic Vocabulary
di: Sudo, Yui, et al.
Pubblicazione: (2024)
di: Sudo, Yui, et al.
Pubblicazione: (2024)
Automatic Screening for Children with Speech Disorder using Automatic Speech Recognition: Opportunities and Challenges
di: Liu, Dancheng, et al.
Pubblicazione: (2024)
di: Liu, Dancheng, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Enhancing Entertainment Translation for Indian Languages using Adaptive Context, Style and LLMs
di: Singh, Pratik Rakesh, et al.
Pubblicazione: (2024) -
Sustainable self-supervised learning for speech representations
di: Lugo, Luis, et al.
Pubblicazione: (2024) -
Enhancing Whisper's Accuracy and Speed for Indian Languages through Prompt-Tuning and Tokenization
di: Tripathi, Kumud, et al.
Pubblicazione: (2024) -
Faster Machine Translation Ensembling with Reinforcement Learning and Competitive Correction
di: Prasad, Kritarth, et al.
Pubblicazione: (2025) -
SSHR: Leveraging Self-supervised Hierarchical Representations for Multilingual Automatic Speech Recognition
di: Xue, Hongfei, et al.
Pubblicazione: (2023)