Optimizing ASR for Catalan-Spanish Code-Switching: A Comparative Analysis of Methodologies
Fuente:
arXiv
Salvato in:
| Autori principali: | Mena, Carlos, Serra, Pol, Romero, Jacobo, Messaoudi, Abir, Giraldo, Jose, Armentano-Oller, Carme, Zevallos, Rodolfo, Meza, Ivan, Hernando, Javier |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Enhancing Crowdsourced Audio for Text-to-Speech Models
di: Giraldo, José, et al.
Pubblicazione: (2024)
di: Giraldo, José, et al.
Pubblicazione: (2024)
How Attention Shapes Emotion: A Comparative Study of Attention Mechanisms for Speech Emotion Recognition
di: Casals-Salvador, Marc, et al.
Pubblicazione: (2026)
di: Casals-Salvador, Marc, et al.
Pubblicazione: (2026)
Zero-Shot TTS With Enhanced Audio Prompts: Bsc Submission For The 2026 Wildspoof Challenge TTS Track
di: Giraldo, Jose, et al.
Pubblicazione: (2026)
di: Giraldo, Jose, et al.
Pubblicazione: (2026)
Semi-supervised Learning for Code-Switching ASR with Large Language Model Filter
di: Xi, Yu, et al.
Pubblicazione: (2024)
di: Xi, Yu, et al.
Pubblicazione: (2024)
Doctor or Patient? Synergizing Diarization and ASR for Code-Switched Hinglish Medical Conditions Extraction
di: Baroudi, Séverin, et al.
Pubblicazione: (2026)
di: Baroudi, Séverin, et al.
Pubblicazione: (2026)
AsyncSwitch: Asynchronous Text-Speech Adaptation for Code-Switched ASR
di: Nguyen, Tuan, et al.
Pubblicazione: (2025)
di: Nguyen, Tuan, et al.
Pubblicazione: (2025)
Boosting Code-Switching ASR with Mixture of Experts Enhanced Speech-Conditioned LLM
di: Zhang, Fengrun, et al.
Pubblicazione: (2024)
di: Zhang, Fengrun, et al.
Pubblicazione: (2024)
A Comparative Study of LLM-based ASR and Whisper in Low Resource and Code Switching Scenario
di: Song, Zheshu, et al.
Pubblicazione: (2024)
di: Song, Zheshu, et al.
Pubblicazione: (2024)
SC-MoE: Switch Conformer Mixture of Experts for Unified Streaming and Non-streaming Code-Switching ASR
di: Ye, Shuaishuai, et al.
Pubblicazione: (2024)
di: Ye, Shuaishuai, et al.
Pubblicazione: (2024)
AdaCS: Adaptive Normalization for Enhanced Code-Switching ASR
di: Chu, The Chuong, et al.
Pubblicazione: (2025)
di: Chu, The Chuong, et al.
Pubblicazione: (2025)
Comparative Analysis of ASR Methods for Speech Deepfake Detection
di: Salvi, Davide, et al.
Pubblicazione: (2024)
di: Salvi, Davide, et al.
Pubblicazione: (2024)
Comparing Unsupervised and Supervised Semantic Speech Tokens: A Case Study of Child ASR
di: Shi, Mohan, et al.
Pubblicazione: (2025)
di: Shi, Mohan, et al.
Pubblicazione: (2025)
Improving Zero-Shot Chinese-English Code-Switching ASR with kNN-CTC and Gated Monolingual Datastores
di: Zhou, Jiaming, et al.
Pubblicazione: (2024)
di: Zhou, Jiaming, et al.
Pubblicazione: (2024)
DM-ASR: Diarization-aware Multi-speaker ASR with Large Language Models
di: Li, Li, et al.
Pubblicazione: (2026)
di: Li, Li, et al.
Pubblicazione: (2026)
First Steps Towards Voice Anonymization for Code-Switching Speech
di: Meyer, Sarina, et al.
Pubblicazione: (2025)
di: Meyer, Sarina, et al.
Pubblicazione: (2025)
NeuRO: An Application for Code-Switched Autism Detection in Children
di: Akhtar, Mohd Mujtaba, et al.
Pubblicazione: (2024)
di: Akhtar, Mohd Mujtaba, et al.
Pubblicazione: (2024)
MDM-ASR: Bridging Accuracy and Efficiency in ASR with Diffusion-Based Non-Autoregressive Decoding
di: Yen, Hao, et al.
Pubblicazione: (2026)
di: Yen, Hao, et al.
Pubblicazione: (2026)
Mind the Gap: Impact of Synthetic Conversational Data on Multi-Talker ASR and Speaker Diarization
di: Polok, Alexander, et al.
Pubblicazione: (2026)
di: Polok, Alexander, et al.
Pubblicazione: (2026)
Investigating Zero-Shot Generalizability on Mandarin-English Code-Switched ASR and Speech-to-text Translation of Recent Foundation Models with Self-Supervision and Weak Supervision
di: Yang, Chih-Kai, et al.
Pubblicazione: (2023)
di: Yang, Chih-Kai, et al.
Pubblicazione: (2023)
All-in-One ASR: Unifying Encoder-Decoder Models of CTC, Attention, and Transducer in Dual-Mode ASR
di: Moriya, Takafumi, et al.
Pubblicazione: (2025)
di: Moriya, Takafumi, et al.
Pubblicazione: (2025)
Quantifying Cross-Lingual Transfer in Paralinguistic Speech Tasks
di: Buitrago, Pol, et al.
Pubblicazione: (2026)
di: Buitrago, Pol, et al.
Pubblicazione: (2026)
Leave No Knowledge Behind During Knowledge Distillation: Towards Practical and Effective Knowledge Distillation for Code-Switching ASR Using Realistic Data
di: Tseng, Liang-Hsuan, et al.
Pubblicazione: (2024)
di: Tseng, Liang-Hsuan, et al.
Pubblicazione: (2024)
Attention-Guided Adaptation for Code-Switching Speech Recognition
di: Aditya, Bobbi, et al.
Pubblicazione: (2023)
di: Aditya, Bobbi, et al.
Pubblicazione: (2023)
Inverse-Hessian Regularization for Continual Learning in ASR
di: Eeckt, Steven Vander, et al.
Pubblicazione: (2026)
di: Eeckt, Steven Vander, et al.
Pubblicazione: (2026)
Improving Code Switching with Supervised Fine Tuning and GELU Adapters
di: Pham, Linh
Pubblicazione: (2025)
di: Pham, Linh
Pubblicazione: (2025)
SOT Triggered Neural Clustering for Speaker Attributed ASR
di: Zheng, Xianrui, et al.
Pubblicazione: (2024)
di: Zheng, Xianrui, et al.
Pubblicazione: (2024)
DNCASR: End-to-End Training for Speaker-Attributed ASR
di: Zheng, Xianrui, et al.
Pubblicazione: (2025)
di: Zheng, Xianrui, et al.
Pubblicazione: (2025)
An investigation of modularity for noise robustness in conformer-based ASR
di: de Gibson, Louise Coppieters, et al.
Pubblicazione: (2024)
di: de Gibson, Louise Coppieters, et al.
Pubblicazione: (2024)
Enhancing Code-Switching ASR Leveraging Non-Peaky CTC Loss and Deep Language Posterior Injection
di: Yang, Tzu-Ting, et al.
Pubblicazione: (2024)
di: Yang, Tzu-Ting, et al.
Pubblicazione: (2024)
Resource-Efficient Adaptation of Speech Foundation Models for Multi-Speaker ASR
di: Wang, Weiqing, et al.
Pubblicazione: (2024)
di: Wang, Weiqing, et al.
Pubblicazione: (2024)
Speaker Targeting via Self-Speaker Adaptation for Multi-talker ASR
di: Wang, Weiqing, et al.
Pubblicazione: (2025)
di: Wang, Weiqing, et al.
Pubblicazione: (2025)
Bootstrapping Audiovisual Speech Recognition in Zero-AV-Resource Scenarios with Synthetic Visual Data
di: Buitrago, Pol, et al.
Pubblicazione: (2026)
di: Buitrago, Pol, et al.
Pubblicazione: (2026)
Target Speaker ASR with Whisper
di: Polok, Alexander, et al.
Pubblicazione: (2024)
di: Polok, Alexander, et al.
Pubblicazione: (2024)
Index-ASR Technical Report
di: Song, Zheshu, et al.
Pubblicazione: (2025)
di: Song, Zheshu, et al.
Pubblicazione: (2025)
NLE: Non-autoregressive LLM-based ASR by Transcript Editing
di: Dekel, Avihu, et al.
Pubblicazione: (2026)
di: Dekel, Avihu, et al.
Pubblicazione: (2026)
XLSR-Transducer: Streaming ASR for Self-Supervised Pretrained Models
di: Kumar, Shashi, et al.
Pubblicazione: (2024)
di: Kumar, Shashi, et al.
Pubblicazione: (2024)
Towards a Single ASR Model That Generalizes to Disordered Speech
di: Tobin, Jimmy, et al.
Pubblicazione: (2024)
di: Tobin, Jimmy, et al.
Pubblicazione: (2024)
Comparative Evaluation of Text and Audio Simplification: A Methodological Replication Study
di: Barai, Prosanta, et al.
Pubblicazione: (2025)
di: Barai, Prosanta, et al.
Pubblicazione: (2025)
MedASR: An Open-Source Model for High-Accuracy Medical Dictation
di: Wu, Ke, et al.
Pubblicazione: (2026)
di: Wu, Ke, et al.
Pubblicazione: (2026)
Contextual Biasing for Streaming ASR via CTC-based Word Spotting
di: Tsai, Kai-Chen, et al.
Pubblicazione: (2026)
di: Tsai, Kai-Chen, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Enhancing Crowdsourced Audio for Text-to-Speech Models
di: Giraldo, José, et al.
Pubblicazione: (2024) -
How Attention Shapes Emotion: A Comparative Study of Attention Mechanisms for Speech Emotion Recognition
di: Casals-Salvador, Marc, et al.
Pubblicazione: (2026) -
Zero-Shot TTS With Enhanced Audio Prompts: Bsc Submission For The 2026 Wildspoof Challenge TTS Track
di: Giraldo, Jose, et al.
Pubblicazione: (2026) -
Semi-supervised Learning for Code-Switching ASR with Large Language Model Filter
di: Xi, Yu, et al.
Pubblicazione: (2024) -
Doctor or Patient? Synergizing Diarization and ASR for Code-Switched Hinglish Medical Conditions Extraction
di: Baroudi, Séverin, et al.
Pubblicazione: (2026)