Continual Learning Optimizations for Auto-regressive Decoder of Multilingual ASR systems
Fuente:
arXiv
Salvato in:
| Autori principali: | Kwok, Chin Yuen, Yip, Jia Qi, Chng, Eng Siong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Bridging Speech and Text: Enhancing ASR with Pinyin-to-Character Pre-training in LLMs
di: Yuhang, Yang, et al.
Pubblicazione: (2024)
di: Yuhang, Yang, et al.
Pubblicazione: (2024)
Analysis of Speaker Verification Performance Trade-offs with Neural Audio Codec Transmission
di: Thakur, Nirmalya Mallick, et al.
Pubblicazione: (2025)
di: Thakur, Nirmalya Mallick, et al.
Pubblicazione: (2025)
Robust Zero-Shot Text-to-Speech Synthesis with Reverse Inference Optimization
di: Hu, Yuchen, et al.
Pubblicazione: (2024)
di: Hu, Yuchen, et al.
Pubblicazione: (2024)
Hierarchical Self-Supervised Representation Learning for Depression Detection from Speech
di: Li, Yuxin, et al.
Pubblicazione: (2025)
di: Li, Yuxin, et al.
Pubblicazione: (2025)
Bi-directional Context-Enhanced Speech Large Language Models for Multilingual Conversational ASR
di: Peng, Yizhou, et al.
Pubblicazione: (2025)
di: Peng, Yizhou, et al.
Pubblicazione: (2025)
Speech Separation using Neural Audio Codecs with Embedding Loss
di: Yip, Jia Qi, et al.
Pubblicazione: (2024)
di: Yip, Jia Qi, et al.
Pubblicazione: (2024)
Speech Enhancement Using Continuous Embeddings of Neural Audio Codec
di: Li, Haoyang, et al.
Pubblicazione: (2025)
di: Li, Haoyang, et al.
Pubblicazione: (2025)
Emphasized Non-Target Speaker Knowledge in Knowledge Distillation for Automatic Speaker Verification
di: Truong, Duc-Tuan, et al.
Pubblicazione: (2023)
di: Truong, Duc-Tuan, et al.
Pubblicazione: (2023)
Enhancing Zero-shot Text-to-Speech Synthesis with Human Feedback
di: Chen, Chen, et al.
Pubblicazione: (2024)
di: Chen, Chen, et al.
Pubblicazione: (2024)
Romanization Encoding For Multilingual ASR
di: Ding, Wen, et al.
Pubblicazione: (2024)
di: Ding, Wen, et al.
Pubblicazione: (2024)
Audio-CoT: Exploring Chain-of-Thought Reasoning in Large Audio Language Model
di: Ma, Ziyang, et al.
Pubblicazione: (2025)
di: Ma, Ziyang, et al.
Pubblicazione: (2025)
Speechless: Speech Instruction Training Without Speech for Low Resource Languages
di: Dao, Alan, et al.
Pubblicazione: (2025)
di: Dao, Alan, et al.
Pubblicazione: (2025)
AutoMode-ASR: Learning to Select ASR Systems for Better Quality and Cost
di: Gündüz, Ahmet, et al.
Pubblicazione: (2024)
di: Gündüz, Ahmet, et al.
Pubblicazione: (2024)
Towards Audio Codec-based Speech Separation
di: Yip, Jia Qi, et al.
Pubblicazione: (2024)
di: Yip, Jia Qi, et al.
Pubblicazione: (2024)
Noro: Noise-Robust One-shot Voice Conversion with Hidden Speaker Representation Learning
di: He, Haorui, et al.
Pubblicazione: (2024)
di: He, Haorui, et al.
Pubblicazione: (2024)
Wav2code: Restore Clean Speech Representations via Codebook Lookup for Noise-Robust ASR
di: Hu, Yuchen, et al.
Pubblicazione: (2023)
di: Hu, Yuchen, et al.
Pubblicazione: (2023)
MSA-ASR: Efficient Multilingual Speaker Attribution with frozen ASR Models
di: Nguyen, Thai-Binh, et al.
Pubblicazione: (2024)
di: Nguyen, Thai-Binh, et al.
Pubblicazione: (2024)
Audio Large Language Models Can Be Descriptive Speech Quality Evaluators
di: Chen, Chen, et al.
Pubblicazione: (2025)
di: Chen, Chen, et al.
Pubblicazione: (2025)
Exploring SSL Discrete Tokens for Multilingual ASR
di: Cui, Mingyu, et al.
Pubblicazione: (2024)
di: Cui, Mingyu, et al.
Pubblicazione: (2024)
Configurable Multilingual ASR with Speech Summary Representations
di: Zhu, Harrison, et al.
Pubblicazione: (2024)
di: Zhu, Harrison, et al.
Pubblicazione: (2024)
Zero-shot Context Biasing with Trie-based Decoding using Synthetic Multi-Pronunciation
di: Liu, Changsong, et al.
Pubblicazione: (2025)
di: Liu, Changsong, et al.
Pubblicazione: (2025)
EASY: Emotion-aware Speaker Anonymization via Factorized Distillation
di: Yao, Jixun, et al.
Pubblicazione: (2025)
di: Yao, Jixun, et al.
Pubblicazione: (2025)
Advocating Character Error Rate for Multilingual ASR Evaluation
di: K, Thennal D, et al.
Pubblicazione: (2024)
di: K, Thennal D, et al.
Pubblicazione: (2024)
Training-Free Intelligibility-Guided Observation Addition for Noisy ASR
di: Li, Haoyang, et al.
Pubblicazione: (2026)
di: Li, Haoyang, et al.
Pubblicazione: (2026)
Efficient Multilingual ASR Finetuning via LoRA Language Experts
di: Li, Jiahong, et al.
Pubblicazione: (2025)
di: Li, Jiahong, et al.
Pubblicazione: (2025)
Improving Multilingual ASR in the Wild Using Simple N-best Re-ranking
di: Yan, Brian, et al.
Pubblicazione: (2024)
di: Yan, Brian, et al.
Pubblicazione: (2024)
GenTranslate: Large Language Models are Generative Multilingual Speech and Machine Translators
di: Hu, Yuchen, et al.
Pubblicazione: (2024)
di: Hu, Yuchen, et al.
Pubblicazione: (2024)
UniArray: Unified Spectral-Spatial Modeling for Array-Geometry-Agnostic Speech Separation
di: Chen, Weiguang, et al.
Pubblicazione: (2025)
di: Chen, Weiguang, et al.
Pubblicazione: (2025)
NTU Speechlab LLM-Based Multilingual ASR System for Interspeech MLC-SLM Challenge 2025
di: Peng, Yizhou, et al.
Pubblicazione: (2025)
di: Peng, Yizhou, et al.
Pubblicazione: (2025)
Loss Masking Is Not Needed in Decoder-only Transformer for Discrete-token-based ASR
di: Chen, Qian, et al.
Pubblicazione: (2023)
di: Chen, Qian, et al.
Pubblicazione: (2023)
Model-free Speculative Decoding for Transformer-based ASR with Token Map Drafting
di: Ho, Tuan Vu, et al.
Pubblicazione: (2025)
di: Ho, Tuan Vu, et al.
Pubblicazione: (2025)
LAMA-UT: Language Agnostic Multilingual ASR through Orthography Unification and Language-Specific Transliteration
di: Lee, Sangmin, et al.
Pubblicazione: (2024)
di: Lee, Sangmin, et al.
Pubblicazione: (2024)
Multilingual and Fully Non-Autoregressive ASR with Large Language Model Fusion: A Comprehensive Study
di: Huang, W. Ronny, et al.
Pubblicazione: (2024)
di: Huang, W. Ronny, et al.
Pubblicazione: (2024)
Towards Rehearsal-Free Multilingual ASR: A LoRA-based Case Study on Whisper
di: Xu, Tianyi, et al.
Pubblicazione: (2024)
di: Xu, Tianyi, et al.
Pubblicazione: (2024)
Noise-Aware Speech Separation with Contrastive Learning
di: Zhang, Zizheng, et al.
Pubblicazione: (2023)
di: Zhang, Zizheng, et al.
Pubblicazione: (2023)
A Language-Agnostic Hierarchical LoRA-MoE Architecture for CTC-based Multilingual ASR
di: Zheng, Yuang, et al.
Pubblicazione: (2026)
di: Zheng, Yuang, et al.
Pubblicazione: (2026)
Room Impulse Responses help attackers to evade Deep Fake Detection
di: Luong, Hieu-Thi, et al.
Pubblicazione: (2024)
di: Luong, Hieu-Thi, et al.
Pubblicazione: (2024)
Diagnostic-Driven Layer-Wise Compensation for Post-Training Quantization of Encoder-Decoder ASR Models
di: Wang, Xinyu, et al.
Pubblicazione: (2026)
di: Wang, Xinyu, et al.
Pubblicazione: (2026)
PromptASR for contextualized ASR with controllable style
di: Yang, Xiaoyu, et al.
Pubblicazione: (2023)
di: Yang, Xiaoyu, et al.
Pubblicazione: (2023)
Anatomy of Industrial Scale Multilingual ASR
di: Ramirez, Francis McCann, et al.
Pubblicazione: (2024)
di: Ramirez, Francis McCann, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Bridging Speech and Text: Enhancing ASR with Pinyin-to-Character Pre-training in LLMs
di: Yuhang, Yang, et al.
Pubblicazione: (2024) -
Analysis of Speaker Verification Performance Trade-offs with Neural Audio Codec Transmission
di: Thakur, Nirmalya Mallick, et al.
Pubblicazione: (2025) -
Robust Zero-Shot Text-to-Speech Synthesis with Reverse Inference Optimization
di: Hu, Yuchen, et al.
Pubblicazione: (2024) -
Hierarchical Self-Supervised Representation Learning for Depression Detection from Speech
di: Li, Yuxin, et al.
Pubblicazione: (2025) -
Bi-directional Context-Enhanced Speech Large Language Models for Multilingual Conversational ASR
di: Peng, Yizhou, et al.
Pubblicazione: (2025)