Zipper-LoRA: Dynamic Parameter Decoupling for Speech-LLM based Multilingual Speech Recognition
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Mei, Yuxiang, Qiu, Delai, Liu, Shengping, Liang, Jiaen, Long, Yanhua |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Bridging the gap: A comparative exploration of Speech-LLM and end-to-end architecture for multilingual conversational ASR
von: Mei, Yuxiang, et al.
Veröffentlicht: (2026)
von: Mei, Yuxiang, et al.
Veröffentlicht: (2026)
A Language-Agnostic Hierarchical LoRA-MoE Architecture for CTC-based Multilingual ASR
von: Zheng, Yuang, et al.
Veröffentlicht: (2026)
von: Zheng, Yuang, et al.
Veröffentlicht: (2026)
UtterTune: LoRA-Based Target-Language Pronunciation Edit and Control in Multilingual Text-to-Speech
von: Kato, Shuhei
Veröffentlicht: (2025)
von: Kato, Shuhei
Veröffentlicht: (2025)
Efficient Multilingual ASR Finetuning via LoRA Language Experts
von: Li, Jiahong, et al.
Veröffentlicht: (2025)
von: Li, Jiahong, et al.
Veröffentlicht: (2025)
DQ-Data2vec: Decoupling Quantization for Multilingual Speech Recognition
von: Shao, Qijie, et al.
Veröffentlicht: (2025)
von: Shao, Qijie, et al.
Veröffentlicht: (2025)
VAPO: End-to-end Slide-Enhanced Speech Recognition with Omni-modal Large Language Models
von: Hu, Rui, et al.
Veröffentlicht: (2025)
von: Hu, Rui, et al.
Veröffentlicht: (2025)
Towards Rehearsal-Free Multilingual ASR: A LoRA-based Case Study on Whisper
von: Xu, Tianyi, et al.
Veröffentlicht: (2024)
von: Xu, Tianyi, et al.
Veröffentlicht: (2024)
Sparsely Shared LoRA on Whisper for Child Speech Recognition
von: Liu, Wei, et al.
Veröffentlicht: (2023)
von: Liu, Wei, et al.
Veröffentlicht: (2023)
A Unified Speech LLM for Diarization and Speech Recognition in Multilingual Conversations
von: Saengthong, Phurich, et al.
Veröffentlicht: (2025)
von: Saengthong, Phurich, et al.
Veröffentlicht: (2025)
On the Role of Encoder Depth: Pruning Whisper and LoRA Fine-Tuning in SLAM-ASR
von: Kolluri, Ganesh Pavan Kartikeya Bharadwaj, et al.
Veröffentlicht: (2026)
von: Kolluri, Ganesh Pavan Kartikeya Bharadwaj, et al.
Veröffentlicht: (2026)
Adaptive Inner Speech-Text Alignment for LLM-based Speech Translation
von: Liu, Henglyu, et al.
Veröffentlicht: (2025)
von: Liu, Henglyu, et al.
Veröffentlicht: (2025)
ILT-Iterative LoRA Training through Focus-Feedback-Fix for Multilingual Speech Recognition
von: Meng, Qingliang, et al.
Veröffentlicht: (2025)
von: Meng, Qingliang, et al.
Veröffentlicht: (2025)
Enhancing Indonesian Automatic Speech Recognition: Evaluating Multilingual Models with Diverse Speech Variabilities
von: Adila, Aulia, et al.
Veröffentlicht: (2024)
von: Adila, Aulia, et al.
Veröffentlicht: (2024)
SHNU Multilingual Conversational Speech Recognition System for INTERSPEECH 2025 MLC-SLM Challenge
von: Mei, Yuxiang, et al.
Veröffentlicht: (2025)
von: Mei, Yuxiang, et al.
Veröffentlicht: (2025)
DQ-Whisper: Joint Distillation and Quantization for Efficient Multilingual Speech Recognition
von: Shao, Hang, et al.
Veröffentlicht: (2023)
von: Shao, Hang, et al.
Veröffentlicht: (2023)
SpeechTaxi: On Multilingual Semantic Speech Classification
von: Keller, Lennart, et al.
Veröffentlicht: (2024)
von: Keller, Lennart, et al.
Veröffentlicht: (2024)
SSHR: Leveraging Self-supervised Hierarchical Representations for Multilingual Automatic Speech Recognition
von: Xue, Hongfei, et al.
Veröffentlicht: (2023)
von: Xue, Hongfei, et al.
Veröffentlicht: (2023)
Qwen vs. Gemma Integration with Whisper: A Comparative Study in Multilingual SpeechLLM Systems
von: Nguyen, Tuan, et al.
Veröffentlicht: (2025)
von: Nguyen, Tuan, et al.
Veröffentlicht: (2025)
Weighted Cross-entropy for Low-Resource Languages in Multilingual Speech Recognition
von: Piñeiro-Martín, Andrés, et al.
Veröffentlicht: (2024)
von: Piñeiro-Martín, Andrés, et al.
Veröffentlicht: (2024)
Cross-lingual Embedding Clustering for Hierarchical Softmax in Low-Resource Multilingual Speech Recognition
von: Yang, Zhengdong, et al.
Veröffentlicht: (2025)
von: Yang, Zhengdong, et al.
Veröffentlicht: (2025)
Dynamic Data Pruning for Automatic Speech Recognition
von: Xiao, Qiao, et al.
Veröffentlicht: (2024)
von: Xiao, Qiao, et al.
Veröffentlicht: (2024)
Cocktail-Party Audio-Visual Speech Recognition
von: Nguyen, Thai-Binh, et al.
Veröffentlicht: (2025)
von: Nguyen, Thai-Binh, et al.
Veröffentlicht: (2025)
Speech-MASSIVE: A Multilingual Speech Dataset for SLU and Beyond
von: Lee, Beomseok, et al.
Veröffentlicht: (2024)
von: Lee, Beomseok, et al.
Veröffentlicht: (2024)
Uni-ASR: Unified LLM-Based Architecture for Non-Streaming and Streaming Automatic Speech Recognition
von: Xia, Yinfeng, et al.
Veröffentlicht: (2026)
von: Xia, Yinfeng, et al.
Veröffentlicht: (2026)
MultiMed: Multilingual Medical Speech Recognition via Attention Encoder Decoder
von: Le-Duc, Khai, et al.
Veröffentlicht: (2024)
von: Le-Duc, Khai, et al.
Veröffentlicht: (2024)
Multi-Teacher Language-Aware Knowledge Distillation for Multilingual Speech Emotion Recognition
von: Bijoy, Mehedi Hasan, et al.
Veröffentlicht: (2025)
von: Bijoy, Mehedi Hasan, et al.
Veröffentlicht: (2025)
PART: Progressive Alignment Representation Training for Multilingual Speech-To-Text with LLMs
von: Zhang, Pei, et al.
Veröffentlicht: (2025)
von: Zhang, Pei, et al.
Veröffentlicht: (2025)
Low-Resourced Speech Recognition for Iu Mien Language via Weakly-Supervised Phoneme-based Multilingual Pre-training
von: Dong, Lukuan, et al.
Veröffentlicht: (2024)
von: Dong, Lukuan, et al.
Veröffentlicht: (2024)
Contextualized Automatic Speech Recognition with Dynamic Vocabulary
von: Sudo, Yui, et al.
Veröffentlicht: (2024)
von: Sudo, Yui, et al.
Veröffentlicht: (2024)
DYNAC: Dynamic Vocabulary based Non-Autoregressive Contextualization for Speech Recognition
von: Sudo, Yui, et al.
Veröffentlicht: (2025)
von: Sudo, Yui, et al.
Veröffentlicht: (2025)
OWSM-Biasing: Contextualizing Open Whisper-Style Speech Models for Automatic Speech Recognition with Dynamic Vocabulary
von: Sudo, Yui, et al.
Veröffentlicht: (2025)
von: Sudo, Yui, et al.
Veröffentlicht: (2025)
Rethinking Entropy Allocation in LLM-based ASR: Understanding the Dynamics between Speech Encoders and LLMs
von: Xie, Yuan, et al.
Veröffentlicht: (2026)
von: Xie, Yuan, et al.
Veröffentlicht: (2026)
Efficient Streaming LLM for Speech Recognition
von: Jia, Junteng, et al.
Veröffentlicht: (2024)
von: Jia, Junteng, et al.
Veröffentlicht: (2024)
VoiceCraft-X: Unifying Multilingual, Voice-Cloning Speech Synthesis and Speech Editing
von: Zheng, Zhisheng, et al.
Veröffentlicht: (2025)
von: Zheng, Zhisheng, et al.
Veröffentlicht: (2025)
Language-Universal Speech Attributes Modeling for Zero-Shot Multilingual Spoken Keyword Recognition
von: Yen, Hao, et al.
Veröffentlicht: (2024)
von: Yen, Hao, et al.
Veröffentlicht: (2024)
Whistle: Data-Efficient Multilingual and Crosslingual Speech Recognition via Weakly Phonetic Supervision
von: Yusuyin, Saierdaer, et al.
Veröffentlicht: (2024)
von: Yusuyin, Saierdaer, et al.
Veröffentlicht: (2024)
Unimodal Aggregation for CTC-based Speech Recognition
von: Fang, Ying, et al.
Veröffentlicht: (2023)
von: Fang, Ying, et al.
Veröffentlicht: (2023)
Equipping LLM with Directional Multi-Talker Speech Understanding Capabilities
von: Lin, Ju, et al.
Veröffentlicht: (2026)
von: Lin, Ju, et al.
Veröffentlicht: (2026)
Mixture of LoRA Experts with Multi-Modal and Multi-Granularity LLM Generative Error Correction for Accented Speech Recognition
von: Mu, Bingshen, et al.
Veröffentlicht: (2025)
von: Mu, Bingshen, et al.
Veröffentlicht: (2025)
Behind the Scenes: Mechanistic Interpretability of LoRA-adapted Whisper for Speech Emotion Recognition
von: Ma, Yujian, et al.
Veröffentlicht: (2025)
von: Ma, Yujian, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Bridging the gap: A comparative exploration of Speech-LLM and end-to-end architecture for multilingual conversational ASR
von: Mei, Yuxiang, et al.
Veröffentlicht: (2026) -
A Language-Agnostic Hierarchical LoRA-MoE Architecture for CTC-based Multilingual ASR
von: Zheng, Yuang, et al.
Veröffentlicht: (2026) -
UtterTune: LoRA-Based Target-Language Pronunciation Edit and Control in Multilingual Text-to-Speech
von: Kato, Shuhei
Veröffentlicht: (2025) -
Efficient Multilingual ASR Finetuning via LoRA Language Experts
von: Li, Jiahong, et al.
Veröffentlicht: (2025) -
DQ-Data2vec: Decoupling Quantization for Multilingual Speech Recognition
von: Shao, Qijie, et al.
Veröffentlicht: (2025)