USM-Lite: Quantization and Sparsity Aware Fine-tuning for Speech Recognition with Universal Speech Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ding, Shaojin, Qiu, David, Rim, David, He, Yanzhang, Rybakov, Oleg, Li, Bo, Prabhavalkar, Rohit, Wang, Weiran, Sainath, Tara N., Han, Zhonglin, Li, Jian, Yazdanbakhsh, Amir, Agrawal, Shivani |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
USM RNN-T model weights binarization
par: Rybakov, Oleg, et autres
Publié: (2024)
par: Rybakov, Oleg, et autres
Publié: (2024)
Extreme Encoder Output Frame Rate Reduction: Improving Computational Latencies of Large End-to-End Models
par: Prabhavalkar, Rohit, et autres
Publié: (2024)
par: Prabhavalkar, Rohit, et autres
Publié: (2024)
How to Estimate Model Transferability of Pre-Trained Speech Models?
par: Chen, Zih-Ching, et autres
Publié: (2023)
par: Chen, Zih-Ching, et autres
Publié: (2023)
Text Injection for Neural Contextual Biasing
par: Meng, Zhong, et autres
Publié: (2024)
par: Meng, Zhong, et autres
Publié: (2024)
SLiM: One-shot Quantization and Sparsity with Low-rank Approximation for LLM Weight Compression
par: Mozaffari, Mohammad, et autres
Publié: (2024)
par: Mozaffari, Mohammad, et autres
Publié: (2024)
Progressive Gradient Flow for Robust N:M Sparsity Training in Transformers
par: Bambhaniya, Abhimanyu Rajeshkumar, et autres
Publié: (2024)
par: Bambhaniya, Abhimanyu Rajeshkumar, et autres
Publié: (2024)
SimulTron: On-Device Simultaneous Speech to Speech Translation
par: Agranovich, Alex, et autres
Publié: (2024)
par: Agranovich, Alex, et autres
Publié: (2024)
Speech-Omni-Lite: Portable Speech Interfaces for Vision-Language Models
par: Tao, Dehua, et autres
Publié: (2026)
par: Tao, Dehua, et autres
Publié: (2026)
LiteASR: Efficient Automatic Speech Recognition with Low-Rank Approximation
par: Kamahori, Keisuke, et autres
Publié: (2025)
par: Kamahori, Keisuke, et autres
Publié: (2025)
Multistage Fine-tuning Strategies for Automatic Speech Recognition in Low-resource Languages
par: Pillai, Leena G, et autres
Publié: (2024)
par: Pillai, Leena G, et autres
Publié: (2024)
Beyond Moore's Law: Harnessing the Redshift of Generative AI with Effective Hardware-Software Co-Design
par: Yazdanbakhsh, Amir
Publié: (2025)
par: Yazdanbakhsh, Amir
Publié: (2025)
SparseLoRA: Accelerating LLM Fine-Tuning with Contextual Sparsity
par: Khaki, Samir, et autres
Publié: (2025)
par: Khaki, Samir, et autres
Publié: (2025)
Effective Interplay between Sparsity and Quantization: From Theory to Practice
par: Harma, Simla Burcu, et autres
Publié: (2024)
par: Harma, Simla Burcu, et autres
Publié: (2024)
Improving the Inclusivity of Dutch Speech Recognition by Fine-tuning Whisper on the JASMIN-CGN Corpus
par: Shekoufandeh, Golshid, et autres
Publié: (2025)
par: Shekoufandeh, Golshid, et autres
Publié: (2025)
Hierarchical Recurrent Adapters for Efficient Multi-Task Adaptation of Large Speech Models
par: Munkhdalai, Tsendsuren, et autres
Publié: (2024)
par: Munkhdalai, Tsendsuren, et autres
Publié: (2024)
Enhancing Pre-trained ASR System Fine-tuning for Dysarthric Speech Recognition using Adversarial Data Augmentation
par: Wang, Huimeng, et autres
Publié: (2024)
par: Wang, Huimeng, et autres
Publié: (2024)
Position-invariant Fine-tuning of Speech Enhancement Models with Self-supervised Speech Representations
par: Meghanani, Amit, et autres
Publié: (2026)
par: Meghanani, Amit, et autres
Publié: (2026)
Jurnal USM Law Review
Publié: (2020)
Publié: (2020)
Bangla Hate Speech Classification with Fine-tuned Transformer Models
par: Jafari, Yalda Keivan, et autres
Publié: (2025)
par: Jafari, Yalda Keivan, et autres
Publié: (2025)
Not All NVFP4 QAT Recipes Are Equal: How Architecture and Scale Shape Model Quality for Anomaly Segmentation
par: Du, Zijian, et autres
Publié: (2026)
par: Du, Zijian, et autres
Publié: (2026)
On the Contribution of Lexical Features to Speech Emotion Recognition
par: Combei, David
Publié: (2025)
par: Combei, David
Publié: (2025)
Automatic Screening for Children with Speech Disorder using Automatic Speech Recognition: Opportunities and Challenges
par: Liu, Dancheng, et autres
Publié: (2024)
par: Liu, Dancheng, et autres
Publié: (2024)
Speech Recognition Model Improves Text-to-Speech Synthesis using Fine-Grained Reward
par: Wang, Guansu, et autres
Publié: (2025)
par: Wang, Guansu, et autres
Publié: (2025)
Speech Robust Bench: A Robustness Benchmark For Speech Recognition
par: Shah, Muhammad A., et autres
Publié: (2024)
par: Shah, Muhammad A., et autres
Publié: (2024)
Gradient Norm-based Fine-Tuning for Backdoor Defense in Automatic Speech Recognition
par: Zhou, Nanjun, et autres
Publié: (2025)
par: Zhou, Nanjun, et autres
Publié: (2025)
Persian Speech Emotion Recognition by Fine-Tuning Transformers
par: Shayaninasab, Minoo, et autres
Publié: (2024)
par: Shayaninasab, Minoo, et autres
Publié: (2024)
Speech Emotion Recognition with ASR Integration
par: Li, Yuanchao
Publié: (2026)
par: Li, Yuanchao
Publié: (2026)
Joint Automatic Speech Recognition And Structure Learning For Better Speech Understanding
par: Hu, Jiliang, et autres
Publié: (2025)
par: Hu, Jiliang, et autres
Publié: (2025)
Semantic Communications for Speech Recognition
par: Weng, Zhenzi, et autres
Publié: (2021)
par: Weng, Zhenzi, et autres
Publié: (2021)
Rubric-Guided Fine-tuning of SpeechLLMs for Multi-Aspect, Multi-Rater L2 Reading-Speech Assessment
par: Parikh, Aditya Kamlesh, et autres
Publié: (2026)
par: Parikh, Aditya Kamlesh, et autres
Publié: (2026)
Optimizing Contextual Speech Recognition Using Vector Quantization for Efficient Retrieval
par: Flemotomos, Nikolaos, et autres
Publié: (2024)
par: Flemotomos, Nikolaos, et autres
Publié: (2024)
DQ-Whisper: Joint Distillation and Quantization for Efficient Multilingual Speech Recognition
par: Shao, Hang, et autres
Publié: (2023)
par: Shao, Hang, et autres
Publié: (2023)
DQ-Data2vec: Decoupling Quantization for Multilingual Speech Recognition
par: Shao, Qijie, et autres
Publié: (2025)
par: Shao, Qijie, et autres
Publié: (2025)
Statistical Beamformer Exploiting Non-stationarity and Sparsity with Spatially Constrained ICA for Robust Speech Recognition
par: Shin, Ui-Hyeop, et autres
Publié: (2023)
par: Shin, Ui-Hyeop, et autres
Publié: (2023)
BrainWavLM: Fine-tuning Speech Representations with Brain Responses to Language
par: Vattikonda, Nishitha, et autres
Publié: (2025)
par: Vattikonda, Nishitha, et autres
Publié: (2025)
Sparsity-Driven EEG Channel Selection for Brain-Assisted Speech Enhancement
par: Zhang, Jie, et autres
Publié: (2023)
par: Zhang, Jie, et autres
Publié: (2023)
Fine-tuning Quantized Neural Networks with Zeroth-order Optimization
par: Shang, Sifeng, et autres
Publié: (2025)
par: Shang, Sifeng, et autres
Publié: (2025)
Towards LLM-Empowered Fine-Grained Speech Descriptors for Explainable Emotion Recognition
par: Chen, Youjun, et autres
Publié: (2025)
par: Chen, Youjun, et autres
Publié: (2025)
Personalized Fine-Tuning with Controllable Synthetic Speech from LLM-Generated Transcripts for Dysarthric Speech Recognition
par: Wagner, Dominik, et autres
Publié: (2025)
par: Wagner, Dominik, et autres
Publié: (2025)
Fine-Tuning Automatic Speech Recognition for People with Parkinson's: An Effective Strategy for Enhancing Speech Technology Accessibility
par: Zheng, Xiuwen, et autres
Publié: (2024)
par: Zheng, Xiuwen, et autres
Publié: (2024)
Documents similaires
-
USM RNN-T model weights binarization
par: Rybakov, Oleg, et autres
Publié: (2024) -
Extreme Encoder Output Frame Rate Reduction: Improving Computational Latencies of Large End-to-End Models
par: Prabhavalkar, Rohit, et autres
Publié: (2024) -
How to Estimate Model Transferability of Pre-Trained Speech Models?
par: Chen, Zih-Ching, et autres
Publié: (2023) -
Text Injection for Neural Contextual Biasing
par: Meng, Zhong, et autres
Publié: (2024) -
SLiM: One-shot Quantization and Sparsity with Low-rank Approximation for LLM Weight Compression
par: Mozaffari, Mohammad, et autres
Publié: (2024)