Structured Sparsity and Weight-adaptive Pruning for Memory and Compute efficient Whisper models
Fuente:
arXiv
Salvato in:
| Autori principali: | Mudi, Prasenjit K, Sachan, Anshi, Devapriya, Dahlia, Kalyani, Sheetal |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Breaking the Script Barrier: Enabling Automatic Alignment for PoS-based ASR Error Analysis in Non-Latin Scripts
di: Mudi, Prasenjit K, et al.
Pubblicazione: (2026)
di: Mudi, Prasenjit K, et al.
Pubblicazione: (2026)
Geometry Aware Meta-Learning Neural Network for Joint Phase and Precoder Optimization in RIS
di: Devapriya, Dahlia, et al.
Pubblicazione: (2024)
di: Devapriya, Dahlia, et al.
Pubblicazione: (2024)
Randomness Helps Rigor: A Probabilistic Learning Rate Scheduler Bridging Theory and Deep Learning Practice
di: Devapriya, Dahlia, et al.
Pubblicazione: (2024)
di: Devapriya, Dahlia, et al.
Pubblicazione: (2024)
Tuning-Free Structured Sparse Recovery of Multiple Measurement Vectors using Implicit Regularization
di: Jayalal, Lakshmi, et al.
Pubblicazione: (2025)
di: Jayalal, Lakshmi, et al.
Pubblicazione: (2025)
Learning Rate Optimization for Deep Neural Networks Using Lipschitz Bandits
di: Priyanka, Padma, et al.
Pubblicazione: (2024)
di: Priyanka, Padma, et al.
Pubblicazione: (2024)
First line of defense: A robust first layer mitigates adversarial attacks
di: Suresh, Janani, et al.
Pubblicazione: (2024)
di: Suresh, Janani, et al.
Pubblicazione: (2024)
Online waveform selection for cognitive radar
di: Tholeti, Thulasi, et al.
Pubblicazione: (2024)
di: Tholeti, Thulasi, et al.
Pubblicazione: (2024)
Tuning-Free Online Robust Principal Component Analysis through Implicit Regularization
di: Jayalal, Lakshmi, et al.
Pubblicazione: (2024)
di: Jayalal, Lakshmi, et al.
Pubblicazione: (2024)
Weight Concentration Regularization for Improving Pruning Robustness Under High Sparsity
di: Yun, Vincent-Daniel, et al.
Pubblicazione: (2025)
di: Yun, Vincent-Daniel, et al.
Pubblicazione: (2025)
Golden Ratio Search: A Low-Power Adversarial Attack for Deep Learning based Modulation Classification
di: Sadhukhan, Deepsayan, et al.
Pubblicazione: (2024)
di: Sadhukhan, Deepsayan, et al.
Pubblicazione: (2024)
Textless NLP -- Zero Resource Challenge with Low Resource Compute
di: Ramadass, Krithiga, et al.
Pubblicazione: (2024)
di: Ramadass, Krithiga, et al.
Pubblicazione: (2024)
Týr-the-Pruner: Structural Pruning LLMs via Global Sparsity Distribution Optimization
di: Li, Guanchen, et al.
Pubblicazione: (2025)
di: Li, Guanchen, et al.
Pubblicazione: (2025)
Federated Learning of Binary Neural Networks: Enabling Low-Cost Inference
di: Shankar, Nitin Priyadarshini, et al.
Pubblicazione: (2026)
di: Shankar, Nitin Priyadarshini, et al.
Pubblicazione: (2026)
DRL-AdaPart: DRL-Driven Adaptive STAR-RIS Partitioning for Fair and Frugal Resource Utilization
di: Kumar, Ashok S., et al.
Pubblicazione: (2024)
di: Kumar, Ashok S., et al.
Pubblicazione: (2024)
Activity Sparsity Complements Weight Sparsity for Efficient RNN Inference
di: Mukherji, Rishav, et al.
Pubblicazione: (2023)
di: Mukherji, Rishav, et al.
Pubblicazione: (2023)
Outlier Weighed Layerwise Sparsity (OWL): A Missing Secret Sauce for Pruning LLMs to High Sparsity
di: Yin, Lu, et al.
Pubblicazione: (2023)
di: Yin, Lu, et al.
Pubblicazione: (2023)
CRISP: Hybrid Structured Sparsity for Class-aware Model Pruning
di: Aggarwal, Shivam, et al.
Pubblicazione: (2023)
di: Aggarwal, Shivam, et al.
Pubblicazione: (2023)
Improving MoE Compute Efficiency by Composing Weight and Data Sparsity
di: Kilian, Maciej, et al.
Pubblicazione: (2026)
di: Kilian, Maciej, et al.
Pubblicazione: (2026)
Selection Plateau and a Sparsity-Dependent Hierarchy of Pruning Features
di: Li, Guangqi, et al.
Pubblicazione: (2026)
di: Li, Guangqi, et al.
Pubblicazione: (2026)
Beyond One-Way Pruning: Bidirectional Pruning-Regrowth for Extreme Accuracy-Sparsity Tradeoff
di: Liu, Junchen, et al.
Pubblicazione: (2025)
di: Liu, Junchen, et al.
Pubblicazione: (2025)
Mustafar: Promoting Unstructured Sparsity for KV Cache Pruning in LLM Inference
di: Joo, Donghyeon, et al.
Pubblicazione: (2025)
di: Joo, Donghyeon, et al.
Pubblicazione: (2025)
FedMef: Towards Memory-efficient Federated Dynamic Pruning
di: Huang, Hong, et al.
Pubblicazione: (2024)
di: Huang, Hong, et al.
Pubblicazione: (2024)
Twilight: Adaptive Attention Sparsity with Hierarchical Top-$p$ Pruning
di: Lin, Chaofan, et al.
Pubblicazione: (2025)
di: Lin, Chaofan, et al.
Pubblicazione: (2025)
StructPrune: Structured Global Pruning asymptotics with $\mathcal{O}(\sqrt{N})$ GPU Memory
di: Song, Xinyuan, et al.
Pubblicazione: (2025)
di: Song, Xinyuan, et al.
Pubblicazione: (2025)
Weight Sparsity Complements Activity Sparsity in Neuromorphic Language Models
di: Mukherji, Rishav, et al.
Pubblicazione: (2024)
di: Mukherji, Rishav, et al.
Pubblicazione: (2024)
DuoGPT: Training-free Dual Sparsity through Activation-aware Pruning in LLMs
di: Yin, Ruokai, et al.
Pubblicazione: (2025)
di: Yin, Ruokai, et al.
Pubblicazione: (2025)
PACiM: A Sparsity-Centric Hybrid Compute-in-Memory Architecture via Probabilistic Approximation
di: Zhang, Wenlun, et al.
Pubblicazione: (2024)
di: Zhang, Wenlun, et al.
Pubblicazione: (2024)
Pruning Weights but Not Truth: Safeguarding Truthfulness While Pruning LLMs
di: Fu, Yao, et al.
Pubblicazione: (2025)
di: Fu, Yao, et al.
Pubblicazione: (2025)
Understanding and Exploiting Weight Update Sparsity for Communication-Efficient Distributed RL
di: Miahi, Erfan, et al.
Pubblicazione: (2026)
di: Miahi, Erfan, et al.
Pubblicazione: (2026)
Maximum Redundancy Pruning: A Principle-Driven Layerwise Sparsity Allocation for LLMs
di: Gao, Chang, et al.
Pubblicazione: (2025)
di: Gao, Chang, et al.
Pubblicazione: (2025)
SwiftPrune: Hessian-Free Weight Pruning for Large Language Models
di: Kang, Yuhan, et al.
Pubblicazione: (2025)
di: Kang, Yuhan, et al.
Pubblicazione: (2025)
Accelerating LLM Inference with Flexible N:M Sparsity via A Fully Digital Compute-in-Memory Accelerator
di: Ramachandran, Akshat, et al.
Pubblicazione: (2025)
di: Ramachandran, Akshat, et al.
Pubblicazione: (2025)
FedPaI: Achieving Extreme Sparsity in Federated Learning via Pruning at Initialization
di: Wang, Haonan, et al.
Pubblicazione: (2025)
di: Wang, Haonan, et al.
Pubblicazione: (2025)
TT-Prune: Joint Model Pruning and Resource Allocation for Communication-efficient Time-triggered Federated Learning
di: Zhang, Xinlu, et al.
Pubblicazione: (2025)
di: Zhang, Xinlu, et al.
Pubblicazione: (2025)
Whispering in Amharic: Fine-tuning Whisper for Low-resource Language
di: Gete, Dawit Ketema, et al.
Pubblicazione: (2025)
di: Gete, Dawit Ketema, et al.
Pubblicazione: (2025)
EMP: Enhance Memory in Data Pruning
di: Xiao, Jinying, et al.
Pubblicazione: (2024)
di: Xiao, Jinying, et al.
Pubblicazione: (2024)
Augmenting Attention with Exponentially Decaying Memory Improves Query-Aware KV Sparsity
di: Wei, Xiuying, et al.
Pubblicazione: (2026)
di: Wei, Xiuying, et al.
Pubblicazione: (2026)
Rethinking Pruning for Vision-Language Models: Strategies for Effective Sparsity and Performance Restoration
di: He, Shwai, et al.
Pubblicazione: (2024)
di: He, Shwai, et al.
Pubblicazione: (2024)
BESA: Pruning Large Language Models with Blockwise Parameter-Efficient Sparsity Allocation
di: Xu, Peng, et al.
Pubblicazione: (2024)
di: Xu, Peng, et al.
Pubblicazione: (2024)
Rapid Deployment of DNNs for Edge Computing via Structured Pruning at Initialization
di: Eccles, Bailey J., et al.
Pubblicazione: (2024)
di: Eccles, Bailey J., et al.
Pubblicazione: (2024)
Documenti analoghi
-
Breaking the Script Barrier: Enabling Automatic Alignment for PoS-based ASR Error Analysis in Non-Latin Scripts
di: Mudi, Prasenjit K, et al.
Pubblicazione: (2026) -
Geometry Aware Meta-Learning Neural Network for Joint Phase and Precoder Optimization in RIS
di: Devapriya, Dahlia, et al.
Pubblicazione: (2024) -
Randomness Helps Rigor: A Probabilistic Learning Rate Scheduler Bridging Theory and Deep Learning Practice
di: Devapriya, Dahlia, et al.
Pubblicazione: (2024) -
Tuning-Free Structured Sparse Recovery of Multiple Measurement Vectors using Implicit Regularization
di: Jayalal, Lakshmi, et al.
Pubblicazione: (2025) -
Learning Rate Optimization for Deep Neural Networks Using Lipschitz Bandits
di: Priyanka, Padma, et al.
Pubblicazione: (2024)