Tight Compression: Compressing CNN Through Fine-Grained Pruning and Weight Permutation for Efficient Implementation
Fuente:
arXiv
Salvato in:
| Autori principali: | Chen, Xizi, Zhu, Jingyang, Jiang, Jingbo, Tsui, Chi-Ying |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2021
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Partial Knowledge Distillation for Alleviating the Inherent Inter-Class Discrepancy in Federated Learning
di: Gan, Xiaoyu, et al.
Pubblicazione: (2024)
di: Gan, Xiaoyu, et al.
Pubblicazione: (2024)
Accelerating Large Kernel Convolutions with Nested Winograd Transformation.pdf
di: Jiang, Jingbo, et al.
Pubblicazione: (2021)
di: Jiang, Jingbo, et al.
Pubblicazione: (2021)
SHRP: Specialized Head Routing and Pruning for Efficient Encoder Compression
di: Su, Zeli, et al.
Pubblicazione: (2025)
di: Su, Zeli, et al.
Pubblicazione: (2025)
EPSD: Early Pruning with Self-Distillation for Efficient Model Compression
di: Chen, Dong, et al.
Pubblicazione: (2024)
di: Chen, Dong, et al.
Pubblicazione: (2024)
Memory-Efficient Fine-Tuning via Low-Rank Activation Compression
di: Shi, Jiang-Xin, et al.
Pubblicazione: (2025)
di: Shi, Jiang-Xin, et al.
Pubblicazione: (2025)
PACE: Prune-And-Compress Ensemble Models
di: Akkerman, Fabian, et al.
Pubblicazione: (2026)
di: Akkerman, Fabian, et al.
Pubblicazione: (2026)
PrunePEFT: Iterative Hybrid Pruning for Parameter-Efficient Fine-tuning of LLMs
di: Yu, Tongzhou, et al.
Pubblicazione: (2025)
di: Yu, Tongzhou, et al.
Pubblicazione: (2025)
Bandwidth-Aware and Overlap-Weighted Compression for Communication-Efficient Federated Learning
di: Tang, Zichen, et al.
Pubblicazione: (2024)
di: Tang, Zichen, et al.
Pubblicazione: (2024)
MUC-G4: Minimal Unsat Core-Guided Incremental Verification for Deep Neural Network Compression
di: Li, Jingyang, et al.
Pubblicazione: (2025)
di: Li, Jingyang, et al.
Pubblicazione: (2025)
Neural Weight Compression for Language Models
di: Ryu, Jegwang, et al.
Pubblicazione: (2025)
di: Ryu, Jegwang, et al.
Pubblicazione: (2025)
Shapley Pruning for Neural Network Compression
di: Adamczewski, Kamil, et al.
Pubblicazione: (2024)
di: Adamczewski, Kamil, et al.
Pubblicazione: (2024)
Prune-Quantize-Distill: An Ordered Pipeline for Efficient Neural Network Compression
di: Zhou, Longsheng, et al.
Pubblicazione: (2026)
di: Zhou, Longsheng, et al.
Pubblicazione: (2026)
Sink-Token-Aware Pruning for Fine-Grained Video Understanding in Efficient Video LLMs
di: Kim, Kibum, et al.
Pubblicazione: (2026)
di: Kim, Kibum, et al.
Pubblicazione: (2026)
Long Chain-of-Thought Compression via Fine-Grained Group Policy Optimization
di: Han, Xinchen, et al.
Pubblicazione: (2026)
di: Han, Xinchen, et al.
Pubblicazione: (2026)
Adaptive Pruning with Module Robustness Sensitivity: Balancing Compression and Robustness
di: Bai, Lincen, et al.
Pubblicazione: (2024)
di: Bai, Lincen, et al.
Pubblicazione: (2024)
Hyper-Compression: Model Compression via Hyperfunction
di: Fan, Fenglei, et al.
Pubblicazione: (2024)
di: Fan, Fenglei, et al.
Pubblicazione: (2024)
Compressing CNN models for resource-constrained systems by channel and layer pruning
di: Sadaqa, Ahmed, et al.
Pubblicazione: (2025)
di: Sadaqa, Ahmed, et al.
Pubblicazione: (2025)
Order of Compression: A Systematic and Optimal Sequence to Combinationally Compress CNN
di: Shen, Yingtao, et al.
Pubblicazione: (2024)
di: Shen, Yingtao, et al.
Pubblicazione: (2024)
Locality-Aware Redundancy Pruning for LLM Depth Compression
di: Yun, Vincent-Daniel, et al.
Pubblicazione: (2026)
di: Yun, Vincent-Daniel, et al.
Pubblicazione: (2026)
Automatic Joint Structured Pruning and Quantization for Efficient Neural Network Training and Compression
di: Qu, Xiaoyi, et al.
Pubblicazione: (2025)
di: Qu, Xiaoyi, et al.
Pubblicazione: (2025)
AutoCompress: Critical Layer Isolation for Efficient Transformer Compression
di: Thorat, Archit
Pubblicazione: (2026)
di: Thorat, Archit
Pubblicazione: (2026)
Spatio-Temporal Pruning for Compressed Spiking Large Language Models
di: Jiang, Yi, et al.
Pubblicazione: (2025)
di: Jiang, Yi, et al.
Pubblicazione: (2025)
VTrans: Accelerating Transformer Compression with Variational Information Bottleneck based Pruning
di: Dutta, Oshin, et al.
Pubblicazione: (2024)
di: Dutta, Oshin, et al.
Pubblicazione: (2024)
SimCert: Probabilistic Certification for Behavioral Similarity in Deep Neural Network Compression
di: Li, Jingyang, et al.
Pubblicazione: (2026)
di: Li, Jingyang, et al.
Pubblicazione: (2026)
Smooth Model Compression without Fine-Tuning
di: Runkel, Christina, et al.
Pubblicazione: (2025)
di: Runkel, Christina, et al.
Pubblicazione: (2025)
FedLAM: Low-latency Wireless Federated Learning via Layer-wise Adaptive Modulation
di: Qu, Linping, et al.
Pubblicazione: (2025)
di: Qu, Linping, et al.
Pubblicazione: (2025)
Towards Efficient VLMs: Information-Theoretic Driven Compression via Adaptive Structural Pruning
di: Xu, Zhaoqi, et al.
Pubblicazione: (2025)
di: Xu, Zhaoqi, et al.
Pubblicazione: (2025)
Sparse Gradient Compression for Fine-Tuning Large Language Models
di: Yang, David H., et al.
Pubblicazione: (2025)
di: Yang, David H., et al.
Pubblicazione: (2025)
To Compress or Not? Pushing the Frontier of Lossless GenAI Model Weights Compression with Exponent Concentration
di: Yang, Zeyu, et al.
Pubblicazione: (2025)
di: Yang, Zeyu, et al.
Pubblicazione: (2025)
Variance-Based Pruning for Accelerating and Compressing Trained Networks
di: Berisha, Uranik, et al.
Pubblicazione: (2025)
di: Berisha, Uranik, et al.
Pubblicazione: (2025)
RazorAttention: Efficient KV Cache Compression Through Retrieval Heads
di: Tang, Hanlin, et al.
Pubblicazione: (2024)
di: Tang, Hanlin, et al.
Pubblicazione: (2024)
An Empirical Study of the Influence of Adversarial Fine-Tuning on Compressed Neural Networks
di: Thorsteinsson, Hallgrimur, et al.
Pubblicazione: (2024)
di: Thorsteinsson, Hallgrimur, et al.
Pubblicazione: (2024)
Activation Compression in LLMs: Theoretical Analysis and Efficient Algorithm
di: Wei, Wen-Da, et al.
Pubblicazione: (2026)
di: Wei, Wen-Da, et al.
Pubblicazione: (2026)
Motion-Compensated Weight Compression
di: Lamaakal, Ismail
Pubblicazione: (2026)
di: Lamaakal, Ismail
Pubblicazione: (2026)
Compressed Sensing: Mathematical Foundations, Implementation, and Advanced Optimization Techniques
di: Stevenson, Shane, et al.
Pubblicazione: (2025)
di: Stevenson, Shane, et al.
Pubblicazione: (2025)
One Shot vs. Iterative: Rethinking Pruning Strategies for Model Compression
di: Janusz, Mikołaj, et al.
Pubblicazione: (2025)
di: Janusz, Mikołaj, et al.
Pubblicazione: (2025)
RAP: KV-Cache Compression via RoPE-Aligned Pruning
di: Xin, Jihao, et al.
Pubblicazione: (2026)
di: Xin, Jihao, et al.
Pubblicazione: (2026)
A Free Lunch in LLM Compression: Revisiting Retraining after Pruning
di: Wagner, Moritz, et al.
Pubblicazione: (2025)
di: Wagner, Moritz, et al.
Pubblicazione: (2025)
EntroLLM: Entropy Encoded Weight Compression for Efficient Large Language Model Inference on Edge Devices
di: Sanyal, Arnab, et al.
Pubblicazione: (2025)
di: Sanyal, Arnab, et al.
Pubblicazione: (2025)
C-SWAP: Explainability-Aware Structured Pruning for Efficient Neural Networks Compression
di: Bauvin, Baptiste, et al.
Pubblicazione: (2025)
di: Bauvin, Baptiste, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Partial Knowledge Distillation for Alleviating the Inherent Inter-Class Discrepancy in Federated Learning
di: Gan, Xiaoyu, et al.
Pubblicazione: (2024) -
Accelerating Large Kernel Convolutions with Nested Winograd Transformation.pdf
di: Jiang, Jingbo, et al.
Pubblicazione: (2021) -
SHRP: Specialized Head Routing and Pruning for Efficient Encoder Compression
di: Su, Zeli, et al.
Pubblicazione: (2025) -
EPSD: Early Pruning with Self-Distillation for Efficient Model Compression
di: Chen, Dong, et al.
Pubblicazione: (2024) -
Memory-Efficient Fine-Tuning via Low-Rank Activation Compression
di: Shi, Jiang-Xin, et al.
Pubblicazione: (2025)