Towards Robust Pruning: An Adaptive Knowledge-Retention Pruning Strategy for Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Li, Jianwei, Lei, Qi, Cheng, Wei, Xu, Dongkuan |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2023
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Adaptive Draft-Verification for Efficient Large Language Model Decoding
von: Liu, Xukun, et al.
Veröffentlicht: (2024)
von: Liu, Xukun, et al.
Veröffentlicht: (2024)
Breaking through Deterministic Barriers: Randomized Pruning Mask Generation and Selection
von: Li, Jianwei, et al.
Veröffentlicht: (2023)
von: Li, Jianwei, et al.
Veröffentlicht: (2023)
ALPS: Attention Localization and Pruning Strategy for Efficient Alignment of Large Language Models
von: Chen, Hao, et al.
Veröffentlicht: (2025)
von: Chen, Hao, et al.
Veröffentlicht: (2025)
IDEA Prune: An Integrated Enlarge-and-Prune Pipeline in Generative Language Model Pretraining
von: Li, Yixiao, et al.
Veröffentlicht: (2025)
von: Li, Yixiao, et al.
Veröffentlicht: (2025)
DLP: Dynamic Layerwise Pruning in Large Language Models
von: Chen, Yuli, et al.
Veröffentlicht: (2025)
von: Chen, Yuli, et al.
Veröffentlicht: (2025)
PrunePath: Towards Highly Structured Sparse Language Models
von: Gu, Zhexuan, et al.
Veröffentlicht: (2026)
von: Gu, Zhexuan, et al.
Veröffentlicht: (2026)
Think Before You Prune: Self-Reflective Structured Pruning for Reasoning Language Models
von: Wang, Ziyan, et al.
Veröffentlicht: (2025)
von: Wang, Ziyan, et al.
Veröffentlicht: (2025)
Pruning Large Language Models with Semi-Structural Adaptive Sparse Training
von: Huang, Weiyu, et al.
Veröffentlicht: (2024)
von: Huang, Weiyu, et al.
Veröffentlicht: (2024)
Compact Language Models via Pruning and Knowledge Distillation
von: Muralidharan, Saurav, et al.
Veröffentlicht: (2024)
von: Muralidharan, Saurav, et al.
Veröffentlicht: (2024)
Towards Threshold-Free KV Cache Pruning
von: Ni, Xuanfan, et al.
Veröffentlicht: (2025)
von: Ni, Xuanfan, et al.
Veröffentlicht: (2025)
Adaptive Pruning for Large Language Models with Structural Importance Awareness
von: Zheng, Haotian, et al.
Veröffentlicht: (2024)
von: Zheng, Haotian, et al.
Veröffentlicht: (2024)
Toward Adaptive Large Language Models Structured Pruning via Hybrid-grained Weight Importance Assessment
von: Liu, Jun, et al.
Veröffentlicht: (2024)
von: Liu, Jun, et al.
Veröffentlicht: (2024)
Sample-aware Adaptive Structured Pruning for Large Language Models
von: Kong, Jun, et al.
Veröffentlicht: (2025)
von: Kong, Jun, et al.
Veröffentlicht: (2025)
Probe Pruning: Accelerating LLMs through Dynamic Pruning via Model-Probing
von: Le, Qi, et al.
Veröffentlicht: (2025)
von: Le, Qi, et al.
Veröffentlicht: (2025)
Adaptive Computation Pruning for the Forgetting Transformer
von: Lin, Zhixuan, et al.
Veröffentlicht: (2025)
von: Lin, Zhixuan, et al.
Veröffentlicht: (2025)
Large Language Model Pruning
von: Huang, Hanjuan, et al.
Veröffentlicht: (2024)
von: Huang, Hanjuan, et al.
Veröffentlicht: (2024)
PruneCD: Contrasting Pruned Self Model to Improve Decoding Factuality
von: Yu, Byeongho, et al.
Veröffentlicht: (2025)
von: Yu, Byeongho, et al.
Veröffentlicht: (2025)
Entropy-Based Block Pruning for Efficient Large Language Models
von: Yang, Liangwei, et al.
Veröffentlicht: (2025)
von: Yang, Liangwei, et al.
Veröffentlicht: (2025)
Multi-Source Knowledge Pruning for Retrieval-Augmented Generation: A Benchmark and Empirical Study
von: Yu, Shuo, et al.
Veröffentlicht: (2024)
von: Yu, Shuo, et al.
Veröffentlicht: (2024)
EvoP: Robust LLM Inference via Evolutionary Pruning
von: Wu, Shangyu, et al.
Veröffentlicht: (2025)
von: Wu, Shangyu, et al.
Veröffentlicht: (2025)
Prompt-based Depth Pruning of Large Language Models
von: Wee, Juyun, et al.
Veröffentlicht: (2025)
von: Wee, Juyun, et al.
Veröffentlicht: (2025)
Sink-Aware Pruning for Diffusion Language Models
von: Myrzakhan, Aidar, et al.
Veröffentlicht: (2026)
von: Myrzakhan, Aidar, et al.
Veröffentlicht: (2026)
Pruning General Large Language Models into Customized Expert Models
von: Zhao, Yirao, et al.
Veröffentlicht: (2025)
von: Zhao, Yirao, et al.
Veröffentlicht: (2025)
DPPA: Pruning Method for Large Language Model to Model Merging
von: Zhu, Yaochen, et al.
Veröffentlicht: (2024)
von: Zhu, Yaochen, et al.
Veröffentlicht: (2024)
Sparsity Induction for Accurate Post-Training Pruning of Large Language Models
von: Jiang, Minhao, et al.
Veröffentlicht: (2026)
von: Jiang, Minhao, et al.
Veröffentlicht: (2026)
Adapt-Pruner: Adaptive Structural Pruning for Efficient Small Language Model Training
von: Pan, Rui, et al.
Veröffentlicht: (2025)
von: Pan, Rui, et al.
Veröffentlicht: (2025)
Investigating Hallucinations in Pruned Large Language Models for Abstractive Summarization
von: Chrysostomou, George, et al.
Veröffentlicht: (2023)
von: Chrysostomou, George, et al.
Veröffentlicht: (2023)
Saliency-driven Dynamic Token Pruning for Large Language Models
von: Tao, Yao, et al.
Veröffentlicht: (2025)
von: Tao, Yao, et al.
Veröffentlicht: (2025)
Beware of Calibration Data for Pruning Large Language Models
von: Ji, Yixin, et al.
Veröffentlicht: (2024)
von: Ji, Yixin, et al.
Veröffentlicht: (2024)
On the Limitations of Language Targeted Pruning: Investigating the Calibration Language Impact in Multilingual LLM Pruning
von: Kurz, Simon, et al.
Veröffentlicht: (2024)
von: Kurz, Simon, et al.
Veröffentlicht: (2024)
Efficient Shapley Value-based Non-Uniform Pruning of Large Language Models
von: Sun, Chuan, et al.
Veröffentlicht: (2025)
von: Sun, Chuan, et al.
Veröffentlicht: (2025)
DeepPrune: Parallel Scaling without Inter-trace Redundancy
von: Tu, Shangqing, et al.
Veröffentlicht: (2025)
von: Tu, Shangqing, et al.
Veröffentlicht: (2025)
PAT: Pruning-Aware Tuning for Large Language Models
von: Liu, Yijiang, et al.
Veröffentlicht: (2024)
von: Liu, Yijiang, et al.
Veröffentlicht: (2024)
Text Quality-Based Pruning for Efficient Training of Language Models
von: Sharma, Vasu, et al.
Veröffentlicht: (2024)
von: Sharma, Vasu, et al.
Veröffentlicht: (2024)
Pruning Large Language Models to Intra-module Low-rank Architecture with Transitional Activations
von: Shen, Bowen, et al.
Veröffentlicht: (2024)
von: Shen, Bowen, et al.
Veröffentlicht: (2024)
Not All Experts are Equal: Efficient Expert Pruning and Skipping for Mixture-of-Experts Large Language Models
von: Lu, Xudong, et al.
Veröffentlicht: (2024)
von: Lu, Xudong, et al.
Veröffentlicht: (2024)
Revisiting Large Language Model Pruning using Neuron Semantic Attribution
von: Ding, Yizhuo, et al.
Veröffentlicht: (2025)
von: Ding, Yizhuo, et al.
Veröffentlicht: (2025)
LaCo: Large Language Model Pruning via Layer Collapse
von: Yang, Yifei, et al.
Veröffentlicht: (2024)
von: Yang, Yifei, et al.
Veröffentlicht: (2024)
All-in-One Tuning and Structural Pruning for Domain-Specific LLMs
von: Lu, Lei, et al.
Veröffentlicht: (2024)
von: Lu, Lei, et al.
Veröffentlicht: (2024)
From Local to Global: Revisiting Structured Pruning Paradigms for Large Language Models
von: Wang, Ziyan, et al.
Veröffentlicht: (2025)
von: Wang, Ziyan, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Adaptive Draft-Verification for Efficient Large Language Model Decoding
von: Liu, Xukun, et al.
Veröffentlicht: (2024) -
Breaking through Deterministic Barriers: Randomized Pruning Mask Generation and Selection
von: Li, Jianwei, et al.
Veröffentlicht: (2023) -
ALPS: Attention Localization and Pruning Strategy for Efficient Alignment of Large Language Models
von: Chen, Hao, et al.
Veröffentlicht: (2025) -
IDEA Prune: An Integrated Enlarge-and-Prune Pipeline in Generative Language Model Pretraining
von: Li, Yixiao, et al.
Veröffentlicht: (2025) -
DLP: Dynamic Layerwise Pruning in Large Language Models
von: Chen, Yuli, et al.
Veröffentlicht: (2025)