Týr-the-Pruner: Structural Pruning LLMs via Global Sparsity Distribution Optimization
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Guanchen, Xu, Yixing, Li, Zeping, Liu, Ji, Yin, Xuanwu, Li, Dong, Barsoum, Emad |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Learnable Permutation for Structured Sparsity on Transformer Models
di: Li, Zekai, et al.
Pubblicazione: (2026)
di: Li, Zekai, et al.
Pubblicazione: (2026)
SparK: Query-Aware Unstructured Sparsity with Recoverable KV Cache Channel Pruning
di: Liao, Huanxuan, et al.
Pubblicazione: (2025)
di: Liao, Huanxuan, et al.
Pubblicazione: (2025)
Enhancing One-shot Pruned Pre-trained Language Models through Sparse-Dense-Sparse Mechanism
di: Li, Guanchen, et al.
Pubblicazione: (2024)
di: Li, Guanchen, et al.
Pubblicazione: (2024)
Gumiho: A Hybrid Architecture to Prioritize Early Tokens in Speculative Decoding
di: Li, Jinze, et al.
Pubblicazione: (2025)
di: Li, Jinze, et al.
Pubblicazione: (2025)
Jakiro: Boosting Speculative Decoding with Decoupled Multi-Head via MoE
di: Huang, Haiduo, et al.
Pubblicazione: (2025)
di: Huang, Haiduo, et al.
Pubblicazione: (2025)
Athena: Enhancing Multimodal Reasoning with Data-efficient Process Reward Models
di: Wang, Shuai, et al.
Pubblicazione: (2025)
di: Wang, Shuai, et al.
Pubblicazione: (2025)
Theory-optimal Quantization Based on Flatness
di: Huang, Xiusheng, et al.
Pubblicazione: (2026)
di: Huang, Xiusheng, et al.
Pubblicazione: (2026)
Training-Free Loosely Speculative Decoding: Accepting Semantically Correct Drafts Beyond Exact Match
di: Li, Jinze, et al.
Pubblicazione: (2025)
di: Li, Jinze, et al.
Pubblicazione: (2025)
VLM-Pruner: Buffering for Spatial Sparsity in an Efficient VLM Centrifugal Token Pruning Paradigm
di: Wu, Zhenkai, et al.
Pubblicazione: (2025)
di: Wu, Zhenkai, et al.
Pubblicazione: (2025)
Dual LoRA: Enhancing LoRA with Magnitude and Direction Updates
di: Xu, Yixing, et al.
Pubblicazione: (2025)
di: Xu, Yixing, et al.
Pubblicazione: (2025)
DuoGPT: Training-free Dual Sparsity through Activation-aware Pruning in LLMs
di: Yin, Ruokai, et al.
Pubblicazione: (2025)
di: Yin, Ruokai, et al.
Pubblicazione: (2025)
PARD: Accelerating LLM Inference with Low-Cost PARallel Draft Model Adaptation
di: An, Zihao, et al.
Pubblicazione: (2025)
di: An, Zihao, et al.
Pubblicazione: (2025)
Outlier Weighed Layerwise Sparsity (OWL): A Missing Secret Sauce for Pruning LLMs to High Sparsity
di: Yin, Lu, et al.
Pubblicazione: (2023)
di: Yin, Lu, et al.
Pubblicazione: (2023)
Beyond the Target: From Imitation to Collaboration in Speculative Decoding
di: Li, Jinze, et al.
Pubblicazione: (2026)
di: Li, Jinze, et al.
Pubblicazione: (2026)
Pruner-Zero: Evolving Symbolic Pruning Metric from scratch for Large Language Models
di: Dong, Peijie, et al.
Pubblicazione: (2024)
di: Dong, Peijie, et al.
Pubblicazione: (2024)
Selection Plateau and a Sparsity-Dependent Hierarchy of Pruning Features
di: Li, Guangqi, et al.
Pubblicazione: (2026)
di: Li, Guangqi, et al.
Pubblicazione: (2026)
FTP: A Fine-grained Token-wise Pruner for Large Language Models via Token Routing
di: Li, Zekai, et al.
Pubblicazione: (2024)
di: Li, Zekai, et al.
Pubblicazione: (2024)
Adapt-Pruner: Adaptive Structural Pruning for Efficient Small Language Model Training
di: Pan, Rui, et al.
Pubblicazione: (2025)
di: Pan, Rui, et al.
Pubblicazione: (2025)
DL-QAT: Weight-Decomposed Low-Rank Quantization-Aware Training for Large Language Models
di: Ke, Wenjin, et al.
Pubblicazione: (2025)
di: Ke, Wenjin, et al.
Pubblicazione: (2025)
Compressing LLMs with MoP: Mixture of Pruners
di: Yamamoto, Bruno Lopes, et al.
Pubblicazione: (2026)
di: Yamamoto, Bruno Lopes, et al.
Pubblicazione: (2026)
Separate, Dynamic and Differentiable (SMART) Pruner for Block/Output Channel Pruning on Computer Vision Tasks
di: Ding, Guanhua, et al.
Pubblicazione: (2024)
di: Ding, Guanhua, et al.
Pubblicazione: (2024)
Amber Pruner: Leveraging N:M Activation Sparsity for Efficient Prefill in Large Language Models
di: An, Tai, et al.
Pubblicazione: (2025)
di: An, Tai, et al.
Pubblicazione: (2025)
FAIR-Pruner: A Flexible Framework for Automatic Layer-Wise Pruning via Tolerance of Difference
di: Lin, Chenqing, et al.
Pubblicazione: (2025)
di: Lin, Chenqing, et al.
Pubblicazione: (2025)
FarSkip-Collective: Unhobbling Blocking Communication in Mixture of Experts Models
di: Dukler, Yonatan, et al.
Pubblicazione: (2025)
di: Dukler, Yonatan, et al.
Pubblicazione: (2025)
Progressive Binarization with Semi-Structured Pruning for LLMs
di: Yan, Xianglong, et al.
Pubblicazione: (2025)
di: Yan, Xianglong, et al.
Pubblicazione: (2025)
Pruning Weights but Not Truth: Safeguarding Truthfulness While Pruning LLMs
di: Fu, Yao, et al.
Pubblicazione: (2025)
di: Fu, Yao, et al.
Pubblicazione: (2025)
MoreauPruner: Robust Pruning of Large Language Models against Weight Perturbations
di: Wang, Zixiao, et al.
Pubblicazione: (2024)
di: Wang, Zixiao, et al.
Pubblicazione: (2024)
Zebra-Llama: Towards Extremely Efficient Hybrid Models
di: Yang, Mingyu, et al.
Pubblicazione: (2025)
di: Yang, Mingyu, et al.
Pubblicazione: (2025)
TernaryLLM: Ternarized Large Language Model
di: Chen, Tianqi, et al.
Pubblicazione: (2024)
di: Chen, Tianqi, et al.
Pubblicazione: (2024)
Z-Pruner: Post-Training Pruning of Large Language Models for Efficiency without Retraining
di: Bhuiyan, Samiul Basir, et al.
Pubblicazione: (2025)
di: Bhuiyan, Samiul Basir, et al.
Pubblicazione: (2025)
SAU: Sparsity-Aware Unlearning for LLMs via Gradient Masking and Importance Redistribution
di: Wang, Yuze, et al.
Pubblicazione: (2026)
di: Wang, Yuze, et al.
Pubblicazione: (2026)
Amphista: Bi-directional Multi-head Decoding for Accelerating LLM Inference
di: Li, Zeping, et al.
Pubblicazione: (2024)
di: Li, Zeping, et al.
Pubblicazione: (2024)
Federated Learning via Variational Bayesian Inference: Personalization, Sparsity and Clustering
di: Zhang, Xu, et al.
Pubblicazione: (2023)
di: Zhang, Xu, et al.
Pubblicazione: (2023)
Structured Sparsity and Weight-adaptive Pruning for Memory and Compute efficient Whisper models
di: Mudi, Prasenjit K, et al.
Pubblicazione: (2025)
di: Mudi, Prasenjit K, et al.
Pubblicazione: (2025)
MoE-Pruner: Pruning Mixture-of-Experts Large Language Model using the Hints from Its Router
di: Xie, Yanyue, et al.
Pubblicazione: (2024)
di: Xie, Yanyue, et al.
Pubblicazione: (2024)
Sparsity and Out-of-Distribution Generalization
di: Aaronson, Scott, et al.
Pubblicazione: (2026)
di: Aaronson, Scott, et al.
Pubblicazione: (2026)
Maximum Redundancy Pruning: A Principle-Driven Layerwise Sparsity Allocation for LLMs
di: Gao, Chang, et al.
Pubblicazione: (2025)
di: Gao, Chang, et al.
Pubblicazione: (2025)
Beyond One-Way Pruning: Bidirectional Pruning-Regrowth for Extreme Accuracy-Sparsity Tradeoff
di: Liu, Junchen, et al.
Pubblicazione: (2025)
di: Liu, Junchen, et al.
Pubblicazione: (2025)
Enhancing Unsupervised Feature Selection via Double Sparsity Constrained Optimization
di: Xiu, Xianchao, et al.
Pubblicazione: (2025)
di: Xiu, Xianchao, et al.
Pubblicazione: (2025)
AgentKernelArena: Generalization-Aware Benchmarking of GPU Kernel Optimization Agents
di: Younesian, Sharareh, et al.
Pubblicazione: (2026)
di: Younesian, Sharareh, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Learnable Permutation for Structured Sparsity on Transformer Models
di: Li, Zekai, et al.
Pubblicazione: (2026) -
SparK: Query-Aware Unstructured Sparsity with Recoverable KV Cache Channel Pruning
di: Liao, Huanxuan, et al.
Pubblicazione: (2025) -
Enhancing One-shot Pruned Pre-trained Language Models through Sparse-Dense-Sparse Mechanism
di: Li, Guanchen, et al.
Pubblicazione: (2024) -
Gumiho: A Hybrid Architecture to Prioritize Early Tokens in Speculative Decoding
di: Li, Jinze, et al.
Pubblicazione: (2025) -
Jakiro: Boosting Speculative Decoding with Decoupled Multi-Head via MoE
di: Huang, Haiduo, et al.
Pubblicazione: (2025)