Amber Pruner: Leveraging N:M Activation Sparsity for Efficient Prefill in Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | An, Tai, Cai, Ruwu, Zhang, Yanzhe, Liu, Yang, Chen, Hao, Xie, Pengcheng, Chang, Sheng, Yao, Yiwu, Wang, Gongyi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Toward Efficient Permutation for Hierarchical N:M Sparsity on GPUs
di: Yu, Seungmin, et al.
Pubblicazione: (2024)
di: Yu, Seungmin, et al.
Pubblicazione: (2024)
Spatial Re-parameterization for N:M Sparsity
di: Zhang, Yuxin, et al.
Pubblicazione: (2023)
di: Zhang, Yuxin, et al.
Pubblicazione: (2023)
Progressive Gradient Flow for Robust N:M Sparsity Training in Transformers
di: Bambhaniya, Abhimanyu Rajeshkumar, et al.
Pubblicazione: (2024)
di: Bambhaniya, Abhimanyu Rajeshkumar, et al.
Pubblicazione: (2024)
NM-SpMM: Accelerating Matrix Multiplication Using N:M Sparsity with GPGPU
di: Ma, Cong, et al.
Pubblicazione: (2025)
di: Ma, Cong, et al.
Pubblicazione: (2025)
ELSA: Exploiting Layer-wise N:M Sparsity for Vision Transformer Acceleration
di: Huang, Ning-Chi, et al.
Pubblicazione: (2024)
di: Huang, Ning-Chi, et al.
Pubblicazione: (2024)
Minimum Variance Unbiased N:M Sparsity for the Neural Gradients
di: Chmiel, Brian, et al.
Pubblicazione: (2022)
di: Chmiel, Brian, et al.
Pubblicazione: (2022)
E-Sparse: Boosting the Large Language Model Inference through Entropy-based N:M Sparsity
di: Li, Yun, et al.
Pubblicazione: (2023)
di: Li, Yun, et al.
Pubblicazione: (2023)
MaxQ: Multi-Axis Query for N:M Sparsity Network
di: Xiang, Jingyang, et al.
Pubblicazione: (2023)
di: Xiang, Jingyang, et al.
Pubblicazione: (2023)
RazorAttention: Efficient KV Cache Compression Through Retrieval Heads
di: Tang, Hanlin, et al.
Pubblicazione: (2024)
di: Tang, Hanlin, et al.
Pubblicazione: (2024)
Motivating Next-Gen Accelerators with Flexible (N:M) Activation Sparsity via Benchmarking Lightweight Post-Training Sparsification Approaches
di: Alanova, Shirin, et al.
Pubblicazione: (2025)
di: Alanova, Shirin, et al.
Pubblicazione: (2025)
MaskPro: Linear-Space Probabilistic Learning for Strict (N:M)-Sparsity on LLMs
di: Sun, Yan, et al.
Pubblicazione: (2025)
di: Sun, Yan, et al.
Pubblicazione: (2025)
Accelerating Prefilling via Decoding-time Contribution Sparsity
di: He, Zhiyuan, et al.
Pubblicazione: (2025)
di: He, Zhiyuan, et al.
Pubblicazione: (2025)
VLM-Pruner: Buffering for Spatial Sparsity in an Efficient VLM Centrifugal Token Pruning Paradigm
di: Wu, Zhenkai, et al.
Pubblicazione: (2025)
di: Wu, Zhenkai, et al.
Pubblicazione: (2025)
FPGA Co-Design for Efficient N:M Sparse and Quantized Model Inference
di: Hsieh, Fen-Yu, et al.
Pubblicazione: (2025)
di: Hsieh, Fen-Yu, et al.
Pubblicazione: (2025)
RCP: Representation Consistency Pruner for Mitigating Distribution Shift in Large Vision-Language Models
di: Zhang, Jianwei, et al.
Pubblicazione: (2026)
di: Zhang, Jianwei, et al.
Pubblicazione: (2026)
Beyond Token Length: Step Pruner for Efficient and Accurate Reasoning in Large Language Models
di: Wu, Canhui, et al.
Pubblicazione: (2025)
di: Wu, Canhui, et al.
Pubblicazione: (2025)
Training-Free Activation Sparsity in Large Language Models
di: Liu, James, et al.
Pubblicazione: (2024)
di: Liu, James, et al.
Pubblicazione: (2024)
Accelerating LLM Inference with Flexible N:M Sparsity via A Fully Digital Compute-in-Memory Accelerator
di: Ramachandran, Akshat, et al.
Pubblicazione: (2025)
di: Ramachandran, Akshat, et al.
Pubblicazione: (2025)
PrefillOnly: An Inference Engine for Prefill-only Workloads in Large Language Model Applications
di: Du, Kuntai, et al.
Pubblicazione: (2025)
di: Du, Kuntai, et al.
Pubblicazione: (2025)
Amber-Image: Efficient Compression of Large-Scale Diffusion Transformers
di: Yang, Chaojie, et al.
Pubblicazione: (2026)
di: Yang, Chaojie, et al.
Pubblicazione: (2026)
PermLLM: Learnable Channel Permutation for N:M Sparse Large Language Models
di: Zou, Lancheng, et al.
Pubblicazione: (2025)
di: Zou, Lancheng, et al.
Pubblicazione: (2025)
RainFusion: Adaptive Video Generation Acceleration via Multi-Dimensional Visual Redundancy
di: Chen, Aiyue, et al.
Pubblicazione: (2025)
di: Chen, Aiyue, et al.
Pubblicazione: (2025)
Efficient Column-Wise N:M Pruning on RISC-V CPU
di: Chu, Chi-Wei, et al.
Pubblicazione: (2025)
di: Chu, Chi-Wei, et al.
Pubblicazione: (2025)
Fast Forward: Accelerating LLM Prefill with Predictive FFN Sparsity
di: Gautam, Aayush, et al.
Pubblicazione: (2026)
di: Gautam, Aayush, et al.
Pubblicazione: (2026)
Týr-the-Pruner: Structural Pruning LLMs via Global Sparsity Distribution Optimization
di: Li, Guanchen, et al.
Pubblicazione: (2025)
di: Li, Guanchen, et al.
Pubblicazione: (2025)
MI-Pruner: Crossmodal Mutual Information-guided Token Pruner for Efficient MLLMs
di: Li, Jiameng, et al.
Pubblicazione: (2026)
di: Li, Jiameng, et al.
Pubblicazione: (2026)
TSENOR: Highly-Efficient Algorithm for Finding Transposable N:M Sparse Masks
di: Meng, Xiang, et al.
Pubblicazione: (2025)
di: Meng, Xiang, et al.
Pubblicazione: (2025)
SoLA: Leveraging Soft Activation Sparsity and Low-Rank Decomposition for Large Language Model Compression
di: Huang, Xinhao, et al.
Pubblicazione: (2026)
di: Huang, Xinhao, et al.
Pubblicazione: (2026)
BlockPruner: Fine-grained Pruning for Large Language Models
di: Zhong, Longguang, et al.
Pubblicazione: (2024)
di: Zhong, Longguang, et al.
Pubblicazione: (2024)
E$^3$-Pruner: Towards Efficient, Economical, and Effective Layer Pruning for Large Language Models
di: Yuan, Tao, et al.
Pubblicazione: (2025)
di: Yuan, Tao, et al.
Pubblicazione: (2025)
Leveraging Sparsity for Sample-Efficient Preference Learning: A Theoretical Perspective
di: Yao, Yunzhen, et al.
Pubblicazione: (2025)
di: Yao, Yunzhen, et al.
Pubblicazione: (2025)
LLM Router: Rethinking Routing with Prefill Activations
di: Varshney, Tanay, et al.
Pubblicazione: (2026)
di: Varshney, Tanay, et al.
Pubblicazione: (2026)
CritiPrefill: A Segment-wise Criticality-based Approach for Prefilling Acceleration in LLMs
di: Lv, Junlin, et al.
Pubblicazione: (2024)
di: Lv, Junlin, et al.
Pubblicazione: (2024)
Universal Properties of Activation Sparsity in Modern Large Language Models
di: Szatkowski, Filip, et al.
Pubblicazione: (2025)
di: Szatkowski, Filip, et al.
Pubblicazione: (2025)
Activation Sparsity Opportunities for Compressing General Large Language Models
di: Dhar, Nobel, et al.
Pubblicazione: (2024)
di: Dhar, Nobel, et al.
Pubblicazione: (2024)
ActTail: Global Activation Sparsity in Large Language Models
di: Hou, Wenwen, et al.
Pubblicazione: (2026)
di: Hou, Wenwen, et al.
Pubblicazione: (2026)
OriginPruner: Leveraging Method Origins for Guided Call Graph Pruning
di: Mir, Amir M., et al.
Pubblicazione: (2024)
di: Mir, Amir M., et al.
Pubblicazione: (2024)
Block-Attention for Efficient Prefilling
di: Ma, Dongyang, et al.
Pubblicazione: (2024)
di: Ma, Dongyang, et al.
Pubblicazione: (2024)
MoE-Pruner: Pruning Mixture-of-Experts Large Language Model using the Hints from Its Router
di: Xie, Yanyue, et al.
Pubblicazione: (2024)
di: Xie, Yanyue, et al.
Pubblicazione: (2024)
POP: Prefill-Only Pruning for Efficient Large Model Inference
di: He, Junhui, et al.
Pubblicazione: (2026)
di: He, Junhui, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Toward Efficient Permutation for Hierarchical N:M Sparsity on GPUs
di: Yu, Seungmin, et al.
Pubblicazione: (2024) -
Spatial Re-parameterization for N:M Sparsity
di: Zhang, Yuxin, et al.
Pubblicazione: (2023) -
Progressive Gradient Flow for Robust N:M Sparsity Training in Transformers
di: Bambhaniya, Abhimanyu Rajeshkumar, et al.
Pubblicazione: (2024) -
NM-SpMM: Accelerating Matrix Multiplication Using N:M Sparsity with GPGPU
di: Ma, Cong, et al.
Pubblicazione: (2025) -
ELSA: Exploiting Layer-wise N:M Sparsity for Vision Transformer Acceleration
di: Huang, Ning-Chi, et al.
Pubblicazione: (2024)