E-Sparse: Boosting the Large Language Model Inference through Entropy-based N:M Sparsity
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Yun, Niu, Lin, Zhang, Xipeng, Liu, Kai, Zhu, Jianchen, Kang, Zhanhui |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Spatial Re-parameterization for N:M Sparsity
par: Zhang, Yuxin, et autres
Publié: (2023)
par: Zhang, Yuxin, et autres
Publié: (2023)
FPGA Co-Design for Efficient N:M Sparse and Quantized Model Inference
par: Hsieh, Fen-Yu, et autres
Publié: (2025)
par: Hsieh, Fen-Yu, et autres
Publié: (2025)
Sparsity-Accelerated Training for Large Language Models
par: Ma, Da, et autres
Publié: (2024)
par: Ma, Da, et autres
Publié: (2024)
Amber Pruner: Leveraging N:M Activation Sparsity for Efficient Prefill in Large Language Models
par: An, Tai, et autres
Publié: (2025)
par: An, Tai, et autres
Publié: (2025)
Exploring Forgetting in Large Language Model Pre-Training
par: Liao, Chonghua, et autres
Publié: (2024)
par: Liao, Chonghua, et autres
Publié: (2024)
Inference-Time Decontamination: Reusing Leaked Benchmarks for Large Language Model Evaluation
par: Zhu, Qin, et autres
Publié: (2024)
par: Zhu, Qin, et autres
Publié: (2024)
Sparsing Law: Towards Large Language Models with Greater Activation Sparsity
par: Luo, Yuqi, et autres
Publié: (2024)
par: Luo, Yuqi, et autres
Publié: (2024)
NM-SpMM: Accelerating Matrix Multiplication Using N:M Sparsity with GPGPU
par: Ma, Cong, et autres
Publié: (2025)
par: Ma, Cong, et autres
Publié: (2025)
Emergent Structured Representations Support Flexible In-Context Inference in Large Language Models
par: Xu, Ningyu, et autres
Publié: (2026)
par: Xu, Ningyu, et autres
Publié: (2026)
ELSA: Exploiting Layer-wise N:M Sparsity for Vision Transformer Acceleration
par: Huang, Ning-Chi, et autres
Publié: (2024)
par: Huang, Ning-Chi, et autres
Publié: (2024)
Inference-Time Language Model Alignment via Integrated Value Guidance
par: Liu, Zhixuan, et autres
Publié: (2024)
par: Liu, Zhixuan, et autres
Publié: (2024)
Making Large Language Models Better Reasoners with Orchestrated Streaming Experiences
par: Liu, Xiangyang, et autres
Publié: (2025)
par: Liu, Xiangyang, et autres
Publié: (2025)
Gaussian Entropy Fields: Driving Adaptive Sparsity in 3D Gaussian Optimization
par: Kuang, Hong, et autres
Publié: (2025)
par: Kuang, Hong, et autres
Publié: (2025)
Truth Forest: Toward Multi-Scale Truthfulness in Large Language Models through Intervention without Tuning
par: Chen, Zhongzhi, et autres
Publié: (2023)
par: Chen, Zhongzhi, et autres
Publié: (2023)
Full Parameter Fine-tuning for Large Language Models with Limited Resources
par: Lv, Kai, et autres
Publié: (2023)
par: Lv, Kai, et autres
Publié: (2023)
Sensitivity Meets Sparsity: The Impact of Extremely Sparse Parameter Patterns on Theory-of-Mind of Large Language Models
par: Wu, Yuheng, et autres
Publié: (2025)
par: Wu, Yuheng, et autres
Publié: (2025)
Efficient Tuning and Inference for Large Language Models on Textual Graphs
par: Zhu, Yun, et autres
Publié: (2024)
par: Zhu, Yun, et autres
Publié: (2024)
PermLLM: Learnable Channel Permutation for N:M Sparse Large Language Models
par: Zou, Lancheng, et autres
Publié: (2025)
par: Zou, Lancheng, et autres
Publié: (2025)
Scaling Laws for Fact Memorization of Large Language Models
par: Lu, Xingyu, et autres
Publié: (2024)
par: Lu, Xingyu, et autres
Publié: (2024)
ProSparse: Introducing and Enhancing Intrinsic Activation Sparsity within Large Language Models
par: Song, Chenyang, et autres
Publié: (2024)
par: Song, Chenyang, et autres
Publié: (2024)
MetaAlign: Align Large Language Models with Diverse Preferences during Inference Time
par: Zhang, Mozhi, et autres
Publié: (2024)
par: Zhang, Mozhi, et autres
Publié: (2024)
Minimum Variance Unbiased N:M Sparsity for the Neural Gradients
par: Chmiel, Brian, et autres
Publié: (2022)
par: Chmiel, Brian, et autres
Publié: (2022)
Toward Efficient Permutation for Hierarchical N:M Sparsity on GPUs
par: Yu, Seungmin, et autres
Publié: (2024)
par: Yu, Seungmin, et autres
Publié: (2024)
MaxQ: Multi-Axis Query for N:M Sparsity Network
par: Xiang, Jingyang, et autres
Publié: (2023)
par: Xiang, Jingyang, et autres
Publié: (2023)
AVSS: Layer Importance Evaluation in Large Language Models via Activation Variance-Sparsity Analysis
par: Song, Zichen, et autres
Publié: (2024)
par: Song, Zichen, et autres
Publié: (2024)
Training-Free Activation Sparsity in Large Language Models
par: Liu, James, et autres
Publié: (2024)
par: Liu, James, et autres
Publié: (2024)
PEARL: Parallel Speculative Decoding with Adaptive Draft Length
par: Liu, Tianyu, et autres
Publié: (2024)
par: Liu, Tianyu, et autres
Publié: (2024)
ActTail: Global Activation Sparsity in Large Language Models
par: Hou, Wenwen, et autres
Publié: (2026)
par: Hou, Wenwen, et autres
Publié: (2026)
Layer Importance and Hallucination Analysis in Large Language Models via Enhanced Activation Variance-Sparsity
par: Song, Zichen, et autres
Publié: (2024)
par: Song, Zichen, et autres
Publié: (2024)
Mitigating Hallucination in Multimodal Large Language Model via Hallucination-targeted Direct Preference Optimization
par: Fu, Yuhan, et autres
Publié: (2024)
par: Fu, Yuhan, et autres
Publié: (2024)
Weak-to-Strong Search: Align Large Language Models via Searching over Small Language Models
par: Zhou, Zhanhui, et autres
Publié: (2024)
par: Zhou, Zhanhui, et autres
Publié: (2024)
Language Models "Grok" to Copy
par: Lv, Ang, et autres
Publié: (2024)
par: Lv, Ang, et autres
Publié: (2024)
Benchmarking Hallucination in Large Language Models based on Unanswerable Math Word Problem
par: Sun, Yuhong, et autres
Publié: (2024)
par: Sun, Yuhong, et autres
Publié: (2024)
ShadowLLM: Predictor-based Contextual Sparsity for Large Language Models
par: Akhauri, Yash, et autres
Publié: (2024)
par: Akhauri, Yash, et autres
Publié: (2024)
Progressive Gradient Flow for Robust N:M Sparsity Training in Transformers
par: Bambhaniya, Abhimanyu Rajeshkumar, et autres
Publié: (2024)
par: Bambhaniya, Abhimanyu Rajeshkumar, et autres
Publié: (2024)
Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free
par: Qiu, Zihan, et autres
Publié: (2025)
par: Qiu, Zihan, et autres
Publié: (2025)
UNIQUE: Universal Top-k Sparse Attention for Training-free Inference and Sparsity-aware Training
par: Deng, Keqi, et autres
Publié: (2026)
par: Deng, Keqi, et autres
Publié: (2026)
Boosting of Thoughts: Trial-and-Error Problem Solving with Large Language Models
par: Chen, Sijia, et autres
Publié: (2024)
par: Chen, Sijia, et autres
Publié: (2024)
Data-free Weight Compress and Denoise for Large Language Models
par: Peng, Runyu, et autres
Publié: (2024)
par: Peng, Runyu, et autres
Publié: (2024)
CAST: Continuous and Differentiable Semi-Structured Sparsity-Aware Training for Large Language Models
par: Huang, Weiyu, et autres
Publié: (2025)
par: Huang, Weiyu, et autres
Publié: (2025)
Documents similaires
-
Spatial Re-parameterization for N:M Sparsity
par: Zhang, Yuxin, et autres
Publié: (2023) -
FPGA Co-Design for Efficient N:M Sparse and Quantized Model Inference
par: Hsieh, Fen-Yu, et autres
Publié: (2025) -
Sparsity-Accelerated Training for Large Language Models
par: Ma, Da, et autres
Publié: (2024) -
Amber Pruner: Leveraging N:M Activation Sparsity for Efficient Prefill in Large Language Models
par: An, Tai, et autres
Publié: (2025) -
Exploring Forgetting in Large Language Model Pre-Training
par: Liao, Chonghua, et autres
Publié: (2024)