Deterministic Differentiable Structured Pruning for Large Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Huang, Weiyu, Zhang, Pengle, Zhang, Xiaolu, Zhou, Jun, Zhu, Jun, Chen, Jianfei |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
CAST: Continuous and Differentiable Semi-Structured Sparsity-Aware Training for Large Language Models
von: Huang, Weiyu, et al.
Veröffentlicht: (2025)
von: Huang, Weiyu, et al.
Veröffentlicht: (2025)
Pruning Large Language Models with Semi-Structural Adaptive Sparse Training
von: Huang, Weiyu, et al.
Veröffentlicht: (2024)
von: Huang, Weiyu, et al.
Veröffentlicht: (2024)
Sample-aware Adaptive Structured Pruning for Large Language Models
von: Kong, Jun, et al.
Veröffentlicht: (2025)
von: Kong, Jun, et al.
Veröffentlicht: (2025)
Large Language Diffusion Models
von: Nie, Shen, et al.
Veröffentlicht: (2025)
von: Nie, Shen, et al.
Veröffentlicht: (2025)
LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning
von: You, Zebin, et al.
Veröffentlicht: (2025)
von: You, Zebin, et al.
Veröffentlicht: (2025)
Adaptive Pruning for Large Language Models with Structural Importance Awareness
von: Zheng, Haotian, et al.
Veröffentlicht: (2024)
von: Zheng, Haotian, et al.
Veröffentlicht: (2024)
Toward Adaptive Large Language Models Structured Pruning via Hybrid-grained Weight Importance Assessment
von: Liu, Jun, et al.
Veröffentlicht: (2024)
von: Liu, Jun, et al.
Veröffentlicht: (2024)
DarwinLM: Evolutionary Structured Pruning of Large Language Models
von: Tang, Shengkun, et al.
Veröffentlicht: (2025)
von: Tang, Shengkun, et al.
Veröffentlicht: (2025)
A Survey on Training-free Alignment of Large Language Models
von: Pan, Birong, et al.
Veröffentlicht: (2025)
von: Pan, Birong, et al.
Veröffentlicht: (2025)
Large Language Model Pruning
von: Huang, Hanjuan, et al.
Veröffentlicht: (2024)
von: Huang, Hanjuan, et al.
Veröffentlicht: (2024)
Olica: Efficient Structured Pruning of Large Language Models without Retraining
von: He, Jiujun, et al.
Veröffentlicht: (2025)
von: He, Jiujun, et al.
Veröffentlicht: (2025)
DISP-LLM: Dimension-Independent Structural Pruning for Large Language Models
von: Gao, Shangqian, et al.
Veröffentlicht: (2024)
von: Gao, Shangqian, et al.
Veröffentlicht: (2024)
Bypass Back-propagation: Optimization-based Structural Pruning for Large Language Models via Policy Gradient
von: Gao, Yuan, et al.
Veröffentlicht: (2024)
von: Gao, Yuan, et al.
Veröffentlicht: (2024)
SageAttention2: Efficient Attention with Thorough Outlier Smoothing and Per-thread INT4 Quantization
von: Zhang, Jintao, et al.
Veröffentlicht: (2024)
von: Zhang, Jintao, et al.
Veröffentlicht: (2024)
Attention-Based Sampler for Diffusion Language Models
von: Zhou, Yuyan, et al.
Veröffentlicht: (2026)
von: Zhou, Yuyan, et al.
Veröffentlicht: (2026)
Accurate INT8 Training Through Dynamic Block-Level Fallback
von: Zhang, Pengle, et al.
Veröffentlicht: (2025)
von: Zhang, Pengle, et al.
Veröffentlicht: (2025)
Relative Kinetic Utility for Reasoning-Aware Structural Pruning in Large Language Models
von: Qian, Tianhao
Veröffentlicht: (2026)
von: Qian, Tianhao
Veröffentlicht: (2026)
PAT: Pruning-Aware Tuning for Large Language Models
von: Liu, Yijiang, et al.
Veröffentlicht: (2024)
von: Liu, Yijiang, et al.
Veröffentlicht: (2024)
MoreauPruner: Robust Pruning of Large Language Models against Weight Perturbations
von: Wang, Zixiao, et al.
Veröffentlicht: (2024)
von: Wang, Zixiao, et al.
Veröffentlicht: (2024)
SageAttention: Accurate 8-Bit Attention for Plug-and-play Inference Acceleration
von: Zhang, Jintao, et al.
Veröffentlicht: (2024)
von: Zhang, Jintao, et al.
Veröffentlicht: (2024)
Query Performance Explanation through Large Language Model for HTAP Systems
von: Xiu, Haibo, et al.
Veröffentlicht: (2024)
von: Xiu, Haibo, et al.
Veröffentlicht: (2024)
ToMoE: Converting Dense Large Language Models to Mixture-of-Experts through Dynamic Structural Pruning
von: Gao, Shangqian, et al.
Veröffentlicht: (2025)
von: Gao, Shangqian, et al.
Veröffentlicht: (2025)
Not All Experts are Equal: Efficient Expert Pruning and Skipping for Mixture-of-Experts Large Language Models
von: Lu, Xudong, et al.
Veröffentlicht: (2024)
von: Lu, Xudong, et al.
Veröffentlicht: (2024)
Beware of Calibration Data for Pruning Large Language Models
von: Ji, Yixin, et al.
Veröffentlicht: (2024)
von: Ji, Yixin, et al.
Veröffentlicht: (2024)
SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models
von: Zhu, Hourun, et al.
Veröffentlicht: (2025)
von: Zhu, Hourun, et al.
Veröffentlicht: (2025)
Keyframe-oriented Vision Token Pruning: Enhancing Efficiency of Large Vision Language Models on Long-Form Video Processing
von: Liu, Yudong, et al.
Veröffentlicht: (2025)
von: Liu, Yudong, et al.
Veröffentlicht: (2025)
Efficient Sequential Decision Making with Large Language Models
von: Chen, Dingyang, et al.
Veröffentlicht: (2024)
von: Chen, Dingyang, et al.
Veröffentlicht: (2024)
Frustratingly Easy Task-aware Pruning for Large Language Models
von: Tian, Yuanhe, et al.
Veröffentlicht: (2025)
von: Tian, Yuanhe, et al.
Veröffentlicht: (2025)
Fast and Effective Weight Update for Pruned Large Language Models
von: Boža, Vladimír
Veröffentlicht: (2024)
von: Boža, Vladimír
Veröffentlicht: (2024)
Detecting and Pruning Prominent but Detrimental Neurons in Large Language Models
von: Ali, Ameen, et al.
Veröffentlicht: (2025)
von: Ali, Ameen, et al.
Veröffentlicht: (2025)
PIP: Perturbation-based Iterative Pruning for Large Language Models
von: Cao, Yi, et al.
Veröffentlicht: (2025)
von: Cao, Yi, et al.
Veröffentlicht: (2025)
Structured Agent Distillation for Large Language Model
von: Liu, Jun, et al.
Veröffentlicht: (2025)
von: Liu, Jun, et al.
Veröffentlicht: (2025)
From Local to Global: Revisiting Structured Pruning Paradigms for Large Language Models
von: Wang, Ziyan, et al.
Veröffentlicht: (2025)
von: Wang, Ziyan, et al.
Veröffentlicht: (2025)
Adapt-Pruner: Adaptive Structural Pruning for Efficient Small Language Model Training
von: Pan, Rui, et al.
Veröffentlicht: (2025)
von: Pan, Rui, et al.
Veröffentlicht: (2025)
BESA: Pruning Large Language Models with Blockwise Parameter-Efficient Sparsity Allocation
von: Xu, Peng, et al.
Veröffentlicht: (2024)
von: Xu, Peng, et al.
Veröffentlicht: (2024)
Efficient Post-Training Pruning of Large Language Models with Statistical Correction
von: Yu, Peiqi, et al.
Veröffentlicht: (2026)
von: Yu, Peiqi, et al.
Veröffentlicht: (2026)
Self-Data Distillation for Recovering Quality in Pruned Large Language Models
von: Thangarasa, Vithursan, et al.
Veröffentlicht: (2024)
von: Thangarasa, Vithursan, et al.
Veröffentlicht: (2024)
TetraJet-v2: Accurate NVFP4 Training for Large Language Models with Oscillation Suppression and Outlier Control
von: Chen, Yuxiang, et al.
Veröffentlicht: (2025)
von: Chen, Yuxiang, et al.
Veröffentlicht: (2025)
LoRAP: Transformer Sub-Layers Deserve Differentiated Structured Compression for Large Language Models
von: Li, Guangyan, et al.
Veröffentlicht: (2024)
von: Li, Guangyan, et al.
Veröffentlicht: (2024)
Harnessing Large Language Models for Disaster Management: A Survey
von: Lei, Zhenyu, et al.
Veröffentlicht: (2025)
von: Lei, Zhenyu, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
CAST: Continuous and Differentiable Semi-Structured Sparsity-Aware Training for Large Language Models
von: Huang, Weiyu, et al.
Veröffentlicht: (2025) -
Pruning Large Language Models with Semi-Structural Adaptive Sparse Training
von: Huang, Weiyu, et al.
Veröffentlicht: (2024) -
Sample-aware Adaptive Structured Pruning for Large Language Models
von: Kong, Jun, et al.
Veröffentlicht: (2025) -
Large Language Diffusion Models
von: Nie, Shen, et al.
Veröffentlicht: (2025) -
LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning
von: You, Zebin, et al.
Veröffentlicht: (2025)