QPruner: Probabilistic Decision Quantization for Structured Pruning in Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Zhou, Changhai, Zhou, Yuhua, Han, Shijie, Qiao, Qian, Li, Hongguang |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Large Language Model Compression with Global Rank and Sparsity Optimization
by: Zhou, Changhai, et al.
Published: (2025)
by: Zhou, Changhai, et al.
Published: (2025)
AutoQRA: Joint Optimization of Mixed-Precision Quantization and Low-rank Adapters for Efficient LLM Fine-Tuning
by: Zhou, Changhai, et al.
Published: (2026)
by: Zhou, Changhai, et al.
Published: (2026)
AutoMixQ: Self-Adjusting Quantization for High Performance Memory-Efficient Fine-Tuning
by: Zhou, Changhai, et al.
Published: (2024)
by: Zhou, Changhai, et al.
Published: (2024)
RankAdaptor: Hierarchical Rank Allocation for Efficient Fine-Tuning Pruned LLMs via Performance Model
by: Zhou, Changhai, et al.
Published: (2024)
by: Zhou, Changhai, et al.
Published: (2024)
Balancing Fidelity and Plasticity: Aligning Mixed-Precision Fine-Tuning with Linguistic Hierarchies
by: Zhou, Changhai, et al.
Published: (2025)
by: Zhou, Changhai, et al.
Published: (2025)
Deterministic Differentiable Structured Pruning for Large Language Models
by: Huang, Weiyu, et al.
Published: (2026)
by: Huang, Weiyu, et al.
Published: (2026)
Relative Kinetic Utility for Reasoning-Aware Structural Pruning in Large Language Models
by: Qian, Tianhao
Published: (2026)
by: Qian, Tianhao
Published: (2026)
Prune, Update and Trim: Robust Structured Pruning for Large Language Models
by: Mecke, Diego Coello de Portugal, et al.
Published: (2026)
by: Mecke, Diego Coello de Portugal, et al.
Published: (2026)
FASP: Fast and Accurate Structured Pruning of Large Language Models
by: Hu, Hanyu, et al.
Published: (2025)
by: Hu, Hanyu, et al.
Published: (2025)
Adaptive Pruning for Large Language Models with Structural Importance Awareness
by: Zheng, Haotian, et al.
Published: (2024)
by: Zheng, Haotian, et al.
Published: (2024)
SlimLLM: Accurate Structured Pruning for Large Language Models
by: Guo, Jialong, et al.
Published: (2025)
by: Guo, Jialong, et al.
Published: (2025)
Mostly Text, Smart Visuals: Asymmetric Text-Visual Pruning for Large Vision-Language Models
by: Li, Sijie, et al.
Published: (2026)
by: Li, Sijie, et al.
Published: (2026)
UniComp: A Unified Evaluation of Large Language Model Compression via Pruning, Quantization and Distillation
by: von Rad, Jonathan, et al.
Published: (2026)
by: von Rad, Jonathan, et al.
Published: (2026)
Restoring Pruned Large Language Models via Lost Component Compensation
by: Feng, Zijian, et al.
Published: (2025)
by: Feng, Zijian, et al.
Published: (2025)
AlphaPruning: Using Heavy-Tailed Self Regularization Theory for Improved Layer-wise Pruning of Large Language Models
by: Lu, Haiquan, et al.
Published: (2024)
by: Lu, Haiquan, et al.
Published: (2024)
D$^2$-DPM: Dual Denoising for Quantized Diffusion Probabilistic Models
by: Zeng, Qian, et al.
Published: (2025)
by: Zeng, Qian, et al.
Published: (2025)
The Structural Scalpel: Automated Contiguous Layer Pruning for Large Language Models
by: Lu, Yao, et al.
Published: (2025)
by: Lu, Yao, et al.
Published: (2025)
DarwinLM: Evolutionary Structured Pruning of Large Language Models
by: Tang, Shengkun, et al.
Published: (2025)
by: Tang, Shengkun, et al.
Published: (2025)
Balanced Multimodal Learning: An Unidirectional Dynamic Interaction Perspective
by: Wang, Shijie, et al.
Published: (2025)
by: Wang, Shijie, et al.
Published: (2025)
Exploring Federated Pruning for Large Language Models
by: Guo, Pengxin, et al.
Published: (2025)
by: Guo, Pengxin, et al.
Published: (2025)
Beyond Size: How Gradients Shape Pruning Decisions in Large Language Models
by: Das, Rocktim Jyoti, et al.
Published: (2023)
by: Das, Rocktim Jyoti, et al.
Published: (2023)
Prune-Quantize-Distill: An Ordered Pipeline for Efficient Neural Network Compression
by: Zhou, Longsheng, et al.
Published: (2026)
by: Zhou, Longsheng, et al.
Published: (2026)
DISP-LLM: Dimension-Independent Structural Pruning for Large Language Models
by: Gao, Shangqian, et al.
Published: (2024)
by: Gao, Shangqian, et al.
Published: (2024)
GPrune-LLM: Generalization-Aware Structured Pruning for Large Language Models
by: Liu, Xiaoyun, et al.
Published: (2026)
by: Liu, Xiaoyun, et al.
Published: (2026)
Olica: Efficient Structured Pruning of Large Language Models without Retraining
by: He, Jiujun, et al.
Published: (2025)
by: He, Jiujun, et al.
Published: (2025)
OmniQuant: Omnidirectionally Calibrated Quantization for Large Language Models
by: Shao, Wenqi, et al.
Published: (2023)
by: Shao, Wenqi, et al.
Published: (2023)
ToMoE: Converting Dense Large Language Models to Mixture-of-Experts through Dynamic Structural Pruning
by: Gao, Shangqian, et al.
Published: (2025)
by: Gao, Shangqian, et al.
Published: (2025)
Sample-aware Adaptive Structured Pruning for Large Language Models
by: Kong, Jun, et al.
Published: (2025)
by: Kong, Jun, et al.
Published: (2025)
Symmetric Pruning of Large Language Models
by: Yi, Kai, et al.
Published: (2025)
by: Yi, Kai, et al.
Published: (2025)
ResPrune: Text-Conditioned Subspace Reconstruction for Visual Token Pruning in Large Vision-Language Models
by: Li, Xu, et al.
Published: (2026)
by: Li, Xu, et al.
Published: (2026)
Pruning vs Quantization: Which is Better?
by: Kuzmin, Andrey, et al.
Published: (2023)
by: Kuzmin, Andrey, et al.
Published: (2023)
Large Language Model Pruning
by: Huang, Hanjuan, et al.
Published: (2024)
by: Huang, Hanjuan, et al.
Published: (2024)
Pushing the Limits of Large Language Model Quantization via the Linearity Theorem
by: Malinovskii, Vladimir, et al.
Published: (2024)
by: Malinovskii, Vladimir, et al.
Published: (2024)
SwiftPrune: Hessian-Free Weight Pruning for Large Language Models
by: Kang, Yuhan, et al.
Published: (2025)
by: Kang, Yuhan, et al.
Published: (2025)
FedSODA: Federated Fine-tuning of LLMs via Similarity Group Pruning and Orchestrated Distillation Alignment
by: Zhu, Manning, et al.
Published: (2025)
by: Zhu, Manning, et al.
Published: (2025)
From Local to Global: Revisiting Structured Pruning Paradigms for Large Language Models
by: Wang, Ziyan, et al.
Published: (2025)
by: Wang, Ziyan, et al.
Published: (2025)
FedSpaLLM: Federated Pruning of Large Language Models
by: Bai, Guangji, et al.
Published: (2024)
by: Bai, Guangji, et al.
Published: (2024)
Statistically-Lossless Quantization of Large Language Models
by: Helcig, Michael, et al.
Published: (2026)
by: Helcig, Michael, et al.
Published: (2026)
EGGS-PTP: An Expander-Graph Guided Structured Post-training Pruning Method for Large Language Models
by: Bazarbachi, Omar, et al.
Published: (2025)
by: Bazarbachi, Omar, et al.
Published: (2025)
PagedEviction: Structured Block-wise KV Cache Pruning for Efficient Large Language Model Inference
by: Chitty-Venkata, Krishna Teja, et al.
Published: (2025)
by: Chitty-Venkata, Krishna Teja, et al.
Published: (2025)
Similar Items
-
Large Language Model Compression with Global Rank and Sparsity Optimization
by: Zhou, Changhai, et al.
Published: (2025) -
AutoQRA: Joint Optimization of Mixed-Precision Quantization and Low-rank Adapters for Efficient LLM Fine-Tuning
by: Zhou, Changhai, et al.
Published: (2026) -
AutoMixQ: Self-Adjusting Quantization for High Performance Memory-Efficient Fine-Tuning
by: Zhou, Changhai, et al.
Published: (2024) -
RankAdaptor: Hierarchical Rank Allocation for Efficient Fine-Tuning Pruned LLMs via Performance Model
by: Zhou, Changhai, et al.
Published: (2024) -
Balancing Fidelity and Plasticity: Aligning Mixed-Precision Fine-Tuning with Linguistic Hierarchies
by: Zhou, Changhai, et al.
Published: (2025)