Prune-then-Quantize or Quantize-then-Prune? Understanding the Impact of Compression Order in Joint Model Compression
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Kim, Minjun, Choi, Jaehyeon, Yang, Hyunwoo, Kim, Jongjin, Song, Jinho, Kang, U |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SynQ: Accurate Zero-shot Quantization by Synthesis-aware Fine-tuning
par: Kim, Minjun, et autres
Publié: (2026)
par: Kim, Minjun, et autres
Publié: (2026)
Automatic Joint Structured Pruning and Quantization for Efficient Neural Network Training and Compression
par: Qu, Xiaoyi, et autres
Publié: (2025)
par: Qu, Xiaoyi, et autres
Publié: (2025)
Prune-Quantize-Distill: An Ordered Pipeline for Efficient Neural Network Compression
par: Zhou, Longsheng, et autres
Publié: (2026)
par: Zhou, Longsheng, et autres
Publié: (2026)
The Impact of Quantization and Pruning on Deep Reinforcement Learning Models
par: Lu, Heng, et autres
Publié: (2024)
par: Lu, Heng, et autres
Publié: (2024)
A Comprehensive Survey of Compression Algorithms for Language Models
par: Park, Seungcheol, et autres
Publié: (2024)
par: Park, Seungcheol, et autres
Publié: (2024)
Locality-Aware Redundancy Pruning for LLM Depth Compression
par: Yun, Vincent-Daniel, et autres
Publié: (2026)
par: Yun, Vincent-Daniel, et autres
Publié: (2026)
Zero-shot Quantization: A Comprehensive Survey
par: Kim, Minjun, et autres
Publié: (2025)
par: Kim, Minjun, et autres
Publié: (2025)
Focus on the Core: Efficient Attention via Pruned Token Compression for Document Classification
par: Yun, Jungmin, et autres
Publié: (2024)
par: Yun, Jungmin, et autres
Publié: (2024)
Singular Value Scaling: Efficient Generative Model Compression via Pruned Weights Refinement
par: Kim, Hyeonjin, et autres
Publié: (2024)
par: Kim, Hyeonjin, et autres
Publié: (2024)
DYCP: Dynamic Context Pruning for Long-Form Dialogue with LLMs
par: Choi, Nayoung, et autres
Publié: (2026)
par: Choi, Nayoung, et autres
Publié: (2026)
Model Compression using Progressive Channel Pruning
par: Guo, Jinyang, et autres
Publié: (2025)
par: Guo, Jinyang, et autres
Publié: (2025)
Quantization-Aware and Tensor-Compressed Training of Transformers for Natural Language Understanding
par: Yang, Zi, et autres
Publié: (2023)
par: Yang, Zi, et autres
Publié: (2023)
On the Compressibility of Quantized Large Language Models
par: Mao, Yu, et autres
Publié: (2024)
par: Mao, Yu, et autres
Publié: (2024)
LampQ: Towards Accurate Layer-wise Mixed Precision Quantization for Vision Transformers
par: Kim, Minjun, et autres
Publié: (2025)
par: Kim, Minjun, et autres
Publié: (2025)
Soft Label Pruning and Quantization for Large-Scale Dataset Distillation
par: Lingao, Xiao, et autres
Publié: (2026)
par: Lingao, Xiao, et autres
Publié: (2026)
FibQuant: Universal Vector Quantization for Random-Access KV-Cache Compression
par: Lee, Namyoon, et autres
Publié: (2026)
par: Lee, Namyoon, et autres
Publié: (2026)
Large Multimodal Model Compression via Efficient Pruning and Distillation at AntGroup
par: Wang, Maolin, et autres
Publié: (2023)
par: Wang, Maolin, et autres
Publié: (2023)
Binary Quadratic Quantization: Beyond First-Order Quantization for Real-Valued Matrix Compression
par: Kuroki, Kyo, et autres
Publié: (2025)
par: Kuroki, Kyo, et autres
Publié: (2025)
Frequency Matters: Fast Model-Agnostic Data Curation for Pruning and Quantization
par: Monaco, Francesco Pio, et autres
Publié: (2026)
par: Monaco, Francesco Pio, et autres
Publié: (2026)
One Shot vs. Iterative: Rethinking Pruning Strategies for Model Compression
par: Janusz, Mikołaj, et autres
Publié: (2025)
par: Janusz, Mikołaj, et autres
Publié: (2025)
GETA-3DGS: Automatic Joint Structured Pruning and Quantization for 3D Gaussian Splatting
par: Zhang, Baobing, et autres
Publié: (2026)
par: Zhang, Baobing, et autres
Publié: (2026)
QAPruner: Quantization-Aware Vision Token Pruning for Multimodal Large Language Models
par: Wang, Xinhao, et autres
Publié: (2026)
par: Wang, Xinhao, et autres
Publié: (2026)
Rotation Invariant Quantization for Model Compression
par: Kampeas, Joseph, et autres
Publié: (2023)
par: Kampeas, Joseph, et autres
Publié: (2023)
SQS: Bayesian DNN Compression through Sparse Quantized Sub-distributions
par: Wang, Ziyi, et autres
Publié: (2025)
par: Wang, Ziyi, et autres
Publié: (2025)
EPSD: Early Pruning with Self-Distillation for Efficient Model Compression
par: Chen, Dong, et autres
Publié: (2024)
par: Chen, Dong, et autres
Publié: (2024)
Adaptive Dataset Quantization: A New Direction for Dataset Pruning
par: Yu, Chenyue, et autres
Publié: (2025)
par: Yu, Chenyue, et autres
Publié: (2025)
Structured Pruning and Quantization for Learned Image Compression
par: Hossain, Md Adnan Faisal, et autres
Publié: (2025)
par: Hossain, Md Adnan Faisal, et autres
Publié: (2025)
HierarchicalPrune: Position-Aware Compression for Large-Scale Diffusion Models
par: Kwon, Young D., et autres
Publié: (2025)
par: Kwon, Young D., et autres
Publié: (2025)
ROSAQ: Rotation-based Saliency-Aware Weight Quantization for Efficiently Compressing Large Language Models
par: Yoon, Junho, et autres
Publié: (2025)
par: Yoon, Junho, et autres
Publié: (2025)
DAQ: Delta-Aware Quantization for Post-Training LLM Weight Compression
par: Yu, Xiaoming, et autres
Publié: (2026)
par: Yu, Xiaoming, et autres
Publié: (2026)
PPC-GPT: Federated Task-Specific Compression of Large Language Models via Pruning and Chain-of-Thought Distillation
par: Fan, Tao, et autres
Publié: (2025)
par: Fan, Tao, et autres
Publié: (2025)
Hurwitz Quaternion Multiplicative Quantization for KV Cache Compression
par: Swain, Kabir, et autres
Publié: (2026)
par: Swain, Kabir, et autres
Publié: (2026)
No Token Left Behind: Reliable KV Cache Compression via Importance-Aware Mixed Precision Quantization
par: Yang, June Yong, et autres
Publié: (2024)
par: Yang, June Yong, et autres
Publié: (2024)
SwiftPrune: Hessian-Free Weight Pruning for Large Language Models
par: Kang, Yuhan, et autres
Publié: (2025)
par: Kang, Yuhan, et autres
Publié: (2025)
CommVQ: Commutative Vector Quantization for KV Cache Compression
par: Li, Junyan, et autres
Publié: (2025)
par: Li, Junyan, et autres
Publié: (2025)
RAP: KV-Cache Compression via RoPE-Aligned Pruning
par: Xin, Jihao, et autres
Publié: (2026)
par: Xin, Jihao, et autres
Publié: (2026)
LLMs can Compress LLMs: Adaptive Pruning by Agents
par: Kodathala, Sai Varun, et autres
Publié: (2026)
par: Kodathala, Sai Varun, et autres
Publié: (2026)
A Free Lunch in LLM Compression: Revisiting Retraining after Pruning
par: Wagner, Moritz, et autres
Publié: (2025)
par: Wagner, Moritz, et autres
Publié: (2025)
Sensitivity-Guided Framework for Pruned and Quantized Reservoir Computing Accelerators
par: Jafari, Atousa, et autres
Publié: (2026)
par: Jafari, Atousa, et autres
Publié: (2026)
Multi-View Node Pruning for Accurate Graph Representation
par: Kim, Hanjin, et autres
Publié: (2025)
par: Kim, Hanjin, et autres
Publié: (2025)
Documents similaires
-
SynQ: Accurate Zero-shot Quantization by Synthesis-aware Fine-tuning
par: Kim, Minjun, et autres
Publié: (2026) -
Automatic Joint Structured Pruning and Quantization for Efficient Neural Network Training and Compression
par: Qu, Xiaoyi, et autres
Publié: (2025) -
Prune-Quantize-Distill: An Ordered Pipeline for Efficient Neural Network Compression
par: Zhou, Longsheng, et autres
Publié: (2026) -
The Impact of Quantization and Pruning on Deep Reinforcement Learning Models
par: Lu, Heng, et autres
Publié: (2024) -
A Comprehensive Survey of Compression Algorithms for Language Models
par: Park, Seungcheol, et autres
Publié: (2024)