SLiM: One-shot Quantization and Sparsity with Low-rank Approximation for LLM Weight Compression
Fuente:
arXiv
Salvato in:
| Autori principali: | Mozaffari, Mohammad, Yazdanbakhsh, Amir, Dehnavi, Maryam Mehri |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
OPTIMA: Optimal One-shot Pruning for LLMs via Quadratic Programming Reconstruction
di: Mozaffari, Mohammad, et al.
Pubblicazione: (2025)
di: Mozaffari, Mohammad, et al.
Pubblicazione: (2025)
PATCH: Learnable Tile-level Hybrid Sparsity for LLMs
di: Hourri, Younes, et al.
Pubblicazione: (2025)
di: Hourri, Younes, et al.
Pubblicazione: (2025)
SLoPe: Double-Pruned Sparse Plus Lazy Low-Rank Adapter Pretraining of LLMs
di: Mozaffari, Mohammad, et al.
Pubblicazione: (2024)
di: Mozaffari, Mohammad, et al.
Pubblicazione: (2024)
MKOR: Momentum-Enabled Kronecker-Factor-Based Optimizer Using Rank-1 Updates
di: Mozaffari, Mohammad, et al.
Pubblicazione: (2023)
di: Mozaffari, Mohammad, et al.
Pubblicazione: (2023)
QJL: 1-Bit Quantized JL Transform for KV Cache Quantization with Zero Overhead
di: Zandieh, Amir, et al.
Pubblicazione: (2024)
di: Zandieh, Amir, et al.
Pubblicazione: (2024)
EcoSpa: Efficient Transformer Training with Coupled Sparsity
di: Xiao, Jinqi, et al.
Pubblicazione: (2025)
di: Xiao, Jinqi, et al.
Pubblicazione: (2025)
EDGC: Entropy-driven Dynamic Gradient Compression for Efficient LLM Training
di: Yi, Qingao, et al.
Pubblicazione: (2025)
di: Yi, Qingao, et al.
Pubblicazione: (2025)
ClusterKV: Manipulating LLM KV Cache in Semantic Space for Recallable Compression
di: Liu, Guangda, et al.
Pubblicazione: (2024)
di: Liu, Guangda, et al.
Pubblicazione: (2024)
ALISA: Accelerating Large Language Model Inference via Sparsity-Aware KV Caching
di: Zhao, Youpeng, et al.
Pubblicazione: (2024)
di: Zhao, Youpeng, et al.
Pubblicazione: (2024)
EXAQ: Exponent Aware Quantization For LLMs Acceleration
di: Shkolnik, Moran, et al.
Pubblicazione: (2024)
di: Shkolnik, Moran, et al.
Pubblicazione: (2024)
Learning Performance-Improving Code Edits
di: Shypula, Alexander, et al.
Pubblicazione: (2023)
di: Shypula, Alexander, et al.
Pubblicazione: (2023)
Dynamic Expert Quantization for Scalable Mixture-of-Experts Inference
di: Chu, Kexin, et al.
Pubblicazione: (2025)
di: Chu, Kexin, et al.
Pubblicazione: (2025)
QServe: W4A8KV4 Quantization and System Co-design for Efficient LLM Serving
di: Lin, Yujun, et al.
Pubblicazione: (2024)
di: Lin, Yujun, et al.
Pubblicazione: (2024)
Unveiling the Potential of Quantization with MXFP4: Strategies for Quantization Error Reduction
di: Chhugani, Jatin, et al.
Pubblicazione: (2026)
di: Chhugani, Jatin, et al.
Pubblicazione: (2026)
Pushing the Envelope of LLM Inference on AI-PC and Intel GPUs
di: Georganas, Evangelos, et al.
Pubblicazione: (2025)
di: Georganas, Evangelos, et al.
Pubblicazione: (2025)
FlashSVD: Memory-Efficient Inference with Streaming for Low-Rank Models
di: Shao, Zishan, et al.
Pubblicazione: (2025)
di: Shao, Zishan, et al.
Pubblicazione: (2025)
Ragged Paged Attention: A High-Performance and Flexible LLM Inference Kernel for TPU
di: Jiang, Jevin, et al.
Pubblicazione: (2026)
di: Jiang, Jevin, et al.
Pubblicazione: (2026)
ShadowNPU: System and Algorithm Co-design for NPU-Centric On-Device LLM Inference
di: Yin, Wangsong, et al.
Pubblicazione: (2025)
di: Yin, Wangsong, et al.
Pubblicazione: (2025)
FlashSVD v1.5: Making Low-Rank Transformers Inference Actually Fast
di: Wu, Wenhao, et al.
Pubblicazione: (2026)
di: Wu, Wenhao, et al.
Pubblicazione: (2026)
Reducing Latency of LLM Search Agent via Speculation-based Algorithm-System Co-Design
di: Huang, Zixiao, et al.
Pubblicazione: (2025)
di: Huang, Zixiao, et al.
Pubblicazione: (2025)
GreedySnake: Accelerating SSD-Offloaded LLM Training with Efficient Scheduling and Optimizer Step Overlapping
di: Yin, Yishu, et al.
Pubblicazione: (2025)
di: Yin, Yishu, et al.
Pubblicazione: (2025)
LLM Swiss Round: Aggregating Multi-Benchmark Performance via Competitive Swiss-System Dynamics
di: Liu, Jiashuo, et al.
Pubblicazione: (2025)
di: Liu, Jiashuo, et al.
Pubblicazione: (2025)
Private LLM Inference on Consumer Blackwell GPUs: A Practical Guide for Cost-Effective Local Deployment in SMEs
di: Knoop, Jonathan, et al.
Pubblicazione: (2026)
di: Knoop, Jonathan, et al.
Pubblicazione: (2026)
Ensuring Reliability of Curated EHR-Derived Data: The Validation of Accuracy for LLM/ML-Extracted Information and Data (VALID) Framework
di: Estevez, Melissa, et al.
Pubblicazione: (2025)
di: Estevez, Melissa, et al.
Pubblicazione: (2025)
Research on Low-Latency Inference and Training Efficiency Optimization for Graph Neural Network and Large Language Model-Based Recommendation Systems
di: Zhao, Yushang, et al.
Pubblicazione: (2025)
di: Zhao, Yushang, et al.
Pubblicazione: (2025)
Effective Interplay between Sparsity and Quantization: From Theory to Practice
di: Harma, Simla Burcu, et al.
Pubblicazione: (2024)
di: Harma, Simla Burcu, et al.
Pubblicazione: (2024)
Online Pseudo-average Shifting Attention(PASA) for Robust Low-precision LLM Inference: Algorithms and Numerical Analysis
di: Cheng, Long, et al.
Pubblicazione: (2025)
di: Cheng, Long, et al.
Pubblicazione: (2025)
Low-Rank GEMM: Efficient Matrix Multiplication via Low-Rank Approximation with FP8 Acceleration
di: Metere, Alfredo
Pubblicazione: (2025)
di: Metere, Alfredo
Pubblicazione: (2025)
Quamba2: A Robust and Scalable Post-training Quantization Framework for Selective State Space Models
di: Chiang, Hung-Yueh, et al.
Pubblicazione: (2025)
di: Chiang, Hung-Yueh, et al.
Pubblicazione: (2025)
Model Compression and Efficient Inference for Large Language Models: A Survey
di: Wang, Wenxiao, et al.
Pubblicazione: (2024)
di: Wang, Wenxiao, et al.
Pubblicazione: (2024)
LLM-Vectorizer: LLM-based Verified Loop Vectorizer
di: Taneja, Jubi, et al.
Pubblicazione: (2024)
di: Taneja, Jubi, et al.
Pubblicazione: (2024)
SparAMX: Accelerating Compressed LLMs Token Generation on AMX-powered CPUs
di: AbouElhamayed, Ahmed F., et al.
Pubblicazione: (2025)
di: AbouElhamayed, Ahmed F., et al.
Pubblicazione: (2025)
Prompt-Aware Scheduling for Low-Latency LLM Serving
di: Tao, Yiheng, et al.
Pubblicazione: (2025)
di: Tao, Yiheng, et al.
Pubblicazione: (2025)
Causal Unlearning in Collaborative Optimization: Exact and Approximate Influence Reversal under Adversarial Contributions
di: Mahdavi, Ali, et al.
Pubblicazione: (2026)
di: Mahdavi, Ali, et al.
Pubblicazione: (2026)
CodeRosetta: Pushing the Boundaries of Unsupervised Code Translation for Parallel Programming
di: TehraniJamsaz, Ali, et al.
Pubblicazione: (2024)
di: TehraniJamsaz, Ali, et al.
Pubblicazione: (2024)
A Performance Evaluation of a Quantized Large Language Model on Various Smartphones
di: Çöplü, Tolga, et al.
Pubblicazione: (2023)
di: Çöplü, Tolga, et al.
Pubblicazione: (2023)
REAM: Merging Improves Pruning of Experts in LLMs
di: Jha, Saurav, et al.
Pubblicazione: (2026)
di: Jha, Saurav, et al.
Pubblicazione: (2026)
Systematic Characterization of LLM Quantization: A Performance, Energy, and Quality Perspective
di: Shi, Tianyao, et al.
Pubblicazione: (2025)
di: Shi, Tianyao, et al.
Pubblicazione: (2025)
Forecasting LLM Inference Performance via Hardware-Agnostic Analytical Modeling
di: Patwari, Rajeev, et al.
Pubblicazione: (2025)
di: Patwari, Rajeev, et al.
Pubblicazione: (2025)
Bench360: Benchmarking Local LLM Inference from 360 Degrees
di: Stuhlmann, Linus, et al.
Pubblicazione: (2025)
di: Stuhlmann, Linus, et al.
Pubblicazione: (2025)
Documenti analoghi
-
OPTIMA: Optimal One-shot Pruning for LLMs via Quadratic Programming Reconstruction
di: Mozaffari, Mohammad, et al.
Pubblicazione: (2025) -
PATCH: Learnable Tile-level Hybrid Sparsity for LLMs
di: Hourri, Younes, et al.
Pubblicazione: (2025) -
SLoPe: Double-Pruned Sparse Plus Lazy Low-Rank Adapter Pretraining of LLMs
di: Mozaffari, Mohammad, et al.
Pubblicazione: (2024) -
MKOR: Momentum-Enabled Kronecker-Factor-Based Optimizer Using Rank-1 Updates
di: Mozaffari, Mohammad, et al.
Pubblicazione: (2023) -
QJL: 1-Bit Quantized JL Transform for KV Cache Quantization with Zero Overhead
di: Zandieh, Amir, et al.
Pubblicazione: (2024)