Pushing the Limits of Large Language Model Quantization via the Linearity Theorem
Fuente:
arXiv
Salvato in:
| Autori principali: | Malinovskii, Vladimir, Panferov, Andrei, Ilin, Ivan, Guo, Han, Richtárik, Peter, Alistarh, Dan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Apertus LLM Family Expansion via Distillation and Quantization
di: Panferov, Andrei, et al.
Pubblicazione: (2026)
di: Panferov, Andrei, et al.
Pubblicazione: (2026)
Extreme Compression of Large Language Models via Additive Quantization
di: Egiazarian, Vage, et al.
Pubblicazione: (2024)
di: Egiazarian, Vage, et al.
Pubblicazione: (2024)
PV-Tuning: Beyond Straight-Through Estimation for Extreme LLM Compression
di: Malinovskii, Vladimir, et al.
Pubblicazione: (2024)
di: Malinovskii, Vladimir, et al.
Pubblicazione: (2024)
Grid Games: The Power of Multiple Grids for Quantizing Large Language Models
di: Egiazarian, Vage, et al.
Pubblicazione: (2026)
di: Egiazarian, Vage, et al.
Pubblicazione: (2026)
Cache Me If You Must: Adaptive Key-Value Quantization for Large Language Models
di: Shutova, Alina, et al.
Pubblicazione: (2025)
di: Shutova, Alina, et al.
Pubblicazione: (2025)
CAGE: Curvature-Aware Gradient Estimation For Accurate Quantization-Aware Training
di: Tabesh, Soroush, et al.
Pubblicazione: (2025)
di: Tabesh, Soroush, et al.
Pubblicazione: (2025)
Correlated Quantization for Faster Nonconvex Distributed Optimization
di: Panferov, Andrei, et al.
Pubblicazione: (2024)
di: Panferov, Andrei, et al.
Pubblicazione: (2024)
Quartet II: Accurate LLM Pre-Training in NVFP4 by Improved Unbiased Gradient Estimation
di: Panferov, Andrei, et al.
Pubblicazione: (2026)
di: Panferov, Andrei, et al.
Pubblicazione: (2026)
Thanos: A Block-wise Pruning Algorithm for Efficient Large Language Model Compression
di: Ilin, Ivan, et al.
Pubblicazione: (2025)
di: Ilin, Ivan, et al.
Pubblicazione: (2025)
Statistically-Lossless Quantization of Large Language Models
di: Helcig, Michael, et al.
Pubblicazione: (2026)
di: Helcig, Michael, et al.
Pubblicazione: (2026)
Quartet: Native FP4 Training Can Be Optimal for Large Language Models
di: Castro, Roberto L., et al.
Pubblicazione: (2025)
di: Castro, Roberto L., et al.
Pubblicazione: (2025)
QuEST: Stable Training of LLMs with 1-Bit Weights and Activations
di: Panferov, Andrei, et al.
Pubblicazione: (2025)
di: Panferov, Andrei, et al.
Pubblicazione: (2025)
Ringmaster LMO: Asynchronous Linear Minimization Oracle Momentum Method
di: Sadiev, Abdurakhmon, et al.
Pubblicazione: (2026)
di: Sadiev, Abdurakhmon, et al.
Pubblicazione: (2026)
Unified Scaling Laws for Compressed Representations
di: Panferov, Andrei, et al.
Pubblicazione: (2025)
di: Panferov, Andrei, et al.
Pubblicazione: (2025)
The Unseen Frontier: Pushing the Limits of LLM Sparsity with Surrogate-Free ADMM
di: Lee, Kwanhee, et al.
Pubblicazione: (2025)
di: Lee, Kwanhee, et al.
Pubblicazione: (2025)
Bridging the Gap Between Promise and Performance for Microscaling FP4 Quantization
di: Egiazarian, Vage, et al.
Pubblicazione: (2025)
di: Egiazarian, Vage, et al.
Pubblicazione: (2025)
Symmetric Pruning of Large Language Models
di: Yi, Kai, et al.
Pubblicazione: (2025)
di: Yi, Kai, et al.
Pubblicazione: (2025)
Shadowheart SGD: Distributed Asynchronous SGD with Optimal Time Complexity Under Arbitrary Computation and Communication Heterogeneity
di: Tyurin, Alexander, et al.
Pubblicazione: (2024)
di: Tyurin, Alexander, et al.
Pubblicazione: (2024)
Model Compression with Exact Budget Constraints via Riemannian Manifolds
di: Helcig, Michael, et al.
Pubblicazione: (2026)
di: Helcig, Michael, et al.
Pubblicazione: (2026)
MatGPTQ: Accurate and Efficient Post-Training Matryoshka Quantization
di: Kleinegger, Maximilian, et al.
Pubblicazione: (2026)
di: Kleinegger, Maximilian, et al.
Pubblicazione: (2026)
GPTQT: Quantize Large Language Models Twice to Push the Efficiency
di: Guo, Yipin, et al.
Pubblicazione: (2024)
di: Guo, Yipin, et al.
Pubblicazione: (2024)
Mitigating the Impact of Outlier Channels for Language Model Quantization with Activation Regularization
di: Nrusimha, Aniruddha, et al.
Pubblicazione: (2024)
di: Nrusimha, Aniruddha, et al.
Pubblicazione: (2024)
SKIM: Any-bit Quantization Pushing The Limits of Post-Training Quantization
di: Bai, Runsheng, et al.
Pubblicazione: (2024)
di: Bai, Runsheng, et al.
Pubblicazione: (2024)
Mathador-LM: A Dynamic Benchmark for Mathematical Reasoning on Large Language Models
di: Kurtic, Eldar, et al.
Pubblicazione: (2024)
di: Kurtic, Eldar, et al.
Pubblicazione: (2024)
Beyond Outliers: A Study of Optimizers Under Quantization
di: Vlassis, Georgios, et al.
Pubblicazione: (2025)
di: Vlassis, Georgios, et al.
Pubblicazione: (2025)
DarwinLM: Evolutionary Structured Pruning of Large Language Models
di: Tang, Shengkun, et al.
Pubblicazione: (2025)
di: Tang, Shengkun, et al.
Pubblicazione: (2025)
MARLIN: Mixed-Precision Auto-Regressive Parallel Inference on Large Language Models
di: Frantar, Elias, et al.
Pubblicazione: (2024)
di: Frantar, Elias, et al.
Pubblicazione: (2024)
Pushing the Limits of Block Rotations in Post-Training Quantization
di: Sanjeet, Sai, et al.
Pubblicazione: (2026)
di: Sanjeet, Sai, et al.
Pubblicazione: (2026)
WUSH: Near-Optimal Adaptive Transforms for LLM Quantization
di: Chen, Jiale, et al.
Pubblicazione: (2025)
di: Chen, Jiale, et al.
Pubblicazione: (2025)
Local LMO: Constrained Gradient Optimization via a Local Linear Minimization Oracle
di: Richtárik, Peter, et al.
Pubblicazione: (2026)
di: Richtárik, Peter, et al.
Pubblicazione: (2026)
PTQ1.61: Push the Real Limit of Extremely Low-Bit Post-Training Quantization Methods for Large Language Models
di: Zhao, Jiaqi, et al.
Pubblicazione: (2025)
di: Zhao, Jiaqi, et al.
Pubblicazione: (2025)
Behemoth: Benchmarking Unlearning in LLMs Using Fully Synthetic Data
di: Iofinova, Eugenia, et al.
Pubblicazione: (2026)
di: Iofinova, Eugenia, et al.
Pubblicazione: (2026)
Compression Scaling Laws:Unifying Sparsity and Quantization
di: Frantar, Elias, et al.
Pubblicazione: (2025)
di: Frantar, Elias, et al.
Pubblicazione: (2025)
MicroAdam: Accurate Adaptive Optimization with Low Space Overhead and Provable Convergence
di: Modoranu, Ionut-Vlad, et al.
Pubblicazione: (2024)
di: Modoranu, Ionut-Vlad, et al.
Pubblicazione: (2024)
ECO: Quantized Training without Full-Precision Master Weights
di: Nikdan, Mahdi, et al.
Pubblicazione: (2026)
di: Nikdan, Mahdi, et al.
Pubblicazione: (2026)
Hessian of Perplexity for Large Language Models by PyTorch autograd (Open Source)
di: Ilin, Ivan
Pubblicazione: (2025)
di: Ilin, Ivan
Pubblicazione: (2025)
CLAQ: Pushing the Limits of Low-Bit Post-Training Quantization for LLMs
di: Wang, Haoyu, et al.
Pubblicazione: (2024)
di: Wang, Haoyu, et al.
Pubblicazione: (2024)
EvoPress: Accurate Dynamic Model Compression via Evolutionary Search
di: Sieberling, Oliver, et al.
Pubblicazione: (2024)
di: Sieberling, Oliver, et al.
Pubblicazione: (2024)
Panza: Design and Analysis of a Fully-Local Personalized Text Writing Assistant
di: Nicolicioiu, Armand, et al.
Pubblicazione: (2024)
di: Nicolicioiu, Armand, et al.
Pubblicazione: (2024)
MX+: Pushing the Limits of Microscaling Formats for Efficient Large Language Model Serving
di: Lee, Jungi, et al.
Pubblicazione: (2025)
di: Lee, Jungi, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Apertus LLM Family Expansion via Distillation and Quantization
di: Panferov, Andrei, et al.
Pubblicazione: (2026) -
Extreme Compression of Large Language Models via Additive Quantization
di: Egiazarian, Vage, et al.
Pubblicazione: (2024) -
PV-Tuning: Beyond Straight-Through Estimation for Extreme LLM Compression
di: Malinovskii, Vladimir, et al.
Pubblicazione: (2024) -
Grid Games: The Power of Multiple Grids for Quantizing Large Language Models
di: Egiazarian, Vage, et al.
Pubblicazione: (2026) -
Cache Me If You Must: Adaptive Key-Value Quantization for Large Language Models
di: Shutova, Alina, et al.
Pubblicazione: (2025)