PV-Tuning: Beyond Straight-Through Estimation for Extreme LLM Compression
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Malinovskii, Vladimir, Mazur, Denis, Ilin, Ivan, Kuznedelev, Denis, Burlachenko, Konstantin, Yi, Kai, Alistarh, Dan, Richtarik, Peter |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Cache Me If You Must: Adaptive Key-Value Quantization for Large Language Models
par: Shutova, Alina, et autres
Publié: (2025)
par: Shutova, Alina, et autres
Publié: (2025)
Pushing the Limits of Large Language Model Quantization via the Linearity Theorem
par: Malinovskii, Vladimir, et autres
Publié: (2024)
par: Malinovskii, Vladimir, et autres
Publié: (2024)
EvoPress: Accurate Dynamic Model Compression via Evolutionary Search
par: Sieberling, Oliver, et autres
Publié: (2024)
par: Sieberling, Oliver, et autres
Publié: (2024)
Extreme Compression of Large Language Models via Additive Quantization
par: Egiazarian, Vage, et autres
Publié: (2024)
par: Egiazarian, Vage, et autres
Publié: (2024)
Unlocking FedNL: Self-Contained Compute-Optimized Implementation
par: Burlachenko, Konstantin, et autres
Publié: (2024)
par: Burlachenko, Konstantin, et autres
Publié: (2024)
BurTorch: Revisiting Training from First Principles by Coupling Autodiff, Math Optimization, and Systems
par: Burlachenko, Konstantin, et autres
Publié: (2025)
par: Burlachenko, Konstantin, et autres
Publié: (2025)
Error Feedback Reloaded: From Quadratic to Arithmetic Mean of Smoothness Constants
par: Richtárik, Peter, et autres
Publié: (2024)
par: Richtárik, Peter, et autres
Publié: (2024)
Thanos: A Block-wise Pruning Algorithm for Efficient Large Language Model Compression
par: Ilin, Ivan, et autres
Publié: (2025)
par: Ilin, Ivan, et autres
Publié: (2025)
The Iterative Optimal Brain Surgeon: Faster Sparse Recovery by Leveraging Second-Order Information
par: Wu, Diyuan, et autres
Publié: (2024)
par: Wu, Diyuan, et autres
Publié: (2024)
Optimization Methods and Software for Federated Learning
par: Burlachenko, Konstantin
Publié: (2025)
par: Burlachenko, Konstantin
Publié: (2025)
Hogwild! Inference: Parallel LLM Generation via Concurrent Attention
par: Rodionov, Gleb, et autres
Publié: (2025)
par: Rodionov, Gleb, et autres
Publié: (2025)
Characterizing Graph Datasets for Node Classification: Homophily-Heterophily Dichotomy and Beyond
par: Platonov, Oleg, et autres
Publié: (2022)
par: Platonov, Oleg, et autres
Publié: (2022)
Model Compression with Exact Budget Constraints via Riemannian Manifolds
par: Helcig, Michael, et autres
Publié: (2026)
par: Helcig, Michael, et autres
Publié: (2026)
Shadowheart SGD: Distributed Asynchronous SGD with Optimal Time Complexity Under Arbitrary Computation and Communication Heterogeneity
par: Tyurin, Alexander, et autres
Publié: (2024)
par: Tyurin, Alexander, et autres
Publié: (2024)
Accurate Compression of Text-to-Image Diffusion Models via Vector Quantization
par: Egiazarian, Vage, et autres
Publié: (2024)
par: Egiazarian, Vage, et autres
Publié: (2024)
Ringmaster LMO: Asynchronous Linear Minimization Oracle Momentum Method
par: Sadiev, Abdurakhmon, et autres
Publié: (2026)
par: Sadiev, Abdurakhmon, et autres
Publié: (2026)
Symmetric Pruning of Large Language Models
par: Yi, Kai, et autres
Publié: (2025)
par: Yi, Kai, et autres
Publié: (2025)
KV Cache Offloading for Context-Intensive Tasks
par: Bocharnikov, Andrey, et autres
Publié: (2026)
par: Bocharnikov, Andrey, et autres
Publié: (2026)
Cohort Squeeze: Beyond a Single Communication Round per Cohort in Cross-Device Federated Learning
par: Yi, Kai, et autres
Publié: (2024)
par: Yi, Kai, et autres
Publié: (2024)
MatryoshkaLoRA: Learning Accurate Hierarchical Low-Rank Representations for LLM Fine-Tuning
par: Modoranu, Ionut-Vlad, et autres
Publié: (2026)
par: Modoranu, Ionut-Vlad, et autres
Publié: (2026)
Custom Gradient Estimators are Straight-Through Estimators in Disguise
par: Schoenbauer, Matt, et autres
Publié: (2024)
par: Schoenbauer, Matt, et autres
Publié: (2024)
Quartet II: Accurate LLM Pre-Training in NVFP4 by Improved Unbiased Gradient Estimation
par: Panferov, Andrei, et autres
Publié: (2026)
par: Panferov, Andrei, et autres
Publié: (2026)
Bridging the Gap Between Promise and Performance for Microscaling FP4 Quantization
par: Egiazarian, Vage, et autres
Publié: (2025)
par: Egiazarian, Vage, et autres
Publié: (2025)
A critical look at the evaluation of GNNs under heterophily: Are we really making progress?
par: Platonov, Oleg, et autres
Publié: (2023)
par: Platonov, Oleg, et autres
Publié: (2023)
CompressedScaffnew: The First Theoretical Double Acceleration of Communication from Local Training and Compression in Distributed Optimization
par: Condat, Laurent, et autres
Publié: (2022)
par: Condat, Laurent, et autres
Publié: (2022)
Improving the Straight-Through Estimator with Zeroth-Order Information
par: Yang, Ningfeng, et autres
Publié: (2025)
par: Yang, Ningfeng, et autres
Publié: (2025)
TAMUNA: Doubly Accelerated Distributed Optimization with Local Training, Compression, and Partial Participation
par: Condat, Laurent, et autres
Publié: (2023)
par: Condat, Laurent, et autres
Publié: (2023)
MicroAdam: Accurate Adaptive Optimization with Low Space Overhead and Provable Convergence
par: Modoranu, Ionut-Vlad, et autres
Publié: (2024)
par: Modoranu, Ionut-Vlad, et autres
Publié: (2024)
Behemoth: Benchmarking Unlearning in LLMs Using Fully Synthetic Data
par: Iofinova, Eugenia, et autres
Publié: (2026)
par: Iofinova, Eugenia, et autres
Publié: (2026)
Improving Discrete Optimisation Via Decoupled Straight-Through Estimator
par: Shah, Rushi, et autres
Publié: (2024)
par: Shah, Rushi, et autres
Publié: (2024)
Apertus LLM Family Expansion via Distillation and Quantization
par: Panferov, Andrei, et autres
Publié: (2026)
par: Panferov, Andrei, et autres
Publié: (2026)
Compression Scaling Laws:Unifying Sparsity and Quantization
par: Frantar, Elias, et autres
Publié: (2025)
par: Frantar, Elias, et autres
Publié: (2025)
Beyond Discreteness: Sample Complexity Analysis of Straight-Through Estimator for 1-bit Quantization
par: Jeong, Halyun, et autres
Publié: (2025)
par: Jeong, Halyun, et autres
Publié: (2025)
RoSA: Accurate Parameter-Efficient Fine-Tuning via Robust Adaptation
par: Nikdan, Mahdi, et autres
Publié: (2024)
par: Nikdan, Mahdi, et autres
Publié: (2024)
BiCoLoR: Communication-Efficient Optimization with Bidirectional Compression and Local Training
par: Condat, Laurent, et autres
Publié: (2026)
par: Condat, Laurent, et autres
Publié: (2026)
Beyond Outliers: A Study of Optimizers Under Quantization
par: Vlassis, Georgios, et autres
Publié: (2025)
par: Vlassis, Georgios, et autres
Publié: (2025)
Label Privacy in Split Learning for Large Models with Parameter-Efficient Training
par: Zmushko, Philip, et autres
Publié: (2024)
par: Zmushko, Philip, et autres
Publié: (2024)
LLMQ: Efficient Lower-Precision Pretraining for Consumer GPUs
par: Schultheis, Erik, et autres
Publié: (2025)
par: Schultheis, Erik, et autres
Publié: (2025)
Sparse-ProxSkip: Accelerated Sparse-to-Sparse Training in Federated Learning
par: Meinhardt, Georg, et autres
Publié: (2024)
par: Meinhardt, Georg, et autres
Publié: (2024)
FedP3: Federated Personalized and Privacy-friendly Network Pruning under Model Heterogeneity
par: Yi, Kai, et autres
Publié: (2024)
par: Yi, Kai, et autres
Publié: (2024)
Documents similaires
-
Cache Me If You Must: Adaptive Key-Value Quantization for Large Language Models
par: Shutova, Alina, et autres
Publié: (2025) -
Pushing the Limits of Large Language Model Quantization via the Linearity Theorem
par: Malinovskii, Vladimir, et autres
Publié: (2024) -
EvoPress: Accurate Dynamic Model Compression via Evolutionary Search
par: Sieberling, Oliver, et autres
Publié: (2024) -
Extreme Compression of Large Language Models via Additive Quantization
par: Egiazarian, Vage, et autres
Publié: (2024) -
Unlocking FedNL: Self-Contained Compute-Optimized Implementation
par: Burlachenko, Konstantin, et autres
Publié: (2024)