PV-Tuning: Beyond Straight-Through Estimation for Extreme LLM Compression
Fuente:
arXiv
Salvato in:
| Autori principali: | Malinovskii, Vladimir, Mazur, Denis, Ilin, Ivan, Kuznedelev, Denis, Burlachenko, Konstantin, Yi, Kai, Alistarh, Dan, Richtarik, Peter |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Cache Me If You Must: Adaptive Key-Value Quantization for Large Language Models
di: Shutova, Alina, et al.
Pubblicazione: (2025)
di: Shutova, Alina, et al.
Pubblicazione: (2025)
Pushing the Limits of Large Language Model Quantization via the Linearity Theorem
di: Malinovskii, Vladimir, et al.
Pubblicazione: (2024)
di: Malinovskii, Vladimir, et al.
Pubblicazione: (2024)
EvoPress: Accurate Dynamic Model Compression via Evolutionary Search
di: Sieberling, Oliver, et al.
Pubblicazione: (2024)
di: Sieberling, Oliver, et al.
Pubblicazione: (2024)
Extreme Compression of Large Language Models via Additive Quantization
di: Egiazarian, Vage, et al.
Pubblicazione: (2024)
di: Egiazarian, Vage, et al.
Pubblicazione: (2024)
Unlocking FedNL: Self-Contained Compute-Optimized Implementation
di: Burlachenko, Konstantin, et al.
Pubblicazione: (2024)
di: Burlachenko, Konstantin, et al.
Pubblicazione: (2024)
BurTorch: Revisiting Training from First Principles by Coupling Autodiff, Math Optimization, and Systems
di: Burlachenko, Konstantin, et al.
Pubblicazione: (2025)
di: Burlachenko, Konstantin, et al.
Pubblicazione: (2025)
Error Feedback Reloaded: From Quadratic to Arithmetic Mean of Smoothness Constants
di: Richtárik, Peter, et al.
Pubblicazione: (2024)
di: Richtárik, Peter, et al.
Pubblicazione: (2024)
Thanos: A Block-wise Pruning Algorithm for Efficient Large Language Model Compression
di: Ilin, Ivan, et al.
Pubblicazione: (2025)
di: Ilin, Ivan, et al.
Pubblicazione: (2025)
The Iterative Optimal Brain Surgeon: Faster Sparse Recovery by Leveraging Second-Order Information
di: Wu, Diyuan, et al.
Pubblicazione: (2024)
di: Wu, Diyuan, et al.
Pubblicazione: (2024)
Optimization Methods and Software for Federated Learning
di: Burlachenko, Konstantin
Pubblicazione: (2025)
di: Burlachenko, Konstantin
Pubblicazione: (2025)
Hogwild! Inference: Parallel LLM Generation via Concurrent Attention
di: Rodionov, Gleb, et al.
Pubblicazione: (2025)
di: Rodionov, Gleb, et al.
Pubblicazione: (2025)
Characterizing Graph Datasets for Node Classification: Homophily-Heterophily Dichotomy and Beyond
di: Platonov, Oleg, et al.
Pubblicazione: (2022)
di: Platonov, Oleg, et al.
Pubblicazione: (2022)
Model Compression with Exact Budget Constraints via Riemannian Manifolds
di: Helcig, Michael, et al.
Pubblicazione: (2026)
di: Helcig, Michael, et al.
Pubblicazione: (2026)
Shadowheart SGD: Distributed Asynchronous SGD with Optimal Time Complexity Under Arbitrary Computation and Communication Heterogeneity
di: Tyurin, Alexander, et al.
Pubblicazione: (2024)
di: Tyurin, Alexander, et al.
Pubblicazione: (2024)
Accurate Compression of Text-to-Image Diffusion Models via Vector Quantization
di: Egiazarian, Vage, et al.
Pubblicazione: (2024)
di: Egiazarian, Vage, et al.
Pubblicazione: (2024)
Ringmaster LMO: Asynchronous Linear Minimization Oracle Momentum Method
di: Sadiev, Abdurakhmon, et al.
Pubblicazione: (2026)
di: Sadiev, Abdurakhmon, et al.
Pubblicazione: (2026)
Symmetric Pruning of Large Language Models
di: Yi, Kai, et al.
Pubblicazione: (2025)
di: Yi, Kai, et al.
Pubblicazione: (2025)
KV Cache Offloading for Context-Intensive Tasks
di: Bocharnikov, Andrey, et al.
Pubblicazione: (2026)
di: Bocharnikov, Andrey, et al.
Pubblicazione: (2026)
Cohort Squeeze: Beyond a Single Communication Round per Cohort in Cross-Device Federated Learning
di: Yi, Kai, et al.
Pubblicazione: (2024)
di: Yi, Kai, et al.
Pubblicazione: (2024)
MatryoshkaLoRA: Learning Accurate Hierarchical Low-Rank Representations for LLM Fine-Tuning
di: Modoranu, Ionut-Vlad, et al.
Pubblicazione: (2026)
di: Modoranu, Ionut-Vlad, et al.
Pubblicazione: (2026)
Custom Gradient Estimators are Straight-Through Estimators in Disguise
di: Schoenbauer, Matt, et al.
Pubblicazione: (2024)
di: Schoenbauer, Matt, et al.
Pubblicazione: (2024)
Quartet II: Accurate LLM Pre-Training in NVFP4 by Improved Unbiased Gradient Estimation
di: Panferov, Andrei, et al.
Pubblicazione: (2026)
di: Panferov, Andrei, et al.
Pubblicazione: (2026)
Bridging the Gap Between Promise and Performance for Microscaling FP4 Quantization
di: Egiazarian, Vage, et al.
Pubblicazione: (2025)
di: Egiazarian, Vage, et al.
Pubblicazione: (2025)
A critical look at the evaluation of GNNs under heterophily: Are we really making progress?
di: Platonov, Oleg, et al.
Pubblicazione: (2023)
di: Platonov, Oleg, et al.
Pubblicazione: (2023)
CompressedScaffnew: The First Theoretical Double Acceleration of Communication from Local Training and Compression in Distributed Optimization
di: Condat, Laurent, et al.
Pubblicazione: (2022)
di: Condat, Laurent, et al.
Pubblicazione: (2022)
Improving the Straight-Through Estimator with Zeroth-Order Information
di: Yang, Ningfeng, et al.
Pubblicazione: (2025)
di: Yang, Ningfeng, et al.
Pubblicazione: (2025)
TAMUNA: Doubly Accelerated Distributed Optimization with Local Training, Compression, and Partial Participation
di: Condat, Laurent, et al.
Pubblicazione: (2023)
di: Condat, Laurent, et al.
Pubblicazione: (2023)
MicroAdam: Accurate Adaptive Optimization with Low Space Overhead and Provable Convergence
di: Modoranu, Ionut-Vlad, et al.
Pubblicazione: (2024)
di: Modoranu, Ionut-Vlad, et al.
Pubblicazione: (2024)
Behemoth: Benchmarking Unlearning in LLMs Using Fully Synthetic Data
di: Iofinova, Eugenia, et al.
Pubblicazione: (2026)
di: Iofinova, Eugenia, et al.
Pubblicazione: (2026)
Improving Discrete Optimisation Via Decoupled Straight-Through Estimator
di: Shah, Rushi, et al.
Pubblicazione: (2024)
di: Shah, Rushi, et al.
Pubblicazione: (2024)
Apertus LLM Family Expansion via Distillation and Quantization
di: Panferov, Andrei, et al.
Pubblicazione: (2026)
di: Panferov, Andrei, et al.
Pubblicazione: (2026)
Compression Scaling Laws:Unifying Sparsity and Quantization
di: Frantar, Elias, et al.
Pubblicazione: (2025)
di: Frantar, Elias, et al.
Pubblicazione: (2025)
Beyond Discreteness: Sample Complexity Analysis of Straight-Through Estimator for 1-bit Quantization
di: Jeong, Halyun, et al.
Pubblicazione: (2025)
di: Jeong, Halyun, et al.
Pubblicazione: (2025)
RoSA: Accurate Parameter-Efficient Fine-Tuning via Robust Adaptation
di: Nikdan, Mahdi, et al.
Pubblicazione: (2024)
di: Nikdan, Mahdi, et al.
Pubblicazione: (2024)
BiCoLoR: Communication-Efficient Optimization with Bidirectional Compression and Local Training
di: Condat, Laurent, et al.
Pubblicazione: (2026)
di: Condat, Laurent, et al.
Pubblicazione: (2026)
Beyond Outliers: A Study of Optimizers Under Quantization
di: Vlassis, Georgios, et al.
Pubblicazione: (2025)
di: Vlassis, Georgios, et al.
Pubblicazione: (2025)
Label Privacy in Split Learning for Large Models with Parameter-Efficient Training
di: Zmushko, Philip, et al.
Pubblicazione: (2024)
di: Zmushko, Philip, et al.
Pubblicazione: (2024)
LLMQ: Efficient Lower-Precision Pretraining for Consumer GPUs
di: Schultheis, Erik, et al.
Pubblicazione: (2025)
di: Schultheis, Erik, et al.
Pubblicazione: (2025)
Sparse-ProxSkip: Accelerated Sparse-to-Sparse Training in Federated Learning
di: Meinhardt, Georg, et al.
Pubblicazione: (2024)
di: Meinhardt, Georg, et al.
Pubblicazione: (2024)
FedP3: Federated Personalized and Privacy-friendly Network Pruning under Model Heterogeneity
di: Yi, Kai, et al.
Pubblicazione: (2024)
di: Yi, Kai, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Cache Me If You Must: Adaptive Key-Value Quantization for Large Language Models
di: Shutova, Alina, et al.
Pubblicazione: (2025) -
Pushing the Limits of Large Language Model Quantization via the Linearity Theorem
di: Malinovskii, Vladimir, et al.
Pubblicazione: (2024) -
EvoPress: Accurate Dynamic Model Compression via Evolutionary Search
di: Sieberling, Oliver, et al.
Pubblicazione: (2024) -
Extreme Compression of Large Language Models via Additive Quantization
di: Egiazarian, Vage, et al.
Pubblicazione: (2024) -
Unlocking FedNL: Self-Contained Compute-Optimized Implementation
di: Burlachenko, Konstantin, et al.
Pubblicazione: (2024)