Quartet II: Accurate LLM Pre-Training in NVFP4 by Improved Unbiased Gradient Estimation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Panferov, Andrei, Schultheis, Erik, Tabesh, Soroush, Alistarh, Dan |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
CAGE: Curvature-Aware Gradient Estimation For Accurate Quantization-Aware Training
par: Tabesh, Soroush, et autres
Publié: (2025)
par: Tabesh, Soroush, et autres
Publié: (2025)
Quartet: Native FP4 Training Can Be Optimal for Large Language Models
par: Castro, Roberto L., et autres
Publié: (2025)
par: Castro, Roberto L., et autres
Publié: (2025)
QuEST: Stable Training of LLMs with 1-Bit Weights and Activations
par: Panferov, Andrei, et autres
Publié: (2025)
par: Panferov, Andrei, et autres
Publié: (2025)
Grid Games: The Power of Multiple Grids for Quantizing Large Language Models
par: Egiazarian, Vage, et autres
Publié: (2026)
par: Egiazarian, Vage, et autres
Publié: (2026)
RoSA: Accurate Parameter-Efficient Fine-Tuning via Robust Adaptation
par: Nikdan, Mahdi, et autres
Publié: (2024)
par: Nikdan, Mahdi, et autres
Publié: (2024)
Apertus LLM Family Expansion via Distillation and Quantization
par: Panferov, Andrei, et autres
Publié: (2026)
par: Panferov, Andrei, et autres
Publié: (2026)
LLMQ: Efficient Lower-Precision Pretraining for Consumer GPUs
par: Schultheis, Erik, et autres
Publié: (2025)
par: Schultheis, Erik, et autres
Publié: (2025)
GSQ: Highly-Accurate Low-Precision Scalar Quantization for LLMs via Gumbel-Softmax Sampling
par: Dadgarnia, Alireza, et autres
Publié: (2026)
par: Dadgarnia, Alireza, et autres
Publié: (2026)
HALO: Hadamard-Assisted Lower-Precision Optimization for LLMs
par: Ashkboos, Saleh, et autres
Publié: (2025)
par: Ashkboos, Saleh, et autres
Publié: (2025)
Pushing the Limits of Large Language Model Quantization via the Linearity Theorem
par: Malinovskii, Vladimir, et autres
Publié: (2024)
par: Malinovskii, Vladimir, et autres
Publié: (2024)
MatGPTQ: Accurate and Efficient Post-Training Matryoshka Quantization
par: Kleinegger, Maximilian, et autres
Publié: (2026)
par: Kleinegger, Maximilian, et autres
Publié: (2026)
Extreme Compression of Large Language Models via Additive Quantization
par: Egiazarian, Vage, et autres
Publié: (2024)
par: Egiazarian, Vage, et autres
Publié: (2024)
Unified Scaling Laws for Compressed Representations
par: Panferov, Andrei, et autres
Publié: (2025)
par: Panferov, Andrei, et autres
Publié: (2025)
SOAR: Scale Optimization for Accurate Reconstruction in NVFP4 Quantization
par: Bao, Chengzhu, et autres
Publié: (2026)
par: Bao, Chengzhu, et autres
Publié: (2026)
DASH: Faster Shampoo via Batched Block Preconditioning and Efficient Inverse-Root Solvers
par: Modoranu, Ionut-Vlad, et autres
Publié: (2026)
par: Modoranu, Ionut-Vlad, et autres
Publié: (2026)
Dissecting Outlier Dynamics in LLM NVFP4 Pretraining
par: Dong, Peijie, et autres
Publié: (2026)
par: Dong, Peijie, et autres
Publié: (2026)
MatryoshkaLoRA: Learning Accurate Hierarchical Low-Rank Representations for LLM Fine-Tuning
par: Modoranu, Ionut-Vlad, et autres
Publié: (2026)
par: Modoranu, Ionut-Vlad, et autres
Publié: (2026)
FFT-based Dynamic Subspace Selection for Low-Rank Adaptive Optimization of Large Language Models
par: Modoranu, Ionut-Vlad, et autres
Publié: (2025)
par: Modoranu, Ionut-Vlad, et autres
Publié: (2025)
TetraJet-v2: Accurate NVFP4 Training for Large Language Models with Oscillation Suppression and Outlier Control
par: Chen, Yuxiang, et autres
Publié: (2025)
par: Chen, Yuxiang, et autres
Publié: (2025)
Hogwild! Inference: Parallel LLM Generation via Concurrent Attention
par: Rodionov, Gleb, et autres
Publié: (2025)
par: Rodionov, Gleb, et autres
Publié: (2025)
Four Over Six: More Accurate NVFP4 Quantization with Adaptive Block Scaling
par: Cook, Jack, et autres
Publié: (2025)
par: Cook, Jack, et autres
Publié: (2025)
Bridging the Gap Between Promise and Performance for Microscaling FP4 Quantization
par: Egiazarian, Vage, et autres
Publié: (2025)
par: Egiazarian, Vage, et autres
Publié: (2025)
EvoPress: Accurate Dynamic Model Compression via Evolutionary Search
par: Sieberling, Oliver, et autres
Publié: (2024)
par: Sieberling, Oliver, et autres
Publié: (2024)
Quantization-Aware Distillation for NVFP4 Inference Accuracy Recovery
par: Xin, Meng, et autres
Publié: (2026)
par: Xin, Meng, et autres
Publié: (2026)
Behemoth: Benchmarking Unlearning in LLMs Using Fully Synthetic Data
par: Iofinova, Eugenia, et autres
Publié: (2026)
par: Iofinova, Eugenia, et autres
Publié: (2026)
Model Compression with Exact Budget Constraints via Riemannian Manifolds
par: Helcig, Michael, et autres
Publié: (2026)
par: Helcig, Michael, et autres
Publié: (2026)
FAAR: Format-Aware Adaptive Rounding for NVFP4
par: Li, Hanglin, et autres
Publié: (2026)
par: Li, Hanglin, et autres
Publié: (2026)
Pretraining Large Language Models with NVFP4
par: NVIDIA, et autres
Publié: (2025)
par: NVIDIA, et autres
Publié: (2025)
PLUMAGE: Probabilistic Low rank Unbiased Min Variance Gradient Estimator for Efficient Large Model Training
par: Haroush, Matan, et autres
Publié: (2025)
par: Haroush, Matan, et autres
Publié: (2025)
Panza: Design and Analysis of a Fully-Local Personalized Text Writing Assistant
par: Nicolicioiu, Armand, et autres
Publié: (2024)
par: Nicolicioiu, Armand, et autres
Publié: (2024)
LDAdam: Adaptive Optimization from Low-Dimensional Gradient Statistics
par: Robert, Thomas, et autres
Publié: (2024)
par: Robert, Thomas, et autres
Publié: (2024)
PV-Tuning: Beyond Straight-Through Estimation for Extreme LLM Compression
par: Malinovskii, Vladimir, et autres
Publié: (2024)
par: Malinovskii, Vladimir, et autres
Publié: (2024)
Error Feedback Can Accurately Compress Preconditioners
par: Modoranu, Ionut-Vlad, et autres
Publié: (2023)
par: Modoranu, Ionut-Vlad, et autres
Publié: (2023)
ARCQuant: Boosting NVFP4 Quantization with Augmented Residual Channels for LLMs
par: Meng, Haoqian, et autres
Publié: (2026)
par: Meng, Haoqian, et autres
Publié: (2026)
Can LLMs Separate Instructions From Data? And What Do We Even Mean By That?
par: Zverev, Egor, et autres
Publié: (2024)
par: Zverev, Egor, et autres
Publié: (2024)
Statistically-Lossless Quantization of Large Language Models
par: Helcig, Michael, et autres
Publié: (2026)
par: Helcig, Michael, et autres
Publié: (2026)
ECO: Quantized Training without Full-Precision Master Weights
par: Nikdan, Mahdi, et autres
Publié: (2026)
par: Nikdan, Mahdi, et autres
Publié: (2026)
Powerset Convolutional Neural Networks
par: Wendler, Chris, et autres
Publié: (2019)
par: Wendler, Chris, et autres
Publié: (2019)
WUSH: Near-Optimal Adaptive Transforms for LLM Quantization
par: Chen, Jiale, et autres
Publié: (2025)
par: Chen, Jiale, et autres
Publié: (2025)
On the Optimal Construction of Unbiased Gradient Estimators for Zeroth-Order Optimization
par: Ma, Shaocong, et autres
Publié: (2025)
par: Ma, Shaocong, et autres
Publié: (2025)
Documents similaires
-
CAGE: Curvature-Aware Gradient Estimation For Accurate Quantization-Aware Training
par: Tabesh, Soroush, et autres
Publié: (2025) -
Quartet: Native FP4 Training Can Be Optimal for Large Language Models
par: Castro, Roberto L., et autres
Publié: (2025) -
QuEST: Stable Training of LLMs with 1-Bit Weights and Activations
par: Panferov, Andrei, et autres
Publié: (2025) -
Grid Games: The Power of Multiple Grids for Quantizing Large Language Models
par: Egiazarian, Vage, et autres
Publié: (2026) -
RoSA: Accurate Parameter-Efficient Fine-Tuning via Robust Adaptation
par: Nikdan, Mahdi, et autres
Publié: (2024)