SOAR: Scale Optimization for Accurate Reconstruction in NVFP4 Quantization
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Bao, Chengzhu, Yan, Xianglong, Li, Zhiteng, Qin, Guangshuo, Yu, Guanghua, Zhang, Yulun |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
D$^2$Quant: Accurate Low-bit Post-Training Weight Quantization for LLMs
par: Yan, Xianglong, et autres
Publié: (2026)
par: Yan, Xianglong, et autres
Publié: (2026)
Quant-dLLM: Post-Training Extreme Low-Bit Quantization for Diffusion Large Language Models
par: Zhang, Tianao, et autres
Publié: (2025)
par: Zhang, Tianao, et autres
Publié: (2025)
PT$^2$-LLM: Post-Training Ternarization for Large Language Models
par: Yan, Xianglong, et autres
Publié: (2025)
par: Yan, Xianglong, et autres
Publié: (2025)
Progressive Binarization with Semi-Structured Pruning for LLMs
par: Yan, Xianglong, et autres
Publié: (2025)
par: Yan, Xianglong, et autres
Publié: (2025)
Four Over Six: More Accurate NVFP4 Quantization with Adaptive Block Scaling
par: Cook, Jack, et autres
Publié: (2025)
par: Cook, Jack, et autres
Publié: (2025)
ReCalKV: Low-Rank KV Cache Compression via Head Reordering and Offline Calibration
par: Yan, Xianglong, et autres
Publié: (2025)
par: Yan, Xianglong, et autres
Publié: (2025)
Quantization-Aware Distillation for NVFP4 Inference Accuracy Recovery
par: Xin, Meng, et autres
Publié: (2026)
par: Xin, Meng, et autres
Publié: (2026)
ARCQuant: Boosting NVFP4 Quantization with Augmented Residual Channels for LLMs
par: Meng, Haoqian, et autres
Publié: (2026)
par: Meng, Haoqian, et autres
Publié: (2026)
Low-bit Model Quantization for Deep Neural Networks: A Survey
par: Liu, Kai, et autres
Publié: (2025)
par: Liu, Kai, et autres
Publié: (2025)
VEQ: Modality-Adaptive Quantization for MoE Vision-Language Models
par: Qin, Guangshuo, et autres
Publié: (2026)
par: Qin, Guangshuo, et autres
Publié: (2026)
Quartet II: Accurate LLM Pre-Training in NVFP4 by Improved Unbiased Gradient Estimation
par: Panferov, Andrei, et autres
Publié: (2026)
par: Panferov, Andrei, et autres
Publié: (2026)
RaZeR: Pushing the Limits of NVFP4 Quantization with Redundant Zero Remapping
par: Chen, Yuzong, et autres
Publié: (2025)
par: Chen, Yuzong, et autres
Publié: (2025)
On-Chip Hardware-Aware Quantization for Mixed Precision Neural Networks
par: Huang, Wei, et autres
Publié: (2023)
par: Huang, Wei, et autres
Publié: (2023)
Dissecting Outlier Dynamics in LLM NVFP4 Pretraining
par: Dong, Peijie, et autres
Publié: (2026)
par: Dong, Peijie, et autres
Publié: (2026)
FAAR: Format-Aware Adaptive Rounding for NVFP4
par: Li, Hanglin, et autres
Publié: (2026)
par: Li, Hanglin, et autres
Publié: (2026)
Accurate LoRA-Finetuning Quantization of LLMs via Information Retention
par: Qin, Haotong, et autres
Publié: (2024)
par: Qin, Haotong, et autres
Publié: (2024)
TetraJet-v2: Accurate NVFP4 Training for Large Language Models with Oscillation Suppression and Outlier Control
par: Chen, Yuxiang, et autres
Publié: (2025)
par: Chen, Yuxiang, et autres
Publié: (2025)
ARB-LLM: Alternating Refined Binarizations for Large Language Models
par: Li, Zhiteng, et autres
Publié: (2024)
par: Li, Zhiteng, et autres
Publié: (2024)
Pretraining Large Language Models with NVFP4
par: NVIDIA, et autres
Publié: (2025)
par: NVIDIA, et autres
Publié: (2025)
SOAR: Self-Correction for Optimal Alignment and Refinement in Diffusion Models
par: Qin, You, et autres
Publié: (2026)
par: Qin, You, et autres
Publié: (2026)
SOAR: Improved Indexing for Approximate Nearest Neighbor Search
par: Sun, Philip, et autres
Publié: (2024)
par: Sun, Philip, et autres
Publié: (2024)
First-Order Error Matters: Accurate Compensation for Quantized Large Language Models
par: Zheng, Xingyu, et autres
Publié: (2025)
par: Zheng, Xingyu, et autres
Publié: (2025)
RepQuant: Towards Accurate Post-Training Quantization of Large Transformer Models via Scale Reparameterization
par: Li, Zhikai, et autres
Publié: (2024)
par: Li, Zhikai, et autres
Publié: (2024)
Minimax-Optimal Spectral Clustering with Covariance Projection for High-Dimensional Anisotropic Mixtures
par: Huang, Chengzhu, et autres
Publié: (2025)
par: Huang, Chengzhu, et autres
Publié: (2025)
IL-SOAR : Imitation Learning with Soft Optimistic Actor cRitic
par: Viel, Stefano, et autres
Publié: (2025)
par: Viel, Stefano, et autres
Publié: (2025)
An Empirical Study of Qwen3 Quantization
par: Zheng, Xingyu, et autres
Publié: (2025)
par: Zheng, Xingyu, et autres
Publié: (2025)
DAQ: Delta-Aware Quantization for Post-Training LLM Weight Compression
par: Yu, Xiaoming, et autres
Publié: (2026)
par: Yu, Xiaoming, et autres
Publié: (2026)
PTQ4SAM: Post-Training Quantization for Segment Anything
par: Lv, Chengtao, et autres
Publié: (2024)
par: Lv, Chengtao, et autres
Publié: (2024)
OSAQ: Outlier Self-Absorption for Accurate Low-bit LLM Quantization
par: Li, Zhikai, et autres
Publié: (2026)
par: Li, Zhikai, et autres
Publié: (2026)
BiLLM: Pushing the Limit of Post-Training Quantization for LLMs
par: Huang, Wei, et autres
Publié: (2024)
par: Huang, Wei, et autres
Publié: (2024)
Coder as Editor: Code-driven Interpretable Molecular Optimization
par: Zhu, Wenyu, et autres
Publié: (2025)
par: Zhu, Wenyu, et autres
Publié: (2025)
Generalized Grade-of-Membership Estimation for High-dimensional Locally Dependent Data
par: Chen, Ling, et autres
Publié: (2024)
par: Chen, Ling, et autres
Publié: (2024)
Atom: Low-bit Quantization for Efficient and Accurate LLM Serving
par: Zhao, Yilong, et autres
Publié: (2023)
par: Zhao, Yilong, et autres
Publié: (2023)
SliM-LLM: Salience-Driven Mixed-Precision Quantization for Large Language Models
par: Huang, Wei, et autres
Publié: (2024)
par: Huang, Wei, et autres
Publié: (2024)
IntraMix: Intra-Class Mixup Generation for Accurate Labels and Neighbors
par: Zheng, Shenghe, et autres
Publié: (2024)
par: Zheng, Shenghe, et autres
Publié: (2024)
QERA: an Analytical Framework for Quantization Error Reconstruction
par: Zhang, Cheng, et autres
Publié: (2024)
par: Zhang, Cheng, et autres
Publié: (2024)
Accurate and Efficient Fine-Tuning of Quantized Large Language Models Through Optimal Balance
par: Shen, Ao, et autres
Publié: (2024)
par: Shen, Ao, et autres
Publié: (2024)
BWTA: Accurate and Efficient Binarized Transformer by Algorithm-Hardware Co-design
par: Ding, Yifu, et autres
Publié: (2026)
par: Ding, Yifu, et autres
Publié: (2026)
Tequila: Trapping-free Ternary Quantization for Large Language Models
par: Huang, Hong, et autres
Publié: (2025)
par: Huang, Hong, et autres
Publié: (2025)
MatGPTQ: Accurate and Efficient Post-Training Matryoshka Quantization
par: Kleinegger, Maximilian, et autres
Publié: (2026)
par: Kleinegger, Maximilian, et autres
Publié: (2026)
Documents similaires
-
D$^2$Quant: Accurate Low-bit Post-Training Weight Quantization for LLMs
par: Yan, Xianglong, et autres
Publié: (2026) -
Quant-dLLM: Post-Training Extreme Low-Bit Quantization for Diffusion Large Language Models
par: Zhang, Tianao, et autres
Publié: (2025) -
PT$^2$-LLM: Post-Training Ternarization for Large Language Models
par: Yan, Xianglong, et autres
Publié: (2025) -
Progressive Binarization with Semi-Structured Pruning for LLMs
par: Yan, Xianglong, et autres
Publié: (2025) -
Four Over Six: More Accurate NVFP4 Quantization with Adaptive Block Scaling
par: Cook, Jack, et autres
Publié: (2025)