Benchmarking Post-Training Quantization of Large Language Models under Microscaling Floating Point Formats
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Manyi, Li, Ji-Fu, Sun, Zhongao, Bai, Haoli, Zhen, Hui-Ling, Dong, Zhenhua, Yu, Xianzhi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
QuantClaw: Precision Where It Matters for OpenClaw
di: Zhang, Manyi, et al.
Pubblicazione: (2026)
di: Zhang, Manyi, et al.
Pubblicazione: (2026)
BATQuant: Outlier-resilient MXFP4 Quantization via Learnable Block-wise Optimization
di: Li, Ji-Fu, et al.
Pubblicazione: (2026)
di: Li, Ji-Fu, et al.
Pubblicazione: (2026)
Microscaling Floating Point Formats for Large Language Models
di: Cococcioni, Marco, et al.
Pubblicazione: (2025)
di: Cococcioni, Marco, et al.
Pubblicazione: (2025)
Post Training Quantization of Large Language Models with Microscaling Formats
di: Sharify, Sayeh, et al.
Pubblicazione: (2024)
di: Sharify, Sayeh, et al.
Pubblicazione: (2024)
Quantization Hurts Reasoning? An Empirical Study on Quantized Reasoning Models
di: Liu, Ruikang, et al.
Pubblicazione: (2025)
di: Liu, Ruikang, et al.
Pubblicazione: (2025)
Unleashing Low-Bit Inference on Ascend NPUs: A Comprehensive Evaluation of HiFloat Formats
di: Zhao, Pengxiang, et al.
Pubblicazione: (2026)
di: Zhao, Pengxiang, et al.
Pubblicazione: (2026)
What Makes Low-Bit Quantization-Aware Training Work for Reasoning LLMs? A Systematic Study
di: Lv, Keyu, et al.
Pubblicazione: (2026)
di: Lv, Keyu, et al.
Pubblicazione: (2026)
MOSS: Efficient and Accurate FP8 LLM Training with Microscaling and Automatic Scaling
di: Zhang, Yu, et al.
Pubblicazione: (2025)
di: Zhang, Yu, et al.
Pubblicazione: (2025)
Scaling Laws for Floating Point Quantization Training
di: Sun, Xingwu, et al.
Pubblicazione: (2025)
di: Sun, Xingwu, et al.
Pubblicazione: (2025)
MicroMix: Efficient Mixed-Precision Quantization with Microscaling Formats for Large Language Models
di: Liu, Wenyuan, et al.
Pubblicazione: (2025)
di: Liu, Wenyuan, et al.
Pubblicazione: (2025)
Characterization and Mitigation of Training Instabilities in Microscaling Formats
di: Su, Huangyuan, et al.
Pubblicazione: (2025)
di: Su, Huangyuan, et al.
Pubblicazione: (2025)
Is Finer Better? The Limits of Microscaling Formats in Large Language Models
di: Fasoli, Andrea, et al.
Pubblicazione: (2026)
di: Fasoli, Andrea, et al.
Pubblicazione: (2026)
MXFormer: A Microscaling Floating-Point Charge-Trap Transistor Compute-in-Memory Transformer Accelerator
di: Karfakis, George, et al.
Pubblicazione: (2026)
di: Karfakis, George, et al.
Pubblicazione: (2026)
OPAL: Outlier-Preserved Microscaling Quantization Accelerator for Generative Large Language Models
di: Koo, Jahyun, et al.
Pubblicazione: (2024)
di: Koo, Jahyun, et al.
Pubblicazione: (2024)
What Matters For Safety Alignment?
di: Li, Xing, et al.
Pubblicazione: (2026)
di: Li, Xing, et al.
Pubblicazione: (2026)
decoupleQ: Towards 2-bit Post-Training Uniform Quantization via decoupling Parameters into Integer and Floating Points
di: Guo, Yi, et al.
Pubblicazione: (2024)
di: Guo, Yi, et al.
Pubblicazione: (2024)
MXDOTP: A RISC-V ISA Extension for Enabling Microscaling (MX) Floating-Point Dot Products
di: İslamoğlu, Gamze, et al.
Pubblicazione: (2025)
di: İslamoğlu, Gamze, et al.
Pubblicazione: (2025)
AMXFP4: Taming Activation Outliers with Asymmetric Microscaling Floating-Point for 4-bit LLM Inference
di: Lee, Janghwan, et al.
Pubblicazione: (2024)
di: Lee, Janghwan, et al.
Pubblicazione: (2024)
MX+: Pushing the Limits of Microscaling Formats for Efficient Large Language Model Serving
di: Lee, Jungi, et al.
Pubblicazione: (2025)
di: Lee, Jungi, et al.
Pubblicazione: (2025)
FreeAct: Freeing Activations for LLM Quantization
di: Liu, Xiaohao, et al.
Pubblicazione: (2026)
di: Liu, Xiaohao, et al.
Pubblicazione: (2026)
EAQuant: Enhancing Post-Training Quantization for MoE Models via Expert-Aware Optimization
di: Fu, Zhongqian, et al.
Pubblicazione: (2025)
di: Fu, Zhongqian, et al.
Pubblicazione: (2025)
E$^3$-Pruner: Towards Efficient, Economical, and Effective Layer Pruning for Large Language Models
di: Yuan, Tao, et al.
Pubblicazione: (2025)
di: Yuan, Tao, et al.
Pubblicazione: (2025)
M2XFP: A Metadata-Augmented Microscaling Data Format for Efficient Low-bit Quantization
di: Hu, Weiming, et al.
Pubblicazione: (2026)
di: Hu, Weiming, et al.
Pubblicazione: (2026)
PTQTP: Post-Training Quantization to Trit-Planes for Large Language Models
di: Xiao, He, et al.
Pubblicazione: (2025)
di: Xiao, He, et al.
Pubblicazione: (2025)
LATMiX: Learnable Affine Transformations for Microscaling Quantization of LLMs
di: Gordon, Ofir, et al.
Pubblicazione: (2026)
di: Gordon, Ofir, et al.
Pubblicazione: (2026)
Behavioral Fingerprinting of Large Language Models
di: Pei, Zehua, et al.
Pubblicazione: (2025)
di: Pei, Zehua, et al.
Pubblicazione: (2025)
SmoothQuant: Accurate and Efficient Post-Training Quantization for Large Language Models
di: Xiao, Guangxuan, et al.
Pubblicazione: (2022)
di: Xiao, Guangxuan, et al.
Pubblicazione: (2022)
The Synergy Dilemma of Long-CoT SFT and RL: Investigating Post-Training Techniques for Reasoning VLMs
di: Chen, Jierun, et al.
Pubblicazione: (2025)
di: Chen, Jierun, et al.
Pubblicazione: (2025)
DuQuant++: Fine-grained Rotation Enhances Microscaling FP4 Quantization
di: Lin, Haokun, et al.
Pubblicazione: (2026)
di: Lin, Haokun, et al.
Pubblicazione: (2026)
LLM-FP4: 4-Bit Floating-Point Quantized Transformers
di: Liu, Shih-yang, et al.
Pubblicazione: (2023)
di: Liu, Shih-yang, et al.
Pubblicazione: (2023)
FlatQuant: Flatness Matters for LLM Quantization
di: Sun, Yuxuan, et al.
Pubblicazione: (2024)
di: Sun, Yuxuan, et al.
Pubblicazione: (2024)
A Simple Linear Patch Revives Layer-Pruned Large Language Models
di: Chen, Xinrui, et al.
Pubblicazione: (2025)
di: Chen, Xinrui, et al.
Pubblicazione: (2025)
PASER: Post-Training Data Selection for Efficient Pruned Large Language Model Recovery
di: He, Bowei, et al.
Pubblicazione: (2025)
di: He, Bowei, et al.
Pubblicazione: (2025)
SwiftMem: Fast Agentic Memory via Query-aware Indexing
di: Tian, Anxin, et al.
Pubblicazione: (2026)
di: Tian, Anxin, et al.
Pubblicazione: (2026)
Bridging the Gap Between Promise and Performance for Microscaling FP4 Quantization
di: Egiazarian, Vage, et al.
Pubblicazione: (2025)
di: Egiazarian, Vage, et al.
Pubblicazione: (2025)
LiDAR-PTQ: Post-Training Quantization for Point Cloud 3D Object Detection
di: Zhou, Sifan, et al.
Pubblicazione: (2024)
di: Zhou, Sifan, et al.
Pubblicazione: (2024)
Accumulator-Aware Post-Training Quantization for Large Language Models
di: Colbert, Ian, et al.
Pubblicazione: (2024)
di: Colbert, Ian, et al.
Pubblicazione: (2024)
Scaling Laws for Post Training Quantized Large Language Models
di: Xu, Zifei, et al.
Pubblicazione: (2024)
di: Xu, Zifei, et al.
Pubblicazione: (2024)
SKIM: Any-bit Quantization Pushing The Limits of Post-Training Quantization
di: Bai, Runsheng, et al.
Pubblicazione: (2024)
di: Bai, Runsheng, et al.
Pubblicazione: (2024)
Efficient Post-Training Refinement of Latent Reasoning in Large Language Models
di: Wang, Xinyuan, et al.
Pubblicazione: (2025)
di: Wang, Xinyuan, et al.
Pubblicazione: (2025)
Documenti analoghi
-
QuantClaw: Precision Where It Matters for OpenClaw
di: Zhang, Manyi, et al.
Pubblicazione: (2026) -
BATQuant: Outlier-resilient MXFP4 Quantization via Learnable Block-wise Optimization
di: Li, Ji-Fu, et al.
Pubblicazione: (2026) -
Microscaling Floating Point Formats for Large Language Models
di: Cococcioni, Marco, et al.
Pubblicazione: (2025) -
Post Training Quantization of Large Language Models with Microscaling Formats
di: Sharify, Sayeh, et al.
Pubblicazione: (2024) -
Quantization Hurts Reasoning? An Empirical Study on Quantized Reasoning Models
di: Liu, Ruikang, et al.
Pubblicazione: (2025)