Pre-Registering the Detectable Effect: A Paired-MDE Budget for 4-bit Quantization Benchmarks, with a Pilot Audit
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhuang, Zexin, Li, Yanhang, Fan, Zhichao |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Auditing Reasoning-Trace Memorization Claims after Unlearning with Head-Conditioned Canaries
par: Li, Yanhang, et autres
Publié: (2026)
par: Li, Yanhang, et autres
Publié: (2026)
SafetyRepro: Configuration-Conditional Rank Instability on Alignment Benchmarks
par: Li, Yanhang, et autres
Publié: (2026)
par: Li, Yanhang, et autres
Publié: (2026)
Auditing and Fixing Economic Validity in Tabular Foundation Models for Discrete Choice
par: Wang, Yingshuo, et autres
Publié: (2026)
par: Wang, Yingshuo, et autres
Publié: (2026)
4bit-Quantization in Vector-Embedding for RAG
par: Jeong, Taehee
Publié: (2025)
par: Jeong, Taehee
Publié: (2025)
MergeQuant: Accurate 4-bit Static Quantization of Large Language Models by Channel-wise Calibration
par: Wang, Jinguang, et autres
Publié: (2025)
par: Wang, Jinguang, et autres
Publié: (2025)
SKIM: Any-bit Quantization Pushing The Limits of Post-Training Quantization
par: Bai, Runsheng, et autres
Publié: (2024)
par: Bai, Runsheng, et autres
Publié: (2024)
LO-BCQ: Block Clustered Quantization for 4-bit (W4A4) LLM Inference
par: Elangovan, Reena, et autres
Publié: (2025)
par: Elangovan, Reena, et autres
Publié: (2025)
LoRaQ: Optimized Low Rank Approximation for 4-bit Quantization
par: Bouquet, Yann, et autres
Publié: (2026)
par: Bouquet, Yann, et autres
Publié: (2026)
Qrazor: Reliable and Effortless 4-bit LLM Quantization by Significant Data Razoring
par: Lee, Dongyoung, et autres
Publié: (2025)
par: Lee, Dongyoung, et autres
Publié: (2025)
CCQ: Convolutional Code for Extreme Low-bit Quantization in LLMs
par: Zhou, Zhaojing, et autres
Publié: (2025)
par: Zhou, Zhaojing, et autres
Publié: (2025)
Continual Quantization-Aware Pre-Training: When to transition from 16-bit to 1.58-bit pre-training for BitNet language models?
par: Nielsen, Jacob, et autres
Publié: (2025)
par: Nielsen, Jacob, et autres
Publié: (2025)
OSAQ: Outlier Self-Absorption for Accurate Low-bit LLM Quantization
par: Li, Zhikai, et autres
Publié: (2026)
par: Li, Zhikai, et autres
Publié: (2026)
Low-bit Model Quantization for Deep Neural Networks: A Survey
par: Liu, Kai, et autres
Publié: (2025)
par: Liu, Kai, et autres
Publié: (2025)
ICQuant: Index Coding enables Low-bit LLM Quantization
par: Li, Xinlin, et autres
Publié: (2025)
par: Li, Xinlin, et autres
Publié: (2025)
Atom: Low-bit Quantization for Efficient and Accurate LLM Serving
par: Zhao, Yilong, et autres
Publié: (2023)
par: Zhao, Yilong, et autres
Publié: (2023)
AAAC: Activation-Aware Adaptive Codebooks for 4-bit LLM Weight Quantization
par: IslamBouli, Beshr, et autres
Publié: (2026)
par: IslamBouli, Beshr, et autres
Publié: (2026)
OSCAR: Offline Spectral Covariance-Aware Rotation for 2-bit KV Cache Quantization
par: Zhou, Zhongzhu, et autres
Publié: (2026)
par: Zhou, Zhongzhu, et autres
Publié: (2026)
Kitty: Accurate and Efficient 2-bit KV Cache Quantization with Dynamic Channel-wise Precision Boost
par: Xia, Haojun, et autres
Publié: (2025)
par: Xia, Haojun, et autres
Publié: (2025)
DiRotQ: Rotation-Aware Quantization for 4-bit Diffusion Transformers
par: Sharify, Sayeh, et autres
Publié: (2026)
par: Sharify, Sayeh, et autres
Publié: (2026)
Preserve-Then-Quantize: Balancing Rank Budgets for Quantization Error Reconstruction in LLMs
par: Cho, Yoonjun, et autres
Publié: (2026)
par: Cho, Yoonjun, et autres
Publié: (2026)
Activation Quantization of Vision Encoders Needs Prefixing Registers
par: Kim, Seunghyeon, et autres
Publié: (2025)
par: Kim, Seunghyeon, et autres
Publié: (2025)
Fine-Grained Iterative Adversarial Attacks with Limited Computation Budget
par: Hou, Zhichao, et autres
Publié: (2025)
par: Hou, Zhichao, et autres
Publié: (2025)
BitNet a4.8: 4-bit Activations for 1-bit LLMs
par: Wang, Hongyu, et autres
Publié: (2024)
par: Wang, Hongyu, et autres
Publié: (2024)
Rethinking Output Alignment For 1-bit Post-Training Quantization of Large Language Models
par: Hoang, Dung Anh, et autres
Publié: (2025)
par: Hoang, Dung Anh, et autres
Publié: (2025)
Improving Block-Wise LLM Quantization by 4-bit Block-Wise Optimal Float (BOF4): Analysis and Variations
par: Blumenberg, Patrick, et autres
Publié: (2025)
par: Blumenberg, Patrick, et autres
Publié: (2025)
SDP4Bit: Toward 4-bit Communication Quantization in Sharded Data Parallelism for LLM Training
par: Jia, Jinda, et autres
Publié: (2024)
par: Jia, Jinda, et autres
Publié: (2024)
D$^2$Quant: Accurate Low-bit Post-Training Weight Quantization for LLMs
par: Yan, Xianglong, et autres
Publié: (2026)
par: Yan, Xianglong, et autres
Publié: (2026)
INT v.s. FP: A Comprehensive Study of Fine-Grained Low-bit Quantization Formats
par: Chen, Mengzhao, et autres
Publié: (2025)
par: Chen, Mengzhao, et autres
Publié: (2025)
KIVI: A Tuning-Free Asymmetric 2bit Quantization for KV Cache
par: Liu, Zirui, et autres
Publié: (2024)
par: Liu, Zirui, et autres
Publié: (2024)
Rethinking Channel Dimensions to Isolate Outliers for Low-bit Weight Quantization of Large Language Models
par: Heo, Jung Hwan, et autres
Publié: (2023)
par: Heo, Jung Hwan, et autres
Publié: (2023)
decoupleQ: Towards 2-bit Post-Training Uniform Quantization via decoupling Parameters into Integer and Floating Points
par: Guo, Yi, et autres
Publié: (2024)
par: Guo, Yi, et autres
Publié: (2024)
BitRL: Reinforcement Learning with 1-bit Quantized Language Models for Resource-Constrained Edge Deployment
par: Sajid, Md. Ashiq Ul Islam, et autres
Publié: (2026)
par: Sajid, Md. Ashiq Ul Islam, et autres
Publié: (2026)
When are 1.58 bits enough? A Bottom-up Exploration of BitNet Quantization
par: Nielsen, Jacob, et autres
Publié: (2024)
par: Nielsen, Jacob, et autres
Publié: (2024)
PID-Guided Partial Alignment for Multimodal Decentralized Federated Learning
par: Shi, Yanhang, et autres
Publié: (2026)
par: Shi, Yanhang, et autres
Publié: (2026)
4-bit Shampoo for Memory-Efficient Network Training
par: Wang, Sike, et autres
Publié: (2024)
par: Wang, Sike, et autres
Publié: (2024)
Combining the Strengths of Dutch Survey and Register Data in a Data Challenge to Predict Fertility (PreFer)
par: Sivak, Elizaveta, et autres
Publié: (2024)
par: Sivak, Elizaveta, et autres
Publié: (2024)
When Less is More: 8-bit Quantization Improves Continual Learning in Large Language Models
par: Zhang, Michael S., et autres
Publié: (2025)
par: Zhang, Michael S., et autres
Publié: (2025)
1-Bit FQT: Pushing the Limit of Fully Quantized Training to 1-bit
par: Gao, Chang, et autres
Publié: (2024)
par: Gao, Chang, et autres
Publié: (2024)
Metis: Training LLMs with FP4 Quantization
par: Cao, Hengjie, et autres
Publié: (2025)
par: Cao, Hengjie, et autres
Publié: (2025)
Fast and Efficient 2-bit LLM Inference on GPU: 2/4/16-bit in a Weight Matrix with Asynchronous Dequantization
par: Li, Jinhao, et autres
Publié: (2023)
par: Li, Jinhao, et autres
Publié: (2023)
Documents similaires
-
Auditing Reasoning-Trace Memorization Claims after Unlearning with Head-Conditioned Canaries
par: Li, Yanhang, et autres
Publié: (2026) -
SafetyRepro: Configuration-Conditional Rank Instability on Alignment Benchmarks
par: Li, Yanhang, et autres
Publié: (2026) -
Auditing and Fixing Economic Validity in Tabular Foundation Models for Discrete Choice
par: Wang, Yingshuo, et autres
Publié: (2026) -
4bit-Quantization in Vector-Embedding for RAG
par: Jeong, Taehee
Publié: (2025) -
MergeQuant: Accurate 4-bit Static Quantization of Large Language Models by Channel-wise Calibration
par: Wang, Jinguang, et autres
Publié: (2025)