OSC: Hardware Efficient W4A4 Quantization via Outlier Separation in Channel Dimension
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Zhiyuan, Li, Yanzhao, Zou, Zhiqiang, Du, Bai, Sun, Yupeng, Dong, Hui, Wang, Hui |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
VFA: Relieving Vector Operations in Flash Attention with Global Maximum Pre-computation
par: Sun, Yupeng, et autres
Publié: (2026)
par: Sun, Yupeng, et autres
Publié: (2026)
MixPE: Quantization and Hardware Co-design for Efficient LLM Inference
par: Zhang, Yu, et autres
Publié: (2024)
par: Zhang, Yu, et autres
Publié: (2024)
Rethinking RoPE Scaling in Quantized LLM: Theory, Outlier, and Channel-Band Analysis with Weight Rescaling
par: Qiao, Ye, et autres
Publié: (2025)
par: Qiao, Ye, et autres
Publié: (2025)
BATQuant: Outlier-resilient MXFP4 Quantization via Learnable Block-wise Optimization
par: Li, Ji-Fu, et autres
Publié: (2026)
par: Li, Ji-Fu, et autres
Publié: (2026)
Widening the Gap: Exploiting LLM Quantization via Outlier Injection
par: Zhan, Xiaohua, et autres
Publié: (2026)
par: Zhan, Xiaohua, et autres
Publié: (2026)
ARCQuant: Boosting NVFP4 Quantization with Augmented Residual Channels for LLMs
par: Meng, Haoqian, et autres
Publié: (2026)
par: Meng, Haoqian, et autres
Publié: (2026)
Quaff: Quantized Parameter-Efficient Fine-Tuning under Outlier Spatial Stability Hypothesis
par: Huang, Hong, et autres
Publié: (2025)
par: Huang, Hong, et autres
Publié: (2025)
Outlier-Safe Pre-Training for Robust 4-Bit Quantization of Large Language Models
par: Park, Jungwoo, et autres
Publié: (2025)
par: Park, Jungwoo, et autres
Publié: (2025)
Sherry: Hardware-Efficient 1.25-Bit Ternary Quantization via Fine-grained Sparsification
par: Huang, Hong, et autres
Publié: (2026)
par: Huang, Hong, et autres
Publié: (2026)
SageAttention2: Efficient Attention with Thorough Outlier Smoothing and Per-thread INT4 Quantization
par: Zhang, Jintao, et autres
Publié: (2024)
par: Zhang, Jintao, et autres
Publié: (2024)
QServe: W4A8KV4 Quantization and System Co-design for Efficient LLM Serving
par: Lin, Yujun, et autres
Publié: (2024)
par: Lin, Yujun, et autres
Publié: (2024)
MUXQ: Mixed-to-Uniform Precision MatriX Quantization via Low-Rank Outlier Decomposition
par: Lee, Seoungsub, et autres
Publié: (2026)
par: Lee, Seoungsub, et autres
Publié: (2026)
LiquidGEMM: Hardware-Efficient W4A8 GEMM Kernel for High-Performance LLM Serving
par: Hu, Huanqi, et autres
Publié: (2025)
par: Hu, Huanqi, et autres
Publié: (2025)
Activation Outliers in Transformer Quantization: Reproduction, Statistical Analysis, and Deployment Tradeoffs
par: Kaliaperumal, Pranav Kumar
Publié: (2026)
par: Kaliaperumal, Pranav Kumar
Publié: (2026)
RQ-MoE: Residual Quantization via Mixture of Experts for Efficient Input-Dependent Vector Compression
par: Zhong, Zhengjia, et autres
Publié: (2026)
par: Zhong, Zhengjia, et autres
Publié: (2026)
Efficient Skill Discovery via Regret-Aware Optimization
par: Zhang, He, et autres
Publié: (2025)
par: Zhang, He, et autres
Publié: (2025)
AnyBCQ: Hardware Efficient Flexible Binary-Coded Quantization for Multi-Precision LLMs
par: Park, Gunho, et autres
Publié: (2025)
par: Park, Gunho, et autres
Publié: (2025)
GO-OSC and VASH: Geometry-Aware Representation Learning for Early Degradation Detection in Oscillatory Systems
par: Nobaub, Vashista
Publié: (2026)
par: Nobaub, Vashista
Publié: (2026)
Learning Quantized Continuous Controllers for Integer Hardware
par: Kresse, Fabian, et autres
Publié: (2025)
par: Kresse, Fabian, et autres
Publié: (2025)
Rotate, Clip, and Partition: Towards W2A4KV4 Quantization by Integrating Rotation and Learnable Non-uniform Quantizer
par: Choi, Euntae, et autres
Publié: (2025)
par: Choi, Euntae, et autres
Publié: (2025)
Astro: Activation-guided Structured Regularization for Outlier-Robust LLM Post-Training Quantization
par: Chen, Xi, et autres
Publié: (2026)
par: Chen, Xi, et autres
Publié: (2026)
OptRot: Mitigating Weight Outliers via Data-Free Rotations for Post-Training Quantization
par: Gadhikar, Advait, et autres
Publié: (2025)
par: Gadhikar, Advait, et autres
Publié: (2025)
XFP: Quality-Targeted Adaptive Codebook Quantization with Sparse Outlier Separation for LLM Inference
par: Witt, Thomas
Publié: (2026)
par: Witt, Thomas
Publié: (2026)
Outliers and Calibration Sets have Diminishing Effect on Quantization of Modern LLMs
par: Paglieri, Davide, et autres
Publié: (2024)
par: Paglieri, Davide, et autres
Publié: (2024)
The Curse and Blessing of Mean Bias in FP4-Quantized LLM Training
par: Cao, Hengjie, et autres
Publié: (2026)
par: Cao, Hengjie, et autres
Publié: (2026)
Q-ROAR: Outlier-Aware Rescaling for RoPE Position Interpolation in Quantized Long-Context LLMs
par: Qiao, Ye, et autres
Publié: (2025)
par: Qiao, Ye, et autres
Publié: (2025)
Robust Statistical Scaling of Outlier Scores: Improving the Quality of Outlier Probabilities for Outliers (Extended Version)
par: Röchner, Philipp, et autres
Publié: (2024)
par: Röchner, Philipp, et autres
Publié: (2024)
Phenotypic Profile-Informed Generation of Drug-Like Molecules via Dual-Channel Variational Autoencoders
par: Liu, Hui, et autres
Publié: (2025)
par: Liu, Hui, et autres
Publié: (2025)
Attn-QAT: 4-Bit Attention With Quantization-Aware Training
par: Zhang, Peiyuan, et autres
Publié: (2026)
par: Zhang, Peiyuan, et autres
Publié: (2026)
Pretraining large language models with MXFP4 on Native FP4 Hardware
par: Cim, Musa, et autres
Publié: (2026)
par: Cim, Musa, et autres
Publié: (2026)
DMQ: Dissecting Outliers of Diffusion Models for Post-Training Quantization
par: Lee, Dongyeun, et autres
Publié: (2025)
par: Lee, Dongyeun, et autres
Publié: (2025)
Outlier-Efficient Hopfield Layers for Large Transformer-Based Models
par: Hu, Jerry Yao-Chieh, et autres
Publié: (2024)
par: Hu, Jerry Yao-Chieh, et autres
Publié: (2024)
On-Chip Hardware-Aware Quantization for Mixed Precision Neural Networks
par: Huang, Wei, et autres
Publié: (2023)
par: Huang, Wei, et autres
Publié: (2023)
Long-Term Outlier Prediction Through Outlier Score Modeling
par: Aoki, Yuma, et autres
Publié: (2026)
par: Aoki, Yuma, et autres
Publié: (2026)
RotateKV: Accurate and Robust 2-Bit KV Cache Quantization for LLMs via Outlier-Aware Adaptive Rotations
par: Su, Zunhai, et autres
Publié: (2025)
par: Su, Zunhai, et autres
Publié: (2025)
From 2:4 to 8:16 sparsity patterns in LLMs for Outliers and Weights with Variance Correction
par: Maximov, Egor, et autres
Publié: (2025)
par: Maximov, Egor, et autres
Publié: (2025)
MicroScopiQ: Accelerating Foundational Models through Outlier-Aware Microscaling Quantization
par: Ramachandran, Akshat, et autres
Publié: (2024)
par: Ramachandran, Akshat, et autres
Publié: (2024)
Learning under Quantization for High-Dimensional Linear Regression
par: Zhang, Dechen, et autres
Publié: (2025)
par: Zhang, Dechen, et autres
Publié: (2025)
4bit-Quantization in Vector-Embedding for RAG
par: Jeong, Taehee
Publié: (2025)
par: Jeong, Taehee
Publié: (2025)
Mamba-PTQ: Outlier Channels in Recurrent Large Language Models
par: Pierro, Alessandro, et autres
Publié: (2024)
par: Pierro, Alessandro, et autres
Publié: (2024)
Documents similaires
-
VFA: Relieving Vector Operations in Flash Attention with Global Maximum Pre-computation
par: Sun, Yupeng, et autres
Publié: (2026) -
MixPE: Quantization and Hardware Co-design for Efficient LLM Inference
par: Zhang, Yu, et autres
Publié: (2024) -
Rethinking RoPE Scaling in Quantized LLM: Theory, Outlier, and Channel-Band Analysis with Weight Rescaling
par: Qiao, Ye, et autres
Publié: (2025) -
BATQuant: Outlier-resilient MXFP4 Quantization via Learnable Block-wise Optimization
par: Li, Ji-Fu, et autres
Publié: (2026) -
Widening the Gap: Exploiting LLM Quantization via Outlier Injection
par: Zhan, Xiaohua, et autres
Publié: (2026)