Enregistré dans:
| Auteurs principaux: | Zhang, Zhiyuan, Li, Yanzhao, Zou, Zhiqiang, Du, Bai, Sun, Yupeng, Dong, Hui, Wang, Hui |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2604.12782 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
VFA: Relieving Vector Operations in Flash Attention with Global Maximum Pre-computation
par: Sun, Yupeng, et autres
Publié: (2026)
par: Sun, Yupeng, et autres
Publié: (2026)
MixPE: Quantization and Hardware Co-design for Efficient LLM Inference
par: Zhang, Yu, et autres
Publié: (2024)
par: Zhang, Yu, et autres
Publié: (2024)
BATQuant: Outlier-resilient MXFP4 Quantization via Learnable Block-wise Optimization
par: Li, Ji-Fu, et autres
Publié: (2026)
par: Li, Ji-Fu, et autres
Publié: (2026)
Rethinking RoPE Scaling in Quantized LLM: Theory, Outlier, and Channel-Band Analysis with Weight Rescaling
par: Qiao, Ye, et autres
Publié: (2025)
par: Qiao, Ye, et autres
Publié: (2025)
Widening the Gap: Exploiting LLM Quantization via Outlier Injection
par: Zhan, Xiaohua, et autres
Publié: (2026)
par: Zhan, Xiaohua, et autres
Publié: (2026)
Outlier-Safe Pre-Training for Robust 4-Bit Quantization of Large Language Models
par: Park, Jungwoo, et autres
Publié: (2025)
par: Park, Jungwoo, et autres
Publié: (2025)
Quaff: Quantized Parameter-Efficient Fine-Tuning under Outlier Spatial Stability Hypothesis
par: Huang, Hong, et autres
Publié: (2025)
par: Huang, Hong, et autres
Publié: (2025)
SageAttention2: Efficient Attention with Thorough Outlier Smoothing and Per-thread INT4 Quantization
par: Zhang, Jintao, et autres
Publié: (2024)
par: Zhang, Jintao, et autres
Publié: (2024)
ARCQuant: Boosting NVFP4 Quantization with Augmented Residual Channels for LLMs
par: Meng, Haoqian, et autres
Publié: (2026)
par: Meng, Haoqian, et autres
Publié: (2026)
Sherry: Hardware-Efficient 1.25-Bit Ternary Quantization via Fine-grained Sparsification
par: Huang, Hong, et autres
Publié: (2026)
par: Huang, Hong, et autres
Publié: (2026)
QServe: W4A8KV4 Quantization and System Co-design for Efficient LLM Serving
par: Lin, Yujun, et autres
Publié: (2024)
par: Lin, Yujun, et autres
Publié: (2024)
LiquidGEMM: Hardware-Efficient W4A8 GEMM Kernel for High-Performance LLM Serving
par: Hu, Huanqi, et autres
Publié: (2025)
par: Hu, Huanqi, et autres
Publié: (2025)
MUXQ: Mixed-to-Uniform Precision MatriX Quantization via Low-Rank Outlier Decomposition
par: Lee, Seoungsub, et autres
Publié: (2026)
par: Lee, Seoungsub, et autres
Publié: (2026)
RQ-MoE: Residual Quantization via Mixture of Experts for Efficient Input-Dependent Vector Compression
par: Zhong, Zhengjia, et autres
Publié: (2026)
par: Zhong, Zhengjia, et autres
Publié: (2026)
GO-OSC and VASH: Geometry-Aware Representation Learning for Early Degradation Detection in Oscillatory Systems
par: Nobaub, Vashista
Publié: (2026)
par: Nobaub, Vashista
Publié: (2026)
Activation Outliers in Transformer Quantization: Reproduction, Statistical Analysis, and Deployment Tradeoffs
par: Kaliaperumal, Pranav Kumar
Publié: (2026)
par: Kaliaperumal, Pranav Kumar
Publié: (2026)
Efficient Skill Discovery via Regret-Aware Optimization
par: Zhang, He, et autres
Publié: (2025)
par: Zhang, He, et autres
Publié: (2025)
XFP: Quality-Targeted Adaptive Codebook Quantization with Sparse Outlier Separation for LLM Inference
par: Witt, Thomas
Publié: (2026)
par: Witt, Thomas
Publié: (2026)
AnyBCQ: Hardware Efficient Flexible Binary-Coded Quantization for Multi-Precision LLMs
par: Park, Gunho, et autres
Publié: (2025)
par: Park, Gunho, et autres
Publié: (2025)
Learning Quantized Continuous Controllers for Integer Hardware
par: Kresse, Fabian, et autres
Publié: (2025)
par: Kresse, Fabian, et autres
Publié: (2025)
OptRot: Mitigating Weight Outliers via Data-Free Rotations for Post-Training Quantization
par: Gadhikar, Advait, et autres
Publié: (2025)
par: Gadhikar, Advait, et autres
Publié: (2025)
Astro: Activation-guided Structured Regularization for Outlier-Robust LLM Post-Training Quantization
par: Chen, Xi, et autres
Publié: (2026)
par: Chen, Xi, et autres
Publié: (2026)
Rotate, Clip, and Partition: Towards W2A4KV4 Quantization by Integrating Rotation and Learnable Non-uniform Quantizer
par: Choi, Euntae, et autres
Publié: (2025)
par: Choi, Euntae, et autres
Publié: (2025)
Outliers and Calibration Sets have Diminishing Effect on Quantization of Modern LLMs
par: Paglieri, Davide, et autres
Publié: (2024)
par: Paglieri, Davide, et autres
Publié: (2024)
DMQ: Dissecting Outliers of Diffusion Models for Post-Training Quantization
par: Lee, Dongyeun, et autres
Publié: (2025)
par: Lee, Dongyeun, et autres
Publié: (2025)
Phenotypic Profile-Informed Generation of Drug-Like Molecules via Dual-Channel Variational Autoencoders
par: Liu, Hui, et autres
Publié: (2025)
par: Liu, Hui, et autres
Publié: (2025)
Q-ROAR: Outlier-Aware Rescaling for RoPE Position Interpolation in Quantized Long-Context LLMs
par: Qiao, Ye, et autres
Publié: (2025)
par: Qiao, Ye, et autres
Publié: (2025)
The Curse and Blessing of Mean Bias in FP4-Quantized LLM Training
par: Cao, Hengjie, et autres
Publié: (2026)
par: Cao, Hengjie, et autres
Publié: (2026)
Robust Statistical Scaling of Outlier Scores: Improving the Quality of Outlier Probabilities for Outliers (Extended Version)
par: Röchner, Philipp, et autres
Publié: (2024)
par: Röchner, Philipp, et autres
Publié: (2024)
On-Chip Hardware-Aware Quantization for Mixed Precision Neural Networks
par: Huang, Wei, et autres
Publié: (2023)
par: Huang, Wei, et autres
Publié: (2023)
Mamba-PTQ: Outlier Channels in Recurrent Large Language Models
par: Pierro, Alessandro, et autres
Publié: (2024)
par: Pierro, Alessandro, et autres
Publié: (2024)
MicroScopiQ: Accelerating Foundational Models through Outlier-Aware Microscaling Quantization
par: Ramachandran, Akshat, et autres
Publié: (2024)
par: Ramachandran, Akshat, et autres
Publié: (2024)
Model Quantization and Hardware Acceleration for Vision Transformers: A Comprehensive Survey
par: Du, Dayou, et autres
Publié: (2024)
par: Du, Dayou, et autres
Publié: (2024)
RotateKV: Accurate and Robust 2-Bit KV Cache Quantization for LLMs via Outlier-Aware Adaptive Rotations
par: Su, Zunhai, et autres
Publié: (2025)
par: Su, Zunhai, et autres
Publié: (2025)
Quasar-ViT: Hardware-Oriented Quantization-Aware Architecture Search for Vision Transformers
par: Li, Zhengang, et autres
Publié: (2024)
par: Li, Zhengang, et autres
Publié: (2024)
Outlier-Efficient Hopfield Layers for Large Transformer-Based Models
par: Hu, Jerry Yao-Chieh, et autres
Publié: (2024)
par: Hu, Jerry Yao-Chieh, et autres
Publié: (2024)
Long-Term Outlier Prediction Through Outlier Score Modeling
par: Aoki, Yuma, et autres
Publié: (2026)
par: Aoki, Yuma, et autres
Publié: (2026)
i-MAE: Are Latent Representations in Masked Autoencoders Linearly Separable?
par: Zhang, Kevin, et autres
Publié: (2022)
par: Zhang, Kevin, et autres
Publié: (2022)
Learning under Quantization for High-Dimensional Linear Regression
par: Zhang, Dechen, et autres
Publié: (2025)
par: Zhang, Dechen, et autres
Publié: (2025)
LeanK: Learnable K Cache Channel Pruning for Efficient Decoding
par: Zhang, Yike, et autres
Publié: (2025)
par: Zhang, Yike, et autres
Publié: (2025)
Documents similaires
-
VFA: Relieving Vector Operations in Flash Attention with Global Maximum Pre-computation
par: Sun, Yupeng, et autres
Publié: (2026) -
MixPE: Quantization and Hardware Co-design for Efficient LLM Inference
par: Zhang, Yu, et autres
Publié: (2024) -
BATQuant: Outlier-resilient MXFP4 Quantization via Learnable Block-wise Optimization
par: Li, Ji-Fu, et autres
Publié: (2026) -
Rethinking RoPE Scaling in Quantized LLM: Theory, Outlier, and Channel-Band Analysis with Weight Rescaling
par: Qiao, Ye, et autres
Publié: (2025) -
Widening the Gap: Exploiting LLM Quantization via Outlier Injection
par: Zhan, Xiaohua, et autres
Publié: (2026)