Enregistré dans:
| Auteurs principaux: | Zhang, Xi, Wu, Xiaolin, Wang, Jiamang, Lin, Weisi |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2510.20984 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Why Do Some Inputs Break Low-Bit LLM Quantization?
par: Chang, Ting-Yun, et autres
Publié: (2025)
par: Chang, Ting-Yun, et autres
Publié: (2025)
InfoQuant: Shaping Activation Distributions for Low-Bit LLM Quantization
par: Li, Ke, et autres
Publié: (2026)
par: Li, Ke, et autres
Publié: (2026)
UltraSketchLLM: Saliency-Driven Sketching for Ultra-Low Bit LLM Compression
par: Zou, Sunan, et autres
Publié: (2025)
par: Zou, Sunan, et autres
Publié: (2025)
SplitQuant: Layer Splitting for Low-Bit Neural Network Quantization
par: Song, Jaewoo, et autres
Publié: (2025)
par: Song, Jaewoo, et autres
Publié: (2025)
NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache
par: Son, Donghyun, et autres
Publié: (2025)
par: Son, Donghyun, et autres
Publié: (2025)
Quant-dLLM: Post-Training Extreme Low-Bit Quantization for Diffusion Large Language Models
par: Zhang, Tianao, et autres
Publié: (2025)
par: Zhang, Tianao, et autres
Publié: (2025)
VP-VAE: Rethinking Vector Quantization via Adaptive Vector Perturbation
par: Zhai, Linwei, et autres
Publié: (2026)
par: Zhai, Linwei, et autres
Publié: (2026)
SplitQuantV2: Enhancing Low-Bit Quantization of LLMs Without GPUs
par: Song, Jaewoo, et autres
Publié: (2025)
par: Song, Jaewoo, et autres
Publié: (2025)
Tiled Bit Networks: Sub-Bit Neural Network Compression Through Reuse of Learnable Binary Vectors
par: Gorbett, Matt, et autres
Publié: (2024)
par: Gorbett, Matt, et autres
Publié: (2024)
LittleBit: Ultra Low-Bit Quantization via Latent Factorization
par: Lee, Banseok, et autres
Publié: (2025)
par: Lee, Banseok, et autres
Publié: (2025)
Q-Palette: Fractional-Bit Quantizers Toward Optimal Bit Allocation for Efficient LLM Deployment
par: Lee, Deokjae, et autres
Publié: (2025)
par: Lee, Deokjae, et autres
Publié: (2025)
BitsMoE: Efficient Spectral Energy-Guided Bit Allocation for MoE LLM Quantization
par: Zhao, Jiayu, et autres
Publié: (2026)
par: Zhao, Jiayu, et autres
Publié: (2026)
Attn-QAT: 4-Bit Attention With Quantization-Aware Training
par: Zhang, Peiyuan, et autres
Publié: (2026)
par: Zhang, Peiyuan, et autres
Publié: (2026)
SpecQuant: Spectral Decomposition and Adaptive Truncation for Ultra-Low-Bit LLMs Quantization
par: Zhao, Zhixiong, et autres
Publié: (2025)
par: Zhao, Zhixiong, et autres
Publié: (2025)
Quantization Meets Reasoning: Exploring and Mitigating Degradation of Low-Bit LLMs in Mathematical Reasoning
par: Li, Zhen, et autres
Publié: (2025)
par: Li, Zhen, et autres
Publié: (2025)
ECQ$^{\text{x}}$: Explainability-Driven Quantization for Low-Bit and Sparse DNNs
par: Becking, Daniel, et autres
Publié: (2021)
par: Becking, Daniel, et autres
Publié: (2021)
HeRo-Q: A General Framework for Stable Low Bit Quantization via Hessian Conditioning
par: Zhang, Jinhao Zhang Yunquan, et autres
Publié: (2026)
par: Zhang, Jinhao Zhang Yunquan, et autres
Publié: (2026)
UniQL: Unified Quantization and Low-rank Compression for Adaptive Edge LLMs
par: Chiang, Hung-Yueh, et autres
Publié: (2025)
par: Chiang, Hung-Yueh, et autres
Publié: (2025)
HESTIA: A Hessian-Guided Differentiable Quantization-Aware Training Framework for Extremely Low-Bit LLMs
par: Wang, Guoan, et autres
Publié: (2026)
par: Wang, Guoan, et autres
Publié: (2026)
PTQ1.61: Push the Real Limit of Extremely Low-Bit Post-Training Quantization Methods for Large Language Models
par: Zhao, Jiaqi, et autres
Publié: (2025)
par: Zhao, Jiaqi, et autres
Publié: (2025)
I-LLM: Efficient Integer-Only Inference for Fully-Quantized Low-Bit Large Language Models
par: Hu, Xing, et autres
Publié: (2024)
par: Hu, Xing, et autres
Publié: (2024)
RQ-MoE: Residual Quantization via Mixture of Experts for Efficient Input-Dependent Vector Compression
par: Zhong, Zhengjia, et autres
Publié: (2026)
par: Zhong, Zhengjia, et autres
Publié: (2026)
SLiM: One-shot Quantization and Sparsity with Low-rank Approximation for LLM Weight Compression
par: Mozaffari, Mohammad, et autres
Publié: (2024)
par: Mozaffari, Mohammad, et autres
Publié: (2024)
Graph is a Natural Regularization: Revisiting Vector Quantization for Graph Representation Learning
par: Zhai, Zian, et autres
Publié: (2025)
par: Zhai, Zian, et autres
Publié: (2025)
FoldToken: Learning Protein Language via Vector Quantization and Beyond
par: Gao, Zhangyang, et autres
Publié: (2024)
par: Gao, Zhangyang, et autres
Publié: (2024)
Lattice: Learning to Efficiently Compress the Memory
par: Karami, Mahdi, et autres
Publié: (2025)
par: Karami, Mahdi, et autres
Publié: (2025)
MoBiQuant: Mixture-of-Bits Quantization for Token-Adaptive Any-Precision LLM
par: Wang, Dongwei, et autres
Publié: (2026)
par: Wang, Dongwei, et autres
Publié: (2026)
Influence-Inspired Spectral Rotations for Extreme Low-Bit LLM Quantization
par: Pavlov, Gorgi
Publié: (2026)
par: Pavlov, Gorgi
Publié: (2026)
RDKV: Rate-Distortion Bit Allocation for Joint Eviction and Quantization of the KV Cache
par: Zhang, Junkai, et autres
Publié: (2026)
par: Zhang, Junkai, et autres
Publié: (2026)
DAQ: Delta-Aware Quantization for Post-Training LLM Weight Compression
par: Yu, Xiaoming, et autres
Publié: (2026)
par: Yu, Xiaoming, et autres
Publié: (2026)
Sherry: Hardware-Efficient 1.25-Bit Ternary Quantization via Fine-grained Sparsification
par: Huang, Hong, et autres
Publié: (2026)
par: Huang, Hong, et autres
Publié: (2026)
Gradient Based Method for the Fusion of Lattice Quantizers
par: Zhang, Liyuan, et autres
Publié: (2025)
par: Zhang, Liyuan, et autres
Publié: (2025)
AdaQAT: Adaptive Bit-Width Quantization-Aware Training
par: Gernigon, Cédric, et autres
Publié: (2024)
par: Gernigon, Cédric, et autres
Publié: (2024)
BTC-LLM: Efficient Sub-1-Bit LLM Quantization via Learnable Transformation and Binary Codebook
par: Gu, Hao, et autres
Publié: (2025)
par: Gu, Hao, et autres
Publié: (2025)
SQS: Bayesian DNN Compression through Sparse Quantized Sub-distributions
par: Wang, Ziyi, et autres
Publié: (2025)
par: Wang, Ziyi, et autres
Publié: (2025)
Control Your View: High-Resolution Global Semantic Manipulation in Learned Image Compression
par: Liang, Jiaming, et autres
Publié: (2026)
par: Liang, Jiaming, et autres
Publié: (2026)
FibQuant: Universal Vector Quantization for Random-Access KV-Cache Compression
par: Lee, Namyoon, et autres
Publié: (2026)
par: Lee, Namyoon, et autres
Publié: (2026)
What Makes Low-Bit Quantization-Aware Training Work for Reasoning LLMs? A Systematic Study
par: Lv, Keyu, et autres
Publié: (2026)
par: Lv, Keyu, et autres
Publié: (2026)
Vector Quantization in the Brain: Grid-like Codes in World Models
par: Peng, Xiangyuan, et autres
Publié: (2025)
par: Peng, Xiangyuan, et autres
Publié: (2025)
Pushing the Limits of Low-Bit Optimizers: A Focus on EMA Dynamics
par: Xu, Cong, et autres
Publié: (2025)
par: Xu, Cong, et autres
Publié: (2025)
Documents similaires
-
Why Do Some Inputs Break Low-Bit LLM Quantization?
par: Chang, Ting-Yun, et autres
Publié: (2025) -
InfoQuant: Shaping Activation Distributions for Low-Bit LLM Quantization
par: Li, Ke, et autres
Publié: (2026) -
UltraSketchLLM: Saliency-Driven Sketching for Ultra-Low Bit LLM Compression
par: Zou, Sunan, et autres
Publié: (2025) -
SplitQuant: Layer Splitting for Low-Bit Neural Network Quantization
par: Song, Jaewoo, et autres
Publié: (2025) -
NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache
par: Son, Donghyun, et autres
Publié: (2025)