NanoQuant: Efficient Sub-1-Bit Quantization of Large Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Chong, Hyochan, Kim, Dongkyu, Kim, Changdong, Choi, Minseop |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
RaBiT: Residual-Aware Binarization Training for Accurate and Efficient LLMs
por: You, Youngcheon, et al.
Publicado: (2026)
por: You, Youngcheon, et al.
Publicado: (2026)
LittleBit: Ultra Low-Bit Quantization via Latent Factorization
por: Lee, Banseok, et al.
Publicado: (2025)
por: Lee, Banseok, et al.
Publicado: (2025)
TruncQuant: Truncation-Ready Quantization for DNNs with Flexible Weight Bit Precision
por: Kim, Jinhee, et al.
Publicado: (2025)
por: Kim, Jinhee, et al.
Publicado: (2025)
Quant-dLLM: Post-Training Extreme Low-Bit Quantization for Diffusion Large Language Models
por: Zhang, Tianao, et al.
Publicado: (2025)
por: Zhang, Tianao, et al.
Publicado: (2025)
FrameQuant: Flexible Low-Bit Quantization for Transformers
por: Adepu, Harshavardhan, et al.
Publicado: (2024)
por: Adepu, Harshavardhan, et al.
Publicado: (2024)
GuidedQuant: Large Language Model Quantization via Exploiting End Loss Guidance
por: Kim, Jinuk, et al.
Publicado: (2025)
por: Kim, Jinuk, et al.
Publicado: (2025)
AffineQuant: Affine Transformation Quantization for Large Language Models
por: Ma, Yuexiao, et al.
Publicado: (2024)
por: Ma, Yuexiao, et al.
Publicado: (2024)
BAQ: Efficient Bit Allocation Quantization for Large Language Models
por: Zhang, Chao, et al.
Publicado: (2025)
por: Zhang, Chao, et al.
Publicado: (2025)
SmoothQuant: Accurate and Efficient Post-Training Quantization for Large Language Models
por: Xiao, Guangxuan, et al.
Publicado: (2022)
por: Xiao, Guangxuan, et al.
Publicado: (2022)
OmniQuant: Omnidirectionally Calibrated Quantization for Large Language Models
por: Shao, Wenqi, et al.
Publicado: (2023)
por: Shao, Wenqi, et al.
Publicado: (2023)
InfoQuant: Shaping Activation Distributions for Low-Bit LLM Quantization
por: Li, Ke, et al.
Publicado: (2026)
por: Li, Ke, et al.
Publicado: (2026)
SplitQuant: Layer Splitting for Low-Bit Neural Network Quantization
por: Song, Jaewoo, et al.
Publicado: (2025)
por: Song, Jaewoo, et al.
Publicado: (2025)
MoBiQuant: Mixture-of-Bits Quantization for Token-Adaptive Any-Precision LLM
por: Wang, Dongwei, et al.
Publicado: (2026)
por: Wang, Dongwei, et al.
Publicado: (2026)
pQuant: Towards Effective Low-Bit Language Models via Decoupled Linear Quantization-Aware Training
por: Zhang, Wenzheng, et al.
Publicado: (2026)
por: Zhang, Wenzheng, et al.
Publicado: (2026)
MSQ: Memory-Efficient Bit Sparsification Quantization
por: Han, Seokho, et al.
Publicado: (2025)
por: Han, Seokho, et al.
Publicado: (2025)
KV Cache is 1 Bit Per Channel: Efficient Large Language Model Inference with Coupled Quantization
por: Zhang, Tianyi, et al.
Publicado: (2024)
por: Zhang, Tianyi, et al.
Publicado: (2024)
ContrastCAD: Contrastive Learning-based Representation Learning for Computer-Aided Design Models
por: Jung, Minseop, et al.
Publicado: (2024)
por: Jung, Minseop, et al.
Publicado: (2024)
PrefixQuant: Eliminating Outliers by Prefixed Tokens for Large Language Models Quantization
por: Chen, Mengzhao, et al.
Publicado: (2024)
por: Chen, Mengzhao, et al.
Publicado: (2024)
QQQ: Quality Quattuor-Bit Quantization for Large Language Models
por: Zhang, Ying, et al.
Publicado: (2024)
por: Zhang, Ying, et al.
Publicado: (2024)
SplitQuantV2: Enhancing Low-Bit Quantization of LLMs Without GPUs
por: Song, Jaewoo, et al.
Publicado: (2025)
por: Song, Jaewoo, et al.
Publicado: (2025)
SpecQuant: Spectral Decomposition and Adaptive Truncation for Ultra-Low-Bit LLMs Quantization
por: Zhao, Zhixiong, et al.
Publicado: (2025)
por: Zhao, Zhixiong, et al.
Publicado: (2025)
LeanQuant: Accurate and Scalable Large Language Model Quantization with Loss-error-aware Grid
por: Zhang, Tianyi, et al.
Publicado: (2024)
por: Zhang, Tianyi, et al.
Publicado: (2024)
A Lightweight CNN-Transformer Model for Learning Traveling Salesman Problems
por: Jung, Minseop, et al.
Publicado: (2023)
por: Jung, Minseop, et al.
Publicado: (2023)
Quant VideoGen: Auto-Regressive Long Video Generation via 2-Bit KV-Cache Quantization
por: Xi, Haocheng, et al.
Publicado: (2026)
por: Xi, Haocheng, et al.
Publicado: (2026)
MergeQuant: Accurate 4-bit Static Quantization of Large Language Models by Channel-wise Calibration
por: Wang, Jinguang, et al.
Publicado: (2025)
por: Wang, Jinguang, et al.
Publicado: (2025)
LittleBit-2: Maximizing the Spectral Energy Gain in Sub-1-Bit LLMs via Latent Geometry Alignment
por: Lee, Banseok, et al.
Publicado: (2026)
por: Lee, Banseok, et al.
Publicado: (2026)
L4Q: Parameter Efficient Quantization-Aware Fine-Tuning on Large Language Models
por: Jeon, Hyesung, et al.
Publicado: (2024)
por: Jeon, Hyesung, et al.
Publicado: (2024)
FibQuant: Universal Vector Quantization for Random-Access KV-Cache Compression
por: Lee, Namyoon, et al.
Publicado: (2026)
por: Lee, Namyoon, et al.
Publicado: (2026)
CrossQuant: A Post-Training Quantization Method with Smaller Quantization Kernel for Precise Large Language Model Compression
por: Liu, Wenyuan, et al.
Publicado: (2024)
por: Liu, Wenyuan, et al.
Publicado: (2024)
ABQ-LLM: Arbitrary-Bit Quantized Inference Acceleration for Large Language Models
por: Zeng, Chao, et al.
Publicado: (2024)
por: Zeng, Chao, et al.
Publicado: (2024)
LogQuant: Log-Distributed 2-Bit Quantization of KV Cache with Superior Accuracy Preservation
por: Chen, Han, et al.
Publicado: (2025)
por: Chen, Han, et al.
Publicado: (2025)
ApiQ: Finetuning of 2-Bit Quantized Large Language Model
por: Liao, Baohao, et al.
Publicado: (2024)
por: Liao, Baohao, et al.
Publicado: (2024)
QuIP: 2-Bit Quantization of Large Language Models With Guarantees
por: Chee, Jerry, et al.
Publicado: (2023)
por: Chee, Jerry, et al.
Publicado: (2023)
QuantVLA: Scale-Calibrated Post-Training Quantization for Vision-Language-Action Models
por: Zhang, Jingxuan, et al.
Publicado: (2026)
por: Zhang, Jingxuan, et al.
Publicado: (2026)
DartQuant: Efficient Rotational Distribution Calibration for LLM Quantization
por: Shao, Yuantian, et al.
Publicado: (2025)
por: Shao, Yuantian, et al.
Publicado: (2025)
EasyQuant: An Efficient Data-free Quantization Algorithm for LLMs
por: Tang, Hanlin, et al.
Publicado: (2024)
por: Tang, Hanlin, et al.
Publicado: (2024)
OstQuant: Refining Large Language Model Quantization with Orthogonal and Scaling Transformations for Better Distribution Fitting
por: Hu, Xing, et al.
Publicado: (2025)
por: Hu, Xing, et al.
Publicado: (2025)
BPDQ: Bit-Plane Decomposition Quantization on a Variable Grid for Large Language Models
por: Chen, Junyu, et al.
Publicado: (2026)
por: Chen, Junyu, et al.
Publicado: (2026)
QuantLRM: Quantization of Large Reasoning Models via Fine-Tuning Signals
por: Zhang, Nan, et al.
Publicado: (2026)
por: Zhang, Nan, et al.
Publicado: (2026)
Robust Ultra Low-Bit Post-Training Quantization via Stable Diagonal Curvature Estimate
por: Kim, Jaemin, et al.
Publicado: (2026)
por: Kim, Jaemin, et al.
Publicado: (2026)
Ejemplares similares
-
RaBiT: Residual-Aware Binarization Training for Accurate and Efficient LLMs
por: You, Youngcheon, et al.
Publicado: (2026) -
LittleBit: Ultra Low-Bit Quantization via Latent Factorization
por: Lee, Banseok, et al.
Publicado: (2025) -
TruncQuant: Truncation-Ready Quantization for DNNs with Flexible Weight Bit Precision
por: Kim, Jinhee, et al.
Publicado: (2025) -
Quant-dLLM: Post-Training Extreme Low-Bit Quantization for Diffusion Large Language Models
por: Zhang, Tianao, et al.
Publicado: (2025) -
FrameQuant: Flexible Low-Bit Quantization for Transformers
por: Adepu, Harshavardhan, et al.
Publicado: (2024)