VPTQ: Extreme Low-bit Vector Post-Training Quantization for Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Liu, Yifei, Wen, Jicheng, Wang, Yang, Ye, Shengyu, Zhang, Li Lyna, Cao, Ting, Li, Cheng, Yang, Mao |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
LUT-DLA: Lookup Table as Efficient Extreme Low-Bit Deep Learning Accelerator
di: Li, Guoyu, et al.
Pubblicazione: (2025)
di: Li, Guoyu, et al.
Pubblicazione: (2025)
Quant-dLLM: Post-Training Extreme Low-Bit Quantization for Diffusion Large Language Models
di: Zhang, Tianao, et al.
Pubblicazione: (2025)
di: Zhang, Tianao, et al.
Pubblicazione: (2025)
D$^2$Quant: Accurate Low-bit Post-Training Weight Quantization for LLMs
di: Yan, Xianglong, et al.
Pubblicazione: (2026)
di: Yan, Xianglong, et al.
Pubblicazione: (2026)
PTQTP: Post-Training Quantization to Trit-Planes for Large Language Models
di: Xiao, He, et al.
Pubblicazione: (2025)
di: Xiao, He, et al.
Pubblicazione: (2025)
Task-Stratified Knowledge Scaling Laws for Post-Training Quantized Large Language Models
di: Zhou, Chenxi, et al.
Pubblicazione: (2025)
di: Zhou, Chenxi, et al.
Pubblicazione: (2025)
2DQuant: Low-bit Post-Training Quantization for Image Super-Resolution
di: Liu, Kai, et al.
Pubblicazione: (2024)
di: Liu, Kai, et al.
Pubblicazione: (2024)
Low-bit Model Quantization for Deep Neural Networks: A Survey
di: Liu, Kai, et al.
Pubblicazione: (2025)
di: Liu, Kai, et al.
Pubblicazione: (2025)
PTQ1.61: Push the Real Limit of Extremely Low-Bit Post-Training Quantization Methods for Large Language Models
di: Zhao, Jiaqi, et al.
Pubblicazione: (2025)
di: Zhao, Jiaqi, et al.
Pubblicazione: (2025)
Fewer is More: Boosting LLM Reasoning with Reinforced Context Pruning
di: Huang, Xijie, et al.
Pubblicazione: (2023)
di: Huang, Xijie, et al.
Pubblicazione: (2023)
LRQ: Optimizing Post-Training Quantization for Large Language Models by Learning Low-Rank Weight-Scaling Matrices
di: Lee, Jung Hyun, et al.
Pubblicazione: (2024)
di: Lee, Jung Hyun, et al.
Pubblicazione: (2024)
4bit-Quantization in Vector-Embedding for RAG
di: Jeong, Taehee
Pubblicazione: (2025)
di: Jeong, Taehee
Pubblicazione: (2025)
ParetoQ: Improving Scaling Laws in Extremely Low-bit LLM Quantization
di: Liu, Zechun, et al.
Pubblicazione: (2025)
di: Liu, Zechun, et al.
Pubblicazione: (2025)
Aggressive Post-Training Compression on Extremely Large Language Models
di: Zhang, Zining, et al.
Pubblicazione: (2024)
di: Zhang, Zining, et al.
Pubblicazione: (2024)
Post Training Quantization of Large Language Models with Microscaling Formats
di: Sharify, Sayeh, et al.
Pubblicazione: (2024)
di: Sharify, Sayeh, et al.
Pubblicazione: (2024)
Fine-Grained Post-Training Quantization for Large Vision Language Models with Quantization-Aware Integrated Gradients
di: Xiang, Ziwei, et al.
Pubblicazione: (2026)
di: Xiang, Ziwei, et al.
Pubblicazione: (2026)
Accumulator-Aware Post-Training Quantization for Large Language Models
di: Colbert, Ian, et al.
Pubblicazione: (2024)
di: Colbert, Ian, et al.
Pubblicazione: (2024)
LCD: Advancing Extreme Low-Bit Clustering for Large Language Models via Knowledge Distillation
di: Liu, Fangxin, et al.
Pubblicazione: (2025)
di: Liu, Fangxin, et al.
Pubblicazione: (2025)
SignRoundV2: Toward Closing the Performance Gap in Extremely Low-Bit Post-Training Quantization for LLMs
di: Cheng, Wenhua, et al.
Pubblicazione: (2025)
di: Cheng, Wenhua, et al.
Pubblicazione: (2025)
P$^2$-ViT: Power-of-Two Post-Training Quantization and Acceleration for Fully Quantized Vision Transformer
di: Shi, Huihong, et al.
Pubblicazione: (2024)
di: Shi, Huihong, et al.
Pubblicazione: (2024)
ICQuant: Index Coding enables Low-bit LLM Quantization
di: Li, Xinlin, et al.
Pubblicazione: (2025)
di: Li, Xinlin, et al.
Pubblicazione: (2025)
OneBit: Towards Extremely Low-bit Large Language Models
di: Xu, Yuzhuang, et al.
Pubblicazione: (2024)
di: Xu, Yuzhuang, et al.
Pubblicazione: (2024)
Q-MLLM: Vector Quantization for Robust Multimodal Large Language Model Security
di: Zhao, Wei, et al.
Pubblicazione: (2025)
di: Zhao, Wei, et al.
Pubblicazione: (2025)
Interactions Across Blocks in Post-Training Quantization of Large Language Models
di: Shabanovi, Khasmamad, et al.
Pubblicazione: (2024)
di: Shabanovi, Khasmamad, et al.
Pubblicazione: (2024)
Benchmarking Post-Training Quantization of Large Language Models under Microscaling Floating Point Formats
di: Zhang, Manyi, et al.
Pubblicazione: (2026)
di: Zhang, Manyi, et al.
Pubblicazione: (2026)
CrossQuant: A Post-Training Quantization Method with Smaller Quantization Kernel for Precise Large Language Model Compression
di: Liu, Wenyuan, et al.
Pubblicazione: (2024)
di: Liu, Wenyuan, et al.
Pubblicazione: (2024)
Exploring Layer-wise Information Effectiveness for Post-Training Quantization in Small Language Models
di: Xiao, He, et al.
Pubblicazione: (2025)
di: Xiao, He, et al.
Pubblicazione: (2025)
SASQ: Static Activation Scaling for Quantization-Aware Training in Large Language Models
di: Mao, Shizhuo, et al.
Pubblicazione: (2025)
di: Mao, Shizhuo, et al.
Pubblicazione: (2025)
CCQ: Convolutional Code for Extreme Low-bit Quantization in LLMs
di: Zhou, Zhaojing, et al.
Pubblicazione: (2025)
di: Zhou, Zhaojing, et al.
Pubblicazione: (2025)
DL-QAT: Weight-Decomposed Low-Rank Quantization-Aware Training for Large Language Models
di: Ke, Wenjin, et al.
Pubblicazione: (2025)
di: Ke, Wenjin, et al.
Pubblicazione: (2025)
Rethinking Output Alignment For 1-bit Post-Training Quantization of Large Language Models
di: Hoang, Dung Anh, et al.
Pubblicazione: (2025)
di: Hoang, Dung Anh, et al.
Pubblicazione: (2025)
D-QRELO: Training- and Data-Free Delta Compression for Large Language Models via Quantization and Residual Low-Rank Approximation
di: Li, Junlin, et al.
Pubblicazione: (2026)
di: Li, Junlin, et al.
Pubblicazione: (2026)
SmoothQuant: Accurate and Efficient Post-Training Quantization for Large Language Models
di: Xiao, Guangxuan, et al.
Pubblicazione: (2022)
di: Xiao, Guangxuan, et al.
Pubblicazione: (2022)
Understanding Post-Training Structural Changes in Large Language Models
di: He, Xinyu, et al.
Pubblicazione: (2025)
di: He, Xinyu, et al.
Pubblicazione: (2025)
LaCo: Large Language Model Pruning via Layer Collapse
di: Yang, Yifei, et al.
Pubblicazione: (2024)
di: Yang, Yifei, et al.
Pubblicazione: (2024)
VQ4DiT: Efficient Post-Training Vector Quantization for Diffusion Transformers
di: Deng, Juncan, et al.
Pubblicazione: (2024)
di: Deng, Juncan, et al.
Pubblicazione: (2024)
Athena: Efficient Block-Wise Post-Training Quantization for Large Language Models Using Second-Order Matrix Derivative Information
di: Wang, Yanshu, et al.
Pubblicazione: (2024)
di: Wang, Yanshu, et al.
Pubblicazione: (2024)
Evaluating Quantized Large Language Models
di: Li, Shiyao, et al.
Pubblicazione: (2024)
di: Li, Shiyao, et al.
Pubblicazione: (2024)
PCDVQ: Enhancing Vector Quantization for Large Language Models via Polar Coordinate Decoupling
di: Yue, Yuxuan, et al.
Pubblicazione: (2025)
di: Yue, Yuxuan, et al.
Pubblicazione: (2025)
Quantized Embedding Vectors for Controllable Diffusion Language Models
di: Kang, Cheng, et al.
Pubblicazione: (2024)
di: Kang, Cheng, et al.
Pubblicazione: (2024)
HESTIA: A Hessian-Guided Differentiable Quantization-Aware Training Framework for Extremely Low-Bit LLMs
di: Wang, Guoan, et al.
Pubblicazione: (2026)
di: Wang, Guoan, et al.
Pubblicazione: (2026)
Documenti analoghi
-
LUT-DLA: Lookup Table as Efficient Extreme Low-Bit Deep Learning Accelerator
di: Li, Guoyu, et al.
Pubblicazione: (2025) -
Quant-dLLM: Post-Training Extreme Low-Bit Quantization for Diffusion Large Language Models
di: Zhang, Tianao, et al.
Pubblicazione: (2025) -
D$^2$Quant: Accurate Low-bit Post-Training Weight Quantization for LLMs
di: Yan, Xianglong, et al.
Pubblicazione: (2026) -
PTQTP: Post-Training Quantization to Trit-Planes for Large Language Models
di: Xiao, He, et al.
Pubblicazione: (2025) -
Task-Stratified Knowledge Scaling Laws for Post-Training Quantized Large Language Models
di: Zhou, Chenxi, et al.
Pubblicazione: (2025)