BiLLM: Pushing the Limit of Post-Training Quantization for LLMs
Fuente:
arXiv
Salvato in:
| Autori principali: | Huang, Wei, Liu, Yangdong, Qin, Haotong, Li, Ying, Zhang, Shiming, Liu, Xianglong, Magno, Michele, Qi, Xiaojuan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SliM-LLM: Salience-Driven Mixed-Precision Quantization for Large Language Models
di: Huang, Wei, et al.
Pubblicazione: (2024)
di: Huang, Wei, et al.
Pubblicazione: (2024)
On-Chip Hardware-Aware Quantization for Mixed Precision Neural Networks
di: Huang, Wei, et al.
Pubblicazione: (2023)
di: Huang, Wei, et al.
Pubblicazione: (2023)
Post-Training Quantization for Video Matting
di: Zhu, Tianrui, et al.
Pubblicazione: (2025)
di: Zhu, Tianrui, et al.
Pubblicazione: (2025)
First-Order Error Matters: Accurate Compensation for Quantized Large Language Models
di: Zheng, Xingyu, et al.
Pubblicazione: (2025)
di: Zheng, Xingyu, et al.
Pubblicazione: (2025)
Quant-dLLM: Post-Training Extreme Low-Bit Quantization for Diffusion Large Language Models
di: Zhang, Tianao, et al.
Pubblicazione: (2025)
di: Zhang, Tianao, et al.
Pubblicazione: (2025)
DB-LLM: Accurate Dual-Binarization for Efficient LLMs
di: Chen, Hong, et al.
Pubblicazione: (2024)
di: Chen, Hong, et al.
Pubblicazione: (2024)
QuantSR+: Pushing the Limit of Quantized Image Super-Resolution Networks
di: Qin, Haotong, et al.
Pubblicazione: (2026)
di: Qin, Haotong, et al.
Pubblicazione: (2026)
Quantization Meets dLLMs: A Systematic Study of Post-training Quantization for Diffusion LLMs
di: Lin, Haokun, et al.
Pubblicazione: (2025)
di: Lin, Haokun, et al.
Pubblicazione: (2025)
Pushing the Limits of Block Rotations in Post-Training Quantization
di: Sanjeet, Sai, et al.
Pubblicazione: (2026)
di: Sanjeet, Sai, et al.
Pubblicazione: (2026)
A Survey of Low-bit Large Language Models: Basics, Systems, and Algorithms
di: Gong, Ruihao, et al.
Pubblicazione: (2024)
di: Gong, Ruihao, et al.
Pubblicazione: (2024)
Accurate LoRA-Finetuning Quantization of LLMs via Information Retention
di: Qin, Haotong, et al.
Pubblicazione: (2024)
di: Qin, Haotong, et al.
Pubblicazione: (2024)
MegaScience: Pushing the Frontiers of Post-Training Datasets for Science Reasoning
di: Fan, Run-Ze, et al.
Pubblicazione: (2025)
di: Fan, Run-Ze, et al.
Pubblicazione: (2025)
BiDM: Pushing the Limit of Quantization for Diffusion Models
di: Zheng, Xingyu, et al.
Pubblicazione: (2024)
di: Zheng, Xingyu, et al.
Pubblicazione: (2024)
Beyond Distillation: Pushing the Limits of Medical LLM Reasoning with Minimalist Rule-Based RL
di: Liu, Che, et al.
Pubblicazione: (2025)
di: Liu, Che, et al.
Pubblicazione: (2025)
Examining Reasoning LLMs-as-Judges in Non-Verifiable LLM Post-Training
di: Liu, Yixin, et al.
Pubblicazione: (2026)
di: Liu, Yixin, et al.
Pubblicazione: (2026)
Case-Based or Rule-Based: How Do Transformers Do the Math?
di: Hu, Yi, et al.
Pubblicazione: (2024)
di: Hu, Yi, et al.
Pubblicazione: (2024)
GWQ: Gradient-Aware Weight Quantization for Large Language Models
di: Shao, Yihua, et al.
Pubblicazione: (2024)
di: Shao, Yihua, et al.
Pubblicazione: (2024)
LLMCBench: Benchmarking Large Language Model Compression for Efficient Deployment
di: Yang, Ge, et al.
Pubblicazione: (2024)
di: Yang, Ge, et al.
Pubblicazione: (2024)
Pangu Ultra: Pushing the Limits of Dense Large Language Models on Ascend NPUs
di: Yin, Yichun, et al.
Pubblicazione: (2025)
di: Yin, Yichun, et al.
Pubblicazione: (2025)
PT$^2$-LLM: Post-Training Ternarization for Large Language Models
di: Yan, Xianglong, et al.
Pubblicazione: (2025)
di: Yan, Xianglong, et al.
Pubblicazione: (2025)
SignRoundV2: Toward Closing the Performance Gap in Extremely Low-Bit Post-Training Quantization for LLMs
di: Cheng, Wenhua, et al.
Pubblicazione: (2025)
di: Cheng, Wenhua, et al.
Pubblicazione: (2025)
Disperse-Then-Merge: Pushing the Limits of Instruction Tuning via Alignment Tax Reduction
di: Fu, Tingchen, et al.
Pubblicazione: (2024)
di: Fu, Tingchen, et al.
Pubblicazione: (2024)
Q-SAM2: Accurate Quantization for Segment Anything Model 2
di: Farronato, Nicola, et al.
Pubblicazione: (2025)
di: Farronato, Nicola, et al.
Pubblicazione: (2025)
EstLLM: Enhancing Estonian Capabilities in Multilingual LLMs via Continued Pretraining and Post-Training
di: Dorkin, Aleksei, et al.
Pubblicazione: (2026)
di: Dorkin, Aleksei, et al.
Pubblicazione: (2026)
Synthesizing Post-Training Data for LLMs through Multi-Agent Simulation
di: Tang, Shuo, et al.
Pubblicazione: (2024)
di: Tang, Shuo, et al.
Pubblicazione: (2024)
Post-Training Language Models for Crosslingual Consistency
di: Liu, Tianyu, et al.
Pubblicazione: (2026)
di: Liu, Tianyu, et al.
Pubblicazione: (2026)
Catastrophic Failure of LLM Unlearning via Quantization
di: Zhang, Zhiwei, et al.
Pubblicazione: (2024)
di: Zhang, Zhiwei, et al.
Pubblicazione: (2024)
English is Not All You Need: Systematically Exploring the Role of Multilinguality in LLM Post-Training
di: Dhaliwal, Mehak, et al.
Pubblicazione: (2026)
di: Dhaliwal, Mehak, et al.
Pubblicazione: (2026)
How Emotion Shapes the Behavior of LLMs and Agents: A Mechanistic Study
di: Sun, Moran, et al.
Pubblicazione: (2026)
di: Sun, Moran, et al.
Pubblicazione: (2026)
MegaMath: Pushing the Limits of Open Math Corpora
di: Zhou, Fan, et al.
Pubblicazione: (2025)
di: Zhou, Fan, et al.
Pubblicazione: (2025)
APTQ: Attention-aware Post-Training Mixed-Precision Quantization for Large Language Models
di: Guan, Ziyi, et al.
Pubblicazione: (2024)
di: Guan, Ziyi, et al.
Pubblicazione: (2024)
ShiftAddLLM: Accelerating Pretrained LLMs via Post-Training Multiplication-Less Reparameterization
di: You, Haoran, et al.
Pubblicazione: (2024)
di: You, Haoran, et al.
Pubblicazione: (2024)
Low-Rank Quantization-Aware Training for LLMs
di: Bondarenko, Yelysei, et al.
Pubblicazione: (2024)
di: Bondarenko, Yelysei, et al.
Pubblicazione: (2024)
Task-Stratified Knowledge Scaling Laws for Post-Training Quantized Large Language Models
di: Zhou, Chenxi, et al.
Pubblicazione: (2025)
di: Zhou, Chenxi, et al.
Pubblicazione: (2025)
AlphaToken: Decoupling Adaptation and Stability for Path-Aware Response Token Valuation in LLM Post-Training
di: Qing, Liu, et al.
Pubblicazione: (2026)
di: Qing, Liu, et al.
Pubblicazione: (2026)
Continuous Approximations for Improving Quantization Aware Training of LLMs
di: Li, He, et al.
Pubblicazione: (2024)
di: Li, He, et al.
Pubblicazione: (2024)
LLMC: Benchmarking Large Language Model Quantization with a Versatile Compression Toolkit
di: Gong, Ruihao, et al.
Pubblicazione: (2024)
di: Gong, Ruihao, et al.
Pubblicazione: (2024)
Finding and Reactivating Post-Trained LLMs' Hidden Safety Mechanisms
di: Li, Mingjie, et al.
Pubblicazione: (2026)
di: Li, Mingjie, et al.
Pubblicazione: (2026)
GPTQT: Quantize Large Language Models Twice to Push the Efficiency
di: Guo, Yipin, et al.
Pubblicazione: (2024)
di: Guo, Yipin, et al.
Pubblicazione: (2024)
OpenSeeker-v2: Pushing the Limits of Search Agents with Informative and High-Difficulty Trajectories
di: Du, Yuwen, et al.
Pubblicazione: (2026)
di: Du, Yuwen, et al.
Pubblicazione: (2026)
Documenti analoghi
-
SliM-LLM: Salience-Driven Mixed-Precision Quantization for Large Language Models
di: Huang, Wei, et al.
Pubblicazione: (2024) -
On-Chip Hardware-Aware Quantization for Mixed Precision Neural Networks
di: Huang, Wei, et al.
Pubblicazione: (2023) -
Post-Training Quantization for Video Matting
di: Zhu, Tianrui, et al.
Pubblicazione: (2025) -
First-Order Error Matters: Accurate Compensation for Quantized Large Language Models
di: Zheng, Xingyu, et al.
Pubblicazione: (2025) -
Quant-dLLM: Post-Training Extreme Low-Bit Quantization for Diffusion Large Language Models
di: Zhang, Tianao, et al.
Pubblicazione: (2025)