Pushing the Limits of Block Rotations in Post-Training Quantization
Fuente:
arXiv
Salvato in:
| Autori principali: | Sanjeet, Sai, Colbert, Ian, Monteagudo-Lago, Pablo, Franco, Giuseppe, Umuroglu, Yaman, Fraser, Nicholas J. |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Improving Quantization with Post-Training Model Expansion
di: Franco, Giuseppe, et al.
Pubblicazione: (2025)
di: Franco, Giuseppe, et al.
Pubblicazione: (2025)
Accumulator-Aware Post-Training Quantization for Large Language Models
di: Colbert, Ian, et al.
Pubblicazione: (2024)
di: Colbert, Ian, et al.
Pubblicazione: (2024)
A2Q+: Improving Accumulator-Aware Weight Quantization
di: Colbert, Ian, et al.
Pubblicazione: (2024)
di: Colbert, Ian, et al.
Pubblicazione: (2024)
Qronos: Correcting the Past by Shaping the Future... in Post-Training Quantization
di: Zhang, Shihao, et al.
Pubblicazione: (2025)
di: Zhang, Shihao, et al.
Pubblicazione: (2025)
BiLLM: Pushing the Limit of Post-Training Quantization for LLMs
di: Huang, Wei, et al.
Pubblicazione: (2024)
di: Huang, Wei, et al.
Pubblicazione: (2024)
PTQ1.61: Push the Real Limit of Extremely Low-Bit Post-Training Quantization Methods for Large Language Models
di: Zhao, Jiaqi, et al.
Pubblicazione: (2025)
di: Zhao, Jiaqi, et al.
Pubblicazione: (2025)
Provable Post-Training Quantization: Theoretical Analysis of OPTQ and Qronos
di: Zhang, Haoyu, et al.
Pubblicazione: (2025)
di: Zhang, Haoyu, et al.
Pubblicazione: (2025)
Interactions Across Blocks in Post-Training Quantization of Large Language Models
di: Shabanovi, Khasmamad, et al.
Pubblicazione: (2024)
di: Shabanovi, Khasmamad, et al.
Pubblicazione: (2024)
OptRot: Mitigating Weight Outliers via Data-Free Rotations for Post-Training Quantization
di: Gadhikar, Advait, et al.
Pubblicazione: (2025)
di: Gadhikar, Advait, et al.
Pubblicazione: (2025)
Beacon: Post-Training Quantization with Integrated Grid Selection
di: Zhang, Shihao, et al.
Pubblicazione: (2025)
di: Zhang, Shihao, et al.
Pubblicazione: (2025)
Combining Reinforcement Learning and Behavior Trees for NPCs in Video Games with AMD Schola
di: Liu, Tian, et al.
Pubblicazione: (2025)
di: Liu, Tian, et al.
Pubblicazione: (2025)
A Quantized VAE-MLP Botnet Detection Model: A Systematic Evaluation of Quantization-Aware Training and Post-Training Quantization Strategies
di: Wasswa, Hassan, et al.
Pubblicazione: (2025)
di: Wasswa, Hassan, et al.
Pubblicazione: (2025)
Activation Sensitivity as a Unifying Principle for Post-Training Quantization
di: Xu, Bruce Changlong
Pubblicazione: (2026)
di: Xu, Bruce Changlong
Pubblicazione: (2026)
Post Training Quantization of Large Language Models with Microscaling Formats
di: Sharify, Sayeh, et al.
Pubblicazione: (2024)
di: Sharify, Sayeh, et al.
Pubblicazione: (2024)
Shedding the Bits: Pushing the Boundaries of Quantization with Minifloats on FPGAs
di: Aggarwal, Shivam, et al.
Pubblicazione: (2023)
di: Aggarwal, Shivam, et al.
Pubblicazione: (2023)
MegaScience: Pushing the Frontiers of Post-Training Datasets for Science Reasoning
di: Fan, Run-Ze, et al.
Pubblicazione: (2025)
di: Fan, Run-Ze, et al.
Pubblicazione: (2025)
SKIM: Any-bit Quantization Pushing The Limits of Post-Training Quantization
di: Bai, Runsheng, et al.
Pubblicazione: (2024)
di: Bai, Runsheng, et al.
Pubblicazione: (2024)
Achieving binary weight and activation for LLMs using Post-Training Quantization
di: Song, Siqing, et al.
Pubblicazione: (2025)
di: Song, Siqing, et al.
Pubblicazione: (2025)
PTQTP: Post-Training Quantization to Trit-Planes for Large Language Models
di: Xiao, He, et al.
Pubblicazione: (2025)
di: Xiao, He, et al.
Pubblicazione: (2025)
DAQ: Density-Aware Post-Training Weight-Only Quantization For LLMs
di: Luo, Yingsong, et al.
Pubblicazione: (2024)
di: Luo, Yingsong, et al.
Pubblicazione: (2024)
MagR: Weight Magnitude Reduction for Enhancing Post-Training Quantization
di: Zhang, Aozhong, et al.
Pubblicazione: (2024)
di: Zhang, Aozhong, et al.
Pubblicazione: (2024)
Towards Next-Level Post-Training Quantization of Hyper-Scale Transformers
di: Kim, Junhan, et al.
Pubblicazione: (2024)
di: Kim, Junhan, et al.
Pubblicazione: (2024)
DAQ: Delta-Aware Quantization for Post-Training LLM Weight Compression
di: Yu, Xiaoming, et al.
Pubblicazione: (2026)
di: Yu, Xiaoming, et al.
Pubblicazione: (2026)
Athena: Efficient Block-Wise Post-Training Quantization for Large Language Models Using Second-Order Matrix Derivative Information
di: Wang, Yanshu, et al.
Pubblicazione: (2024)
di: Wang, Yanshu, et al.
Pubblicazione: (2024)
Quamba: A Post-Training Quantization Recipe for Selective State Space Models
di: Chiang, Hung-Yueh, et al.
Pubblicazione: (2024)
di: Chiang, Hung-Yueh, et al.
Pubblicazione: (2024)
BWLA: Breaking the Barrier of W1AX Post-Training Quantization for LLMs
di: Zhao, Zhixiong, et al.
Pubblicazione: (2026)
di: Zhao, Zhixiong, et al.
Pubblicazione: (2026)
CrossQuant: A Post-Training Quantization Method with Smaller Quantization Kernel for Precise Large Language Model Compression
di: Liu, Wenyuan, et al.
Pubblicazione: (2024)
di: Liu, Wenyuan, et al.
Pubblicazione: (2024)
FlexRound: Learnable Rounding based on Element-wise Division for Post-Training Quantization
di: Lee, Jung Hyun, et al.
Pubblicazione: (2023)
di: Lee, Jung Hyun, et al.
Pubblicazione: (2023)
Exploring Layer-wise Information Effectiveness for Post-Training Quantization in Small Language Models
di: Xiao, He, et al.
Pubblicazione: (2025)
di: Xiao, He, et al.
Pubblicazione: (2025)
D$^2$Quant: Accurate Low-bit Post-Training Weight Quantization for LLMs
di: Yan, Xianglong, et al.
Pubblicazione: (2026)
di: Yan, Xianglong, et al.
Pubblicazione: (2026)
Astro: Activation-guided Structured Regularization for Outlier-Robust LLM Post-Training Quantization
di: Chen, Xi, et al.
Pubblicazione: (2026)
di: Chen, Xi, et al.
Pubblicazione: (2026)
RaanA: A Fast, Flexible, and Data-Efficient Post-Training Quantization Algorithm
di: Yang, Yongyi, et al.
Pubblicazione: (2025)
di: Yang, Yongyi, et al.
Pubblicazione: (2025)
Benchmarking Post-Training Quantization in LLMs: Comprehensive Taxonomy, Unified Evaluation, and Comparative Analysis
di: Zhao, Jiaqi, et al.
Pubblicazione: (2025)
di: Zhao, Jiaqi, et al.
Pubblicazione: (2025)
Post-Training Quantization of OpenPangu Models for Efficient Deployment on Atlas A2
di: Luo, Yilun, et al.
Pubblicazione: (2025)
di: Luo, Yilun, et al.
Pubblicazione: (2025)
The Unseen Frontier: Pushing the Limits of LLM Sparsity with Surrogate-Free ADMM
di: Lee, Kwanhee, et al.
Pubblicazione: (2025)
di: Lee, Kwanhee, et al.
Pubblicazione: (2025)
Pushing the Limits of Low-Bit Optimizers: A Focus on EMA Dynamics
di: Xu, Cong, et al.
Pubblicazione: (2025)
di: Xu, Cong, et al.
Pubblicazione: (2025)
MoBiE: Efficient Inference of Mixture of Binary Experts under Post-Training Quantization
di: Zhao, Zhixiong, et al.
Pubblicazione: (2026)
di: Zhao, Zhixiong, et al.
Pubblicazione: (2026)
DNN Memory Footprint Reduction via Post-Training Intra-Layer Multi-Precision Quantization
di: Ghavami, Behnam, et al.
Pubblicazione: (2024)
di: Ghavami, Behnam, et al.
Pubblicazione: (2024)
GPTQT: Quantize Large Language Models Twice to Push the Efficiency
di: Guo, Yipin, et al.
Pubblicazione: (2024)
di: Guo, Yipin, et al.
Pubblicazione: (2024)
Pushing Toward the Simplex Vertices: A Simple Remedy for Code Collapse in Smoothed Vector Quantization
di: Morita, Takashi
Pubblicazione: (2025)
di: Morita, Takashi
Pubblicazione: (2025)
Documenti analoghi
-
Improving Quantization with Post-Training Model Expansion
di: Franco, Giuseppe, et al.
Pubblicazione: (2025) -
Accumulator-Aware Post-Training Quantization for Large Language Models
di: Colbert, Ian, et al.
Pubblicazione: (2024) -
A2Q+: Improving Accumulator-Aware Weight Quantization
di: Colbert, Ian, et al.
Pubblicazione: (2024) -
Qronos: Correcting the Past by Shaping the Future... in Post-Training Quantization
di: Zhang, Shihao, et al.
Pubblicazione: (2025) -
BiLLM: Pushing the Limit of Post-Training Quantization for LLMs
di: Huang, Wei, et al.
Pubblicazione: (2024)