GPTAQ: Efficient Finetuning-Free Quantization for Asymmetric Calibration
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Yuhang, Yin, Ruokai, Lee, Donghyun, Xiao, Shiting, Panda, Priyadarshini |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Memba: Membrane-driven Parameter-Efficient Fine-Tuning for Mamba
par: Lee, Donghyun, et autres
Publié: (2025)
par: Lee, Donghyun, et autres
Publié: (2025)
DuoGPT: Training-free Dual Sparsity through Activation-aware Pruning in LLMs
par: Yin, Ruokai, et autres
Publié: (2025)
par: Yin, Ruokai, et autres
Publié: (2025)
Optimal Brain Decomposition for Accurate LLM Low-Rank Approximation
par: Li, Yuhang, et autres
Publié: (2026)
par: Li, Yuhang, et autres
Publié: (2026)
ReSpike: Residual Frames-based Hybrid Spiking Neural Networks for Efficient Action Recognition
par: Xiao, Shiting, et autres
Publié: (2024)
par: Xiao, Shiting, et autres
Publié: (2024)
TesseraQ: Ultra Low-Bit LLM Post-Training Quantization with Block Reconstruction
par: Li, Yuhang, et autres
Publié: (2024)
par: Li, Yuhang, et autres
Publié: (2024)
PacQ: A SIMT Microarchitecture for Efficient Dataflow in Hyper-asymmetric GEMMs
par: Yin, Ruokai, et autres
Publié: (2025)
par: Yin, Ruokai, et autres
Publié: (2025)
QuRL: Efficient Reinforcement Learning with Quantized Rollout
par: Li, Yuhang, et autres
Publié: (2026)
par: Li, Yuhang, et autres
Publié: (2026)
MD-SNN: Membrane Potential-aware Distillation on Quantized Spiking Neural Network
par: Lee, Donghyun, et autres
Publié: (2025)
par: Lee, Donghyun, et autres
Publié: (2025)
TT-SNN: Tensor Train Decomposition for Efficient Spiking Neural Network Training
par: Lee, Donghyun, et autres
Publié: (2024)
par: Lee, Donghyun, et autres
Publié: (2024)
Spiking Transformer with Spatial-Temporal Attention
par: Lee, Donghyun, et autres
Publié: (2024)
par: Lee, Donghyun, et autres
Publié: (2024)
OpenWorldSAM: Extending SAM2 for Universal Image Segmentation with Language Prompts
par: Xiao, Shiting, et autres
Publié: (2025)
par: Xiao, Shiting, et autres
Publié: (2025)
NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache
par: Son, Donghyun, et autres
Publié: (2025)
par: Son, Donghyun, et autres
Publié: (2025)
GenQ: Quantization in Low Data Regimes with Generative Synthetic Data
par: Li, Yuhang, et autres
Publié: (2023)
par: Li, Yuhang, et autres
Publié: (2023)
Do We Really Need a Large Number of Visual Prompts?
par: Kim, Youngeun, et autres
Publié: (2023)
par: Kim, Youngeun, et autres
Publié: (2023)
LoAS: Fully Temporal-Parallel Dataflow for Dual-Sparse Spiking Neural Networks
par: Yin, Ruokai, et autres
Publié: (2024)
par: Yin, Ruokai, et autres
Publié: (2024)
When In-memory Computing Meets Spiking Neural Networks -- A Perspective on Device-Circuit-System-and-Algorithm Co-design
par: Moitra, Abhishek, et autres
Publié: (2024)
par: Moitra, Abhishek, et autres
Publié: (2024)
ClipFormer: Key-Value Clipping of Transformers on Memristive Crossbars for Write Noise Mitigation
par: Bhattacharjee, Abhiroop, et autres
Publié: (2024)
par: Bhattacharjee, Abhiroop, et autres
Publié: (2024)
FF-INT8: Efficient Forward-Forward DNN Training on Edge Devices with INT8 Precision
par: Ma, Jingxiao, et autres
Publié: (2025)
par: Ma, Jingxiao, et autres
Publié: (2025)
How to Parameterize Asymmetric Quantization Ranges for Quantization-Aware Training
par: You, Jaeseong, et autres
Publié: (2024)
par: You, Jaeseong, et autres
Publié: (2024)
Accelerating Energy-Efficient Federated Learning in Cell-Free Networks with Adaptive Quantization
par: Mahmoudi, Afsaneh, et autres
Publié: (2024)
par: Mahmoudi, Afsaneh, et autres
Publié: (2024)
SpikePool: Event-driven Spiking Transformer with Pooling Attention
par: Lee, Donghyun, et autres
Publié: (2025)
par: Lee, Donghyun, et autres
Publié: (2025)
SINQ: Sinkhorn-Normalized Quantization for Calibration-Free Low-Precision LLM Weights
par: Müller, Lorenz K., et autres
Publié: (2025)
par: Müller, Lorenz K., et autres
Publié: (2025)
ModuLoRA: Finetuning 2-Bit LLMs on Consumer GPUs by Integrating with Modular Quantizers
par: Yin, Junjie, et autres
Publié: (2023)
par: Yin, Junjie, et autres
Publié: (2023)
FAQ: Mitigating Quantization Error via Regenerating Calibration Data with Family-Aware Quantization
par: Xiao, Haiyang, et autres
Publié: (2026)
par: Xiao, Haiyang, et autres
Publié: (2026)
FinLoRA: Finetuning Quantized Financial Large Language Models Using Low-Rank Adaptation
par: Wang, Dannong, et autres
Publié: (2024)
par: Wang, Dannong, et autres
Publié: (2024)
Workload-Balanced Pruning for Sparse Spiking Neural Networks
par: Yin, Ruokai, et autres
Publié: (2023)
par: Yin, Ruokai, et autres
Publié: (2023)
Accurate LoRA-Finetuning Quantization of LLMs via Information Retention
par: Qin, Haotong, et autres
Publié: (2024)
par: Qin, Haotong, et autres
Publié: (2024)
DiffAxE: Diffusion-driven Hardware Accelerator Generation and Design Space Exploration
par: Ghosh, Arkapravo, et autres
Publié: (2025)
par: Ghosh, Arkapravo, et autres
Publié: (2025)
LQ-LoRA: Low-rank Plus Quantized Matrix Decomposition for Efficient Language Model Finetuning
par: Guo, Han, et autres
Publié: (2023)
par: Guo, Han, et autres
Publié: (2023)
DartQuant: Efficient Rotational Distribution Calibration for LLM Quantization
par: Shao, Yuantian, et autres
Publié: (2025)
par: Shao, Yuantian, et autres
Publié: (2025)
The Finetuner's Fallacy: When to Pretrain with Your Finetuning Data
par: Baek, Christina, et autres
Publié: (2026)
par: Baek, Christina, et autres
Publié: (2026)
Calibration and Transformation-Free Weight-Only LLMs Quantization via Dynamic Grouping
par: Zheng, Xinzhe, et autres
Publié: (2025)
par: Zheng, Xinzhe, et autres
Publié: (2025)
KIVI: A Tuning-Free Asymmetric 2bit Quantization for KV Cache
par: Liu, Zirui, et autres
Publié: (2024)
par: Liu, Zirui, et autres
Publié: (2024)
ApiQ: Finetuning of 2-Bit Quantized Large Language Model
par: Liao, Baohao, et autres
Publié: (2024)
par: Liao, Baohao, et autres
Publié: (2024)
QCore: Data-Efficient, On-Device Continual Calibration for Quantized Models -- Extended Version
par: Campos, David, et autres
Publié: (2024)
par: Campos, David, et autres
Publié: (2024)
FASQ: Flexible Accelerated Subspace Quantization for Calibration-Free LLM Compression
par: Qiao, Ye, et autres
Publié: (2026)
par: Qiao, Ye, et autres
Publié: (2026)
Logits-Based Finetuning
par: Li, Jingyao, et autres
Publié: (2025)
par: Li, Jingyao, et autres
Publié: (2025)
Thinking Forward: Memory-Efficient Federated Finetuning of Language Models
par: Panchal, Kunjal, et autres
Publié: (2024)
par: Panchal, Kunjal, et autres
Publié: (2024)
MergeQuant: Accurate 4-bit Static Quantization of Large Language Models by Channel-wise Calibration
par: Wang, Jinguang, et autres
Publié: (2025)
par: Wang, Jinguang, et autres
Publié: (2025)
On the Importance of a Multi-Scale Calibration for Quantization
par: Son, Seungwoo, et autres
Publié: (2026)
par: Son, Seungwoo, et autres
Publié: (2026)
Documents similaires
-
Memba: Membrane-driven Parameter-Efficient Fine-Tuning for Mamba
par: Lee, Donghyun, et autres
Publié: (2025) -
DuoGPT: Training-free Dual Sparsity through Activation-aware Pruning in LLMs
par: Yin, Ruokai, et autres
Publié: (2025) -
Optimal Brain Decomposition for Accurate LLM Low-Rank Approximation
par: Li, Yuhang, et autres
Publié: (2026) -
ReSpike: Residual Frames-based Hybrid Spiking Neural Networks for Efficient Action Recognition
par: Xiao, Shiting, et autres
Publié: (2024) -
TesseraQ: Ultra Low-Bit LLM Post-Training Quantization with Block Reconstruction
par: Li, Yuhang, et autres
Publié: (2024)