On the Importance of a Multi-Scale Calibration for Quantization
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Son, Seungwoo, Seong, Ingyu, Kim, Junhan, Jang, Hyemi, Jeon, Yongkweon |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
LookaheadKV: Fast and Accurate KV Cache Eviction by Glimpsing into the Future without Generation
par: Ahn, Jinwoo, et autres
Publié: (2026)
par: Ahn, Jinwoo, et autres
Publié: (2026)
Two-Stage Grid Optimization for Group-wise Quantization of LLMs
par: Kim, Junhan, et autres
Publié: (2026)
par: Kim, Junhan, et autres
Publié: (2026)
TurboBoA: Faster and Exact Attention-aware Quantization without Backpropagation
par: Kim, Junhan, et autres
Publié: (2026)
par: Kim, Junhan, et autres
Publié: (2026)
Prefixing Attention Sinks can Mitigate Activation Outliers for Large Language Model Quantization
par: Son, Seungwoo, et autres
Publié: (2024)
par: Son, Seungwoo, et autres
Publié: (2024)
Towards Next-Level Post-Training Quantization of Hyper-Scale Transformers
par: Kim, Junhan, et autres
Publié: (2024)
par: Kim, Junhan, et autres
Publié: (2024)
BoA: Attention-aware Post-training Quantization without Backpropagation
par: Kim, Junhan, et autres
Publié: (2024)
par: Kim, Junhan, et autres
Publié: (2024)
L4Q: Parameter Efficient Quantization-Aware Fine-Tuning on Large Language Models
par: Jeon, Hyesung, et autres
Publié: (2024)
par: Jeon, Hyesung, et autres
Publié: (2024)
Entropy Meets Importance: A Unified Head Importance-Entropy Score for Stable and Efficient Transformer Pruning
par: Choi, Minsik, et autres
Publié: (2025)
par: Choi, Minsik, et autres
Publié: (2025)
CRIT: Graph-Based Automatic Data Synthesis to Enhance Cross-Modal Multi-Hop Reasoning
par: Sung, Junyoung, et autres
Publié: (2026)
par: Sung, Junyoung, et autres
Publié: (2026)
DartQuant: Efficient Rotational Distribution Calibration for LLM Quantization
par: Shao, Yuantian, et autres
Publié: (2025)
par: Shao, Yuantian, et autres
Publié: (2025)
OmniQuant: Omnidirectionally Calibrated Quantization for Large Language Models
par: Shao, Wenqi, et autres
Publié: (2023)
par: Shao, Wenqi, et autres
Publié: (2023)
OAC: Output-adaptive Calibration for Accurate Post-training Quantization
par: Edalati, Ali, et autres
Publié: (2024)
par: Edalati, Ali, et autres
Publié: (2024)
Scaling Laws For Mixed Quantization
par: Cao, Zeyu, et autres
Publié: (2024)
par: Cao, Zeyu, et autres
Publié: (2024)
BlockDialect: Block-wise Fine-grained Mixed Format Quantization for Energy-Efficient LLM Inference
par: Jang, Wonsuk, et autres
Publié: (2025)
par: Jang, Wonsuk, et autres
Publié: (2025)
Scaling Law for Quantization-Aware Training
par: Chen, Mengzhao, et autres
Publié: (2025)
par: Chen, Mengzhao, et autres
Publié: (2025)
Compression Scaling Laws:Unifying Sparsity and Quantization
par: Frantar, Elias, et autres
Publié: (2025)
par: Frantar, Elias, et autres
Publié: (2025)
Assigning Distinct Roles to Quantized and Low-Rank Matrices Toward Optimal Weight Decomposition
par: Cho, Yoonjun, et autres
Publié: (2025)
par: Cho, Yoonjun, et autres
Publié: (2025)
Low-Bit Quantization Favors Undertrained LLMs: Scaling Laws for Quantized LLMs with 100T Training Tokens
par: Ouyang, Xu, et autres
Publié: (2024)
par: Ouyang, Xu, et autres
Publié: (2024)
Multi-lingual Multi-institutional Electronic Health Record based Predictive Model
par: Hur, Kyunghoon, et autres
Publié: (2026)
par: Hur, Kyunghoon, et autres
Publié: (2026)
Scaling Laws for Post Training Quantized Large Language Models
par: Xu, Zifei, et autres
Publié: (2024)
par: Xu, Zifei, et autres
Publié: (2024)
Do MLLMs Capture How Interfaces Guide User Behavior? A Benchmark for Multimodal UI/UX Design Understanding
par: Jeon, Jaehyun, et autres
Publié: (2025)
par: Jeon, Jaehyun, et autres
Publié: (2025)
Mitigating Quantization Errors Due to Activation Spikes in GLU-Based LLMs
par: Yang, Jaewoo, et autres
Publié: (2024)
par: Yang, Jaewoo, et autres
Publié: (2024)
Outliers and Calibration Sets have Diminishing Effect on Quantization of Modern LLMs
par: Paglieri, Davide, et autres
Publié: (2024)
par: Paglieri, Davide, et autres
Publié: (2024)
Self-Refining Language Model Anonymizers via Adversarial Distillation
par: Kim, Kyuyoung, et autres
Publié: (2025)
par: Kim, Kyuyoung, et autres
Publié: (2025)
Calibrating Large Language Models Using Their Generations Only
par: Ulmer, Dennis, et autres
Publié: (2024)
par: Ulmer, Dennis, et autres
Publié: (2024)
Four Over Six: More Accurate NVFP4 Quantization with Adaptive Block Scaling
par: Cook, Jack, et autres
Publié: (2025)
par: Cook, Jack, et autres
Publié: (2025)
Not All Adapters Matter: Selective Adapter Freezing for Memory-Efficient Fine-Tuning of Language Models
par: Son, Hyegang, et autres
Publié: (2024)
par: Son, Hyegang, et autres
Publié: (2024)
Scaling Laws for Floating Point Quantization Training
par: Sun, Xingwu, et autres
Publié: (2025)
par: Sun, Xingwu, et autres
Publié: (2025)
SqueezeLLM: Dense-and-Sparse Quantization
par: Kim, Sehoon, et autres
Publié: (2023)
par: Kim, Sehoon, et autres
Publié: (2023)
MF-QAT: Multi-Format Quantization-Aware Training for Elastic Inference
par: Xu, Zifei, et autres
Publié: (2026)
par: Xu, Zifei, et autres
Publié: (2026)
RaZeR: Pushing the Limits of NVFP4 Quantization with Redundant Zero Remapping
par: Chen, Yuzong, et autres
Publié: (2025)
par: Chen, Yuzong, et autres
Publié: (2025)
Calibrating Language Models with Adaptive Temperature Scaling
par: Xie, Johnathan, et autres
Publié: (2024)
par: Xie, Johnathan, et autres
Publié: (2024)
Rebellious Student: Reversing Teacher Signals for Reasoning Exploration with Self-Distilled RLVR
par: Kim, Jeonghye, et autres
Publié: (2026)
par: Kim, Jeonghye, et autres
Publié: (2026)
Document Summarization with Conformal Importance Guarantees
par: Kuwahara, Bruce, et autres
Publié: (2025)
par: Kuwahara, Bruce, et autres
Publié: (2025)
Efficient Test-Time Scaling via Self-Calibration
par: Huang, Chengsong, et autres
Publié: (2025)
par: Huang, Chengsong, et autres
Publié: (2025)
MEME: Multi-entity & Evolving Memory Evaluation
par: Jung, Seokwon, et autres
Publié: (2026)
par: Jung, Seokwon, et autres
Publié: (2026)
Mitigating the Impact of Outlier Channels for Language Model Quantization with Activation Regularization
par: Nrusimha, Aniruddha, et autres
Publié: (2024)
par: Nrusimha, Aniruddha, et autres
Publié: (2024)
Fast KVzip: Efficient and Accurate LLM Inference with Gated KV Eviction
par: Kim, Jang-Hyun, et autres
Publié: (2026)
par: Kim, Jang-Hyun, et autres
Publié: (2026)
Two Heads Are Better Than One: Audio-Visual Speech Error Correction with Dual Hypotheses
par: Kim, Sungnyun, et autres
Publié: (2025)
par: Kim, Sungnyun, et autres
Publié: (2025)
Trained on Tokens, Calibrated on Concepts: The Emergence of Semantic Calibration in LLMs
par: Nakkiran, Preetum, et autres
Publié: (2025)
par: Nakkiran, Preetum, et autres
Publié: (2025)
Documents similaires
-
LookaheadKV: Fast and Accurate KV Cache Eviction by Glimpsing into the Future without Generation
par: Ahn, Jinwoo, et autres
Publié: (2026) -
Two-Stage Grid Optimization for Group-wise Quantization of LLMs
par: Kim, Junhan, et autres
Publié: (2026) -
TurboBoA: Faster and Exact Attention-aware Quantization without Backpropagation
par: Kim, Junhan, et autres
Publié: (2026) -
Prefixing Attention Sinks can Mitigate Activation Outliers for Large Language Model Quantization
par: Son, Seungwoo, et autres
Publié: (2024) -
Towards Next-Level Post-Training Quantization of Hyper-Scale Transformers
par: Kim, Junhan, et autres
Publié: (2024)