Dissecting Quantization Error: A Concentration-Alignment Perspective
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Federici, Marco, van Breugel, Boris, Whatmough, Paul, Nagel, Markus |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
STaMP: Sequence Transformation and Mixed Precision for Low-Precision Activation Quantization
par: Federici, Marco, et autres
Publié: (2025)
par: Federici, Marco, et autres
Publié: (2025)
HadaNorm: Diffusion Transformer Quantization through Mean-Centered Transformations
par: Federici, Marco, et autres
Publié: (2025)
par: Federici, Marco, et autres
Publié: (2025)
FPTQuant: Function-Preserving Transforms for LLM Quantization
par: van Breugel, Boris, et autres
Publié: (2025)
par: van Breugel, Boris, et autres
Publié: (2025)
Mixture of Cache-Conditional Experts for Efficient Mobile Device Inference
par: Skliar, Andrii, et autres
Publié: (2024)
par: Skliar, Andrii, et autres
Publié: (2024)
Curated LLM: Synergy of LLMs and Data Curation for tabular augmentation in low-data regimes
par: Seedat, Nabeel, et autres
Publié: (2023)
par: Seedat, Nabeel, et autres
Publié: (2023)
Leech Lattice Vector Quantization for Efficient LLM Compression
par: van der Ouderaa, Tycho F. A., et autres
Publié: (2026)
par: van der Ouderaa, Tycho F. A., et autres
Publié: (2026)
Low-Rank Quantization-Aware Training for LLMs
par: Bondarenko, Yelysei, et autres
Publié: (2024)
par: Bondarenko, Yelysei, et autres
Publié: (2024)
Bridge the Inference Gaps of Neural Processes via Expectation Maximization
par: Wang, Qi, et autres
Publié: (2025)
par: Wang, Qi, et autres
Publié: (2025)
Efficient LLM Inference using Dynamic Input Pruning and Cache-Aware Masking
par: Federici, Marco, et autres
Publié: (2024)
par: Federici, Marco, et autres
Publié: (2024)
Sparse High Rank Adapters
par: Bhardwaj, Kartikeya, et autres
Publié: (2024)
par: Bhardwaj, Kartikeya, et autres
Publié: (2024)
Preserve-Then-Quantize: Balancing Rank Budgets for Quantization Error Reconstruction in LLMs
par: Cho, Yoonjun, et autres
Publié: (2026)
par: Cho, Yoonjun, et autres
Publié: (2026)
Preference Learning for AI Alignment: a Causal Perspective
par: Kobalczyk, Katarzyna, et autres
Publié: (2025)
par: Kobalczyk, Katarzyna, et autres
Publié: (2025)
FAQ: Mitigating Quantization Error via Regenerating Calibration Data with Family-Aware Quantization
par: Xiao, Haiyang, et autres
Publié: (2026)
par: Xiao, Haiyang, et autres
Publié: (2026)
Latent Representation and Simulation of Markov Processes via Time-Lagged Information Bottleneck
par: Federici, Marco, et autres
Publié: (2023)
par: Federici, Marco, et autres
Publié: (2023)
How to Parameterize Asymmetric Quantization Ranges for Quantization-Aware Training
par: You, Jaeseong, et autres
Publié: (2024)
par: You, Jaeseong, et autres
Publié: (2024)
Dissecting Transformers: A CLEAR Perspective towards Green AI
par: Jain, Hemang, et autres
Publié: (2025)
par: Jain, Hemang, et autres
Publié: (2025)
ASER: Activation Smoothing and Error Reconstruction for Large Language Model Quantization
par: Zhao, Weibo, et autres
Publié: (2024)
par: Zhao, Weibo, et autres
Publié: (2024)
GPTVQ: The Blessing of Dimensionality for LLM Quantization
par: van Baalen, Mart, et autres
Publié: (2024)
par: van Baalen, Mart, et autres
Publié: (2024)
DMQ: Dissecting Outliers of Diffusion Models for Post-Training Quantization
par: Lee, Dongyeun, et autres
Publié: (2025)
par: Lee, Dongyeun, et autres
Publié: (2025)
Runtime-Certified Bounded-Error Quantized Attention
par: Calver, Dean
Publié: (2026)
par: Calver, Dean
Publié: (2026)
Unveiling the Potential of Quantization with MXFP4: Strategies for Quantization Error Reduction
par: Chhugani, Jatin, et autres
Publié: (2026)
par: Chhugani, Jatin, et autres
Publié: (2026)
Search-Optimized Quantization in Biomedical Ontology Alignment
par: Bouaggad, Oussama, et autres
Publié: (2025)
par: Bouaggad, Oussama, et autres
Publié: (2025)
A Probabilistic Perspective on Unlearning and Alignment for Large Language Models
par: Scholten, Yan, et autres
Publié: (2024)
par: Scholten, Yan, et autres
Publié: (2024)
Reward Shaping for Inference-Time Alignment: A Stackelberg Game Perspective
par: Wang, Haichuan, et autres
Publié: (2026)
par: Wang, Haichuan, et autres
Publié: (2026)
The Alignment Problem from a Deep Learning Perspective
par: Ngo, Richard, et autres
Publié: (2022)
par: Ngo, Richard, et autres
Publié: (2022)
FP8-Flow-MoE: A Casting-Free FP8 Recipe without Double Quantization Error
par: Wang, Fengjuan, et autres
Publié: (2025)
par: Wang, Fengjuan, et autres
Publié: (2025)
Dissecting the Failure of Invariant Learning on Graphs
par: Wang, Qixun, et autres
Publié: (2024)
par: Wang, Qixun, et autres
Publié: (2024)
The Viscosity of Logic: Phase Transitions and Hysteresis in DPO Alignment
par: Pollanen, Marco
Publié: (2026)
par: Pollanen, Marco
Publié: (2026)
Error Analysis of Shapley Value-Based Model Explanations: An Informative Perspective
par: Zhao, Ningsheng, et autres
Publié: (2024)
par: Zhao, Ningsheng, et autres
Publié: (2024)
BiSup: Bidirectional Quantization Error Suppression for Large Language Models
par: Zou, Minghui, et autres
Publié: (2024)
par: Zou, Minghui, et autres
Publié: (2024)
Unifying Perplexing Behaviors in Modified BP Attributions through Alignment Perspective
par: Zheng, Guanhua, et autres
Publié: (2025)
par: Zheng, Guanhua, et autres
Publié: (2025)
RILQ: Rank-Insensitive LoRA-based Quantization Error Compensation for Boosting 2-bit Large Language Model Accuracy
par: Lee, Geonho, et autres
Publié: (2024)
par: Lee, Geonho, et autres
Publié: (2024)
Enhancing Delta Compression in LLMs via SVD-based Quantization Error Minimization
par: Xiong, Boya, et autres
Publié: (2025)
par: Xiong, Boya, et autres
Publié: (2025)
Rethinking the Sampling Criteria in Reinforcement Learning for LLM Reasoning: A Competence-Difficulty Alignment Perspective
par: Kong, Deyang, et autres
Publié: (2025)
par: Kong, Deyang, et autres
Publié: (2025)
Dissecting Distribution Inference
par: Suri, Anshuman, et autres
Publié: (2022)
par: Suri, Anshuman, et autres
Publié: (2022)
A Quantized VAE-MLP Botnet Detection Model: A Systematic Evaluation of Quantization-Aware Training and Post-Training Quantization Strategies
par: Wasswa, Hassan, et autres
Publié: (2025)
par: Wasswa, Hassan, et autres
Publié: (2025)
Dissecting Discrete Soft Actor-Critic: Limitations and Principled Alternatives
par: Asad, Reza, et autres
Publié: (2025)
par: Asad, Reza, et autres
Publié: (2025)
Beyond the Norms: Detecting Prediction Errors in Regression Models
par: Altieri, Andres, et autres
Publié: (2024)
par: Altieri, Andres, et autres
Publié: (2024)
LLM Probability Concentration: How Alignment Shrinks the Generative Horizon
par: Yang, Chenghao, et autres
Publié: (2025)
par: Yang, Chenghao, et autres
Publié: (2025)
An Efficient Sparse Fine-Tuning with Low Quantization Error via Neural Network Pruning
par: Li, Cen-Jhih, et autres
Publié: (2025)
par: Li, Cen-Jhih, et autres
Publié: (2025)
Documents similaires
-
STaMP: Sequence Transformation and Mixed Precision for Low-Precision Activation Quantization
par: Federici, Marco, et autres
Publié: (2025) -
HadaNorm: Diffusion Transformer Quantization through Mean-Centered Transformations
par: Federici, Marco, et autres
Publié: (2025) -
FPTQuant: Function-Preserving Transforms for LLM Quantization
par: van Breugel, Boris, et autres
Publié: (2025) -
Mixture of Cache-Conditional Experts for Efficient Mobile Device Inference
par: Skliar, Andrii, et autres
Publié: (2024) -
Curated LLM: Synergy of LLMs and Data Curation for tabular augmentation in low-data regimes
par: Seedat, Nabeel, et autres
Publié: (2023)