QERA: an Analytical Framework for Quantization Error Reconstruction
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Cheng, Wong, Jeffrey T. H., Xiao, Can, Constantinides, George A., Zhao, Yiren |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
LQER: Low-Rank Quantization Error Reconstruction for LLMs
par: Zhang, Cheng, et autres
Publié: (2024)
par: Zhang, Cheng, et autres
Publié: (2024)
A3 : an Analytical Low-Rank Approximation Framework for Attention
par: Wong, Jeffrey T. H., et autres
Publié: (2025)
par: Wong, Jeffrey T. H., et autres
Publié: (2025)
Revisiting Block-based Quantisation: What is Important for Sub-8-bit LLM Inference?
par: Zhang, Cheng, et autres
Publié: (2023)
par: Zhang, Cheng, et autres
Publié: (2023)
AMPLE: Event-Driven Accelerator for Mixed-Precision Inference of Graph Neural Networks
par: Gimenes, Pedro, et autres
Publié: (2025)
par: Gimenes, Pedro, et autres
Publié: (2025)
Optimised Grouped-Query Attention Mechanism for Transformers
par: Chen, Yuang, et autres
Publié: (2024)
par: Chen, Yuang, et autres
Publié: (2024)
Unlocking the Global Synergies in Low-Rank Adapters
par: Zhang, Zixi, et autres
Publié: (2024)
par: Zhang, Zixi, et autres
Publié: (2024)
NeuraLUT-Assemble: Hardware-aware Assembling of Sub-Neural Networks for Efficient LUT Inference
par: Andronic, Marta, et autres
Publié: (2025)
par: Andronic, Marta, et autres
Publié: (2025)
ARIES: Autonomous Reasoning with LLMs on Interactive Thought Graph Environments
par: Gimenes, Pedro, et autres
Publié: (2025)
par: Gimenes, Pedro, et autres
Publié: (2025)
On the Existence and Behavior of Secondary Attention Sinks
par: Wong, Jeffrey T. H., et autres
Publié: (2025)
par: Wong, Jeffrey T. H., et autres
Publié: (2025)
Scaling Laws For Mixed Quantization
par: Cao, Zeyu, et autres
Publié: (2024)
par: Cao, Zeyu, et autres
Publié: (2024)
NeuraLUT: Hiding Neural Network Density in Boolean Synthesizable Functions
par: Andronic, Marta, et autres
Publié: (2024)
par: Andronic, Marta, et autres
Publié: (2024)
PolyLUT: Learning Piecewise Polynomials for Ultra-Low Latency FPGA LUT-based Inference
par: Andronic, Marta, et autres
Publié: (2023)
par: Andronic, Marta, et autres
Publié: (2023)
Quantamination: Dynamic Quantization Leaks Your Data Across the Batch
par: Foerster, Hanna, et autres
Publié: (2026)
par: Foerster, Hanna, et autres
Publié: (2026)
Preserve-Then-Quantize: Balancing Rank Budgets for Quantization Error Reconstruction in LLMs
par: Cho, Yoonjun, et autres
Publié: (2026)
par: Cho, Yoonjun, et autres
Publié: (2026)
ASER: Activation Smoothing and Error Reconstruction for Large Language Model Quantization
par: Zhao, Weibo, et autres
Publié: (2024)
par: Zhao, Weibo, et autres
Publié: (2024)
TriAxialKV: Toward Extreme Low-Precision KV-Cache Quantization for Agentic Inference Tasks
par: Shen, Hanzhang, et autres
Publié: (2026)
par: Shen, Hanzhang, et autres
Publié: (2026)
Direction-Preserving Number Representations
par: Zadeh, Bardia, et autres
Publié: (2026)
par: Zadeh, Bardia, et autres
Publié: (2026)
SERQ: Saliency-Aware Low-Rank Error Reconstruction for LLM Quantization
par: Park, Yeonsik, et autres
Publié: (2026)
par: Park, Yeonsik, et autres
Publié: (2026)
PolyLUT: Ultra-low Latency Polynomial Inference with Hardware-Aware Structured Pruning
par: Andronic, Marta, et autres
Publié: (2025)
par: Andronic, Marta, et autres
Publié: (2025)
Convergence for Discrete Parameter Update Schemes
par: Wilson, Paul, et autres
Publié: (2025)
par: Wilson, Paul, et autres
Publié: (2025)
FAQ: Mitigating Quantization Error via Regenerating Calibration Data with Family-Aware Quantization
par: Xiao, Haiyang, et autres
Publié: (2026)
par: Xiao, Haiyang, et autres
Publié: (2026)
ATHEENA: A Toolflow for Hardware Early-Exit Network Automation
par: Biggs, Benjamin, et autres
Publié: (2023)
par: Biggs, Benjamin, et autres
Publié: (2023)
Exploring FPGA designs for MX and beyond
par: Samson, Ebby, et autres
Publié: (2024)
par: Samson, Ebby, et autres
Publié: (2024)
ReducedLUT: Table Decomposition with "Don't Care" Conditions
par: Cassidy, Oliver, et autres
Publié: (2024)
par: Cassidy, Oliver, et autres
Publié: (2024)
Training with Fewer Bits: Unlocking Edge LLMs Training with Stochastic Rounding
par: Liu, Taowen, et autres
Publié: (2025)
par: Liu, Taowen, et autres
Publié: (2025)
Hardware and Software Platform Inference
par: Zhang, Cheng, et autres
Publié: (2024)
par: Zhang, Cheng, et autres
Publié: (2024)
Deep Kernel Fusion for Transformers
par: Zhang, Zixi, et autres
Publié: (2026)
par: Zhang, Zixi, et autres
Publié: (2026)
Rethinking Residual Errors in Compensation-based LLM Quantization
par: Li, Shuaiting, et autres
Publié: (2026)
par: Li, Shuaiting, et autres
Publié: (2026)
The Fourth State: Signed-Zero Ternary for Stable LLM Quantization (and More)
par: Uhlmann, Jeffrey
Publié: (2025)
par: Uhlmann, Jeffrey
Publié: (2025)
Quantization Error Propagation: Revisiting Layer-Wise Post-Training Quantization
par: Arai, Yamato, et autres
Publié: (2025)
par: Arai, Yamato, et autres
Publié: (2025)
SOAR: Scale Optimization for Accurate Reconstruction in NVFP4 Quantization
par: Bao, Chengzhu, et autres
Publié: (2026)
par: Bao, Chengzhu, et autres
Publié: (2026)
Predicting Probabilities of Error to Combine Quantization and Early Exiting: QuEE
par: Regol, Florence, et autres
Publié: (2024)
par: Regol, Florence, et autres
Publié: (2024)
The Exploration of Error Bounds in Classification with Noisy Labels
par: Liu, Haixia, et autres
Publié: (2025)
par: Liu, Haixia, et autres
Publié: (2025)
Dissecting Quantization Error: A Concentration-Alignment Perspective
par: Federici, Marco, et autres
Publié: (2026)
par: Federici, Marco, et autres
Publié: (2026)
Pseudo-Quantized Actor-Critic Algorithm for Robustness to Noisy Temporal Difference Error
par: Kobayashi, Taisuke
Publié: (2026)
par: Kobayashi, Taisuke
Publié: (2026)
OJBKQ: Objective-Joint Babai-Klein Quantization
par: Wang, Xinyu, et autres
Publié: (2026)
par: Wang, Xinyu, et autres
Publié: (2026)
BiSup: Bidirectional Quantization Error Suppression for Large Language Models
par: Zou, Minghui, et autres
Publié: (2024)
par: Zou, Minghui, et autres
Publié: (2024)
Unveiling the Potential of Quantization with MXFP4: Strategies for Quantization Error Reduction
par: Chhugani, Jatin, et autres
Publié: (2026)
par: Chhugani, Jatin, et autres
Publié: (2026)
Runtime-Certified Bounded-Error Quantized Attention
par: Calver, Dean
Publié: (2026)
par: Calver, Dean
Publié: (2026)
Error Diffusion: Post Training Quantization with Block-Scaled Number Formats for Neural Networks
par: Khodamoradi, Alireza, et autres
Publié: (2024)
par: Khodamoradi, Alireza, et autres
Publié: (2024)
Documents similaires
-
LQER: Low-Rank Quantization Error Reconstruction for LLMs
par: Zhang, Cheng, et autres
Publié: (2024) -
A3 : an Analytical Low-Rank Approximation Framework for Attention
par: Wong, Jeffrey T. H., et autres
Publié: (2025) -
Revisiting Block-based Quantisation: What is Important for Sub-8-bit LLM Inference?
par: Zhang, Cheng, et autres
Publié: (2023) -
AMPLE: Event-Driven Accelerator for Mixed-Precision Inference of Graph Neural Networks
par: Gimenes, Pedro, et autres
Publié: (2025) -
Optimised Grouped-Query Attention Mechanism for Transformers
par: Chen, Yuang, et autres
Publié: (2024)