APreQEL: Adaptive Mixed Precision Quantization For Edge LLMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Bouzouad, Meriem, Chang, Yuan-Hao, Boukhobza, Jalil |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
UniQL: Unified Quantization and Low-rank Compression for Adaptive Edge LLMs
par: Chiang, Hung-Yueh, et autres
Publié: (2025)
par: Chiang, Hung-Yueh, et autres
Publié: (2025)
EdgeRazor: A Lightweight Framework for Large Language Models via Mixed-Precision Quantization-Aware Distillation
par: Zhang, Shu-Hao, et autres
Publié: (2026)
par: Zhang, Shu-Hao, et autres
Publié: (2026)
RAMP: Reinforcement Adaptive Mixed Precision Quantization for Efficient On Device LLM Inference
par: Gautam, Arpit Singh, et autres
Publié: (2026)
par: Gautam, Arpit Singh, et autres
Publié: (2026)
Scale When Needed: Adaptive Neuron-level Mixed Precision Quantization Aware Training
par: Varshney, Ayush K., et autres
Publié: (2026)
par: Varshney, Ayush K., et autres
Publié: (2026)
MixKVQ: Query-Aware Mixed-Precision KV Cache Quantization for Long-Context Reasoning
par: Zhang, Tao, et autres
Publié: (2025)
par: Zhang, Tao, et autres
Publié: (2025)
Mixed-Precision Quantization for Language Models: Techniques and Prospects
par: Rakka, Mariam, et autres
Publié: (2025)
par: Rakka, Mariam, et autres
Publié: (2025)
STaMP: Sequence Transformation and Mixed Precision for Low-Precision Activation Quantization
par: Federici, Marco, et autres
Publié: (2025)
par: Federici, Marco, et autres
Publié: (2025)
MicroMix: Efficient Mixed-Precision Quantization with Microscaling Formats for Large Language Models
par: Liu, Wenyuan, et autres
Publié: (2025)
par: Liu, Wenyuan, et autres
Publié: (2025)
Efficient Edge LLMs Deployment via HessianAware Quantization and CPU GPU Collaborative
par: Zhang, Tuo, et autres
Publié: (2025)
par: Zhang, Tuo, et autres
Publié: (2025)
APTQ: Attention-aware Post-Training Mixed-Precision Quantization for Large Language Models
par: Guan, Ziyi, et autres
Publié: (2024)
par: Guan, Ziyi, et autres
Publié: (2024)
On-Chip Hardware-Aware Quantization for Mixed Precision Neural Networks
par: Huang, Wei, et autres
Publié: (2023)
par: Huang, Wei, et autres
Publié: (2023)
Mixed-Precision Federated Learning via Multi-Precision Over-The-Air Aggregation
par: Yuan, Jinsheng, et autres
Publié: (2024)
par: Yuan, Jinsheng, et autres
Publié: (2024)
MUXQ: Mixed-to-Uniform Precision MatriX Quantization via Low-Rank Outlier Decomposition
par: Lee, Seoungsub, et autres
Publié: (2026)
par: Lee, Seoungsub, et autres
Publié: (2026)
AnyBCQ: Hardware Efficient Flexible Binary-Coded Quantization for Multi-Precision LLMs
par: Park, Gunho, et autres
Publié: (2025)
par: Park, Gunho, et autres
Publié: (2025)
A KL Lens on Quantization: Fast, Forward-Only Sensitivity for Mixed-Precision SSM-Transformer Models
par: Kong, Jason, et autres
Publié: (2026)
par: Kong, Jason, et autres
Publié: (2026)
No Token Left Behind: Reliable KV Cache Compression via Importance-Aware Mixed Precision Quantization
par: Yang, June Yong, et autres
Publié: (2024)
par: Yang, June Yong, et autres
Publié: (2024)
ScaleBITS: Scalable Bitwidth Search for Hardware-Aligned Mixed-Precision LLMs
par: Li, Xinlin, et autres
Publié: (2026)
par: Li, Xinlin, et autres
Publié: (2026)
Edge-FIT: Federated Instruction Tuning of Quantized LLMs for Privacy-Preserving Smart Home Environments
par: Venkatesh, Vinay, et autres
Publié: (2025)
par: Venkatesh, Vinay, et autres
Publié: (2025)
Agile-Quant: Activation-Guided Quantization for Faster Inference of LLMs on the Edge
par: Shen, Xuan, et autres
Publié: (2023)
par: Shen, Xuan, et autres
Publié: (2023)
Intrinsic Structure as a Proxy for Saliency: SVD-Based Weight Preservation for Mixed-Precision Quantization in Large Language Models
par: Landge, Shashank, et autres
Publié: (2025)
par: Landge, Shashank, et autres
Publié: (2025)
SpecQuant: Spectral Decomposition and Adaptive Truncation for Ultra-Low-Bit LLMs Quantization
par: Zhao, Zhixiong, et autres
Publié: (2025)
par: Zhao, Zhixiong, et autres
Publié: (2025)
KVTuner: Sensitivity-Aware Layer-Wise Mixed-Precision KV Cache Quantization for Efficient and Nearly Lossless LLM Inference
par: Li, Xing, et autres
Publié: (2025)
par: Li, Xing, et autres
Publié: (2025)
Quantizing Text-attributed Graphs for Semantic-Structural Integration
par: Bo, Jianyuan, et autres
Publié: (2025)
par: Bo, Jianyuan, et autres
Publié: (2025)
Preserve-Then-Quantize: Balancing Rank Budgets for Quantization Error Reconstruction in LLMs
par: Cho, Yoonjun, et autres
Publié: (2026)
par: Cho, Yoonjun, et autres
Publié: (2026)
MoBiQuant: Mixture-of-Bits Quantization for Token-Adaptive Any-Precision LLM
par: Wang, Dongwei, et autres
Publié: (2026)
par: Wang, Dongwei, et autres
Publié: (2026)
MxMoE: Mixed-precision Quantization for MoE with Accuracy and Performance Co-Design
par: Duanmu, Haojie, et autres
Publié: (2025)
par: Duanmu, Haojie, et autres
Publié: (2025)
End-to-End On-Device Quantization-Aware Training for LLMs at Inference Cost
par: Tan, Qitao, et autres
Publié: (2025)
par: Tan, Qitao, et autres
Publié: (2025)
AMAQ: Adaptive Mixed-bit Activation Quantization for Collaborative Parameter Efficient Fine-tuning
par: Song, Yurun, et autres
Publié: (2025)
par: Song, Yurun, et autres
Publié: (2025)
CrossQuant: A Post-Training Quantization Method with Smaller Quantization Kernel for Precise Large Language Model Compression
par: Liu, Wenyuan, et autres
Publié: (2024)
par: Liu, Wenyuan, et autres
Publié: (2024)
AIS: Adaptive Importance Sampling for Quantized RL
par: Zhou, Jiajun, et autres
Publié: (2026)
par: Zhou, Jiajun, et autres
Publié: (2026)
RotateKV: Accurate and Robust 2-Bit KV Cache Quantization for LLMs via Outlier-Aware Adaptive Rotations
par: Su, Zunhai, et autres
Publié: (2025)
par: Su, Zunhai, et autres
Publié: (2025)
Quantized Evolution Strategies: High-precision Fine-tuning of Quantized LLMs at Low-precision Cost
par: Xu, Yinggan, et autres
Publié: (2026)
par: Xu, Yinggan, et autres
Publié: (2026)
On-the-Fly Adaptation to Quantization: Configuration-Aware LoRA for Efficient Fine-Tuning of Quantized LLMs
par: Ye, Rongguang, et autres
Publié: (2025)
par: Ye, Rongguang, et autres
Publié: (2025)
From LLMs to Edge: Parameter-Efficient Fine-Tuning on Edge Devices
par: Slamanig, Georg, et autres
Publié: (2025)
par: Slamanig, Georg, et autres
Publié: (2025)
GANQ: GPU-Adaptive Non-Uniform Quantization for Large Language Models
par: Zhao, Pengxiang, et autres
Publié: (2025)
par: Zhao, Pengxiang, et autres
Publié: (2025)
Dynamic DropConnect: Enhancing Neural Network Robustness through Adaptive Edge Dropping Strategies
par: Yang, Yuan-Chih, et autres
Publié: (2025)
par: Yang, Yuan-Chih, et autres
Publié: (2025)
A Metric Driven Approach to Mixed Precision Training
par: Rasquinha, Mitchelle, et autres
Publié: (2024)
par: Rasquinha, Mitchelle, et autres
Publié: (2024)
MoR: Mixture Of Representations For Mixed-Precision Training
par: Su, Bor-Yiing, et autres
Publié: (2025)
par: Su, Bor-Yiing, et autres
Publié: (2025)
QUAIL: Quantization Aware Unlearning for Mitigating Misinformation in LLMs
par: Mishra, Himanshu, et autres
Publié: (2026)
par: Mishra, Himanshu, et autres
Publié: (2026)
Tagged for Direction: Pinning Down Causal Edge Directions with Precision
par: Busch, Florian Peter, et autres
Publié: (2025)
par: Busch, Florian Peter, et autres
Publié: (2025)
Documents similaires
-
UniQL: Unified Quantization and Low-rank Compression for Adaptive Edge LLMs
par: Chiang, Hung-Yueh, et autres
Publié: (2025) -
EdgeRazor: A Lightweight Framework for Large Language Models via Mixed-Precision Quantization-Aware Distillation
par: Zhang, Shu-Hao, et autres
Publié: (2026) -
RAMP: Reinforcement Adaptive Mixed Precision Quantization for Efficient On Device LLM Inference
par: Gautam, Arpit Singh, et autres
Publié: (2026) -
Scale When Needed: Adaptive Neuron-level Mixed Precision Quantization Aware Training
par: Varshney, Ayush K., et autres
Publié: (2026) -
MixKVQ: Query-Aware Mixed-Precision KV Cache Quantization for Long-Context Reasoning
par: Zhang, Tao, et autres
Publié: (2025)