MUXQ: Mixed-to-Uniform Precision MatriX Quantization via Low-Rank Outlier Decomposition
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Lee, Seoungsub, Kim, In Seo, Kim, Seon Wook |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Assigning Distinct Roles to Quantized and Low-Rank Matrices Toward Optimal Weight Decomposition
par: Cho, Yoonjun, et autres
Publié: (2025)
par: Cho, Yoonjun, et autres
Publié: (2025)
OATS: Outlier-Aware Pruning Through Sparse and Low Rank Decomposition
par: Zhang, Stephen, et autres
Publié: (2024)
par: Zhang, Stephen, et autres
Publié: (2024)
Towards Scalable Handwriting Communication via EEG Decoding and Latent Embedding Integration
par: Kim, Jun-Young, et autres
Publié: (2024)
par: Kim, Jun-Young, et autres
Publié: (2024)
FedWSQ: Efficient Federated Learning with Weight Standardization and Distribution-Aware Non-Uniform Quantization
par: Kim, Seung-Wook, et autres
Publié: (2025)
par: Kim, Seung-Wook, et autres
Publié: (2025)
STaMP: Sequence Transformation and Mixed Precision for Low-Precision Activation Quantization
par: Federici, Marco, et autres
Publié: (2025)
par: Federici, Marco, et autres
Publié: (2025)
ODIM: Outlier Detection via Likelihood of Under-Fitted Generative Models
par: Kim, Dongha, et autres
Publié: (2023)
par: Kim, Dongha, et autres
Publié: (2023)
No Token Left Behind: Reliable KV Cache Compression via Importance-Aware Mixed Precision Quantization
par: Yang, June Yong, et autres
Publié: (2024)
par: Yang, June Yong, et autres
Publié: (2024)
LittleBit: Ultra Low-Bit Quantization via Latent Factorization
par: Lee, Banseok, et autres
Publié: (2025)
par: Lee, Banseok, et autres
Publié: (2025)
DMQ: Dissecting Outliers of Diffusion Models for Post-Training Quantization
par: Lee, Dongyeun, et autres
Publié: (2025)
par: Lee, Dongyeun, et autres
Publié: (2025)
Compressing Large Language Models using Low Rank and Low Precision Decomposition
par: Saha, Rajarshi, et autres
Publié: (2024)
par: Saha, Rajarshi, et autres
Publié: (2024)
LRQ: Optimizing Post-Training Quantization for Large Language Models by Learning Low-Rank Weight-Scaling Matrices
par: Lee, Jung Hyun, et autres
Publié: (2024)
par: Lee, Jung Hyun, et autres
Publié: (2024)
Preserve-Then-Quantize: Balancing Rank Budgets for Quantization Error Reconstruction in LLMs
par: Cho, Yoonjun, et autres
Publié: (2026)
par: Cho, Yoonjun, et autres
Publié: (2026)
Widening the Gap: Exploiting LLM Quantization via Outlier Injection
par: Zhan, Xiaohua, et autres
Publié: (2026)
par: Zhan, Xiaohua, et autres
Publié: (2026)
Mixed-Precision Quantization for Language Models: Techniques and Prospects
par: Rakka, Mariam, et autres
Publié: (2025)
par: Rakka, Mariam, et autres
Publié: (2025)
GlowQ: Group-Shared LOw-Rank Approximation for Quantized LLMs
par: An, Selim, et autres
Publié: (2026)
par: An, Selim, et autres
Publié: (2026)
APreQEL: Adaptive Mixed Precision Quantization For Edge LLMs
par: Bouzouad, Meriem, et autres
Publié: (2026)
par: Bouzouad, Meriem, et autres
Publié: (2026)
MicroMix: Efficient Mixed-Precision Quantization with Microscaling Formats for Large Language Models
par: Liu, Wenyuan, et autres
Publié: (2025)
par: Liu, Wenyuan, et autres
Publié: (2025)
AnyBCQ: Hardware Efficient Flexible Binary-Coded Quantization for Multi-Precision LLMs
par: Park, Gunho, et autres
Publié: (2025)
par: Park, Gunho, et autres
Publié: (2025)
Low-Rank Tensor Decompositions for the Theory of Neural Networks
par: Borsoi, Ricardo, et autres
Publié: (2025)
par: Borsoi, Ricardo, et autres
Publié: (2025)
Random Conditioning with Distillation for Data-Efficient Diffusion Model Compression
par: Kim, Dohyun, et autres
Publié: (2025)
par: Kim, Dohyun, et autres
Publié: (2025)
MixKVQ: Query-Aware Mixed-Precision KV Cache Quantization for Long-Context Reasoning
par: Zhang, Tao, et autres
Publié: (2025)
par: Zhang, Tao, et autres
Publié: (2025)
Decoupling General and Personalized Knowledge in Federated Learning via Additive and Low-Rank Decomposition
par: Wu, Xinghao, et autres
Publié: (2024)
par: Wu, Xinghao, et autres
Publié: (2024)
Parameter Efficient Mamba Tuning via Projector-targeted Diagonal-centric Linear Transformation
par: Ham, Seokil, et autres
Publié: (2024)
par: Ham, Seokil, et autres
Publié: (2024)
RAMP: Reinforcement Adaptive Mixed Precision Quantization for Efficient On Device LLM Inference
par: Gautam, Arpit Singh, et autres
Publié: (2026)
par: Gautam, Arpit Singh, et autres
Publié: (2026)
EdgeRazor: A Lightweight Framework for Large Language Models via Mixed-Precision Quantization-Aware Distillation
par: Zhang, Shu-Hao, et autres
Publié: (2026)
par: Zhang, Shu-Hao, et autres
Publié: (2026)
RILQ: Rank-Insensitive LoRA-based Quantization Error Compensation for Boosting 2-bit Large Language Model Accuracy
par: Lee, Geonho, et autres
Publié: (2024)
par: Lee, Geonho, et autres
Publié: (2024)
Low-Rank Quantization-Aware Training for LLMs
par: Bondarenko, Yelysei, et autres
Publié: (2024)
par: Bondarenko, Yelysei, et autres
Publié: (2024)
Scale When Needed: Adaptive Neuron-level Mixed Precision Quantization Aware Training
par: Varshney, Ayush K., et autres
Publié: (2026)
par: Varshney, Ayush K., et autres
Publié: (2026)
Activation Outliers in Transformer Quantization: Reproduction, Statistical Analysis, and Deployment Tradeoffs
par: Kaliaperumal, Pranav Kumar
Publié: (2026)
par: Kaliaperumal, Pranav Kumar
Publié: (2026)
GraLoRA: Granular Low-Rank Adaptation for Parameter-Efficient Fine-Tuning
par: Jung, Yeonjoon, et autres
Publié: (2025)
par: Jung, Yeonjoon, et autres
Publié: (2025)
Optimal Policy Sparsification and Low Rank Decomposition for Deep Reinforcement Learning
par: Goddla, Vikram
Publié: (2024)
par: Goddla, Vikram
Publié: (2024)
Two-Stage Grid Optimization for Group-wise Quantization of LLMs
par: Kim, Junhan, et autres
Publié: (2026)
par: Kim, Junhan, et autres
Publié: (2026)
Fast and Low-Cost Genomic Foundation Models via Outlier Removal
par: Luo, Haozheng, et autres
Publié: (2025)
par: Luo, Haozheng, et autres
Publié: (2025)
BoA: Attention-aware Post-training Quantization without Backpropagation
par: Kim, Junhan, et autres
Publié: (2024)
par: Kim, Junhan, et autres
Publié: (2024)
OSC: Hardware Efficient W4A4 Quantization via Outlier Separation in Channel Dimension
par: Zhang, Zhiyuan, et autres
Publié: (2026)
par: Zhang, Zhiyuan, et autres
Publié: (2026)
On-Chip Hardware-Aware Quantization for Mixed Precision Neural Networks
par: Huang, Wei, et autres
Publié: (2023)
par: Huang, Wei, et autres
Publié: (2023)
Towards Next-Level Post-Training Quantization of Hyper-Scale Transformers
par: Kim, Junhan, et autres
Publié: (2024)
par: Kim, Junhan, et autres
Publié: (2024)
Memory-Efficient Acceleration of Block Low-Rank Foundation Models on Resource Constrained GPUs
par: Abillama, Pierre, et autres
Publié: (2025)
par: Abillama, Pierre, et autres
Publié: (2025)
SpecQuant: Spectral Decomposition and Adaptive Truncation for Ultra-Low-Bit LLMs Quantization
par: Zhao, Zhixiong, et autres
Publié: (2025)
par: Zhao, Zhixiong, et autres
Publié: (2025)
Breaking the Blocks: Continuous Low-Rank Decomposed Scaling for Unified LLM Quantization and Adaptation
par: Tang, Pingzhi, et autres
Publié: (2026)
par: Tang, Pingzhi, et autres
Publié: (2026)
Documents similaires
-
Assigning Distinct Roles to Quantized and Low-Rank Matrices Toward Optimal Weight Decomposition
par: Cho, Yoonjun, et autres
Publié: (2025) -
OATS: Outlier-Aware Pruning Through Sparse and Low Rank Decomposition
par: Zhang, Stephen, et autres
Publié: (2024) -
Towards Scalable Handwriting Communication via EEG Decoding and Latent Embedding Integration
par: Kim, Jun-Young, et autres
Publié: (2024) -
FedWSQ: Efficient Federated Learning with Weight Standardization and Distribution-Aware Non-Uniform Quantization
par: Kim, Seung-Wook, et autres
Publié: (2025) -
STaMP: Sequence Transformation and Mixed Precision for Low-Precision Activation Quantization
par: Federici, Marco, et autres
Publié: (2025)