Outlier Smoothing with Closed-Form Rotations for W4A4 Large Language Model Quantization
Fuente:
arXiv
Salvato in:
| Autori principali: | Xiao, Jinying, Ji, Bin, Li, Shasha, Liu, Xiaodong, Jun, Ma, Wang, Chao, Li, Wei, Zhong, Ye, Xie, Xuan, Tashi, Nyima, Yu, Jie |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
EMP: Enhance Memory in Data Pruning
di: Xiao, Jinying, et al.
Pubblicazione: (2024)
di: Xiao, Jinying, et al.
Pubblicazione: (2024)
LSAQ: Layer-Specific Adaptive Quantization for Large Language Model Deployment
di: Zeng, Binrui, et al.
Pubblicazione: (2024)
di: Zeng, Binrui, et al.
Pubblicazione: (2024)
SageAttention2: Efficient Attention with Thorough Outlier Smoothing and Per-thread INT4 Quantization
di: Zhang, Jintao, et al.
Pubblicazione: (2024)
di: Zhang, Jintao, et al.
Pubblicazione: (2024)
OSC: Hardware Efficient W4A4 Quantization via Outlier Separation in Channel Dimension
di: Zhang, Zhiyuan, et al.
Pubblicazione: (2026)
di: Zhang, Zhiyuan, et al.
Pubblicazione: (2026)
Model Editing for LLMs4Code: How Far are We?
di: Li, Xiaopeng, et al.
Pubblicazione: (2024)
di: Li, Xiaopeng, et al.
Pubblicazione: (2024)
Context-Aware Dynamic Chunking for Streaming Tibetan Speech Recognition
di: Wang, Chao, et al.
Pubblicazione: (2025)
di: Wang, Chao, et al.
Pubblicazione: (2025)
RetrieveAll: A Multilingual Named Entity Recognition Framework with Large Language Models
di: Zhang, Jin, et al.
Pubblicazione: (2025)
di: Zhang, Jin, et al.
Pubblicazione: (2025)
TSCheater: Generating High-Quality Tibetan Adversarial Texts via Visual Similarity
di: Cao, Xi, et al.
Pubblicazione: (2024)
di: Cao, Xi, et al.
Pubblicazione: (2024)
Human-in-the-Loop Generation of Adversarial Texts: A Case Study on Tibetan Script
di: Cao, Xi, et al.
Pubblicazione: (2024)
di: Cao, Xi, et al.
Pubblicazione: (2024)
BATQuant: Outlier-resilient MXFP4 Quantization via Learnable Block-wise Optimization
di: Li, Ji-Fu, et al.
Pubblicazione: (2026)
di: Li, Ji-Fu, et al.
Pubblicazione: (2026)
Rotate, Clip, and Partition: Towards W2A4KV4 Quantization by Integrating Rotation and Learnable Non-uniform Quantizer
di: Choi, Euntae, et al.
Pubblicazione: (2025)
di: Choi, Euntae, et al.
Pubblicazione: (2025)
QuaRot: Outlier-Free 4-Bit Inference in Rotated LLMs
di: Ashkboos, Saleh, et al.
Pubblicazione: (2024)
di: Ashkboos, Saleh, et al.
Pubblicazione: (2024)
Outlier-Safe Pre-Training for Robust 4-Bit Quantization of Large Language Models
di: Park, Jungwoo, et al.
Pubblicazione: (2025)
di: Park, Jungwoo, et al.
Pubblicazione: (2025)
RotateKV: Accurate and Robust 2-Bit KV Cache Quantization for LLMs via Outlier-Aware Adaptive Rotations
di: Su, Zunhai, et al.
Pubblicazione: (2025)
di: Su, Zunhai, et al.
Pubblicazione: (2025)
TED: Accelerate Model Training by Internal Generalization
di: Xiao, Jinying, et al.
Pubblicazione: (2024)
di: Xiao, Jinying, et al.
Pubblicazione: (2024)
TFD: A Comprehensive Structured Tibetan Foundation Dataset for Low-Resource Language Processing and Large-Scale Modeling
di: Huang, Cheng, et al.
Pubblicazione: (2025)
di: Huang, Cheng, et al.
Pubblicazione: (2025)
Identifying Knowledge Editing Types in Large Language Models
di: Li, Xiaopeng, et al.
Pubblicazione: (2024)
di: Li, Xiaopeng, et al.
Pubblicazione: (2024)
When Modalities Remember: Continual Learning for Multimodal Knowledge Graphs
di: Li, Linyu, et al.
Pubblicazione: (2026)
di: Li, Linyu, et al.
Pubblicazione: (2026)
PrefixQuant: Eliminating Outliers by Prefixed Tokens for Large Language Models Quantization
di: Chen, Mengzhao, et al.
Pubblicazione: (2024)
di: Chen, Mengzhao, et al.
Pubblicazione: (2024)
Listening, Imagining & Refining: A Heuristic Optimized ASR Correction Framework with LLMs
di: Liu, Yutong, et al.
Pubblicazione: (2025)
di: Liu, Yutong, et al.
Pubblicazione: (2025)
SWEA: Updating Factual Knowledge in Large Language Models via Subject Word Embedding Altering
di: Li, Xiaopeng, et al.
Pubblicazione: (2024)
di: Li, Xiaopeng, et al.
Pubblicazione: (2024)
SmoothQuant: Accurate and Efficient Post-Training Quantization for Large Language Models
di: Xiao, Guangxuan, et al.
Pubblicazione: (2022)
di: Xiao, Guangxuan, et al.
Pubblicazione: (2022)
CodeQuant: Unified Clustering and Quantization for Enhanced Outlier Smoothing in Low-Precision Mixture-of-Experts
di: Yin, Xiangyang, et al.
Pubblicazione: (2026)
di: Yin, Xiangyang, et al.
Pubblicazione: (2026)
MASQuant: Modality-Aware Smoothing Quantization for Multimodal Large Language Models
di: Hu, Lulu, et al.
Pubblicazione: (2026)
di: Hu, Lulu, et al.
Pubblicazione: (2026)
Astro: Activation-guided Structured Regularization for Outlier-Robust LLM Post-Training Quantization
di: Chen, Xi, et al.
Pubblicazione: (2026)
di: Chen, Xi, et al.
Pubblicazione: (2026)
MILLION: Mastering Long-Context LLM Inference Via Outlier-Immunized KV Product Quantization
di: Wang, Zongwu, et al.
Pubblicazione: (2025)
di: Wang, Zongwu, et al.
Pubblicazione: (2025)
OptRot: Mitigating Weight Outliers via Data-Free Rotations for Post-Training Quantization
di: Gadhikar, Advait, et al.
Pubblicazione: (2025)
di: Gadhikar, Advait, et al.
Pubblicazione: (2025)
SVDQuant: Absorbing Outliers by Low-Rank Components for 4-Bit Diffusion Models
di: Li, Muyang, et al.
Pubblicazione: (2024)
di: Li, Muyang, et al.
Pubblicazione: (2024)
Accurate KV Cache Quantization with Outlier Tokens Tracing
di: Su, Yi, et al.
Pubblicazione: (2025)
di: Su, Yi, et al.
Pubblicazione: (2025)
DIM: Dynamic Integration of Multimodal Entity Linking with Large Language Model
di: Song, Shezheng, et al.
Pubblicazione: (2024)
di: Song, Shezheng, et al.
Pubblicazione: (2024)
SEVEN: Pruning Transformer Model by Reserving Sentinels
di: Xiao, Jinying, et al.
Pubblicazione: (2024)
di: Xiao, Jinying, et al.
Pubblicazione: (2024)
LNPT: Label-free Network Pruning and Training
di: Xiao, Jinying, et al.
Pubblicazione: (2024)
di: Xiao, Jinying, et al.
Pubblicazione: (2024)
QuantTune: Optimizing Model Quantization with Adaptive Outlier-Driven Fine Tuning
di: Chen, Jiun-Man, et al.
Pubblicazione: (2024)
di: Chen, Jiun-Man, et al.
Pubblicazione: (2024)
Glucocorticoid‐Induced Tumor Necrosis Factor Receptor Ligand: Correlation and Therapeutic Potential for Cognitive Impairment in Temporal Lobe Epilepsy
di: Man Li, et al.
Pubblicazione: (2026)
di: Man Li, et al.
Pubblicazione: (2026)
Rethinking Residual Distribution in Locate-then-Edit Model Editing
di: Li, Xiaopeng, et al.
Pubblicazione: (2025)
di: Li, Xiaopeng, et al.
Pubblicazione: (2025)
TLUE: A Tibetan Language Understanding Evaluation Benchmark
di: Gao, Fan, et al.
Pubblicazione: (2025)
di: Gao, Fan, et al.
Pubblicazione: (2025)
ASER: Activation Smoothing and Error Reconstruction for Large Language Model Quantization
di: Zhao, Weibo, et al.
Pubblicazione: (2024)
di: Zhao, Weibo, et al.
Pubblicazione: (2024)
EMSEdit: Efficient Multi-Step Meta-Learning-based Model Editing
di: Li, Xiaopeng, et al.
Pubblicazione: (2025)
di: Li, Xiaopeng, et al.
Pubblicazione: (2025)
RoLoRA: Fine-tuning Rotated Outlier-free LLMs for Effective Weight-Activation Quantization
di: Huang, Xijie, et al.
Pubblicazione: (2024)
di: Huang, Xijie, et al.
Pubblicazione: (2024)
Progressive Residual Extraction based Pre-training for Speech Representation Learning
di: Wang, Tianrui, et al.
Pubblicazione: (2024)
di: Wang, Tianrui, et al.
Pubblicazione: (2024)
Documenti analoghi
-
EMP: Enhance Memory in Data Pruning
di: Xiao, Jinying, et al.
Pubblicazione: (2024) -
LSAQ: Layer-Specific Adaptive Quantization for Large Language Model Deployment
di: Zeng, Binrui, et al.
Pubblicazione: (2024) -
SageAttention2: Efficient Attention with Thorough Outlier Smoothing and Per-thread INT4 Quantization
di: Zhang, Jintao, et al.
Pubblicazione: (2024) -
OSC: Hardware Efficient W4A4 Quantization via Outlier Separation in Channel Dimension
di: Zhang, Zhiyuan, et al.
Pubblicazione: (2026) -
Model Editing for LLMs4Code: How Far are We?
di: Li, Xiaopeng, et al.
Pubblicazione: (2024)