LLMEasyQuant: Scalable Quantization for Parallel and Distributed LLM Inference
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liu, Dong, Yu, Yanxuan |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
DartQuant: Efficient Rotational Distribution Calibration for LLM Quantization
par: Shao, Yuantian, et autres
Publié: (2025)
par: Shao, Yuantian, et autres
Publié: (2025)
InfoQuant: Shaping Activation Distributions for Low-Bit LLM Quantization
par: Li, Ke, et autres
Publié: (2026)
par: Li, Ke, et autres
Publié: (2026)
FlatQuant: Flatness Matters for LLM Quantization
par: Sun, Yuxuan, et autres
Publié: (2024)
par: Sun, Yuxuan, et autres
Publié: (2024)
MT2ST: Adaptive Multi-Task to Single-Task Learning
par: Liu, Dong, et autres
Publié: (2024)
par: Liu, Dong, et autres
Publié: (2024)
Efficient Graph Optimization via Distance-Aware Graph Representation Learning
par: Liu, Dong, et autres
Publié: (2024)
par: Liu, Dong, et autres
Publié: (2024)
SigmaQuant: Hardware-Aware Heterogeneous Quantization Method for Edge DNN Inference
par: Liu, Qunyou, et autres
Publié: (2026)
par: Liu, Qunyou, et autres
Publié: (2026)
Agile-Quant: Activation-Guided Quantization for Faster Inference of LLMs on the Edge
par: Shen, Xuan, et autres
Publié: (2023)
par: Shen, Xuan, et autres
Publié: (2023)
Accelerating Frequency Domain Diffusion Models with Error-Feedback Event-Driven Caching
par: Liu, Dong, et autres
Publié: (2026)
par: Liu, Dong, et autres
Publié: (2026)
LeanQuant: Accurate and Scalable Large Language Model Quantization with Loss-error-aware Grid
par: Zhang, Tianyi, et autres
Publié: (2024)
par: Zhang, Tianyi, et autres
Publié: (2024)
ButterflyQuant: Ultra-low-bit LLM Quantization through Learnable Orthogonal Butterfly Transforms
par: Xu, Bingxin, et autres
Publié: (2025)
par: Xu, Bingxin, et autres
Publié: (2025)
PolarQuant: Optimal Gaussian Weight Quantization via Hadamard Rotation for LLM Compression
par: Vicentino, Caio
Publié: (2026)
par: Vicentino, Caio
Publié: (2026)
OstQuant: Refining Large Language Model Quantization with Orthogonal and Scaling Transformations for Better Distribution Fitting
par: Hu, Xing, et autres
Publié: (2025)
par: Hu, Xing, et autres
Publié: (2025)
AffineQuant: Affine Transformation Quantization for Large Language Models
par: Ma, Yuexiao, et autres
Publié: (2024)
par: Ma, Yuexiao, et autres
Publié: (2024)
EasyQuant: An Efficient Data-free Quantization Algorithm for LLMs
par: Tang, Hanlin, et autres
Publié: (2024)
par: Tang, Hanlin, et autres
Publié: (2024)
DILEMMA: Joint LLM Quantization and Distributed LLM Inference Over Edge Computing Systems
par: Hosseinzadeh, Minoo, et autres
Publié: (2025)
par: Hosseinzadeh, Minoo, et autres
Publié: (2025)
OmniQuant: Omnidirectionally Calibrated Quantization for Large Language Models
par: Shao, Wenqi, et autres
Publié: (2023)
par: Shao, Wenqi, et autres
Publié: (2023)
FlexQuant: A Flexible and Efficient Dynamic Precision Switching Framework for LLM Quantization
par: Liu, Fangxin, et autres
Publié: (2025)
par: Liu, Fangxin, et autres
Publié: (2025)
Quant.npu: Enabling Efficient Mobile NPU Inference for on-device LLMs via Fully Static Quantization
par: Zhang, Jinghe, et autres
Publié: (2026)
par: Zhang, Jinghe, et autres
Publié: (2026)
FrameQuant: Flexible Low-Bit Quantization for Transformers
par: Adepu, Harshavardhan, et autres
Publié: (2024)
par: Adepu, Harshavardhan, et autres
Publié: (2024)
PolarQuant: Quantizing KV Caches with Polar Transformation
par: Han, Insu, et autres
Publié: (2025)
par: Han, Insu, et autres
Publié: (2025)
QuantKAN: A Unified Quantization Framework for Kolmogorov Arnold Networks
par: Fuad, Kazi Ahmed Asif, et autres
Publié: (2025)
par: Fuad, Kazi Ahmed Asif, et autres
Publié: (2025)
MoBiQuant: Mixture-of-Bits Quantization for Token-Adaptive Any-Precision LLM
par: Wang, Dongwei, et autres
Publié: (2026)
par: Wang, Dongwei, et autres
Publié: (2026)
Quant-dLLM: Post-Training Extreme Low-Bit Quantization for Diffusion Large Language Models
par: Zhang, Tianao, et autres
Publié: (2025)
par: Zhang, Tianao, et autres
Publié: (2025)
Dynamic Expert Quantization for Scalable Mixture-of-Experts Inference
par: Chu, Kexin, et autres
Publié: (2025)
par: Chu, Kexin, et autres
Publié: (2025)
FlattenQuant: Breaking Through the Inference Compute-bound for Large Language Models with Per-tensor Quantization
par: Zhang, Yi, et autres
Publié: (2024)
par: Zhang, Yi, et autres
Publié: (2024)
NanoQuant: Efficient Sub-1-Bit Quantization of Large Language Models
par: Chong, Hyochan, et autres
Publié: (2026)
par: Chong, Hyochan, et autres
Publié: (2026)
TruncQuant: Truncation-Ready Quantization for DNNs with Flexible Weight Bit Precision
par: Kim, Jinhee, et autres
Publié: (2025)
par: Kim, Jinhee, et autres
Publié: (2025)
PrefixQuant: Eliminating Outliers by Prefixed Tokens for Large Language Models Quantization
par: Chen, Mengzhao, et autres
Publié: (2024)
par: Chen, Mengzhao, et autres
Publié: (2024)
Automate Strategy Finding with LLM in Quant Investment
par: Kou, Zhizhuo, et autres
Publié: (2024)
par: Kou, Zhizhuo, et autres
Publié: (2024)
MKA: Memory-Keyed Attention for Efficient Long-Context Reasoning
par: Liu, Dong, et autres
Publié: (2026)
par: Liu, Dong, et autres
Publié: (2026)
LogQuant: Log-Distributed 2-Bit Quantization of KV Cache with Superior Accuracy Preservation
par: Chen, Han, et autres
Publié: (2025)
par: Chen, Han, et autres
Publié: (2025)
CodeQuant: Unified Clustering and Quantization for Enhanced Outlier Smoothing in Low-Precision Mixture-of-Experts
par: Yin, Xiangyang, et autres
Publié: (2026)
par: Yin, Xiangyang, et autres
Publié: (2026)
RepQuant: Towards Accurate Post-Training Quantization of Large Transformer Models via Scale Reparameterization
par: Li, Zhikai, et autres
Publié: (2024)
par: Li, Zhikai, et autres
Publié: (2024)
Towards Low-bit Communication for Tensor Parallel LLM Inference
par: Dong, Harry, et autres
Publié: (2024)
par: Dong, Harry, et autres
Publié: (2024)
CrossQuant: A Post-Training Quantization Method with Smaller Quantization Kernel for Precise Large Language Model Compression
par: Liu, Wenyuan, et autres
Publié: (2024)
par: Liu, Wenyuan, et autres
Publié: (2024)
MambaQuant: Quantizing the Mamba Family with Variance Aligned Rotation Methods
par: Xu, Zukang, et autres
Publié: (2025)
par: Xu, Zukang, et autres
Publié: (2025)
SplitQuant: Layer Splitting for Low-Bit Neural Network Quantization
par: Song, Jaewoo, et autres
Publié: (2025)
par: Song, Jaewoo, et autres
Publié: (2025)
QuantSpec: Self-Speculative Decoding with Hierarchical Quantized KV Cache
par: Tiwari, Rishabh, et autres
Publié: (2025)
par: Tiwari, Rishabh, et autres
Publié: (2025)
QuantMoE-Bench: Examining Post-Training Quantization for Mixture-of-Experts
par: Li, Pingzhi, et autres
Publié: (2024)
par: Li, Pingzhi, et autres
Publié: (2024)
GuidedQuant: Large Language Model Quantization via Exploiting End Loss Guidance
par: Kim, Jinuk, et autres
Publié: (2025)
par: Kim, Jinuk, et autres
Publié: (2025)
Documents similaires
-
DartQuant: Efficient Rotational Distribution Calibration for LLM Quantization
par: Shao, Yuantian, et autres
Publié: (2025) -
InfoQuant: Shaping Activation Distributions for Low-Bit LLM Quantization
par: Li, Ke, et autres
Publié: (2026) -
FlatQuant: Flatness Matters for LLM Quantization
par: Sun, Yuxuan, et autres
Publié: (2024) -
MT2ST: Adaptive Multi-Task to Single-Task Learning
par: Liu, Dong, et autres
Publié: (2024) -
Efficient Graph Optimization via Distance-Aware Graph Representation Learning
par: Liu, Dong, et autres
Publié: (2024)