Gespeichert in:
| Hauptverfasser: | Zhao, Weibo, Shi, Yubin, Lyu, Xinyu, Sui, Wanchen, Li, Shen, Li, Yong |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | https://arxiv.org/abs/2411.07762 |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Saliency-Aware Regularized Quantization Calibration for Large Language Models
von: Zhao, Yanlong, et al.
Veröffentlicht: (2026)
von: Zhao, Yanlong, et al.
Veröffentlicht: (2026)
Preserve-Then-Quantize: Balancing Rank Budgets for Quantization Error Reconstruction in LLMs
von: Cho, Yoonjun, et al.
Veröffentlicht: (2026)
von: Cho, Yoonjun, et al.
Veröffentlicht: (2026)
Quantized Side Tuning: Fast and Memory-Efficient Tuning of Quantized Large Language Models
von: Zhang, Zhengxin, et al.
Veröffentlicht: (2024)
von: Zhang, Zhengxin, et al.
Veröffentlicht: (2024)
SmoothQuant: Accurate and Efficient Post-Training Quantization for Large Language Models
von: Xiao, Guangxuan, et al.
Veröffentlicht: (2022)
von: Xiao, Guangxuan, et al.
Veröffentlicht: (2022)
BiSup: Bidirectional Quantization Error Suppression for Large Language Models
von: Zou, Minghui, et al.
Veröffentlicht: (2024)
von: Zou, Minghui, et al.
Veröffentlicht: (2024)
Quant-dLLM: Post-Training Extreme Low-Bit Quantization for Diffusion Large Language Models
von: Zhang, Tianao, et al.
Veröffentlicht: (2025)
von: Zhang, Tianao, et al.
Veröffentlicht: (2025)
Tequila: Trapping-free Ternary Quantization for Large Language Models
von: Huang, Hong, et al.
Veröffentlicht: (2025)
von: Huang, Hong, et al.
Veröffentlicht: (2025)
First-Order Error Matters: Accurate Compensation for Quantized Large Language Models
von: Zheng, Xingyu, et al.
Veröffentlicht: (2025)
von: Zheng, Xingyu, et al.
Veröffentlicht: (2025)
InfoQuant: Shaping Activation Distributions for Low-Bit LLM Quantization
von: Li, Ke, et al.
Veröffentlicht: (2026)
von: Li, Ke, et al.
Veröffentlicht: (2026)
ELAS: Efficient Pre-Training of Low-Rank Large Language Models via 2:4 Activation Sparsity
von: Li, Jiaxi, et al.
Veröffentlicht: (2026)
von: Li, Jiaxi, et al.
Veröffentlicht: (2026)
FAQ: Mitigating Quantization Error via Regenerating Calibration Data with Family-Aware Quantization
von: Xiao, Haiyang, et al.
Veröffentlicht: (2026)
von: Xiao, Haiyang, et al.
Veröffentlicht: (2026)
PTQTP: Post-Training Quantization to Trit-Planes for Large Language Models
von: Xiao, He, et al.
Veröffentlicht: (2025)
von: Xiao, He, et al.
Veröffentlicht: (2025)
RILQ: Rank-Insensitive LoRA-based Quantization Error Compensation for Boosting 2-bit Large Language Model Accuracy
von: Lee, Geonho, et al.
Veröffentlicht: (2024)
von: Lee, Geonho, et al.
Veröffentlicht: (2024)
Large Language Model Agent for Hyper-Parameter Optimization
von: Liu, Siyi, et al.
Veröffentlicht: (2024)
von: Liu, Siyi, et al.
Veröffentlicht: (2024)
Activation Sparsity Opportunities for Compressing General Large Language Models
von: Dhar, Nobel, et al.
Veröffentlicht: (2024)
von: Dhar, Nobel, et al.
Veröffentlicht: (2024)
GANQ: GPU-Adaptive Non-Uniform Quantization for Large Language Models
von: Zhao, Pengxiang, et al.
Veröffentlicht: (2025)
von: Zhao, Pengxiang, et al.
Veröffentlicht: (2025)
QuZO: Quantized Zeroth-Order Fine-Tuning for Large Language Models
von: Zhou, Jiajun, et al.
Veröffentlicht: (2025)
von: Zhou, Jiajun, et al.
Veröffentlicht: (2025)
Task-Stratified Knowledge Scaling Laws for Post-Training Quantized Large Language Models
von: Zhou, Chenxi, et al.
Veröffentlicht: (2025)
von: Zhou, Chenxi, et al.
Veröffentlicht: (2025)
On the Compressibility of Quantized Large Language Models
von: Mao, Yu, et al.
Veröffentlicht: (2024)
von: Mao, Yu, et al.
Veröffentlicht: (2024)
MicroMix: Efficient Mixed-Precision Quantization with Microscaling Formats for Large Language Models
von: Liu, Wenyuan, et al.
Veröffentlicht: (2025)
von: Liu, Wenyuan, et al.
Veröffentlicht: (2025)
AMS-QUANT: Adaptive Mantissa Sharing for Floating-point Quantization
von: Lv, Mengtao, et al.
Veröffentlicht: (2025)
von: Lv, Mengtao, et al.
Veröffentlicht: (2025)
DeltaDQ: Ultra-High Delta Compression for Fine-Tuned LLMs via Group-wise Dropout and Separate Quantization
von: Jiang, Yanfeng, et al.
Veröffentlicht: (2024)
von: Jiang, Yanfeng, et al.
Veröffentlicht: (2024)
Reinforcing Numerical Reasoning in LLMs for Tabular Prediction via Structural Priors
von: Cai, Pengxiang, et al.
Veröffentlicht: (2025)
von: Cai, Pengxiang, et al.
Veröffentlicht: (2025)
Post Training Quantization of Large Language Models with Microscaling Formats
von: Sharify, Sayeh, et al.
Veröffentlicht: (2024)
von: Sharify, Sayeh, et al.
Veröffentlicht: (2024)
SmoothLLM: Defending Large Language Models Against Jailbreaking Attacks
von: Robey, Alexander, et al.
Veröffentlicht: (2023)
von: Robey, Alexander, et al.
Veröffentlicht: (2023)
D-QRELO: Training- and Data-Free Delta Compression for Large Language Models via Quantization and Residual Low-Rank Approximation
von: Li, Junlin, et al.
Veröffentlicht: (2026)
von: Li, Junlin, et al.
Veröffentlicht: (2026)
Understanding Post-Training Structural Changes in Large Language Models
von: He, Xinyu, et al.
Veröffentlicht: (2025)
von: He, Xinyu, et al.
Veröffentlicht: (2025)
Boosting of Thoughts: Trial-and-Error Problem Solving with Large Language Models
von: Chen, Sijia, et al.
Veröffentlicht: (2024)
von: Chen, Sijia, et al.
Veröffentlicht: (2024)
BASE-Q: Bias and Asymmetric Scaling Enhanced Rotational Quantization for Large Language Models
von: He, Liulu, et al.
Veröffentlicht: (2025)
von: He, Liulu, et al.
Veröffentlicht: (2025)
What Makes Quantization for Large Language Models Hard? An Empirical Study from the Lens of Perturbation
von: Gong, Zhuocheng, et al.
Veröffentlicht: (2024)
von: Gong, Zhuocheng, et al.
Veröffentlicht: (2024)
LearningFlow: Automated Policy Learning Workflow for Urban Driving with Large Language Models
von: Peng, Zengqi, et al.
Veröffentlicht: (2025)
von: Peng, Zengqi, et al.
Veröffentlicht: (2025)
Q-resafe: Assessing Safety Risks and Quantization-aware Safety Patching for Quantized Large Language Models
von: Chen, Kejia, et al.
Veröffentlicht: (2025)
von: Chen, Kejia, et al.
Veröffentlicht: (2025)
Astro: Activation-guided Structured Regularization for Outlier-Robust LLM Post-Training Quantization
von: Chen, Xi, et al.
Veröffentlicht: (2026)
von: Chen, Xi, et al.
Veröffentlicht: (2026)
Agile-Quant: Activation-Guided Quantization for Faster Inference of LLMs on the Edge
von: Shen, Xuan, et al.
Veröffentlicht: (2023)
von: Shen, Xuan, et al.
Veröffentlicht: (2023)
LLMC: Benchmarking Large Language Model Quantization with a Versatile Compression Toolkit
von: Gong, Ruihao, et al.
Veröffentlicht: (2024)
von: Gong, Ruihao, et al.
Veröffentlicht: (2024)
Multi-Level Safety Continual Projection for Fine-Tuned Large Language Models without Retraining
von: Han, Bing, et al.
Veröffentlicht: (2025)
von: Han, Bing, et al.
Veröffentlicht: (2025)
ESI: Epistemic Uncertainty Quantification via Semantic-preserving Intervention for Large Language Models
von: Li, Mingda, et al.
Veröffentlicht: (2025)
von: Li, Mingda, et al.
Veröffentlicht: (2025)
RoSTE: An Efficient Quantization-Aware Supervised Fine-Tuning Approach for Large Language Models
von: Wei, Quan, et al.
Veröffentlicht: (2025)
von: Wei, Quan, et al.
Veröffentlicht: (2025)
Art and Science of Quantizing Large-Scale Models: A Comprehensive Overview
von: Wang, Yanshu, et al.
Veröffentlicht: (2024)
von: Wang, Yanshu, et al.
Veröffentlicht: (2024)
World Models with Hints of Large Language Models for Goal Achieving
von: Liu, Zeyuan, et al.
Veröffentlicht: (2024)
von: Liu, Zeyuan, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Saliency-Aware Regularized Quantization Calibration for Large Language Models
von: Zhao, Yanlong, et al.
Veröffentlicht: (2026) -
Preserve-Then-Quantize: Balancing Rank Budgets for Quantization Error Reconstruction in LLMs
von: Cho, Yoonjun, et al.
Veröffentlicht: (2026) -
Quantized Side Tuning: Fast and Memory-Efficient Tuning of Quantized Large Language Models
von: Zhang, Zhengxin, et al.
Veröffentlicht: (2024) -
SmoothQuant: Accurate and Efficient Post-Training Quantization for Large Language Models
von: Xiao, Guangxuan, et al.
Veröffentlicht: (2022) -
BiSup: Bidirectional Quantization Error Suppression for Large Language Models
von: Zou, Minghui, et al.
Veröffentlicht: (2024)