Distribution-Aware Companding Quantization of Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Radhakrishnan, Athul, Mohan, Siddhant, Sachdeva, Mahima |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Compression Laws for Large Language Models
di: Sengupta, Ayan, et al.
Pubblicazione: (2025)
di: Sengupta, Ayan, et al.
Pubblicazione: (2025)
Fair-GPTQ: Bias-Aware Quantization for Large Language Models
di: Proskurina, Irina, et al.
Pubblicazione: (2025)
di: Proskurina, Irina, et al.
Pubblicazione: (2025)
RSAVQ: Riemannian Sensitivity-Aware Vector Quantization for Large Language Models
di: Xu, Zukang, et al.
Pubblicazione: (2025)
di: Xu, Zukang, et al.
Pubblicazione: (2025)
Are Emergent Abilities in Large Language Models just In-Context Learning?
di: Lu, Sheng, et al.
Pubblicazione: (2023)
di: Lu, Sheng, et al.
Pubblicazione: (2023)
On the Brittle Foundations of ReAct Prompting for Agentic Large Language Models
di: Verma, Mudit, et al.
Pubblicazione: (2024)
di: Verma, Mudit, et al.
Pubblicazione: (2024)
GWQ: Gradient-Aware Weight Quantization for Large Language Models
di: Shao, Yihua, et al.
Pubblicazione: (2024)
di: Shao, Yihua, et al.
Pubblicazione: (2024)
OWQ: Outlier-Aware Weight Quantization for Efficient Fine-Tuning and Inference of Large Language Models
di: Lee, Changhun, et al.
Pubblicazione: (2023)
di: Lee, Changhun, et al.
Pubblicazione: (2023)
SASQ: Static Activation Scaling for Quantization-Aware Training in Large Language Models
di: Mao, Shizhuo, et al.
Pubblicazione: (2025)
di: Mao, Shizhuo, et al.
Pubblicazione: (2025)
The Fragility Of Moral Judgment In Large Language Models
di: van Nuenen, Tom, et al.
Pubblicazione: (2026)
di: van Nuenen, Tom, et al.
Pubblicazione: (2026)
SMARTER: A Data-efficient Framework to Improve Toxicity Detection with Explanation via Self-augmenting Large Language Models
di: Nghiem, Huy, et al.
Pubblicazione: (2025)
di: Nghiem, Huy, et al.
Pubblicazione: (2025)
EfficientQAT: Efficient Quantization-Aware Training for Large Language Models
di: Chen, Mengzhao, et al.
Pubblicazione: (2024)
di: Chen, Mengzhao, et al.
Pubblicazione: (2024)
SiLQ: Simple Large Language Model Quantization-Aware Training
di: Esser, Steven K., et al.
Pubblicazione: (2025)
di: Esser, Steven K., et al.
Pubblicazione: (2025)
QWHA: Quantization-Aware Walsh-Hadamard Adaptation for Parameter-Efficient Fine-Tuning on Large Language Models
di: Jeon, Hyesung, et al.
Pubblicazione: (2025)
di: Jeon, Hyesung, et al.
Pubblicazione: (2025)
Power-of-Two Quantization-Aware-Training (PoT-QAT) in Large Language Models (LLMs)
di: Elgenedy, Mahmoud
Pubblicazione: (2026)
di: Elgenedy, Mahmoud
Pubblicazione: (2026)
Evaluating Quantized Large Language Models
di: Li, Shiyao, et al.
Pubblicazione: (2024)
di: Li, Shiyao, et al.
Pubblicazione: (2024)
Eliciting and Analyzing Emergent Misalignment in State-of-the-Art Large Language Models
di: Panpatil, Siddhant, et al.
Pubblicazione: (2025)
di: Panpatil, Siddhant, et al.
Pubblicazione: (2025)
AnTKV: Anchor Token-Aware Sub-Bit Vector Quantization for KV Cache in Large Language Models
di: Li, Zeyu, et al.
Pubblicazione: (2025)
di: Li, Zeyu, et al.
Pubblicazione: (2025)
InnerQ: Hardware-Aware Tuning-Free Quantization of KV Cache for Large Language Models
di: Hosseini, Sayed Mohammadreza Tayaranian, et al.
Pubblicazione: (2026)
di: Hosseini, Sayed Mohammadreza Tayaranian, et al.
Pubblicazione: (2026)
L4Q: Parameter Efficient Quantization-Aware Fine-Tuning on Large Language Models
di: Jeon, Hyesung, et al.
Pubblicazione: (2024)
di: Jeon, Hyesung, et al.
Pubblicazione: (2024)
ROSAQ: Rotation-based Saliency-Aware Weight Quantization for Efficiently Compressing Large Language Models
di: Yoon, Junho, et al.
Pubblicazione: (2025)
di: Yoon, Junho, et al.
Pubblicazione: (2025)
Cherry on Top: Parameter Heterogeneity and Quantization in Large Language Models
di: Cui, Wanyun, et al.
Pubblicazione: (2024)
di: Cui, Wanyun, et al.
Pubblicazione: (2024)
Quantization of Large Language Models with an Overdetermined Basis
di: Merkulov, Daniil, et al.
Pubblicazione: (2024)
di: Merkulov, Daniil, et al.
Pubblicazione: (2024)
Improving Multilingual Capabilities with Cultural and Local Knowledge in Large Language Models While Enhancing Native Performance
di: Kadiyala, Ram Mohan Rao, et al.
Pubblicazione: (2025)
di: Kadiyala, Ram Mohan Rao, et al.
Pubblicazione: (2025)
On the Compressibility of Quantized Large Language Models
di: Mao, Yu, et al.
Pubblicazione: (2024)
di: Mao, Yu, et al.
Pubblicazione: (2024)
Uncertainty Drives Social Bias Changes in Quantized Large Language Models
di: Hua, Stanley Z., et al.
Pubblicazione: (2026)
di: Hua, Stanley Z., et al.
Pubblicazione: (2026)
1bit-Merging: Dynamic Quantized Merging for Large Language Models
di: Liu, Shuqi, et al.
Pubblicazione: (2025)
di: Liu, Shuqi, et al.
Pubblicazione: (2025)
LSAQ: Layer-Specific Adaptive Quantization for Large Language Model Deployment
di: Zeng, Binrui, et al.
Pubblicazione: (2024)
di: Zeng, Binrui, et al.
Pubblicazione: (2024)
OutlierTune: Efficient Channel-Wise Quantization for Large Language Models
di: Wang, Jinguang, et al.
Pubblicazione: (2024)
di: Wang, Jinguang, et al.
Pubblicazione: (2024)
CBQ: Cross-Block Quantization for Large Language Models
di: Ding, Xin, et al.
Pubblicazione: (2023)
di: Ding, Xin, et al.
Pubblicazione: (2023)
FBQuant: FeedBack Quantization for Large Language Models
di: Liu, Yijiang, et al.
Pubblicazione: (2025)
di: Liu, Yijiang, et al.
Pubblicazione: (2025)
When Quantization Affects Confidence of Large Language Models?
di: Proskurina, Irina, et al.
Pubblicazione: (2024)
di: Proskurina, Irina, et al.
Pubblicazione: (2024)
DLLMQuant: Quantizing Diffusion-based Large Language Models
di: Xu, Chen, et al.
Pubblicazione: (2025)
di: Xu, Chen, et al.
Pubblicazione: (2025)
How Quantization Shapes Bias in Large Language Models
di: Marcuzzi, Federico, et al.
Pubblicazione: (2025)
di: Marcuzzi, Federico, et al.
Pubblicazione: (2025)
Evaluating the Retrieval Robustness of Large Language Models
di: Cao, Shuyang, et al.
Pubblicazione: (2025)
di: Cao, Shuyang, et al.
Pubblicazione: (2025)
Contextual Linear Activation Steering of Language Models
di: Hsu, Brandon, et al.
Pubblicazione: (2026)
di: Hsu, Brandon, et al.
Pubblicazione: (2026)
Large Language Models for Cross-lingual Emotion Detection
di: Kadiyala, Ram Mohan Rao
Pubblicazione: (2024)
di: Kadiyala, Ram Mohan Rao
Pubblicazione: (2024)
Mixed-Precision Graph Neural Quantization for Low Bit Large Language Models
di: Liu, Wanlong, et al.
Pubblicazione: (2025)
di: Liu, Wanlong, et al.
Pubblicazione: (2025)
Enhancing Computation Efficiency in Large Language Models through Weight and Activation Quantization
di: Lee, Janghwan, et al.
Pubblicazione: (2023)
di: Lee, Janghwan, et al.
Pubblicazione: (2023)
Language Modeling for the Future of Finance: A Survey into Metrics, Tasks, and Data Opportunities
di: Tatarinov, Nikita, et al.
Pubblicazione: (2025)
di: Tatarinov, Nikita, et al.
Pubblicazione: (2025)
BAQ: Efficient Bit Allocation Quantization for Large Language Models
di: Zhang, Chao, et al.
Pubblicazione: (2025)
di: Zhang, Chao, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Compression Laws for Large Language Models
di: Sengupta, Ayan, et al.
Pubblicazione: (2025) -
Fair-GPTQ: Bias-Aware Quantization for Large Language Models
di: Proskurina, Irina, et al.
Pubblicazione: (2025) -
RSAVQ: Riemannian Sensitivity-Aware Vector Quantization for Large Language Models
di: Xu, Zukang, et al.
Pubblicazione: (2025) -
Are Emergent Abilities in Large Language Models just In-Context Learning?
di: Lu, Sheng, et al.
Pubblicazione: (2023) -
On the Brittle Foundations of ReAct Prompting for Agentic Large Language Models
di: Verma, Mudit, et al.
Pubblicazione: (2024)