LCQ: Low-Rank Codebook based Quantization for Large Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Cai, Wen-Pu, Li, Ming-Yang, Li, Wu-Jun |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals
von: Saxena, Utkarsh, et al.
Veröffentlicht: (2024)
von: Saxena, Utkarsh, et al.
Veröffentlicht: (2024)
Adaptive Feature-based Low-Rank Compression of Large Language Models via Bayesian Optimization
von: Ji, Yixin, et al.
Veröffentlicht: (2024)
von: Ji, Yixin, et al.
Veröffentlicht: (2024)
QDyLoRA: Quantized Dynamic Low-Rank Adaptation for Efficient Large Language Model Tuning
von: Rajabzadeh, Hossein, et al.
Veröffentlicht: (2024)
von: Rajabzadeh, Hossein, et al.
Veröffentlicht: (2024)
Accelerating the Low-Rank Decomposed Models
von: Hajimolahoseini, Habib, et al.
Veröffentlicht: (2024)
von: Hajimolahoseini, Habib, et al.
Veröffentlicht: (2024)
QLLM: Accurate and Efficient Low-Bitwidth Quantization for Large Language Models
von: Liu, Jing, et al.
Veröffentlicht: (2023)
von: Liu, Jing, et al.
Veröffentlicht: (2023)
RSAVQ: Riemannian Sensitivity-Aware Vector Quantization for Large Language Models
von: Xu, Zukang, et al.
Veröffentlicht: (2025)
von: Xu, Zukang, et al.
Veröffentlicht: (2025)
LQER: Low-Rank Quantization Error Reconstruction for LLMs
von: Zhang, Cheng, et al.
Veröffentlicht: (2024)
von: Zhang, Cheng, et al.
Veröffentlicht: (2024)
LoQT: Low-Rank Adapters for Quantized Pretraining
von: Loeschcke, Sebastian, et al.
Veröffentlicht: (2024)
von: Loeschcke, Sebastian, et al.
Veröffentlicht: (2024)
LoLCATs: On Low-Rank Linearizing of Large Language Models
von: Zhang, Michael, et al.
Veröffentlicht: (2024)
von: Zhang, Michael, et al.
Veröffentlicht: (2024)
Basis Selection: Low-Rank Decomposition of Pretrained Large Language Models for Target Applications
von: Li, Yang, et al.
Veröffentlicht: (2024)
von: Li, Yang, et al.
Veröffentlicht: (2024)
Initialisation Determines the Basin: Efficient Codebook Optimisation for Extreme LLM Quantization
von: Kennedy, Ian W., et al.
Veröffentlicht: (2026)
von: Kennedy, Ian W., et al.
Veröffentlicht: (2026)
QuIP: 2-Bit Quantization of Large Language Models With Guarantees
von: Chee, Jerry, et al.
Veröffentlicht: (2023)
von: Chee, Jerry, et al.
Veröffentlicht: (2023)
BAQ: Efficient Bit Allocation Quantization for Large Language Models
von: Zhang, Chao, et al.
Veröffentlicht: (2025)
von: Zhang, Chao, et al.
Veröffentlicht: (2025)
FBQuant: FeedBack Quantization for Large Language Models
von: Liu, Yijiang, et al.
Veröffentlicht: (2025)
von: Liu, Yijiang, et al.
Veröffentlicht: (2025)
BA-LoRA: Bias-Alleviating Low-Rank Adaptation to Mitigate Catastrophic Inheritance in Large Language Models
von: Chang, Yupeng, et al.
Veröffentlicht: (2024)
von: Chang, Yupeng, et al.
Veröffentlicht: (2024)
Training Acceleration of Low-Rank Decomposed Networks using Sequential Freezing and Rank Quantization
von: Hajimolahoseini, Habib, et al.
Veröffentlicht: (2023)
von: Hajimolahoseini, Habib, et al.
Veröffentlicht: (2023)
CBQ: Cross-Block Quantization for Large Language Models
von: Ding, Xin, et al.
Veröffentlicht: (2023)
von: Ding, Xin, et al.
Veröffentlicht: (2023)
AAAC: Activation-Aware Adaptive Codebooks for 4-bit LLM Weight Quantization
von: IslamBouli, Beshr, et al.
Veröffentlicht: (2026)
von: IslamBouli, Beshr, et al.
Veröffentlicht: (2026)
Dynamic Rank Reinforcement Learning for Adaptive Low-Rank Multi-Head Self Attention in Large Language Models
von: Erden, Caner
Veröffentlicht: (2025)
von: Erden, Caner
Veröffentlicht: (2025)
OMoE: Diversifying Mixture of Low-Rank Adaptation by Orthogonal Finetuning
von: Feng, Jinyuan, et al.
Veröffentlicht: (2025)
von: Feng, Jinyuan, et al.
Veröffentlicht: (2025)
Low-Rank Quantization-Aware Training for LLMs
von: Bondarenko, Yelysei, et al.
Veröffentlicht: (2024)
von: Bondarenko, Yelysei, et al.
Veröffentlicht: (2024)
OmniQuant: Omnidirectionally Calibrated Quantization for Large Language Models
von: Shao, Wenqi, et al.
Veröffentlicht: (2023)
von: Shao, Wenqi, et al.
Veröffentlicht: (2023)
FlexiGPT: Pruning and Extending Large Language Models with Low-Rank Weight Sharing
von: Smith, James Seale, et al.
Veröffentlicht: (2025)
von: Smith, James Seale, et al.
Veröffentlicht: (2025)
SoftLMs: Efficient Adaptive Low-Rank Approximation of Language Models using Soft-Thresholding Mechanism
von: Bhatnagar, Priyansh, et al.
Veröffentlicht: (2024)
von: Bhatnagar, Priyansh, et al.
Veröffentlicht: (2024)
Quantization of Large Language Models with an Overdetermined Basis
von: Merkulov, Daniil, et al.
Veröffentlicht: (2024)
von: Merkulov, Daniil, et al.
Veröffentlicht: (2024)
SKVQ: Sliding-window Key and Value Cache Quantization for Large Language Models
von: Duanmu, Haojie, et al.
Veröffentlicht: (2024)
von: Duanmu, Haojie, et al.
Veröffentlicht: (2024)
BoRA: Bayesian Hierarchical Low-Rank Adaption for Multi-Task Large Language Models
von: Eide, Simen, et al.
Veröffentlicht: (2024)
von: Eide, Simen, et al.
Veröffentlicht: (2024)
Large Language Diffusion Models
von: Nie, Shen, et al.
Veröffentlicht: (2025)
von: Nie, Shen, et al.
Veröffentlicht: (2025)
Multi-Conditional Ranking with Large Language Models
von: Pezeshkpour, Pouya, et al.
Veröffentlicht: (2024)
von: Pezeshkpour, Pouya, et al.
Veröffentlicht: (2024)
Training-Free Bayesianization for Low-Rank Adapters of Large Language Models
von: Shi, Haizhou, et al.
Veröffentlicht: (2024)
von: Shi, Haizhou, et al.
Veröffentlicht: (2024)
Optimizing Large Language Model Training Using FP4 Quantization
von: Wang, Ruizhe, et al.
Veröffentlicht: (2025)
von: Wang, Ruizhe, et al.
Veröffentlicht: (2025)
How Quantization Shapes Bias in Large Language Models
von: Marcuzzi, Federico, et al.
Veröffentlicht: (2025)
von: Marcuzzi, Federico, et al.
Veröffentlicht: (2025)
Demystifying Low-Rank Knowledge Distillation in Large Language Models: Convergence, Generalization, and Information-Theoretic Guarantees
von: Soarez, Alberlucia Rafael, et al.
Veröffentlicht: (2026)
von: Soarez, Alberlucia Rafael, et al.
Veröffentlicht: (2026)
Batched Low-Rank Adaptation of Foundation Models
von: Wen, Yeming, et al.
Veröffentlicht: (2023)
von: Wen, Yeming, et al.
Veröffentlicht: (2023)
Task-Stratified Knowledge Scaling Laws for Post-Training Quantized Large Language Models
von: Zhou, Chenxi, et al.
Veröffentlicht: (2025)
von: Zhou, Chenxi, et al.
Veröffentlicht: (2025)
I-LLM: Efficient Integer-Only Inference for Fully-Quantized Low-Bit Large Language Models
von: Hu, Xing, et al.
Veröffentlicht: (2024)
von: Hu, Xing, et al.
Veröffentlicht: (2024)
Scaling Laws for Post Training Quantized Large Language Models
von: Xu, Zifei, et al.
Veröffentlicht: (2024)
von: Xu, Zifei, et al.
Veröffentlicht: (2024)
Extreme Compression of Large Language Models via Additive Quantization
von: Egiazarian, Vage, et al.
Veröffentlicht: (2024)
von: Egiazarian, Vage, et al.
Veröffentlicht: (2024)
SliM-LLM: Salience-Driven Mixed-Precision Quantization for Large Language Models
von: Huang, Wei, et al.
Veröffentlicht: (2024)
von: Huang, Wei, et al.
Veröffentlicht: (2024)
BLoB: Bayesian Low-Rank Adaptation by Backpropagation for Large Language Models
von: Wang, Yibin, et al.
Veröffentlicht: (2024)
von: Wang, Yibin, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals
von: Saxena, Utkarsh, et al.
Veröffentlicht: (2024) -
Adaptive Feature-based Low-Rank Compression of Large Language Models via Bayesian Optimization
von: Ji, Yixin, et al.
Veröffentlicht: (2024) -
QDyLoRA: Quantized Dynamic Low-Rank Adaptation for Efficient Large Language Model Tuning
von: Rajabzadeh, Hossein, et al.
Veröffentlicht: (2024) -
Accelerating the Low-Rank Decomposed Models
von: Hajimolahoseini, Habib, et al.
Veröffentlicht: (2024) -
QLLM: Accurate and Efficient Low-Bitwidth Quantization for Large Language Models
von: Liu, Jing, et al.
Veröffentlicht: (2023)