Accurate LoRA-Finetuning Quantization of LLMs via Information Retention
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Qin, Haotong, Ma, Xudong, Zheng, Xingyu, Li, Xiaoyang, Zhang, Yang, Liu, Shouda, Luo, Jie, Liu, Xianglong, Magno, Michele |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
First-Order Error Matters: Accurate Compensation for Quantized Large Language Models
par: Zheng, Xingyu, et autres
Publié: (2025)
par: Zheng, Xingyu, et autres
Publié: (2025)
BiLLM: Pushing the Limit of Post-Training Quantization for LLMs
par: Huang, Wei, et autres
Publié: (2024)
par: Huang, Wei, et autres
Publié: (2024)
BiVM: Accurate Binarized Neural Network for Efficient Video Matting
par: Qin, Haotong, et autres
Publié: (2025)
par: Qin, Haotong, et autres
Publié: (2025)
QuantSR+: Pushing the Limit of Quantized Image Super-Resolution Networks
par: Qin, Haotong, et autres
Publié: (2026)
par: Qin, Haotong, et autres
Publié: (2026)
The Impact of Initialization on LoRA Finetuning Dynamics
par: Hayou, Soufiane, et autres
Publié: (2024)
par: Hayou, Soufiane, et autres
Publié: (2024)
An Empirical Study of Qwen3 Quantization
par: Zheng, Xingyu, et autres
Publié: (2025)
par: Zheng, Xingyu, et autres
Publié: (2025)
Efficient Multilingual ASR Finetuning via LoRA Language Experts
par: Li, Jiahong, et autres
Publié: (2025)
par: Li, Jiahong, et autres
Publié: (2025)
LQ-LoRA: Low-rank Plus Quantized Matrix Decomposition for Efficient Language Model Finetuning
par: Guo, Han, et autres
Publié: (2023)
par: Guo, Han, et autres
Publié: (2023)
Sparse Memory Finetuning as a Low-Forgetting Alternative to LoRA and Full Finetuning
par: Gupta, Prakhar, et autres
Publié: (2026)
par: Gupta, Prakhar, et autres
Publié: (2026)
CA-LoRA: Adapting Existing LoRA for Compressed LLMs to Enable Efficient Multi-Tasking on Personal Devices
par: Zhao, Weilin, et autres
Publié: (2023)
par: Zhao, Weilin, et autres
Publié: (2023)
QuAILoRA: Quantization-Aware Initialization for LoRA
par: Lawton, Neal, et autres
Publié: (2024)
par: Lawton, Neal, et autres
Publié: (2024)
An empirical study of LLaMA3 quantization: from LLMs to MLLMs
par: Huang, Wei, et autres
Publié: (2024)
par: Huang, Wei, et autres
Publié: (2024)
LowRA: Accurate and Efficient LoRA Fine-Tuning of LLMs under 2 Bits
par: Zhou, Zikai, et autres
Publié: (2025)
par: Zhou, Zikai, et autres
Publié: (2025)
LoRA-Flow: Dynamic LoRA Fusion for Large Language Models in Generative Tasks
par: Wang, Hanqing, et autres
Publié: (2024)
par: Wang, Hanqing, et autres
Publié: (2024)
Dual LoRA: Enhancing LoRA with Magnitude and Direction Updates
par: Xu, Yixing, et autres
Publié: (2025)
par: Xu, Yixing, et autres
Publié: (2025)
PLoP: Precise LoRA Placement for Efficient Finetuning of Large Models
par: Hayou, Soufiane, et autres
Publié: (2025)
par: Hayou, Soufiane, et autres
Publié: (2025)
SliM-LLM: Salience-Driven Mixed-Precision Quantization for Large Language Models
par: Huang, Wei, et autres
Publié: (2024)
par: Huang, Wei, et autres
Publié: (2024)
Promoting Data and Model Privacy in Federated Learning through Quantized LoRA
par: Zhu, JianHao, et autres
Publié: (2024)
par: Zhu, JianHao, et autres
Publié: (2024)
BinaryDM: Accurate Weight Binarization for Efficient Diffusion Models
par: Zheng, Xingyu, et autres
Publié: (2024)
par: Zheng, Xingyu, et autres
Publié: (2024)
LoRA-Drop: Temporal LoRA Decoding for Efficient LLM Inference
par: Rajabzadeh, Hossein, et autres
Publié: (2026)
par: Rajabzadeh, Hossein, et autres
Publié: (2026)
Learning Rate Scaling across LoRA Ranks and Transfer to Full Finetuning
par: Chen, Nan, et autres
Publié: (2026)
par: Chen, Nan, et autres
Publié: (2026)
LoRA-Gen: Specializing Large Language Model via Online LoRA Generation
par: Xiao, Yicheng, et autres
Publié: (2025)
par: Xiao, Yicheng, et autres
Publié: (2025)
DR-LoRA: Dynamic Rank LoRA for Fine-Tuning Mixture-of-Experts Models
par: Deng, Guanzhi, et autres
Publié: (2026)
par: Deng, Guanzhi, et autres
Publié: (2026)
Flexi-LoRA with Input-Adaptive Ranks: Efficient Finetuning for Speech and Reasoning Tasks
par: Li, Zongqian, et autres
Publié: (2026)
par: Li, Zongqian, et autres
Publié: (2026)
ALTER: Asymmetric LoRA for Token-Entropy-Guided Unlearning of LLMs
par: Chen, Xunlei, et autres
Publié: (2026)
par: Chen, Xunlei, et autres
Publié: (2026)
FIM-LoRA: Task-Informative Rank Allocation for LoRA via Calibration-Time Gradient-Variance Estimation
par: Sathyavageeswaran, Ramakrishnan
Publié: (2026)
par: Sathyavageeswaran, Ramakrishnan
Publié: (2026)
Make LoRA Great Again: Boosting LoRA with Adaptive Singular Values and Mixture-of-Experts Optimization Alignment
par: Fan, Chenghao, et autres
Publié: (2025)
par: Fan, Chenghao, et autres
Publié: (2025)
ProtoBERT-LoRA: Parameter-Efficient Prototypical Finetuning for Immunotherapy Study Identification
par: Zhang, Shijia, et autres
Publié: (2025)
par: Zhang, Shijia, et autres
Publié: (2025)
PeriodicLoRA: Breaking the Low-Rank Bottleneck in LoRA Optimization
par: Meng, Xiangdi, et autres
Publié: (2024)
par: Meng, Xiangdi, et autres
Publié: (2024)
How LoRA Remembers? A Parametric Memory Law for LLM Finetuning
par: Xu, Ziwen, et autres
Publié: (2026)
par: Xu, Ziwen, et autres
Publié: (2026)
Vision as LoRA
par: Wang, Han, et autres
Publié: (2025)
par: Wang, Han, et autres
Publié: (2025)
$D^2LoRA$: Data-Driven LoRA Initialization for Low Resource Tasks
par: SeraJ, Javad, et autres
Publié: (2025)
par: SeraJ, Javad, et autres
Publié: (2025)
LoRA on the Go: Instance-level Dynamic LoRA Selection and Merging
par: Lee, Seungeon, et autres
Publié: (2025)
par: Lee, Seungeon, et autres
Publié: (2025)
LoRA-drop: Efficient LoRA Parameter Pruning based on Output Evaluation
par: Zhou, Hongyun, et autres
Publié: (2024)
par: Zhou, Hongyun, et autres
Publié: (2024)
Tina: Tiny Reasoning Models via LoRA
par: Wang, Shangshang, et autres
Publié: (2025)
par: Wang, Shangshang, et autres
Publié: (2025)
Higher Layers Need More LoRA Experts
par: Gao, Chongyang, et autres
Publié: (2024)
par: Gao, Chongyang, et autres
Publié: (2024)
Robust Federated Finetuning of LLMs via Alternating Optimization of LoRA
par: Chen, Shuangyi, et autres
Publié: (2025)
par: Chen, Shuangyi, et autres
Publié: (2025)
A Survey of Low-bit Large Language Models: Basics, Systems, and Algorithms
par: Gong, Ruihao, et autres
Publié: (2024)
par: Gong, Ruihao, et autres
Publié: (2024)
AFA-LoRA: Enabling Non-Linear Adaptations in LoRA with Activation Function Annealing
par: Li, Jiacheng, et autres
Publié: (2025)
par: Li, Jiacheng, et autres
Publié: (2025)
LoRA-Squeeze: Simple and Effective Post-Tuning and In-Tuning Compression of LoRA Modules
par: Vulić, Ivan, et autres
Publié: (2026)
par: Vulić, Ivan, et autres
Publié: (2026)
Documents similaires
-
First-Order Error Matters: Accurate Compensation for Quantized Large Language Models
par: Zheng, Xingyu, et autres
Publié: (2025) -
BiLLM: Pushing the Limit of Post-Training Quantization for LLMs
par: Huang, Wei, et autres
Publié: (2024) -
BiVM: Accurate Binarized Neural Network for Efficient Video Matting
par: Qin, Haotong, et autres
Publié: (2025) -
QuantSR+: Pushing the Limit of Quantized Image Super-Resolution Networks
par: Qin, Haotong, et autres
Publié: (2026) -
The Impact of Initialization on LoRA Finetuning Dynamics
par: Hayou, Soufiane, et autres
Publié: (2024)