Swift-SVD: Theoretical Optimality Meets Practical Efficiency in Low-Rank LLM Compression
Fuente:
arXiv
Salvato in:
| Autori principali: | Qi, Ruoling, Liu, Yirui, Wu, Xuaner, Wang, Xiangyu, Li, Ming, Chen, Chen, Chen, Jian, Chen, Yin, Weng, Qizhen |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
KV-CoRE: Benchmarking Data-Dependent Low-Rank Compressibility of KV-Caches in LLMs
di: Chen, Jian, et al.
Pubblicazione: (2026)
di: Chen, Jian, et al.
Pubblicazione: (2026)
SAES-SVD: Self-Adaptive Suppression of Accumulated and Local Errors for SVD-based LLM Compression
di: Hu, Xing, et al.
Pubblicazione: (2026)
di: Hu, Xing, et al.
Pubblicazione: (2026)
ERC-SVD: Error-Controlled SVD for Large Language Model Compression
di: Bai, Haolei, et al.
Pubblicazione: (2025)
di: Bai, Haolei, et al.
Pubblicazione: (2025)
Low-Rank Adapters Meet Neural Architecture Search for LLM Compression
di: Muñoz, J. Pablo, et al.
Pubblicazione: (2025)
di: Muñoz, J. Pablo, et al.
Pubblicazione: (2025)
Enhancing Delta Compression in LLMs via SVD-based Quantization Error Minimization
di: Xiong, Boya, et al.
Pubblicazione: (2025)
di: Xiong, Boya, et al.
Pubblicazione: (2025)
SkipCat: Rank-Maximized Low-Rank Compression of Large Language Models via Shared Projection and Block Skipping
di: Lu, Yu-Chen, et al.
Pubblicazione: (2025)
di: Lu, Yu-Chen, et al.
Pubblicazione: (2025)
FLRC: Fine-grained Low-Rank Compressor for Efficient LLM Inference
di: Lu, Yu-Chen, et al.
Pubblicazione: (2025)
di: Lu, Yu-Chen, et al.
Pubblicazione: (2025)
EoRA: Fine-tuning-free Compensation for Compressed LLM with Eigenspace Low-Rank Approximation
di: Liu, Shih-Yang, et al.
Pubblicazione: (2024)
di: Liu, Shih-Yang, et al.
Pubblicazione: (2024)
UIPress: Bringing Optical Token Compression to UI-to-Code Generation
di: Dai, Dasen, et al.
Pubblicazione: (2026)
di: Dai, Dasen, et al.
Pubblicazione: (2026)
SVD-LLM V2: Optimizing Singular Value Truncation for Large Language Model Compression
di: Wang, Xin, et al.
Pubblicazione: (2025)
di: Wang, Xin, et al.
Pubblicazione: (2025)
Weed Out, Then Harvest: Dual Low-Rank Adaptation is an Effective Noisy Label Detector for Noise-Robust Learning
di: Yuan, Bo, et al.
Pubblicazione: (2025)
di: Yuan, Bo, et al.
Pubblicazione: (2025)
Activation-Informed Pareto-Guided Low-Rank Compression for Efficient LLM/VLM
di: Solgi, Ryan, et al.
Pubblicazione: (2025)
di: Solgi, Ryan, et al.
Pubblicazione: (2025)
SVD-LLM: Truncation-aware Singular Value Decomposition for Large Language Model Compression
di: Wang, Xin, et al.
Pubblicazione: (2024)
di: Wang, Xin, et al.
Pubblicazione: (2024)
R.R.: Unveiling LLM Training Privacy through Recollection and Ranking
di: Meng, Wenlong, et al.
Pubblicazione: (2025)
di: Meng, Wenlong, et al.
Pubblicazione: (2025)
Dobi-SVD: Differentiable SVD for LLM Compression and Some New Perspectives
di: Wang, Qinsi, et al.
Pubblicazione: (2025)
di: Wang, Qinsi, et al.
Pubblicazione: (2025)
IO-SVD: Input-Output Whitened SVD for Adaptive-Rank LLM Compression
di: Abbasi, Ali, et al.
Pubblicazione: (2026)
di: Abbasi, Ali, et al.
Pubblicazione: (2026)
LoX: Low-Rank Extrapolation Robustifies LLM Safety Against Fine-tuning
di: Perin, Gabriel J., et al.
Pubblicazione: (2025)
di: Perin, Gabriel J., et al.
Pubblicazione: (2025)
Zero Sum SVD: Balancing Loss Sensitivity for Low Rank LLM Compression
di: Abbasi, Ali, et al.
Pubblicazione: (2026)
di: Abbasi, Ali, et al.
Pubblicazione: (2026)
LLM-RankFusion: Mitigating Intrinsic Inconsistency in LLM-based Ranking
di: Zeng, Yifan, et al.
Pubblicazione: (2024)
di: Zeng, Yifan, et al.
Pubblicazione: (2024)
MEMLA: Enhancing Multilingual Knowledge Editing with Neuron-Masked Low-Rank Adaptation
di: Xie, Jiakuan, et al.
Pubblicazione: (2024)
di: Xie, Jiakuan, et al.
Pubblicazione: (2024)
CoLA: Collaborative Low-Rank Adaptation
di: Zhou, Yiyun, et al.
Pubblicazione: (2025)
di: Zhou, Yiyun, et al.
Pubblicazione: (2025)
LatentLLM: Attention-Aware Joint Tensor Compression
di: Koike-Akino, Toshiaki, et al.
Pubblicazione: (2025)
di: Koike-Akino, Toshiaki, et al.
Pubblicazione: (2025)
A Theoretical Perspective for Speculative Decoding Algorithm
di: Yin, Ming, et al.
Pubblicazione: (2024)
di: Yin, Ming, et al.
Pubblicazione: (2024)
Beyond Binary: Turning Partial Success into Dense Verifiable Rewards for Reinforcement Learning in Code Generation
di: Wang, Longwen, et al.
Pubblicazione: (2026)
di: Wang, Longwen, et al.
Pubblicazione: (2026)
OjaKV: Context-Aware Online Low-Rank KV Cache Compression
di: Zhu, Yuxuan, et al.
Pubblicazione: (2025)
di: Zhu, Yuxuan, et al.
Pubblicazione: (2025)
AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration
di: Lin, Ji, et al.
Pubblicazione: (2023)
di: Lin, Ji, et al.
Pubblicazione: (2023)
CALVO: Improve Serving Efficiency for LLM Inferences with Intense Network Demands
di: Wang, Weiye, et al.
Pubblicazione: (2026)
di: Wang, Weiye, et al.
Pubblicazione: (2026)
Gated Integration of Low-Rank Adaptation for Continual Learning of Large Language Models
di: Liang, Yan-Shuo, et al.
Pubblicazione: (2025)
di: Liang, Yan-Shuo, et al.
Pubblicazione: (2025)
Modeling LLM Agent Reviewer Dynamics in Elo-Ranked Review System
di: Huang, Hsiang-Wei, et al.
Pubblicazione: (2026)
di: Huang, Hsiang-Wei, et al.
Pubblicazione: (2026)
A Bayesian Interpretation of Adaptive Low-Rank Adaptation
di: Chen, Haolin, et al.
Pubblicazione: (2024)
di: Chen, Haolin, et al.
Pubblicazione: (2024)
Adaptive Feature-based Low-Rank Compression of Large Language Models via Bayesian Optimization
di: Ji, Yixin, et al.
Pubblicazione: (2024)
di: Ji, Yixin, et al.
Pubblicazione: (2024)
Entropy Law: The Story Behind Data Compression and LLM Performance
di: Yin, Mingjia, et al.
Pubblicazione: (2024)
di: Yin, Mingjia, et al.
Pubblicazione: (2024)
Optima: Optimizing Effectiveness and Efficiency for LLM-Based Multi-Agent System
di: Chen, Weize, et al.
Pubblicazione: (2024)
di: Chen, Weize, et al.
Pubblicazione: (2024)
ASLoRA: Adaptive Sharing Low-Rank Adaptation Across Layers
di: Hu, Junyan, et al.
Pubblicazione: (2024)
di: Hu, Junyan, et al.
Pubblicazione: (2024)
LLM4Ranking: An Easy-to-use Framework of Utilizing Large Language Models for Document Reranking
di: Liu, Qi, et al.
Pubblicazione: (2025)
di: Liu, Qi, et al.
Pubblicazione: (2025)
Low-Rank Prehab: Preparing Neural Networks for SVD Compression
di: Qin, Haoran, et al.
Pubblicazione: (2025)
di: Qin, Haoran, et al.
Pubblicazione: (2025)
Beyond Heuristics: A Decision-Theoretic Framework for Agent Memory Management
di: Sun, Changzhi, et al.
Pubblicazione: (2025)
di: Sun, Changzhi, et al.
Pubblicazione: (2025)
Intelligent Understanding of Large Language Models in Traditional Chinese Medicine Based on Prompt Engineering Framework
di: Chen, Yirui, et al.
Pubblicazione: (2024)
di: Chen, Yirui, et al.
Pubblicazione: (2024)
Penrose Tiled Low-Rank Compression and Section-Wise Q&A Fine-Tuning: A General Framework for Domain-Specific Large Language Model Adaptation
di: Kuo, Chuan-Wei, et al.
Pubblicazione: (2025)
di: Kuo, Chuan-Wei, et al.
Pubblicazione: (2025)
MoR: Mixture of Ranks for Low-Rank Adaptation Tuning
di: Tang, Chuanyu, et al.
Pubblicazione: (2024)
di: Tang, Chuanyu, et al.
Pubblicazione: (2024)
Documenti analoghi
-
KV-CoRE: Benchmarking Data-Dependent Low-Rank Compressibility of KV-Caches in LLMs
di: Chen, Jian, et al.
Pubblicazione: (2026) -
SAES-SVD: Self-Adaptive Suppression of Accumulated and Local Errors for SVD-based LLM Compression
di: Hu, Xing, et al.
Pubblicazione: (2026) -
ERC-SVD: Error-Controlled SVD for Large Language Model Compression
di: Bai, Haolei, et al.
Pubblicazione: (2025) -
Low-Rank Adapters Meet Neural Architecture Search for LLM Compression
di: Muñoz, J. Pablo, et al.
Pubblicazione: (2025) -
Enhancing Delta Compression in LLMs via SVD-based Quantization Error Minimization
di: Xiong, Boya, et al.
Pubblicazione: (2025)