When Compression Meets Model Compression: Memory-Efficient Double Compression for Large Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Weilan, Mao, Yu, Tang, Dongdong, Du, Hongchao, Guan, Nan, Xue, Chun Jason |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
On the Compressibility of Quantized Large Language Models
por: Mao, Yu, et al.
Publicado: (2024)
por: Mao, Yu, et al.
Publicado: (2024)
Dynamic Compressing Prompts for Efficient Inference of Large Language Models
por: Hu, Jinwu, et al.
Publicado: (2025)
por: Hu, Jinwu, et al.
Publicado: (2025)
When Reasoning Meets Compression: Understanding the Effects of LLMs Compression on Large Reasoning Models
por: Zhang, Nan, et al.
Publicado: (2025)
por: Zhang, Nan, et al.
Publicado: (2025)
A Survey on Model Compression for Large Language Models
por: Zhu, Xunyu, et al.
Publicado: (2023)
por: Zhu, Xunyu, et al.
Publicado: (2023)
LLMCBench: Benchmarking Large Language Model Compression for Efficient Deployment
por: Yang, Ge, et al.
Publicado: (2024)
por: Yang, Ge, et al.
Publicado: (2024)
Clustering-driven Memory Compression for On-device Large Language Models
por: Bohdal, Ondrej, et al.
Publicado: (2026)
por: Bohdal, Ondrej, et al.
Publicado: (2026)
An Empirical Study on Prompt Compression for Large Language Models
por: Zhang, Zheng, et al.
Publicado: (2025)
por: Zhang, Zheng, et al.
Publicado: (2025)
ERC-SVD: Error-Controlled SVD for Large Language Model Compression
por: Bai, Haolei, et al.
Publicado: (2025)
por: Bai, Haolei, et al.
Publicado: (2025)
CMT: A Memory Compression Method for Continual Knowledge Learning of Large Language Models
por: Li, Dongfang, et al.
Publicado: (2024)
por: Li, Dongfang, et al.
Publicado: (2024)
Model Compression and Efficient Inference for Large Language Models: A Survey
por: Wang, Wenxiao, et al.
Publicado: (2024)
por: Wang, Wenxiao, et al.
Publicado: (2024)
LVLM-Compress-Bench: Benchmarking the Broader Impact of Large Vision-Language Model Compression
por: Kundu, Souvik, et al.
Publicado: (2025)
por: Kundu, Souvik, et al.
Publicado: (2025)
ZSMerge: Zero-Shot KV Cache Compression for Memory-Efficient Long-Context LLMs
por: Liu, Xin, et al.
Publicado: (2025)
por: Liu, Xin, et al.
Publicado: (2025)
R-Capsule: Compressing High-Level Plans for Efficient Large Language Model Reasoning
por: Shan, Hongyu, et al.
Publicado: (2025)
por: Shan, Hongyu, et al.
Publicado: (2025)
Aggressive Post-Training Compression on Extremely Large Language Models
por: Zhang, Zining, et al.
Publicado: (2024)
por: Zhang, Zining, et al.
Publicado: (2024)
Contextual Reinforcement in Multimodal Token Compression for Large Language Models
por: Piero, Naderdel, et al.
Publicado: (2025)
por: Piero, Naderdel, et al.
Publicado: (2025)
FlexInfer: Breaking Memory Constraint via Flexible and Efficient Offloading for On-Device LLM Inference
por: Du, Hongchao, et al.
Publicado: (2025)
por: Du, Hongchao, et al.
Publicado: (2025)
In-context Autoencoder for Context Compression in a Large Language Model
por: Ge, Tao, et al.
Publicado: (2023)
por: Ge, Tao, et al.
Publicado: (2023)
Streamlining Redundant Layers to Compress Large Language Models
por: Chen, Xiaodong, et al.
Publicado: (2024)
por: Chen, Xiaodong, et al.
Publicado: (2024)
Language Modeling Is Compression
por: Delétang, Grégoire, et al.
Publicado: (2023)
por: Delétang, Grégoire, et al.
Publicado: (2023)
Lossless Compression of Large Language Model-Generated Text via Next-Token Prediction
por: Mao, Yu, et al.
Publicado: (2025)
por: Mao, Yu, et al.
Publicado: (2025)
Optimizing Length Compression in Large Reasoning Models
por: Cheng, Zhengxiang, et al.
Publicado: (2025)
por: Cheng, Zhengxiang, et al.
Publicado: (2025)
ROSAQ: Rotation-based Saliency-Aware Weight Quantization for Efficiently Compressing Large Language Models
por: Yoon, Junho, et al.
Publicado: (2025)
por: Yoon, Junho, et al.
Publicado: (2025)
SkipCat: Rank-Maximized Low-Rank Compression of Large Language Models via Shared Projection and Block Skipping
por: Lu, Yu-Chen, et al.
Publicado: (2025)
por: Lu, Yu-Chen, et al.
Publicado: (2025)
Learning to Compress: Unlocking the Potential of Large Language Models for Text Representation
por: Zhang, Yeqin, et al.
Publicado: (2025)
por: Zhang, Yeqin, et al.
Publicado: (2025)
Evaluating Large Language Models for Generalization and Robustness via Data Compression
por: Li, Yucheng, et al.
Publicado: (2024)
por: Li, Yucheng, et al.
Publicado: (2024)
Decoding Compressed Trust: Scrutinizing the Trustworthiness of Efficient LLMs Under Compression
por: Hong, Junyuan, et al.
Publicado: (2024)
por: Hong, Junyuan, et al.
Publicado: (2024)
BitStack: Any-Size Compression of Large Language Models in Variable Memory Environments
por: Wang, Xinghao, et al.
Publicado: (2024)
por: Wang, Xinghao, et al.
Publicado: (2024)
Vision Token Reduction via Attention-Driven Self-Compression for Efficient Multimodal Large Language Models
por: Deniz, Omer Faruk, et al.
Publicado: (2026)
por: Deniz, Omer Faruk, et al.
Publicado: (2026)
Compressed Convolutional Attention: Efficient Attention in a Compressed Latent Space
por: Figliolia, Tomas, et al.
Publicado: (2025)
por: Figliolia, Tomas, et al.
Publicado: (2025)
Compressing Sequences in the Latent Embedding Space: $K$-Token Merging for Large Language Models
por: Xu, Zihao, et al.
Publicado: (2026)
por: Xu, Zihao, et al.
Publicado: (2026)
Projected Compression: Trainable Projection for Efficient Transformer Compression
por: Stefaniak, Maciej, et al.
Publicado: (2025)
por: Stefaniak, Maciej, et al.
Publicado: (2025)
LoRAP: Transformer Sub-Layers Deserve Differentiated Structured Compression for Large Language Models
por: Li, Guangyan, et al.
Publicado: (2024)
por: Li, Guangyan, et al.
Publicado: (2024)
Parse Trees Guided LLM Prompt Compression
por: Mao, Wenhao, et al.
Publicado: (2024)
por: Mao, Wenhao, et al.
Publicado: (2024)
Language Models Resist Alignment: Evidence From Data Compression
por: Ji, Jiaming, et al.
Publicado: (2024)
por: Ji, Jiaming, et al.
Publicado: (2024)
EvoP: Robust LLM Inference via Evolutionary Pruning
por: Wu, Shangyu, et al.
Publicado: (2025)
por: Wu, Shangyu, et al.
Publicado: (2025)
Towards Audio Token Compression in Large Audio Language Models
por: Bhati, Saurabhchand, et al.
Publicado: (2025)
por: Bhati, Saurabhchand, et al.
Publicado: (2025)
Prompt Compression in Diffusion Large Language Models: Evaluating LLMLingua-2 on LLaDA
por: Huang, Sterling, et al.
Publicado: (2026)
por: Huang, Sterling, et al.
Publicado: (2026)
Fast Vocabulary Transfer for Language Model Compression
por: Gee, Leonidas, et al.
Publicado: (2024)
por: Gee, Leonidas, et al.
Publicado: (2024)
Noise-Robust Abstractive Compression in Retrieval-Augmented Language Models
por: Kim, Singon
Publicado: (2025)
por: Kim, Singon
Publicado: (2025)
ClusComp: A Simple Paradigm for Model Compression and Efficient Finetuning
por: Liao, Baohao, et al.
Publicado: (2025)
por: Liao, Baohao, et al.
Publicado: (2025)
Ejemplares similares
-
On the Compressibility of Quantized Large Language Models
por: Mao, Yu, et al.
Publicado: (2024) -
Dynamic Compressing Prompts for Efficient Inference of Large Language Models
por: Hu, Jinwu, et al.
Publicado: (2025) -
When Reasoning Meets Compression: Understanding the Effects of LLMs Compression on Large Reasoning Models
por: Zhang, Nan, et al.
Publicado: (2025) -
A Survey on Model Compression for Large Language Models
por: Zhu, Xunyu, et al.
Publicado: (2023) -
LLMCBench: Benchmarking Large Language Model Compression for Efficient Deployment
por: Yang, Ge, et al.
Publicado: (2024)