Dynamic Compressing Prompts for Efficient Inference of Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Hu, Jinwu, Zhang, Wei, Wang, Yufeng, Hu, Yu, Xiao, Bin, Tan, Mingkui, Du, Qing |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Test-Time Learning for Large Language Models
by: Hu, Jinwu, et al.
Published: (2025)
by: Hu, Jinwu, et al.
Published: (2025)
Precedent-Informed Reasoning: Mitigating Overthinking in Large Reasoning Models via Test-Time Precedent Learning
by: Wang, Qianyue, et al.
Published: (2026)
by: Wang, Qianyue, et al.
Published: (2026)
Efficient Dynamic Ensembling for Multiple LLM Experts
by: Hu, Jinwu, et al.
Published: (2024)
by: Hu, Jinwu, et al.
Published: (2024)
When Compression Meets Model Compression: Memory-Efficient Double Compression for Large Language Models
by: Wang, Weilan, et al.
Published: (2025)
by: Wang, Weilan, et al.
Published: (2025)
Beyond Fast and Slow: Cognitive-Inspired Elastic Reasoning for Large Language Models
by: Hu, Jinwu, et al.
Published: (2025)
by: Hu, Jinwu, et al.
Published: (2025)
An Empirical Study on Prompt Compression for Large Language Models
by: Zhang, Zheng, et al.
Published: (2025)
by: Zhang, Zheng, et al.
Published: (2025)
Generating Long-form Story Using Dynamic Hierarchical Outlining with Memory-Enhancement
by: Wang, Qianyue, et al.
Published: (2024)
by: Wang, Qianyue, et al.
Published: (2024)
Training-Free Test-Time Contrastive Learning for Large Language Models
by: Zheng, Kaiwen, et al.
Published: (2026)
by: Zheng, Kaiwen, et al.
Published: (2026)
In-context Autoencoder for Context Compression in a Large Language Model
by: Ge, Tao, et al.
Published: (2023)
by: Ge, Tao, et al.
Published: (2023)
Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion
by: Chen, Zhuokun, et al.
Published: (2024)
by: Chen, Zhuokun, et al.
Published: (2024)
Model Compression and Efficient Inference for Large Language Models: A Survey
by: Wang, Wenxiao, et al.
Published: (2024)
by: Wang, Wenxiao, et al.
Published: (2024)
DROJ: A Prompt-Driven Attack against Large Language Models
by: Hu, Leyang, et al.
Published: (2024)
by: Hu, Leyang, et al.
Published: (2024)
A Survey on Efficient Inference for Large Language Models
by: Zhou, Zixuan, et al.
Published: (2024)
by: Zhou, Zixuan, et al.
Published: (2024)
EFPC: Towards Efficient and Flexible Prompt Compression
by: Cao, Yun-Hao, et al.
Published: (2025)
by: Cao, Yun-Hao, et al.
Published: (2025)
ICPC: In-context Prompt Compression with Faster Inference
by: Yu, Ziyang, et al.
Published: (2025)
by: Yu, Ziyang, et al.
Published: (2025)
CMT: A Memory Compression Method for Continual Knowledge Learning of Large Language Models
by: Li, Dongfang, et al.
Published: (2024)
by: Li, Dongfang, et al.
Published: (2024)
KDFlow: A User-Friendly and Efficient Knowledge Distillation Framework for Large Language Models
by: Zhang, Songming, et al.
Published: (2026)
by: Zhang, Songming, et al.
Published: (2026)
Beyond Model Scaling: Test-Time Intervention for Efficient Deep Reasoning
by: Wang, Qianyue, et al.
Published: (2026)
by: Wang, Qianyue, et al.
Published: (2026)
PromptBridge: Cross-Model Prompt Transfer for Large Language Models
by: Wang, Yaxuan, et al.
Published: (2025)
by: Wang, Yaxuan, et al.
Published: (2025)
On the Compressibility of Quantized Large Language Models
by: Mao, Yu, et al.
Published: (2024)
by: Mao, Yu, et al.
Published: (2024)
Are Large Language Models Good Prompt Optimizers?
by: Ma, Ruotian, et al.
Published: (2024)
by: Ma, Ruotian, et al.
Published: (2024)
MiCU: End-to-End Smart Home Command Understanding with Large Language Model
by: Han, Haowei, et al.
Published: (2026)
by: Han, Haowei, et al.
Published: (2026)
Learning to Compress Prompt in Natural Language Formats
by: Chuang, Yu-Neng, et al.
Published: (2024)
by: Chuang, Yu-Neng, et al.
Published: (2024)
EvidFuse: Writing-Time Evidence Learning for Consistent Text-Chart Data Reporting
by: Lin, Huanxiang, et al.
Published: (2026)
by: Lin, Huanxiang, et al.
Published: (2026)
KnowGPT: Knowledge Graph based Prompting for Large Language Models
by: Zhang, Qinggang, et al.
Published: (2023)
by: Zhang, Qinggang, et al.
Published: (2023)
Learning to Compress: Unlocking the Potential of Large Language Models for Text Representation
by: Zhang, Yeqin, et al.
Published: (2025)
by: Zhang, Yeqin, et al.
Published: (2025)
dInfer: An Efficient Inference Framework for Diffusion Language Models
by: Ma, Yuxin, et al.
Published: (2025)
by: Ma, Yuxin, et al.
Published: (2025)
Graph Neural Prompting with Large Language Models
by: Tian, Yijun, et al.
Published: (2023)
by: Tian, Yijun, et al.
Published: (2023)
ALPS: Attention Localization and Pruning Strategy for Efficient Alignment of Large Language Models
by: Chen, Hao, et al.
Published: (2025)
by: Chen, Hao, et al.
Published: (2025)
Streamlining Redundant Layers to Compress Large Language Models
by: Chen, Xiaodong, et al.
Published: (2024)
by: Chen, Xiaodong, et al.
Published: (2024)
Dynamic Universal Approximation Theory: The Basic Theory for Transformer-based Large Language Models
by: Wang, Wei, et al.
Published: (2024)
by: Wang, Wei, et al.
Published: (2024)
Plato: Plan to Efficiently Decode for Large Language Model Inference
by: Jin, Shuowei, et al.
Published: (2024)
by: Jin, Shuowei, et al.
Published: (2024)
LLMCBench: Benchmarking Large Language Model Compression for Efficient Deployment
by: Yang, Ge, et al.
Published: (2024)
by: Yang, Ge, et al.
Published: (2024)
Prompt Compression in Diffusion Large Language Models: Evaluating LLMLingua-2 on LLaDA
by: Huang, Sterling, et al.
Published: (2026)
by: Huang, Sterling, et al.
Published: (2026)
Inference-Aware Prompt Optimization for Aligning Black-Box Large Language Models
by: Mahmud, Saaduddin, et al.
Published: (2025)
by: Mahmud, Saaduddin, et al.
Published: (2025)
Decoupled Reasoning with Implicit Fact Tokens (DRIFT): A Dual-Model Framework for Efficient Long-Context Inference
by: Xie, Wenxuan, et al.
Published: (2026)
by: Xie, Wenxuan, et al.
Published: (2026)
Saliency-driven Dynamic Token Pruning for Large Language Models
by: Tao, Yao, et al.
Published: (2025)
by: Tao, Yao, et al.
Published: (2025)
Dynamic Adaptive Rank Space Exploration for Efficient Sentiment Analysis with Large Language Models
by: Ding, Hongcheng, et al.
Published: (2024)
by: Ding, Hongcheng, et al.
Published: (2024)
The Price of Prompting: Profiling Energy Use in Large Language Models Inference
by: Husom, Erik Johannes, et al.
Published: (2024)
by: Husom, Erik Johannes, et al.
Published: (2024)
CSV-Decode: Certifiable Sub-Vocabulary Decoding for Efficient Large Language Model Inference
by: Liu, Dong, et al.
Published: (2025)
by: Liu, Dong, et al.
Published: (2025)
Similar Items
-
Test-Time Learning for Large Language Models
by: Hu, Jinwu, et al.
Published: (2025) -
Precedent-Informed Reasoning: Mitigating Overthinking in Large Reasoning Models via Test-Time Precedent Learning
by: Wang, Qianyue, et al.
Published: (2026) -
Efficient Dynamic Ensembling for Multiple LLM Experts
by: Hu, Jinwu, et al.
Published: (2024) -
When Compression Meets Model Compression: Memory-Efficient Double Compression for Large Language Models
by: Wang, Weilan, et al.
Published: (2025) -
Beyond Fast and Slow: Cognitive-Inspired Elastic Reasoning for Large Language Models
by: Hu, Jinwu, et al.
Published: (2025)