ICPC: In-context Prompt Compression with Faster Inference
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yu, Ziyang, Liu, Yuyu |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Prompt Compression in the Wild: Measuring Latency, Rate Adherence, and Quality for Faster LLM Inference
par: Kummer, Cornelius, et autres
Publié: (2026)
par: Kummer, Cornelius, et autres
Publié: (2026)
Dynamic Compressing Prompts for Efficient Inference of Large Language Models
par: Hu, Jinwu, et autres
Publié: (2025)
par: Hu, Jinwu, et autres
Publié: (2025)
EFPC: Towards Efficient and Flexible Prompt Compression
par: Cao, Yun-Hao, et autres
Publié: (2025)
par: Cao, Yun-Hao, et autres
Publié: (2025)
Informed Routing in LLMs: Smarter Token-Level Computation for Faster Inference
par: Han, Chao, et autres
Publié: (2025)
par: Han, Chao, et autres
Publié: (2025)
Discrete Prompt Compression with Reinforcement Learning
par: Jung, Hoyoun, et autres
Publié: (2023)
par: Jung, Hoyoun, et autres
Publié: (2023)
Provable Benefits of Task-Specific Prompts for In-context Learning
par: Chang, Xiangyu, et autres
Publié: (2025)
par: Chang, Xiangyu, et autres
Publié: (2025)
Learning to Compress Prompt in Natural Language Formats
par: Chuang, Yu-Neng, et autres
Publié: (2024)
par: Chuang, Yu-Neng, et autres
Publié: (2024)
Parse Trees Guided LLM Prompt Compression
par: Mao, Wenhao, et autres
Publié: (2024)
par: Mao, Wenhao, et autres
Publié: (2024)
Efficient and Effective Prompt Tuning via Prompt Decomposition and Compressed Outer Product
par: Lan, Pengxiang, et autres
Publié: (2025)
par: Lan, Pengxiang, et autres
Publié: (2025)
Copy-as-Decode: Grammar-Constrained Parallel Prefill for LLM Editing
par: Liu, Ziyang
Publié: (2026)
par: Liu, Ziyang
Publié: (2026)
Cooperative Memory Paging with Keyword Bookmarks for Long-Horizon LLM Conversations
par: Liu, Ziyang
Publié: (2026)
par: Liu, Ziyang
Publié: (2026)
SCOPE: A Generative Approach for LLM Prompt Compression
par: Zhang, Tinghui, et autres
Publié: (2025)
par: Zhang, Tinghui, et autres
Publié: (2025)
An Empirical Study on Prompt Compression for Large Language Models
par: Zhang, Zheng, et autres
Publié: (2025)
par: Zhang, Zheng, et autres
Publié: (2025)
Prompt-SAW: Leveraging Relation-Aware Graphs for Textual Prompt Compression
par: Ali, Muhammad Asif, et autres
Publié: (2024)
par: Ali, Muhammad Asif, et autres
Publié: (2024)
Green Prompting: Characterizing Prompt-driven Energy Costs of LLM Inference
par: Adamska, Marta, et autres
Publié: (2025)
par: Adamska, Marta, et autres
Publié: (2025)
VocalNet: Speech LLM with Multi-Token Prediction for Faster and High-Quality Generation
par: Wang, Yuhao, et autres
Publié: (2025)
par: Wang, Yuhao, et autres
Publié: (2025)
Agile-Quant: Activation-Guided Quantization for Faster Inference of LLMs on the Edge
par: Shen, Xuan, et autres
Publié: (2023)
par: Shen, Xuan, et autres
Publié: (2023)
Dynamic Depth Decoding: Faster Speculative Decoding for LLMs
par: Brown, Oscar, et autres
Publié: (2024)
par: Brown, Oscar, et autres
Publié: (2024)
PIS: Linking Importance Sampling and Attention Mechanisms for Efficient Prompt Compression
par: Chen, Lizhe, et autres
Publié: (2025)
par: Chen, Lizhe, et autres
Publié: (2025)
Smarter, Better, Faster, Longer: A Modern Bidirectional Encoder for Fast, Memory Efficient, and Long Context Finetuning and Inference
par: Warner, Benjamin, et autres
Publié: (2024)
par: Warner, Benjamin, et autres
Publié: (2024)
Self-Supervised Prompt Optimization
par: Xiang, Jinyu, et autres
Publié: (2025)
par: Xiang, Jinyu, et autres
Publié: (2025)
Prompt Cache: Modular Attention Reuse for Low-Latency Inference
par: Gim, In, et autres
Publié: (2023)
par: Gim, In, et autres
Publié: (2023)
Can Language Models Take A Hint? Prompting for Controllable Contextualized Commonsense Inference
par: Colon-Hernandez, Pedro, et autres
Publié: (2024)
par: Colon-Hernandez, Pedro, et autres
Publié: (2024)
Falcon: Faster and Parallel Inference of Large Language Models through Enhanced Semi-Autoregressive Drafting and Custom-Designed Decoding Tree
par: Gao, Xiangxiang, et autres
Publié: (2024)
par: Gao, Xiangxiang, et autres
Publié: (2024)
SafeCtrl-RL: Inference-Time Adaptive Behaviour Control for LLM Dialogue via RL-Driven Prompt Optimisation
par: Orme, Michael, et autres
Publié: (2026)
par: Orme, Michael, et autres
Publié: (2026)
Fine-Tuned Language Models for Domain-Specific Summarization and Tagging
par: Wang, Jun, et autres
Publié: (2025)
par: Wang, Jun, et autres
Publié: (2025)
Take Care of Your Prompt Bias! Investigating and Mitigating Prompt Bias in Factual Knowledge Extraction
par: Xu, Ziyang, et autres
Publié: (2024)
par: Xu, Ziyang, et autres
Publié: (2024)
In-context Autoencoder for Context Compression in a Large Language Model
par: Ge, Tao, et autres
Publié: (2023)
par: Ge, Tao, et autres
Publié: (2023)
Prompt Compression in Diffusion Large Language Models: Evaluating LLMLingua-2 on LLaDA
par: Huang, Sterling, et autres
Publié: (2026)
par: Huang, Sterling, et autres
Publié: (2026)
Structsum Generation for Faster Text Comprehension
par: Jain, Parag, et autres
Publié: (2024)
par: Jain, Parag, et autres
Publié: (2024)
HeteroCache: A Dynamic Retrieval Approach to Heterogeneous KV Cache Compression for Long-Context LLM Inference
par: Shi, Zhiyuan, et autres
Publié: (2026)
par: Shi, Zhiyuan, et autres
Publié: (2026)
Depth Registers Unlock W4A4 on SwiGLU: A Reader/Generator Decomposition
par: Liu, Ziyang
Publié: (2026)
par: Liu, Ziyang
Publié: (2026)
BayesPrompt: Prompting Large-Scale Pre-Trained Language Models on Few-shot Inference via Debiased Domain Abstraction
par: Li, Jiangmeng, et autres
Publié: (2024)
par: Li, Jiangmeng, et autres
Publié: (2024)
Inference-Aware Prompt Optimization for Aligning Black-Box Large Language Models
par: Mahmud, Saaduddin, et autres
Publié: (2025)
par: Mahmud, Saaduddin, et autres
Publié: (2025)
GRL-Prompt: Towards Knowledge Graph based Prompt Optimization via Reinforcement Learning
par: Liu, Yuze, et autres
Publié: (2024)
par: Liu, Yuze, et autres
Publié: (2024)
AhaKV: Adaptive Holistic Attention-Driven KV Cache Eviction for Efficient Inference of Large Language Models
par: Gu, Yifeng, et autres
Publié: (2025)
par: Gu, Yifeng, et autres
Publié: (2025)
LightRetriever: A LLM-based Text Retrieval Architecture with Extremely Faster Query Inference
par: Ma, Guangyuan, et autres
Publié: (2025)
par: Ma, Guangyuan, et autres
Publié: (2025)
PromptEmbedder:: Efficient and Transferable Text Embedding via Dual-LLM Soft Prompting
par: Tsai, Yu-Che, et autres
Publié: (2026)
par: Tsai, Yu-Che, et autres
Publié: (2026)
Revisiting In-context Learning Inference Circuit in Large Language Models
par: Cho, Hakaze, et autres
Publié: (2024)
par: Cho, Hakaze, et autres
Publié: (2024)
Communication Compression for Tensor Parallel LLM Inference
par: Hansen-Palmus, Jan, et autres
Publié: (2024)
par: Hansen-Palmus, Jan, et autres
Publié: (2024)
Documents similaires
-
Prompt Compression in the Wild: Measuring Latency, Rate Adherence, and Quality for Faster LLM Inference
par: Kummer, Cornelius, et autres
Publié: (2026) -
Dynamic Compressing Prompts for Efficient Inference of Large Language Models
par: Hu, Jinwu, et autres
Publié: (2025) -
EFPC: Towards Efficient and Flexible Prompt Compression
par: Cao, Yun-Hao, et autres
Publié: (2025) -
Informed Routing in LLMs: Smarter Token-Level Computation for Faster Inference
par: Han, Chao, et autres
Publié: (2025) -
Discrete Prompt Compression with Reinforcement Learning
par: Jung, Hoyoun, et autres
Publié: (2023)