Characterizing Prompt Compression Methods for Long Context Inference
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Jha, Siddharth, Erdogan, Lutfi Eren, Kim, Sehoon, Keutzer, Kurt, Gholami, Amir |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Efficient and Scalable Estimation of Tool Representations in Vector Space
par: Moon, Suhong, et autres
Publié: (2024)
par: Moon, Suhong, et autres
Publié: (2024)
TinyAgent: Function Calling at the Edge
par: Erdogan, Lutfi Eren, et autres
Publié: (2024)
par: Erdogan, Lutfi Eren, et autres
Publié: (2024)
Plan-and-Act: Improving Planning of Agents for Long-Horizon Tasks
par: Erdogan, Lutfi Eren, et autres
Publié: (2025)
par: Erdogan, Lutfi Eren, et autres
Publié: (2025)
Multipole Attention for Efficient Long Context Reasoning
par: Hooper, Coleman, et autres
Publié: (2025)
par: Hooper, Coleman, et autres
Publié: (2025)
Learned Best-Effort LLM Serving
par: Jha, Siddharth, et autres
Publié: (2024)
par: Jha, Siddharth, et autres
Publié: (2024)
SqueezeLLM: Dense-and-Sparse Quantization
par: Kim, Sehoon, et autres
Publié: (2023)
par: Kim, Sehoon, et autres
Publié: (2023)
Squeezed Attention: Accelerating Long Context Length LLM Inference
par: Hooper, Coleman, et autres
Publié: (2024)
par: Hooper, Coleman, et autres
Publié: (2024)
KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization
par: Hooper, Coleman, et autres
Publié: (2024)
par: Hooper, Coleman, et autres
Publié: (2024)
Agentic Test-Time Scaling for WebAgents
par: Lee, Nicholas, et autres
Publié: (2026)
par: Lee, Nicholas, et autres
Publié: (2026)
Stochastic Communication Avoidance for Recommendation Systems
par: Erdogan, Lutfi Eren, et autres
Publié: (2024)
par: Erdogan, Lutfi Eren, et autres
Publié: (2024)
Beyond Next-Token Prediction: A Performance Characterization of Diffusion versus Autoregressive Language Models
par: Kim, Minseo, et autres
Publié: (2025)
par: Kim, Minseo, et autres
Publié: (2025)
CDLM: Consistency Diffusion Language Models For Faster Sampling
par: Kim, Minseo, et autres
Publié: (2025)
par: Kim, Minseo, et autres
Publié: (2025)
AI and Memory Wall
par: Gholami, Amir, et autres
Publié: (2024)
par: Gholami, Amir, et autres
Publié: (2024)
SPEED: Speculative Pipelined Execution for Efficient Decoding
par: Hooper, Coleman, et autres
Publié: (2023)
par: Hooper, Coleman, et autres
Publié: (2023)
One Model is All You Need: ByT5-Sanskrit, a Unified Model for Sanskrit NLP Tasks
par: Nehrdich, Sebastian, et autres
Publié: (2024)
par: Nehrdich, Sebastian, et autres
Publié: (2024)
Simple and Effective Input Reformulations for Translation
par: Yu, Brian, et autres
Publié: (2023)
par: Yu, Brian, et autres
Publié: (2023)
LongLLMLingua: Accelerating and Enhancing LLMs in Long Context Scenarios via Prompt Compression
par: Jiang, Huiqiang, et autres
Publié: (2023)
par: Jiang, Huiqiang, et autres
Publié: (2023)
Prompt Compression with Context-Aware Sentence Encoding for Fast and Improved LLM Inference
par: Liskavets, Barys, et autres
Publié: (2024)
par: Liskavets, Barys, et autres
Publié: (2024)
LLoCO: Learning Long Contexts Offline
par: Tan, Sijun, et autres
Publié: (2024)
par: Tan, Sijun, et autres
Publié: (2024)
An LLM Compiler for Parallel Function Calling
par: Kim, Sehoon, et autres
Publié: (2023)
par: Kim, Sehoon, et autres
Publié: (2023)
APB: Accelerating Distributed Long-Context Inference by Passing Compressed Context Blocks across GPUs
par: Huang, Yuxiang, et autres
Publié: (2025)
par: Huang, Yuxiang, et autres
Publié: (2025)
ETS: Efficient Tree Search for Inference-Time Scaling
par: Hooper, Coleman, et autres
Publié: (2025)
par: Hooper, Coleman, et autres
Publié: (2025)
LoSA: Locality Aware Sparse Attention for Block-Wise Diffusion Language Models
par: Xi, Haocheng, et autres
Publié: (2026)
par: Xi, Haocheng, et autres
Publié: (2026)
DynSplit-KV: Dynamic Semantic Splitting for KVCache Compression in Efficient Long-Context LLM Inference
par: Ye, Jiancai, et autres
Publié: (2026)
par: Ye, Jiancai, et autres
Publié: (2026)
RocketKV: Accelerating Long-Context LLM Inference via Two-Stage KV Cache Compression
par: Behnam, Payman, et autres
Publié: (2025)
par: Behnam, Payman, et autres
Publié: (2025)
Token Sparse Attention: Efficient Long-Context Inference with Interleaved Token Selection
par: Jo, Dongwon, et autres
Publié: (2026)
par: Jo, Dongwon, et autres
Publié: (2026)
Arbitrage: Efficient Reasoning via Advantage-Aware Speculation
par: Maheswaran, Monishwaran, et autres
Publié: (2025)
par: Maheswaran, Monishwaran, et autres
Publié: (2025)
SCBench: A KV Cache-Centric Analysis of Long-Context Methods
par: Li, Yucheng, et autres
Publié: (2024)
par: Li, Yucheng, et autres
Publié: (2024)
LoCoCo: Dropping In Convolutions for Long Context Compression
par: Cai, Ruisi, et autres
Publié: (2024)
par: Cai, Ruisi, et autres
Publié: (2024)
Compress, Gather, and Recompute: REFORMing Long-Context Processing in Transformers
par: Song, Woomin, et autres
Publié: (2025)
par: Song, Woomin, et autres
Publié: (2025)
LLMSteer: Improving Long-Context LLM Inference by Steering Attention on Reused Contexts
par: Gu, Zhuohan, et autres
Publié: (2024)
par: Gu, Zhuohan, et autres
Publié: (2024)
UT-ACA: Uncertainty-Triggered Adaptive Context Allocation for Long-Context Inference
par: Zhou, Lang, et autres
Publié: (2026)
par: Zhou, Lang, et autres
Publié: (2026)
LLM2LLM: Boosting LLMs with Novel Iterative Data Enhancement
par: Lee, Nicholas, et autres
Publié: (2024)
par: Lee, Nicholas, et autres
Publié: (2024)
Revisiting In-Context Learning with Long Context Language Models
par: Baek, Jinheon, et autres
Publié: (2024)
par: Baek, Jinheon, et autres
Publié: (2024)
QFT: Quantized Full-parameter Tuning of LLMs with Affordable Resources
par: Li, Zhikai, et autres
Publié: (2023)
par: Li, Zhikai, et autres
Publié: (2023)
Training-Inference Consistent Segmented Execution for Long-Context LLMs
par: Shang, Xianpeng, et autres
Publié: (2026)
par: Shang, Xianpeng, et autres
Publié: (2026)
Green Prompting: Characterizing Prompt-driven Energy Costs of LLM Inference
par: Adamska, Marta, et autres
Publié: (2025)
par: Adamska, Marta, et autres
Publié: (2025)
Quest: Query-Aware Sparsity for Efficient Long-Context LLM Inference
par: Tang, Jiaming, et autres
Publié: (2024)
par: Tang, Jiaming, et autres
Publié: (2024)
Compressed Context Memory For Online Language Model Interaction
par: Kim, Jang-Hyun, et autres
Publié: (2023)
par: Kim, Jang-Hyun, et autres
Publié: (2023)
Adapting LLMs for Efficient Context Processing through Soft Prompt Compression
par: Wang, Cangqing, et autres
Publié: (2024)
par: Wang, Cangqing, et autres
Publié: (2024)
Documents similaires
-
Efficient and Scalable Estimation of Tool Representations in Vector Space
par: Moon, Suhong, et autres
Publié: (2024) -
TinyAgent: Function Calling at the Edge
par: Erdogan, Lutfi Eren, et autres
Publié: (2024) -
Plan-and-Act: Improving Planning of Agents for Long-Horizon Tasks
par: Erdogan, Lutfi Eren, et autres
Publié: (2025) -
Multipole Attention for Efficient Long Context Reasoning
par: Hooper, Coleman, et autres
Publié: (2025) -
Learned Best-Effort LLM Serving
par: Jha, Siddharth, et autres
Publié: (2024)