LLMSteer: Improving Long-Context LLM Inference by Steering Attention on Reused Contexts
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Gu, Zhuohan, Yao, Jiayi, Du, Kuntai, Jiang, Junchen |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
PEEK: Context Map as an Orientation Cache for Long-Context LLM Agents
par: Gu, Zhuohan, et autres
Publié: (2026)
par: Gu, Zhuohan, et autres
Publié: (2026)
DroidSpeak: KV Cache Sharing for Cross-LLM Communication and Multi-LLM Serving
par: Liu, Yuhan, et autres
Publié: (2024)
par: Liu, Yuhan, et autres
Publié: (2024)
METIS: Fast Quality-Aware RAG Systems with Configuration Adaptation
par: Ray, Siddhant, et autres
Publié: (2024)
par: Ray, Siddhant, et autres
Publié: (2024)
RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval
par: Liu, Di, et autres
Publié: (2024)
par: Liu, Di, et autres
Publié: (2024)
XKV: Personalized KV Cache Memory Reduction for Long-Context LLM Inference
par: Li, Weizhuo, et autres
Publié: (2024)
par: Li, Weizhuo, et autres
Publié: (2024)
FlexPrefill: A Context-Aware Sparse Attention Mechanism for Efficient Long-Sequence Inference
par: Lai, Xunhao, et autres
Publié: (2025)
par: Lai, Xunhao, et autres
Publié: (2025)
Ltri-LLM: Streaming Long Context Inference for LLMs with Training-Free Dynamic Triangular Attention Pattern
par: Tang, Hongyin, et autres
Publié: (2024)
par: Tang, Hongyin, et autres
Publié: (2024)
DynSplit-KV: Dynamic Semantic Splitting for KVCache Compression in Efficient Long-Context LLM Inference
par: Ye, Jiancai, et autres
Publié: (2026)
par: Ye, Jiancai, et autres
Publié: (2026)
S$^3$-Attention:Attention-Aligned Endogenous Retrieval for Memory-Bounded Long-Context Inference
par: Ma, Qingsen, et autres
Publié: (2026)
par: Ma, Qingsen, et autres
Publié: (2026)
Do Large Language Models Need a Content Delivery Network?
par: Cheng, Yihua, et autres
Publié: (2024)
par: Cheng, Yihua, et autres
Publié: (2024)
SampleAttention: Near-Lossless Acceleration of Long Context LLM Inference with Adaptive Structured Sparse Attention
par: Zhu, Qianchao, et autres
Publié: (2024)
par: Zhu, Qianchao, et autres
Publié: (2024)
Token Sparse Attention: Efficient Long-Context Inference with Interleaved Token Selection
par: Jo, Dongwon, et autres
Publié: (2026)
par: Jo, Dongwon, et autres
Publié: (2026)
Quest: Query-Aware Sparsity for Efficient Long-Context LLM Inference
par: Tang, Jiaming, et autres
Publié: (2024)
par: Tang, Jiaming, et autres
Publié: (2024)
Training-Inference Consistent Segmented Execution for Long-Context LLMs
par: Shang, Xianpeng, et autres
Publié: (2026)
par: Shang, Xianpeng, et autres
Publié: (2026)
Prompt Compression with Context-Aware Sentence Encoding for Fast and Improved LLM Inference
par: Liskavets, Barys, et autres
Publié: (2024)
par: Liskavets, Barys, et autres
Publié: (2024)
Multipole Attention for Efficient Long Context Reasoning
par: Hooper, Coleman, et autres
Publié: (2025)
par: Hooper, Coleman, et autres
Publié: (2025)
UT-ACA: Uncertainty-Triggered Adaptive Context Allocation for Long-Context Inference
par: Zhou, Lang, et autres
Publié: (2026)
par: Zhou, Lang, et autres
Publié: (2026)
Strategic Demonstration Selection for Improved Fairness in LLM In-Context Learning
par: Hu, Jingyu, et autres
Publié: (2024)
par: Hu, Jingyu, et autres
Publié: (2024)
Flux Attention: Context-Aware Hybrid Attention for Efficient LLMs Inference
par: Qiu, Quantong, et autres
Publié: (2026)
par: Qiu, Quantong, et autres
Publié: (2026)
Breaking Quadratic Barriers: A Non-Attention LLM for Ultra-Long Context Horizons
par: Kiruluta, Andrew, et autres
Publié: (2025)
par: Kiruluta, Andrew, et autres
Publié: (2025)
ShadowKV: KV Cache in Shadows for High-Throughput Long-Context LLM Inference
par: Sun, Hanshi, et autres
Publié: (2024)
par: Sun, Hanshi, et autres
Publié: (2024)
Probe and Skip: Self-Predictive Token Skipping for Efficient Long-Context LLM Inference
par: Wu, Zimeng, et autres
Publié: (2026)
par: Wu, Zimeng, et autres
Publié: (2026)
Scaling Long-Horizon LLM Agent via Context-Folding
par: Sun, Weiwei, et autres
Publié: (2025)
par: Sun, Weiwei, et autres
Publié: (2025)
LazyLLM: Dynamic Token Pruning for Efficient Long Context LLM Inference
par: Fu, Qichen, et autres
Publié: (2024)
par: Fu, Qichen, et autres
Publié: (2024)
DELTA: Dynamic Layer-Aware Token Attention for Efficient Long-Context Reasoning
par: Zarch, Hossein Entezari, et autres
Publié: (2025)
par: Zarch, Hossein Entezari, et autres
Publié: (2025)
PQCache: Product Quantization-based KVCache for Long Context LLM Inference
par: Zhang, Hailin, et autres
Publié: (2024)
par: Zhang, Hailin, et autres
Publié: (2024)
TTKV: Temporal-Tiered KV Cache for Long-Context LLM Inference
par: Dzikanyanga, Gradwell, et autres
Publié: (2026)
par: Dzikanyanga, Gradwell, et autres
Publié: (2026)
Characterizing Prompt Compression Methods for Long Context Inference
par: Jha, Siddharth, et autres
Publié: (2024)
par: Jha, Siddharth, et autres
Publié: (2024)
APB: Accelerating Distributed Long-Context Inference by Passing Compressed Context Blocks across GPUs
par: Huang, Yuxiang, et autres
Publié: (2025)
par: Huang, Yuxiang, et autres
Publié: (2025)
ContextPilot: Fast Long-Context Inference via Context Reuse
par: Jiang, Yinsicheng, et autres
Publié: (2025)
par: Jiang, Yinsicheng, et autres
Publié: (2025)
MoBA: Mixture of Block Attention for Long-Context LLMs
par: Lu, Enzhe, et autres
Publié: (2025)
par: Lu, Enzhe, et autres
Publié: (2025)
Tree Attention: Topology-aware Decoding for Long-Context Attention on GPU clusters
par: Shyam, Vasudev, et autres
Publié: (2024)
par: Shyam, Vasudev, et autres
Publié: (2024)
Found in the Middle: Calibrating Positional Attention Bias Improves Long Context Utilization
par: Hsieh, Cheng-Yu, et autres
Publié: (2024)
par: Hsieh, Cheng-Yu, et autres
Publié: (2024)
Unveiling Simplicities of Attention: Adaptive Long-Context Head Identification
par: Donhauser, Konstantin, et autres
Publié: (2025)
par: Donhauser, Konstantin, et autres
Publié: (2025)
RocketKV: Accelerating Long-Context LLM Inference via Two-Stage KV Cache Compression
par: Behnam, Payman, et autres
Publié: (2025)
par: Behnam, Payman, et autres
Publié: (2025)
Long-Short Alignment for Effective Long-Context Modeling in LLMs
par: Du, Tianqi, et autres
Publié: (2025)
par: Du, Tianqi, et autres
Publié: (2025)
Megalodon: Efficient LLM Pretraining and Inference with Unlimited Context Length
par: Ma, Xuezhe, et autres
Publié: (2024)
par: Ma, Xuezhe, et autres
Publié: (2024)
UCS: Estimating Unseen Coverage for Improved In-Context Learning
par: Xin, Jiayi, et autres
Publié: (2026)
par: Xin, Jiayi, et autres
Publié: (2026)
IndexCache: Accelerating Sparse Attention via Cross-Layer Index Reuse
par: Bai, Yushi, et autres
Publié: (2026)
par: Bai, Yushi, et autres
Publié: (2026)
Calibrate to Discriminate: Improve In-Context Learning with Label-Free Comparative Inference
par: Cheng, Wei, et autres
Publié: (2024)
par: Cheng, Wei, et autres
Publié: (2024)
Documents similaires
-
PEEK: Context Map as an Orientation Cache for Long-Context LLM Agents
par: Gu, Zhuohan, et autres
Publié: (2026) -
DroidSpeak: KV Cache Sharing for Cross-LLM Communication and Multi-LLM Serving
par: Liu, Yuhan, et autres
Publié: (2024) -
METIS: Fast Quality-Aware RAG Systems with Configuration Adaptation
par: Ray, Siddhant, et autres
Publié: (2024) -
RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval
par: Liu, Di, et autres
Publié: (2024) -
XKV: Personalized KV Cache Memory Reduction for Long-Context LLM Inference
par: Li, Weizhuo, et autres
Publié: (2024)