Paged Attention Meets FlexAttention: Unlocking Long-Context Efficiency in Deployed Inference
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Joshi, Thomas, Saini, Herman, Dhillon, Neil, Martin, Antoni Viros i, Maghraoui, Kaoutar El |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Using Span Queries to Optimize for Cache and Attention Locality
par: Castro, Paul, et autres
Publié: (2025)
par: Castro, Paul, et autres
Publié: (2025)
FlexAttention for Efficient High-Resolution Vision-Language Models
par: Li, Junyan, et autres
Publié: (2024)
par: Li, Junyan, et autres
Publié: (2024)
Long-Context Attention Benchmark: From Kernel Efficiency to Distributed Context Parallelism
par: Bu, Tao, et autres
Publié: (2025)
par: Bu, Tao, et autres
Publié: (2025)
Context-Aware Mixture-of-Experts Inference on CXL-Enabled GPU-NDP Systems
par: Fan, Zehao, et autres
Publié: (2025)
par: Fan, Zehao, et autres
Publié: (2025)
MISA: Mixture of Indexer Sparse Attention for Long-Context LLM Inference
par: Zhou, Ruijie, et autres
Publié: (2026)
par: Zhou, Ruijie, et autres
Publié: (2026)
Accelerating LLM Inference via Dynamic KV Cache Placement in Heterogeneous Memory System
par: Fang, Yunhua, et autres
Publié: (2025)
par: Fang, Yunhua, et autres
Publié: (2025)
SampleAttention: Near-Lossless Acceleration of Long Context LLM Inference with Adaptive Structured Sparse Attention
par: Zhu, Qianchao, et autres
Publié: (2024)
par: Zhu, Qianchao, et autres
Publié: (2024)
Efficient Low Rank Attention for Long-Context Inference in Large Language Models
par: Li, Tenghui, et autres
Publié: (2025)
par: Li, Tenghui, et autres
Publié: (2025)
FlexPrefill: A Context-Aware Sparse Attention Mechanism for Efficient Long-Sequence Inference
par: Lai, Xunhao, et autres
Publié: (2025)
par: Lai, Xunhao, et autres
Publié: (2025)
An Efficient Hybrid Sparse Attention with CPU-GPU Parallelism for Long-Context Inference
par: Yao, Feiyu, et autres
Publié: (2026)
par: Yao, Feiyu, et autres
Publié: (2026)
Long-Context Generalization with Sparse Attention
par: Vasylenko, Pavlo, et autres
Publié: (2025)
par: Vasylenko, Pavlo, et autres
Publié: (2025)
Robust Heterogeneous Analog-Digital Computing for Mixture-of-Experts Models with Theoretical Generalization Guarantees
par: Chowdhury, Mohammed Nowaz Rabbani, et autres
Publié: (2026)
par: Chowdhury, Mohammed Nowaz Rabbani, et autres
Publié: (2026)
Gated Sparse Attention: Combining Computational Efficiency with Training Stability for Long-Context Language Models
par: Shen, Alfred, et autres
Publié: (2026)
par: Shen, Alfred, et autres
Publié: (2026)
DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Acceleration
par: Zhang, Hanzhi, et autres
Publié: (2025)
par: Zhang, Hanzhi, et autres
Publié: (2025)
Kascade: A Practical Sparse Attention Method for Long-Context LLM Inference
par: Deshmukh, Dhruv, et autres
Publié: (2025)
par: Deshmukh, Dhruv, et autres
Publié: (2025)
Evaluating Temporal Semantic Caching and Workflow Optimization in Agentic Plan-Execute Pipelines
par: Merchant, Alimurtaza Mustafa, et autres
Publié: (2026)
par: Merchant, Alimurtaza Mustafa, et autres
Publié: (2026)
Ragged Paged Attention: A High-Performance and Flexible LLM Inference Kernel for TPU
par: Jiang, Jevin, et autres
Publié: (2026)
par: Jiang, Jevin, et autres
Publié: (2026)
Analog In-Memory Computing with Uncertainty Quantification for Efficient Edge-based Medical Imaging Segmentation
par: Hamzaoui, Imane, et autres
Publié: (2024)
par: Hamzaoui, Imane, et autres
Publié: (2024)
PHMForge: Evaluating LLM Agents on Industrial Prognostics through MCP-Native, Algorithm-Grounded Tools
par: Feng, Tianjun, et autres
Publié: (2026)
par: Feng, Tianjun, et autres
Publié: (2026)
RACE Attention: A Strictly Linear-Time Attention Layer for Training on Outrageously Large Contexts
par: Joshi, Sahil, et autres
Publié: (2025)
par: Joshi, Sahil, et autres
Publié: (2025)
Attention in Constant Time: Vashista Sparse Attention for Long-Context Decoding with Exponential Guarantees
par: Nobaub, Vashista
Publié: (2026)
par: Nobaub, Vashista
Publié: (2026)
Efficient Quantization of Mixture-of-Experts with Theoretical Generalization Guarantees
par: Chowdhury, Mohammed Nowaz Rabbani, et autres
Publié: (2026)
par: Chowdhury, Mohammed Nowaz Rabbani, et autres
Publié: (2026)
SEAL: Scaling to Emphasize Attention for Long-Context Retrieval
par: Lee, Changhun, et autres
Publié: (2025)
par: Lee, Changhun, et autres
Publié: (2025)
Attack-Resilient Image Watermarking Using Stable Diffusion
par: Zhang, Lijun, et autres
Publié: (2024)
par: Zhang, Lijun, et autres
Publié: (2024)
Towards Mechanistic Interpretability of Graph Transformers via Attention Graphs
par: El, Batu, et autres
Publié: (2025)
par: El, Batu, et autres
Publié: (2025)
Efficient Context Scaling with LongCat ZigZag Attention
par: Zhang, Chen, et autres
Publié: (2025)
par: Zhang, Chen, et autres
Publié: (2025)
MKA: Memory-Keyed Attention for Efficient Long-Context Reasoning
par: Liu, Dong, et autres
Publié: (2026)
par: Liu, Dong, et autres
Publié: (2026)
LongHeads: Multi-Head Attention is Secretly a Long Context Processor
par: Lu, Yi, et autres
Publié: (2024)
par: Lu, Yi, et autres
Publié: (2024)
LLMs Know What to Drop: Self-Attention Guided KV Cache Eviction for Efficient Long-Context Inference
par: Wang, Guangtao, et autres
Publié: (2025)
par: Wang, Guangtao, et autres
Publié: (2025)
Star Attention: Efficient LLM Inference over Long Sequences
par: Acharya, Shantanu, et autres
Publié: (2024)
par: Acharya, Shantanu, et autres
Publié: (2024)
HiCI: Hierarchical Construction-Integration for Long-Context Attention
par: Zeng, Xiangyu, et autres
Publié: (2026)
par: Zeng, Xiangyu, et autres
Publié: (2026)
Cost-Optimal Grouped-Query Attention for Long-Context Modeling
par: Chen, Yingfa, et autres
Publié: (2025)
par: Chen, Yingfa, et autres
Publié: (2025)
MoBA: Mixture of Block Attention for Long-Context LLMs
par: Lu, Enzhe, et autres
Publié: (2025)
par: Lu, Enzhe, et autres
Publié: (2025)
Seeing is Understanding: Unlocking Causal Attention into Modality-Mutual Attention for Multimodal LLMs
par: Wang, Wei-Yao, et autres
Publié: (2025)
par: Wang, Wei-Yao, et autres
Publié: (2025)
$π$-Attention: Periodic Sparse Transformers for Efficient Long-Context Modeling
par: Liu, Dong, et autres
Publié: (2025)
par: Liu, Dong, et autres
Publié: (2025)
Internalizing Tool Knowledge in Small Language Models via QLoRA Fine-Tuning
par: Shemla, Yuval, et autres
Publié: (2026)
par: Shemla, Yuval, et autres
Publié: (2026)
SparseST: Exploiting Data Sparsity in Spatiotemporal Modeling and Prediction
par: Wu, Junfeng, et autres
Publié: (2025)
par: Wu, Junfeng, et autres
Publié: (2025)
Partial Convolution Meets Visual Attention
par: Huang, Haiduo, et autres
Publié: (2025)
par: Huang, Haiduo, et autres
Publié: (2025)
Scout Before You Attend: Sketch-and-Walk Sparse Attention for Efficient LLM Inference
par: Le, Hoang Anh Duy, et autres
Publié: (2026)
par: Le, Hoang Anh Duy, et autres
Publié: (2026)
Every Attention Matters: An Efficient Hybrid Architecture for Long-Context Reasoning
par: Ling Team, et autres
Publié: (2025)
par: Ling Team, et autres
Publié: (2025)
Documents similaires
-
Using Span Queries to Optimize for Cache and Attention Locality
par: Castro, Paul, et autres
Publié: (2025) -
FlexAttention for Efficient High-Resolution Vision-Language Models
par: Li, Junyan, et autres
Publié: (2024) -
Long-Context Attention Benchmark: From Kernel Efficiency to Distributed Context Parallelism
par: Bu, Tao, et autres
Publié: (2025) -
Context-Aware Mixture-of-Experts Inference on CXL-Enabled GPU-NDP Systems
par: Fan, Zehao, et autres
Publié: (2025) -
MISA: Mixture of Indexer Sparse Attention for Long-Context LLM Inference
par: Zhou, Ruijie, et autres
Publié: (2026)