Unifying Sparse Attention with Hierarchical Memory for Scalable Long-Context LLM Serving
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhao, Zihan, Lu, Baotong, Lin, Shengjie, Chen, Yizou, Liu, Jing, Zhang, Yanqi, Miao, Ziming, Yang, Ming-Chang, Shen, Haiying, Chen, Qi, Yang, Fan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SparseServe: Unlocking Parallelism for Dynamic Sparse Attention in Long-Context LLM Serving
di: Zhou, Qihui, et al.
Pubblicazione: (2025)
di: Zhou, Qihui, et al.
Pubblicazione: (2025)
LServe: Efficient Long-sequence LLM Serving with Unified Sparse Attention
di: Yang, Shang, et al.
Pubblicazione: (2025)
di: Yang, Shang, et al.
Pubblicazione: (2025)
RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval
di: Liu, Di, et al.
Pubblicazione: (2024)
di: Liu, Di, et al.
Pubblicazione: (2024)
RetroInfer: A Vector Storage Engine for Scalable Long-Context LLM Inference
di: Chen, Yaoqi, et al.
Pubblicazione: (2025)
di: Chen, Yaoqi, et al.
Pubblicazione: (2025)
EconoServe: Maximizing Multi-Resource Utilization with SLO Guarantees in LLM Serving
di: Shen, Haiying, et al.
Pubblicazione: (2024)
di: Shen, Haiying, et al.
Pubblicazione: (2024)
SampleAttention: Near-Lossless Acceleration of Long Context LLM Inference with Adaptive Structured Sparse Attention
di: Zhu, Qianchao, et al.
Pubblicazione: (2024)
di: Zhu, Qianchao, et al.
Pubblicazione: (2024)
AccelGen: Heterogeneous SLO-Guaranteed High-Throughput LLM Inference Serving for Diverse Applications
di: Shen, Haiying, et al.
Pubblicazione: (2025)
di: Shen, Haiying, et al.
Pubblicazione: (2025)
Prefill-Decode Aggregation or Disaggregation? Unifying Both for Goodput-Optimized LLM Serving
di: Wang, Chao, et al.
Pubblicazione: (2025)
di: Wang, Chao, et al.
Pubblicazione: (2025)
HiCI: Hierarchical Construction-Integration for Long-Context Attention
di: Zeng, Xiangyu, et al.
Pubblicazione: (2026)
di: Zeng, Xiangyu, et al.
Pubblicazione: (2026)
Lotus: Optimizing Disaggregated Transactions with Disaggregated Locks
di: Hu, Zhisheng, et al.
Pubblicazione: (2025)
di: Hu, Zhisheng, et al.
Pubblicazione: (2025)
ModServe: Modality- and Stage-Aware Resource Disaggregation for Scalable Multimodal Model Serving
di: Qiu, Haoran, et al.
Pubblicazione: (2025)
di: Qiu, Haoran, et al.
Pubblicazione: (2025)
MemServe: Context Caching for Disaggregated LLM Serving with Elastic Memory Pool
di: Hu, Cunchen, et al.
Pubblicazione: (2024)
di: Hu, Cunchen, et al.
Pubblicazione: (2024)
Apt-Serve: Adaptive Request Scheduling on Hybrid Cache for Scalable LLM Inference Serving
di: Gao, Shihong, et al.
Pubblicazione: (2025)
di: Gao, Shihong, et al.
Pubblicazione: (2025)
VecAttention: Vector-wise Sparse Attention for Accelerating Long Context Inference
di: Liu, Anmin, et al.
Pubblicazione: (2026)
di: Liu, Anmin, et al.
Pubblicazione: (2026)
MorphServe: Efficient and Workload-Aware LLM Serving via Runtime Quantized Layer Swapping and KV Cache Resizing
di: Su, Zhaoyuan, et al.
Pubblicazione: (2025)
di: Su, Zhaoyuan, et al.
Pubblicazione: (2025)
Hardware-aligned Hierarchical Sparse Attention for Efficient Long-term Memory Access
di: Hu, Xiang, et al.
Pubblicazione: (2025)
di: Hu, Xiang, et al.
Pubblicazione: (2025)
Strata: Hierarchical Context Caching for Long Context Language Model Serving
di: Xie, Zhiqiang, et al.
Pubblicazione: (2025)
di: Xie, Zhiqiang, et al.
Pubblicazione: (2025)
Double-P: Hierarchical Top-P Sparse Attention for Long-Context LLMs
di: Ni, Wentao, et al.
Pubblicazione: (2026)
di: Ni, Wentao, et al.
Pubblicazione: (2026)
L3: DIMM-PIM Integrated Architecture and Coordination for Scalable Long-Context LLM Inference
di: Liu, Qingyuan, et al.
Pubblicazione: (2025)
di: Liu, Qingyuan, et al.
Pubblicazione: (2025)
The CAP Principle for LLM Serving: A Survey of Long-Context Large Language Model Serving
di: Zeng, Pai, et al.
Pubblicazione: (2024)
di: Zeng, Pai, et al.
Pubblicazione: (2024)
KunServe: Parameter-centric Memory Management for Efficient Memory Overloading Handling in LLM Serving
di: Cheng, Rongxin, et al.
Pubblicazione: (2024)
di: Cheng, Rongxin, et al.
Pubblicazione: (2024)
MISA: Mixture of Indexer Sparse Attention for Long-Context LLM Inference
di: Zhou, Ruijie, et al.
Pubblicazione: (2026)
di: Zhou, Ruijie, et al.
Pubblicazione: (2026)
VSPrefill: Vertical-Slash Sparse Attention with Lightweight Indexing for Long-Context Prefilling
di: Guanzhong, Chen
Pubblicazione: (2026)
di: Guanzhong, Chen
Pubblicazione: (2026)
Long-Context Generalization with Sparse Attention
di: Vasylenko, Pavlo, et al.
Pubblicazione: (2025)
di: Vasylenko, Pavlo, et al.
Pubblicazione: (2025)
AB-Sparse: Sparse Attention with Adaptive Block Size for Accurate and Efficient Long-Context Inference
di: Liu, Di, et al.
Pubblicazione: (2026)
di: Liu, Di, et al.
Pubblicazione: (2026)
Pancake: Hierarchical Memory System for Multi-Agent LLM Serving
di: Hu, Zhengding, et al.
Pubblicazione: (2026)
di: Hu, Zhengding, et al.
Pubblicazione: (2026)
Gated Sparse Attention: Combining Computational Efficiency with Training Stability for Long-Context Language Models
di: Shen, Alfred, et al.
Pubblicazione: (2026)
di: Shen, Alfred, et al.
Pubblicazione: (2026)
FAST-Prefill: FPGA Accelerated Sparse Attention for Long Context LLM Prefill
di: Jayanth, Rakshith, et al.
Pubblicazione: (2026)
di: Jayanth, Rakshith, et al.
Pubblicazione: (2026)
Kascade: A Practical Sparse Attention Method for Long-Context LLM Inference
di: Deshmukh, Dhruv, et al.
Pubblicazione: (2025)
di: Deshmukh, Dhruv, et al.
Pubblicazione: (2025)
Progressive Sparse Attention: Algorithm and System Co-design for Efficient Attention in LLM Serving
di: Zhou, Qihui, et al.
Pubblicazione: (2025)
di: Zhou, Qihui, et al.
Pubblicazione: (2025)
Tutti: Making SSD-Backed KV Cache Practical for Long-Context LLM Serving
di: Qiu, Shi, et al.
Pubblicazione: (2026)
di: Qiu, Shi, et al.
Pubblicazione: (2026)
HieraSparse: Hierarchical Semi-Structured Sparse KV Attention
di: Wang, Haoxuan, et al.
Pubblicazione: (2026)
di: Wang, Haoxuan, et al.
Pubblicazione: (2026)
HiMem: Hierarchical Long-Term Memory for LLM Long-Horizon Agents
di: Zhang, Ningning, et al.
Pubblicazione: (2026)
di: Zhang, Ningning, et al.
Pubblicazione: (2026)
C2CServe: Leveraging NVLink-C2C for Elastic Serverless LLM Serving on MIG
di: Luo, Shutian, et al.
Pubblicazione: (2026)
di: Luo, Shutian, et al.
Pubblicazione: (2026)
Veda: Scalable Video Diffusion via Distilled Sparse Attention
di: Han, Shihao, et al.
Pubblicazione: (2026)
di: Han, Shihao, et al.
Pubblicazione: (2026)
DEX: Scalable Range Indexing on Disaggregated Memory [Extended Version]
di: Lu, Baotong, et al.
Pubblicazione: (2024)
di: Lu, Baotong, et al.
Pubblicazione: (2024)
HGCA: Hybrid GPU-CPU Attention for Long Context LLM Inference
di: Deng, Weishu, et al.
Pubblicazione: (2025)
di: Deng, Weishu, et al.
Pubblicazione: (2025)
DynaServe: Unified and Elastic Execution for Dynamic Disaggregated LLM Serving
di: Ruan, Chaoyi, et al.
Pubblicazione: (2025)
di: Ruan, Chaoyi, et al.
Pubblicazione: (2025)
Compressing KV Cache for Long-Context LLM Inference with Inter-Layer Attention Similarity
di: Ma, Da, et al.
Pubblicazione: (2024)
di: Ma, Da, et al.
Pubblicazione: (2024)
Parallel Context Compaction for Long-Horizon LLM Agent Serving
di: Cim, Musa, et al.
Pubblicazione: (2026)
di: Cim, Musa, et al.
Pubblicazione: (2026)
Documenti analoghi
-
SparseServe: Unlocking Parallelism for Dynamic Sparse Attention in Long-Context LLM Serving
di: Zhou, Qihui, et al.
Pubblicazione: (2025) -
LServe: Efficient Long-sequence LLM Serving with Unified Sparse Attention
di: Yang, Shang, et al.
Pubblicazione: (2025) -
RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval
di: Liu, Di, et al.
Pubblicazione: (2024) -
RetroInfer: A Vector Storage Engine for Scalable Long-Context LLM Inference
di: Chen, Yaoqi, et al.
Pubblicazione: (2025) -
EconoServe: Maximizing Multi-Resource Utilization with SLO Guarantees in LLM Serving
di: Shen, Haiying, et al.
Pubblicazione: (2024)