SampleAttention: Near-Lossless Acceleration of Long Context LLM Inference with Adaptive Structured Sparse Attention
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhu, Qianchao, Duan, Jiangfei, Chen, Chang, Liu, Siran, Feng, Guanyu, Lv, Xin, Chuanfu, Xiao, Lin, Dahua, Yang, Chao |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
VecAttention: Vector-wise Sparse Attention for Accelerating Long Context Inference
di: Liu, Anmin, et al.
Pubblicazione: (2026)
di: Liu, Anmin, et al.
Pubblicazione: (2026)
Squeezed Attention: Accelerating Long Context Length LLM Inference
di: Hooper, Coleman, et al.
Pubblicazione: (2024)
di: Hooper, Coleman, et al.
Pubblicazione: (2024)
MISA: Mixture of Indexer Sparse Attention for Long-Context LLM Inference
di: Zhou, Ruijie, et al.
Pubblicazione: (2026)
di: Zhou, Ruijie, et al.
Pubblicazione: (2026)
RRAttention: Dynamic Block Sparse Attention via Per-Head Round-Robin Shifts for Long-Context Inference
di: Liu, Siran, et al.
Pubblicazione: (2026)
di: Liu, Siran, et al.
Pubblicazione: (2026)
FAST-Prefill: FPGA Accelerated Sparse Attention for Long Context LLM Prefill
di: Jayanth, Rakshith, et al.
Pubblicazione: (2026)
di: Jayanth, Rakshith, et al.
Pubblicazione: (2026)
Kascade: A Practical Sparse Attention Method for Long-Context LLM Inference
di: Deshmukh, Dhruv, et al.
Pubblicazione: (2025)
di: Deshmukh, Dhruv, et al.
Pubblicazione: (2025)
AB-Sparse: Sparse Attention with Adaptive Block Size for Accurate and Efficient Long-Context Inference
di: Liu, Di, et al.
Pubblicazione: (2026)
di: Liu, Di, et al.
Pubblicazione: (2026)
RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval
di: Liu, Di, et al.
Pubblicazione: (2024)
di: Liu, Di, et al.
Pubblicazione: (2024)
Adamas: Hadamard Sparse Attention for Efficient Long-Context Inference
di: Yan, Siyuan, et al.
Pubblicazione: (2025)
di: Yan, Siyuan, et al.
Pubblicazione: (2025)
Unifying Sparse Attention with Hierarchical Memory for Scalable Long-Context LLM Serving
di: Zhao, Zihan, et al.
Pubblicazione: (2026)
di: Zhao, Zihan, et al.
Pubblicazione: (2026)
Long-Context Generalization with Sparse Attention
di: Vasylenko, Pavlo, et al.
Pubblicazione: (2025)
di: Vasylenko, Pavlo, et al.
Pubblicazione: (2025)
Round Attention: A Novel Round-Level Attention Mechanism to Accelerate LLM Inference
di: Tang, Yaohua, et al.
Pubblicazione: (2025)
di: Tang, Yaohua, et al.
Pubblicazione: (2025)
DuoAttention: Efficient Long-Context LLM Inference with Retrieval and Streaming Heads
di: Xiao, Guangxuan, et al.
Pubblicazione: (2024)
di: Xiao, Guangxuan, et al.
Pubblicazione: (2024)
LongRoPE2: Near-Lossless LLM Context Window Scaling
di: Shang, Ning, et al.
Pubblicazione: (2025)
di: Shang, Ning, et al.
Pubblicazione: (2025)
SparseServe: Unlocking Parallelism for Dynamic Sparse Attention in Long-Context LLM Serving
di: Zhou, Qihui, et al.
Pubblicazione: (2025)
di: Zhou, Qihui, et al.
Pubblicazione: (2025)
An Efficient Hybrid Sparse Attention with CPU-GPU Parallelism for Long-Context Inference
di: Yao, Feiyu, et al.
Pubblicazione: (2026)
di: Yao, Feiyu, et al.
Pubblicazione: (2026)
Token Sparse Attention: Efficient Long-Context Inference with Interleaved Token Selection
di: Jo, Dongwon, et al.
Pubblicazione: (2026)
di: Jo, Dongwon, et al.
Pubblicazione: (2026)
LLMSteer: Improving Long-Context LLM Inference by Steering Attention on Reused Contexts
di: Gu, Zhuohan, et al.
Pubblicazione: (2024)
di: Gu, Zhuohan, et al.
Pubblicazione: (2024)
A Unified Sparse Attention via Multi-Granularity Compression
di: Liu, Siran, et al.
Pubblicazione: (2025)
di: Liu, Siran, et al.
Pubblicazione: (2025)
H2EAL: Hybrid-Bonding Architecture with Hybrid Sparse Attention for Efficient Long-Context LLM Inference
di: Fu, Zizhuo, et al.
Pubblicazione: (2025)
di: Fu, Zizhuo, et al.
Pubblicazione: (2025)
Tactic: Adaptive Sparse Attention with Clustering and Distribution Fitting for Long-Context LLMs
di: Zhu, Kan, et al.
Pubblicazione: (2025)
di: Zhu, Kan, et al.
Pubblicazione: (2025)
HGCA: Hybrid GPU-CPU Attention for Long Context LLM Inference
di: Deng, Weishu, et al.
Pubblicazione: (2025)
di: Deng, Weishu, et al.
Pubblicazione: (2025)
LoMA: Lossless Compressed Memory Attention
di: Wang, Yumeng, et al.
Pubblicazione: (2024)
di: Wang, Yumeng, et al.
Pubblicazione: (2024)
SpargeAttention: Accurate and Training-free Sparse Attention Accelerating Any Model Inference
di: Zhang, Jintao, et al.
Pubblicazione: (2025)
di: Zhang, Jintao, et al.
Pubblicazione: (2025)
LIME:Accelerating Collaborative Lossless LLM Inference on Memory-Constrained Edge Devices
di: Sun, Mingyu, et al.
Pubblicazione: (2025)
di: Sun, Mingyu, et al.
Pubblicazione: (2025)
DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Acceleration
di: Zhang, Hanzhi, et al.
Pubblicazione: (2025)
di: Zhang, Hanzhi, et al.
Pubblicazione: (2025)
LoPT: Lossless Parallel Tokenization Acceleration for Long Context Inference of Large Language Model
di: Shao, Wei, et al.
Pubblicazione: (2025)
di: Shao, Wei, et al.
Pubblicazione: (2025)
Lag-Relative Sparse Attention In Long Context Training
di: Liang, Manlai, et al.
Pubblicazione: (2025)
di: Liang, Manlai, et al.
Pubblicazione: (2025)
Morse: Dual-Sampling for Lossless Acceleration of Diffusion Models
di: Li, Chao, et al.
Pubblicazione: (2025)
di: Li, Chao, et al.
Pubblicazione: (2025)
FlexPrefill: A Context-Aware Sparse Attention Mechanism for Efficient Long-Sequence Inference
di: Lai, Xunhao, et al.
Pubblicazione: (2025)
di: Lai, Xunhao, et al.
Pubblicazione: (2025)
Attention in Constant Time: Vashista Sparse Attention for Long-Context Decoding with Exponential Guarantees
di: Nobaub, Vashista
Pubblicazione: (2026)
di: Nobaub, Vashista
Pubblicazione: (2026)
Training-free and Adaptive Sparse Attention for Efficient Long Video Generation
di: Xia, Yifei, et al.
Pubblicazione: (2025)
di: Xia, Yifei, et al.
Pubblicazione: (2025)
AdaSkip: Adaptive Sublayer Skipping for Accelerating Long-Context LLM Inference
di: He, Zhuomin, et al.
Pubblicazione: (2025)
di: He, Zhuomin, et al.
Pubblicazione: (2025)
Zeppelin: Balancing Variable-length Workloads in Data Parallel Large Model Training
di: Chen, Chang, et al.
Pubblicazione: (2025)
di: Chen, Chang, et al.
Pubblicazione: (2025)
CSAttention: Centroid-Scoring Attention for Accelerating LLM Inference
di: Song, Chuxu, et al.
Pubblicazione: (2026)
di: Song, Chuxu, et al.
Pubblicazione: (2026)
Compressing KV Cache for Long-Context LLM Inference with Inter-Layer Attention Similarity
di: Ma, Da, et al.
Pubblicazione: (2024)
di: Ma, Da, et al.
Pubblicazione: (2024)
InstInfer: In-Storage Attention Offloading for Cost-Effective Long-Context LLM Inference
di: Pan, Xiurui, et al.
Pubblicazione: (2024)
di: Pan, Xiurui, et al.
Pubblicazione: (2024)
MMInference: Accelerating Pre-filling for Long-Context VLMs via Modality-Aware Permutation Sparse Attention
di: Li, Yucheng, et al.
Pubblicazione: (2025)
di: Li, Yucheng, et al.
Pubblicazione: (2025)
MInference 1.0: Accelerating Pre-filling for Long-Context LLMs via Dynamic Sparse Attention
di: Jiang, Huiqiang, et al.
Pubblicazione: (2024)
di: Jiang, Huiqiang, et al.
Pubblicazione: (2024)
SparseBalance: Load-Balanced Long Context Training with Dynamic Sparse Attention
di: Xu, Hongtao, et al.
Pubblicazione: (2026)
di: Xu, Hongtao, et al.
Pubblicazione: (2026)
Documenti analoghi
-
VecAttention: Vector-wise Sparse Attention for Accelerating Long Context Inference
di: Liu, Anmin, et al.
Pubblicazione: (2026) -
Squeezed Attention: Accelerating Long Context Length LLM Inference
di: Hooper, Coleman, et al.
Pubblicazione: (2024) -
MISA: Mixture of Indexer Sparse Attention for Long-Context LLM Inference
di: Zhou, Ruijie, et al.
Pubblicazione: (2026) -
RRAttention: Dynamic Block Sparse Attention via Per-Head Round-Robin Shifts for Long-Context Inference
di: Liu, Siran, et al.
Pubblicazione: (2026) -
FAST-Prefill: FPGA Accelerated Sparse Attention for Long Context LLM Prefill
di: Jayanth, Rakshith, et al.
Pubblicazione: (2026)