KVBuffer: IO-aware Serving for Linear Attention
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zou, Longwei, Zhong, Lin |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Kaczmarz Linear Attention
par: Zou, Jiaxuan, et autres
Publié: (2026)
par: Zou, Jiaxuan, et autres
Publié: (2026)
SonicMoE: Accelerating MoE with IO and Tile-aware Optimizations
par: Guo, Wentao, et autres
Publié: (2025)
par: Guo, Wentao, et autres
Publié: (2025)
Progressive Sparse Attention: Algorithm and System Co-design for Efficient Attention in LLM Serving
par: Zhou, Qihui, et autres
Publié: (2025)
par: Zhou, Qihui, et autres
Publié: (2025)
Enhancing Linear Attention with Residual Learning
par: Lai, Xunhao, et autres
Publié: (2025)
par: Lai, Xunhao, et autres
Publié: (2025)
Toward Carbon-Neutral Human AI: Rethinking Data, Computation, and Learning Paradigms for Sustainable Intelligence
par: Santosh, KC, et autres
Publié: (2025)
par: Santosh, KC, et autres
Publié: (2025)
Enhancing Adversarial Robustness of Deep Neural Networks Through Supervised Contrastive Learning
par: Wang, Longwei, et autres
Publié: (2024)
par: Wang, Longwei, et autres
Publié: (2024)
Bridging Interpretability and Robustness Using LIME-Guided Model Refinement
par: Nayyem, Navid, et autres
Publié: (2024)
par: Nayyem, Navid, et autres
Publié: (2024)
Exact Linear Attention
par: Ou, Weinuo
Publié: (2026)
par: Ou, Weinuo
Publié: (2026)
Analytical Provisioning for Attention-FFN Disaggregated LLM Serving under Stochastic Workloads
par: Song, Chendong, et autres
Publié: (2026)
par: Song, Chendong, et autres
Publié: (2026)
ATP: Enabling Fast LLM Serving via Attention on Top Principal Keys
par: Niu, Yue, et autres
Publié: (2024)
par: Niu, Yue, et autres
Publié: (2024)
Local Linear Attention: An Optimal Interpolation of Linear and Softmax Attention For Test-Time Regression
par: Zuo, Yifei, et autres
Publié: (2025)
par: Zuo, Yifei, et autres
Publié: (2025)
Transolver is a Linear Transformer: Revisiting Physics-Attention through the Lens of Linear Attention
par: Hu, Wenjie, et autres
Publié: (2025)
par: Hu, Wenjie, et autres
Publié: (2025)
Lipschitz-aware Linearity Grafting for Certified Robustness
par: Han, Yongjin, et autres
Publié: (2025)
par: Han, Yongjin, et autres
Publié: (2025)
MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map
par: Chou, Yuhong, et autres
Publié: (2024)
par: Chou, Yuhong, et autres
Publié: (2024)
Adaptive Memory Decay for Log-Linear Attention
par: Amin, Yaxita, et autres
Publié: (2026)
par: Amin, Yaxita, et autres
Publié: (2026)
State Rank Dynamics in Linear Attention LLMs
par: Sun, Ao, et autres
Publié: (2026)
par: Sun, Ao, et autres
Publié: (2026)
Linear Attention is Enough in Spatial-Temporal Forecasting
par: Ning, Xinyu
Publié: (2024)
par: Ning, Xinyu
Publié: (2024)
Linear Attention for Efficient Bidirectional Sequence Modeling
par: Afzal, Arshia, et autres
Publié: (2025)
par: Afzal, Arshia, et autres
Publié: (2025)
On Efficient Scaling of GNNs via IO-Aware Layers Implementations
par: Fomina, Daria, et autres
Publié: (2026)
par: Fomina, Daria, et autres
Publié: (2026)
BoA: Attention-aware Post-training Quantization without Backpropagation
par: Kim, Junhan, et autres
Publié: (2024)
par: Kim, Junhan, et autres
Publié: (2024)
LASP-2: Rethinking Sequence Parallelism for Linear Attention and Its Hybrid
par: Sun, Weigao, et autres
Publié: (2025)
par: Sun, Weigao, et autres
Publié: (2025)
Tiled Flash Linear Attention: More Efficient Linear RNN and xLSTM Kernels
par: Beck, Maximilian, et autres
Publié: (2025)
par: Beck, Maximilian, et autres
Publié: (2025)
Beyond Linearity in Attention Projections: The Case for Nonlinear Queries
par: Karbevski, Marko
Publié: (2026)
par: Karbevski, Marko
Publié: (2026)
ZeroS: Zero-Sum Linear Attention for Efficient Transformers
par: Lu, Jiecheng, et autres
Publié: (2026)
par: Lu, Jiecheng, et autres
Publié: (2026)
Superiority of Multi-Head Attention in In-Context Linear Regression
par: Cui, Yingqian, et autres
Publié: (2024)
par: Cui, Yingqian, et autres
Publié: (2024)
E2Former-V2: On-the-Fly Equivariant Attention with Linear Activation Memory
par: Huang, Lin, et autres
Publié: (2026)
par: Huang, Lin, et autres
Publié: (2026)
RACE Attention: A Strictly Linear-Time Attention Layer for Training on Outrageously Large Contexts
par: Joshi, Sahil, et autres
Publié: (2025)
par: Joshi, Sahil, et autres
Publié: (2025)
Parrot: Efficient Serving of LLM-based Applications with Semantic Variable
par: Lin, Chaofan, et autres
Publié: (2024)
par: Lin, Chaofan, et autres
Publié: (2024)
Efficient High-Accuracy PDEs Solver with the Linear Attention Neural Operator
par: Zhong, Ming, et autres
Publié: (2025)
par: Zhong, Ming, et autres
Publié: (2025)
FlashInfer: Efficient and Customizable Attention Engine for LLM Inference Serving
par: Ye, Zihao, et autres
Publié: (2025)
par: Ye, Zihao, et autres
Publié: (2025)
Learning under Quantization for High-Dimensional Linear Regression
par: Zhang, Dechen, et autres
Publié: (2025)
par: Zhang, Dechen, et autres
Publié: (2025)
Higher-order Linear Attention
par: Zhang, Yifan, et autres
Publié: (2025)
par: Zhang, Yifan, et autres
Publié: (2025)
Learning Advanced Self-Attention for Linear Transformers in the Singular Value Domain
par: Wi, Hyowon, et autres
Publié: (2025)
par: Wi, Hyowon, et autres
Publié: (2025)
LNUCB-TA: Linear-nonlinear Hybrid Bandit Learning with Temporal Attention
par: Khosravi, Hamed, et autres
Publié: (2025)
par: Khosravi, Hamed, et autres
Publié: (2025)
Revisiting Service Level Objectives and System Level Metrics in Large Language Model Serving
par: Wang, Zhibin, et autres
Publié: (2024)
par: Wang, Zhibin, et autres
Publié: (2024)
When Linear Attention Meets Autoregressive Decoding: Towards More Effective and Efficient Linearized Large Language Models
par: You, Haoran, et autres
Publié: (2024)
par: You, Haoran, et autres
Publié: (2024)
Distance-aware Attention Reshaping: Enhance Generalization of Neural Solver for Large-scale Vehicle Routing Problems
par: Wang, Yang, et autres
Publié: (2024)
par: Wang, Yang, et autres
Publié: (2024)
TA-RNN: an Attention-based Time-aware Recurrent Neural Network Architecture for Electronic Health Records
par: Olaimat, Mohammad Al, et autres
Publié: (2024)
par: Olaimat, Mohammad Al, et autres
Publié: (2024)
MTServe: Efficient Serving for Generative Recommendation Models with Hierarchical Caches
par: Wang, Xin, et autres
Publié: (2026)
par: Wang, Xin, et autres
Publié: (2026)
Scaling Laws for Precision in High-Dimensional Linear Regression
par: Zhang, Dechen, et autres
Publié: (2026)
par: Zhang, Dechen, et autres
Publié: (2026)
Documents similaires
-
Kaczmarz Linear Attention
par: Zou, Jiaxuan, et autres
Publié: (2026) -
SonicMoE: Accelerating MoE with IO and Tile-aware Optimizations
par: Guo, Wentao, et autres
Publié: (2025) -
Progressive Sparse Attention: Algorithm and System Co-design for Efficient Attention in LLM Serving
par: Zhou, Qihui, et autres
Publié: (2025) -
Enhancing Linear Attention with Residual Learning
par: Lai, Xunhao, et autres
Publié: (2025) -
Toward Carbon-Neutral Human AI: Rethinking Data, Computation, and Learning Paradigms for Sustainable Intelligence
par: Santosh, KC, et autres
Publié: (2025)