Stochastic Sparse Attention for Memory-Bound Inference
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Lee, Kyle, Delacour, Corentin, Callahan-Coray, Kevin, Jiang, Kyle, Yaras, Can, Oymak, Samet, Srimani, Tathagata, Camsari, Kerem Y. |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Probabilistic Computers for MIMO Detection: From Sparsification to 2D Parallel Tempering
par: Sajeeb, M Mahmudul Hasan, et autres
Publié: (2026)
par: Sajeeb, M Mahmudul Hasan, et autres
Publié: (2026)
Next-generation Probabilistic Computing Hardware with 3D MOSAICs, Illusion Scale-up, and Co-design
par: Srimani, Tathagata, et autres
Publié: (2024)
par: Srimani, Tathagata, et autres
Publié: (2024)
Noise-augmented Chaotic Ising Machines for Combinatorial Optimization and Sampling
par: Lee, Kyle, et autres
Publié: (2024)
par: Lee, Kyle, et autres
Publié: (2024)
AB-Sparse: Sparse Attention with Adaptive Block Size for Accurate and Efficient Long-Context Inference
par: Liu, Di, et autres
Publié: (2026)
par: Liu, Di, et autres
Publié: (2026)
The Consistency Correctness in CoPPar Tree
par: Yang, Xincheng, et autres
Publié: (2026)
par: Yang, Xincheng, et autres
Publié: (2026)
SiDP: Memory-Efficient Data Parallelism for Offline LLM Inference
par: Zhao, Alan, et autres
Publié: (2026)
par: Zhao, Alan, et autres
Publié: (2026)
Opt-GPTQ: An Optimized GPTQ Combining Sparse Attention and Quantization Techniques
par: Kong, Jie, et autres
Publié: (2025)
par: Kong, Jie, et autres
Publié: (2025)
Distributed-Memory Parallel Algorithms for Sparse Matrix and Sparse Tall-and-Skinny Matrix Multiplication
par: Ranawaka, Isuru, et autres
Publié: (2024)
par: Ranawaka, Isuru, et autres
Publié: (2024)
SparseServe: Unlocking Parallelism for Dynamic Sparse Attention in Long-Context LLM Serving
par: Zhou, Qihui, et autres
Publié: (2025)
par: Zhou, Qihui, et autres
Publié: (2025)
Janus: Disaggregating Attention and Experts for Scalable MoE Inference
par: Zhang, Zhexiang, et autres
Publié: (2025)
par: Zhang, Zhexiang, et autres
Publié: (2025)
Gathering Teams of Bounded Memory Agents on a Line
par: Gao, Younan, et autres
Publié: (2025)
par: Gao, Younan, et autres
Publié: (2025)
Space-Time Trade-off in Bounded Iterated Memory
par: Toyos-Marfurt, Guillermo, et autres
Publié: (2025)
par: Toyos-Marfurt, Guillermo, et autres
Publié: (2025)
A-IO: Adaptive Inference Orchestration for Memory-Bound NPUs
par: Zhang, Chen, et autres
Publié: (2026)
par: Zhang, Chen, et autres
Publié: (2026)
PRISM: Processing-In-Memory Sparse MTTKRP for Tensor Decomposition Acceleration
par: Pacheco, Daniel, et autres
Publié: (2026)
par: Pacheco, Daniel, et autres
Publié: (2026)
Communication-Efficient Distributed Learning via Sparse and Adaptive Stochastic Gradient
par: Deng, Xiaoge, et autres
Publié: (2021)
par: Deng, Xiaoge, et autres
Publié: (2021)
PilotANN: Memory-Bounded GPU Acceleration for Vector Search
par: Gui, Yuntao, et autres
Publié: (2025)
par: Gui, Yuntao, et autres
Publié: (2025)
Memory Lower Bounds and Impossibility Results for Anonymous Dynamic Broadcast
par: Parzych, Garrett, et autres
Publié: (2024)
par: Parzych, Garrett, et autres
Publié: (2024)
SYMPHONY: Improving Memory Management for LLM Inference Workloads
par: Agarwal, Saurabh, et autres
Publié: (2024)
par: Agarwal, Saurabh, et autres
Publié: (2024)
From Attention to Disaggregation: Tracing the Evolution of LLM Inference
par: Kumar, Madabattula Rajesh, et autres
Publié: (2025)
par: Kumar, Madabattula Rajesh, et autres
Publié: (2025)
Multi-core & GPU-based Balanced Butterfly Counting in Signed Bipartite Graphs
par: Kiran, Mekala, et autres
Publié: (2026)
par: Kiran, Mekala, et autres
Publié: (2026)
FLASH: Federated Learning Across Simultaneous Heterogeneities
par: Chang, Xiangyu, et autres
Publié: (2024)
par: Chang, Xiangyu, et autres
Publié: (2024)
Memory Offloading for Large Language Model Inference with Latency SLO Guarantees
par: Ma, Chenxiang, et autres
Publié: (2025)
par: Ma, Chenxiang, et autres
Publié: (2025)
LIME:Accelerating Collaborative Lossless LLM Inference on Memory-Constrained Edge Devices
par: Sun, Mingyu, et autres
Publié: (2025)
par: Sun, Mingyu, et autres
Publié: (2025)
Experiences Building Enterprise-Level Privacy-Preserving Federated Learning to Power AI for Science
par: Li, Zilinghan, et autres
Publié: (2025)
par: Li, Zilinghan, et autres
Publié: (2025)
Parsl+CWL: Towards Combining the Python and CWL Ecosystems
par: Karle, Nishchay, et autres
Publié: (2024)
par: Karle, Nishchay, et autres
Publié: (2024)
Accelerating Python Applications with Dask and ProxyStore
par: Pauloski, J. Gregory, et autres
Publié: (2024)
par: Pauloski, J. Gregory, et autres
Publié: (2024)
UniFaaS: Programming across Distributed Cyberinfrastructure with Federated Function Serving
par: Li, Yifei, et autres
Publié: (2024)
par: Li, Yifei, et autres
Publié: (2024)
SkyMemory: A LEO Edge Cache for Transformer Inference Optimization and Scale Out
par: Sandholm, Thomas, et autres
Publié: (2025)
par: Sandholm, Thomas, et autres
Publié: (2025)
Optimizing LLM Inference Throughput via Memory-aware and SLA-constrained Dynamic Batching
par: Pang, Bowen, et autres
Publié: (2025)
par: Pang, Bowen, et autres
Publié: (2025)
DAK: Direct-Access-Enabled GPU Memory Offloading with Optimal Efficiency for LLM Inference
par: Lin, Shouxu, et autres
Publié: (2026)
par: Lin, Shouxu, et autres
Publié: (2026)
Can Tensor Cores Benefit Memory-Bound Kernels? (No!)
par: Zhang, Lingqi, et autres
Publié: (2025)
par: Zhang, Lingqi, et autres
Publié: (2025)
cuFastTuckerPlus: A Stochastic Parallel Sparse FastTucker Decomposition Using GPU Tensor Cores
par: Li, Zixuan, et autres
Publié: (2024)
par: Li, Zixuan, et autres
Publié: (2024)
The GA4GH Task Execution API: Enabling Easy Multi Cloud Task Execution
par: Kanitz, Alexander, et autres
Publié: (2024)
par: Kanitz, Alexander, et autres
Publié: (2024)
Efficient CPU-GPU Collaborative Inference for MoE-based LLMs on Memory-Limited Systems
par: Huang, En-Ming, et autres
Publié: (2025)
par: Huang, En-Ming, et autres
Publié: (2025)
FSA: An Alternative Efficient Implementation of Native Sparse Attention Kernel
par: Yan, Ran, et autres
Publié: (2025)
par: Yan, Ran, et autres
Publié: (2025)
PIM-SHERPA: Software Method for On-device LLM Inference by Resolving PIM Memory Attribute and Layout Inconsistencies
par: Lee, Sunjung, et autres
Publié: (2026)
par: Lee, Sunjung, et autres
Publié: (2026)
All-to-all reconfigurability with sparse and higher-order Ising machines
par: Nikhar, Srijan, et autres
Publié: (2023)
par: Nikhar, Srijan, et autres
Publié: (2023)
HieraSparse: Hierarchical Semi-Structured Sparse KV Attention
par: Wang, Haoxuan, et autres
Publié: (2026)
par: Wang, Haoxuan, et autres
Publié: (2026)
A Structure-Aware Irregular Blocking Method for Sparse LU Factorization
par: Hu, Zhen, et autres
Publié: (2025)
par: Hu, Zhen, et autres
Publié: (2025)
Power Aware Dynamic Reallocation For Inference
par: Jiang, Yiwei, et autres
Publié: (2026)
par: Jiang, Yiwei, et autres
Publié: (2026)
Documents similaires
-
Probabilistic Computers for MIMO Detection: From Sparsification to 2D Parallel Tempering
par: Sajeeb, M Mahmudul Hasan, et autres
Publié: (2026) -
Next-generation Probabilistic Computing Hardware with 3D MOSAICs, Illusion Scale-up, and Co-design
par: Srimani, Tathagata, et autres
Publié: (2024) -
Noise-augmented Chaotic Ising Machines for Combinatorial Optimization and Sampling
par: Lee, Kyle, et autres
Publié: (2024) -
AB-Sparse: Sparse Attention with Adaptive Block Size for Accurate and Efficient Long-Context Inference
par: Liu, Di, et autres
Publié: (2026) -
The Consistency Correctness in CoPPar Tree
par: Yang, Xincheng, et autres
Publié: (2026)