MAS-Attention: Memory-Aware Stream Processing for Attention Acceleration on Resource-Constrained Edge Devices
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Shakerdargah, Mohammadali, Lu, Shan, Gao, Chao, Niu, Di |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Rotary GPU: Exploring Local Execution Paths for Large Mixture-of-Experts Models Under Limited GPU Memory
par: Jo, Myeong Jun
Publié: (2026)
par: Jo, Myeong Jun
Publié: (2026)
Parallelization Strategies for Dense LLM Deployment: Navigating Through Application-Specific Tradeoffs and Bottlenecks
par: Topcu, Burak, et autres
Publié: (2026)
par: Topcu, Burak, et autres
Publié: (2026)
POD-Attention: Unlocking Full Prefill-Decode Overlap for Faster LLM Inference
par: Kamath, Aditya K, et autres
Publié: (2024)
par: Kamath, Aditya K, et autres
Publié: (2024)
Towards Building Private LLMs: Exploring Multi-Node Expert Parallelism on Apple Silicon for Mixture-of-Experts Large Language Model
par: Chen, Mu-Chi, et autres
Publié: (2025)
par: Chen, Mu-Chi, et autres
Publié: (2025)
Comparative Analysis of Large Language Model Inference Serving Systems: A Performance Study of vLLM and HuggingFace TGI
par: Kolluru, Saicharan
Publié: (2025)
par: Kolluru, Saicharan
Publié: (2025)
SparkAttention: High-Performance Multi-Head Attention for Large Models on Volta GPU Architecture
par: Xu, Youxuan, et autres
Publié: (2025)
par: Xu, Youxuan, et autres
Publié: (2025)
Optimizing edge AI models on HPC systems with the edge in the loop
par: Aach, Marcel, et autres
Publié: (2025)
par: Aach, Marcel, et autres
Publié: (2025)
Benchmarking Catastrophic Forgetting Mitigation Methods in Federated Time Series Forecasting
par: Hallak, Khaled, et autres
Publié: (2025)
par: Hallak, Khaled, et autres
Publié: (2025)
ATTNChecker: Highly-Optimized Fault Tolerant Attention for Large Language Model Training
par: Liang, Yuhang, et autres
Publié: (2024)
par: Liang, Yuhang, et autres
Publié: (2024)
Vectorized Adaptive Histograms for Sparse Oblique Forests
par: Lubonja, Ariel, et autres
Publié: (2026)
par: Lubonja, Ariel, et autres
Publié: (2026)
Libra: Unleashing GPU Heterogeneity for High-Performance Sparse Matrix Multiplication
par: Shi, Jinliang, et autres
Publié: (2025)
par: Shi, Jinliang, et autres
Publié: (2025)
Collaborative Processing for Multi-Tenant Inference on Memory-Constrained Edge TPUs
par: Ng, Nathan, et autres
Publié: (2026)
par: Ng, Nathan, et autres
Publié: (2026)
MATCH: Model-Aware TVM-based Compilation for Heterogeneous Edge Devices
par: Hamdi, Mohamed Amine, et autres
Publié: (2024)
par: Hamdi, Mohamed Amine, et autres
Publié: (2024)
Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended
par: Kamath, Aditya K, et autres
Publié: (2026)
par: Kamath, Aditya K, et autres
Publié: (2026)
Efficient Construction of Large Search Spaces for Auto-Tuning
par: Willemsen, Floris-Jan, et autres
Publié: (2025)
par: Willemsen, Floris-Jan, et autres
Publié: (2025)
Flash-Fusion: Enabling Expressive, Low-Latency Queries on IoT Sensor Streams with LLMs
par: Patherya, Kausar, et autres
Publié: (2025)
par: Patherya, Kausar, et autres
Publié: (2025)
GVE-Louvain: Fast Louvain Algorithm for Community Detection in Shared Memory Setting
par: Sahu, Subhajit
Publié: (2023)
par: Sahu, Subhajit
Publié: (2023)
GVE-Leiden: Fast Leiden Algorithm for Community Detection in Shared Memory Setting
par: Sahu, Subhajit
Publié: (2023)
par: Sahu, Subhajit
Publié: (2023)
GVE-LPA: Fast Label Propagation Algorithm (LPA) for Community Detection in Shared Memory Setting
par: Sahu, Subhajit
Publié: (2023)
par: Sahu, Subhajit
Publié: (2023)
Token Arena: A Continuous Benchmark Unifying Energy and Cognition in AI Inference
par: Gao, Yuxuan, et autres
Publié: (2026)
par: Gao, Yuxuan, et autres
Publié: (2026)
SLO-Guard: Crash-Aware, Budget-Consistent Autotuning for SLO-Constrained LLM Serving
par: Lysenstøen, Christian
Publié: (2026)
par: Lysenstøen, Christian
Publié: (2026)
Predictive Multi-Tier Memory Management for KV Cache in Large-Scale GPU Inference
par: Ganjihal, Sanjeev Rao
Publié: (2026)
par: Ganjihal, Sanjeev Rao
Publié: (2026)
StreamIndex: Memory-Bounded Compressed Sparse Attention via Streaming Top-k
par: Jaber, Jaber, et autres
Publié: (2026)
par: Jaber, Jaber, et autres
Publié: (2026)
DAGER: Exact Gradient Inversion for Large Language Models
par: Petrov, Ivo, et autres
Publié: (2024)
par: Petrov, Ivo, et autres
Publié: (2024)
HeteGen: Heterogeneous Parallel Inference for Large Language Models on Resource-Constrained Devices
par: Zhao, Xuanlei, et autres
Publié: (2024)
par: Zhao, Xuanlei, et autres
Publié: (2024)
Cross-Platform Fused MoE Dispatch in Triton: Portable Expert Routing Without CUDA
par: Mitra, Subhadip
Publié: (2026)
par: Mitra, Subhadip
Publié: (2026)
Prima.cpp: Fast 30-70B LLM Inference on Heterogeneous and Low-Resource Home Clusters
par: Li, Zonghang, et autres
Publié: (2025)
par: Li, Zonghang, et autres
Publié: (2025)
Parameter-Efficient and Personalized Federated Training of Generative Models at the Edge
par: Khan, Kabir, et autres
Publié: (2025)
par: Khan, Kabir, et autres
Publié: (2025)
Tempo: Compiled Dynamic Deep Learning with Symbolic Dependence Graphs
par: Silvestre, Pedro F., et autres
Publié: (2025)
par: Silvestre, Pedro F., et autres
Publié: (2025)
ParaQAOA: Efficient Parallel Divide-and-Conquer QAOA for Large-Scale Max-Cut Problems Beyond 10,000 Vertices
par: Huang, Po-Hsuan, et autres
Publié: (2026)
par: Huang, Po-Hsuan, et autres
Publié: (2026)
An Incrementally Expanding Approach for Updating PageRank on Dynamic Graphs
par: Sahu, Subhajit
Publié: (2024)
par: Sahu, Subhajit
Publié: (2024)
Optimization of a Radiofrequency Ablation FEM Application Using Parallel Sparse Solvers
par: Miletto, Marcelo Cogo, et autres
Publié: (2024)
par: Miletto, Marcelo Cogo, et autres
Publié: (2024)
DF* PageRank: Improved Incrementally Expanding Approaches for Updating PageRank on Dynamic Graphs
par: Sahu, Subhajit
Publié: (2024)
par: Sahu, Subhajit
Publié: (2024)
Lock-Free Computation of PageRank in Dynamic Graphs
par: Sahu, Subhajit
Publié: (2024)
par: Sahu, Subhajit
Publié: (2024)
Bine Trees: Enhancing Collective Operations by Optimizing Communication Locality
par: De Sensi, Daniele, et autres
Publié: (2025)
par: De Sensi, Daniele, et autres
Publié: (2025)
FedMon: Federated eBPF Monitoring for Distributed Anomaly Detection in Multi-Cluster Cloud Environments
par: Zehra, Sehar, et autres
Publié: (2025)
par: Zehra, Sehar, et autres
Publié: (2025)
Challenging Portability Paradigms: FPGA Acceleration Using SYCL and OpenCL
par: de Castro, Manuel, et autres
Publié: (2024)
par: de Castro, Manuel, et autres
Publié: (2024)
Performance Optimization in Stream Processing Systems: Experiment-Driven Configuration Tuning for Kafka Streams
par: Chen, David, et autres
Publié: (2026)
par: Chen, David, et autres
Publié: (2026)
SGDRC: Software-Defined Dynamic Resource Control for Concurrent DNN Inference on NVIDIA GPUs
par: Zhang, Yongkang, et autres
Publié: (2024)
par: Zhang, Yongkang, et autres
Publié: (2024)
Multi-Dimensional Autoscaling of Stream Processing Services on Edge Devices
par: Sedlak, Boris, et autres
Publié: (2025)
par: Sedlak, Boris, et autres
Publié: (2025)
Documents similaires
-
Rotary GPU: Exploring Local Execution Paths for Large Mixture-of-Experts Models Under Limited GPU Memory
par: Jo, Myeong Jun
Publié: (2026) -
Parallelization Strategies for Dense LLM Deployment: Navigating Through Application-Specific Tradeoffs and Bottlenecks
par: Topcu, Burak, et autres
Publié: (2026) -
POD-Attention: Unlocking Full Prefill-Decode Overlap for Faster LLM Inference
par: Kamath, Aditya K, et autres
Publié: (2024) -
Towards Building Private LLMs: Exploring Multi-Node Expert Parallelism on Apple Silicon for Mixture-of-Experts Large Language Model
par: Chen, Mu-Chi, et autres
Publié: (2025) -
Comparative Analysis of Large Language Model Inference Serving Systems: A Performance Study of vLLM and HuggingFace TGI
par: Kolluru, Saicharan
Publié: (2025)