AsyncSparse: Accelerating Sparse Matrix-Matrix Multiplication on Asynchronous GPU Architectures
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liu, Jie, Pu, Huanzhi, Zhang, Zhiru |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
HC-SpMM: Accelerating Sparse Matrix-Matrix Multiplication for Graphs with Hybrid GPU Cores
par: Li, Zhonggen, et autres
Publié: (2024)
par: Li, Zhonggen, et autres
Publié: (2024)
Accelerating Sparse Matrix-Matrix Multiplication on GPUs with Processing Near HBMs
par: Li, Shiju, et autres
Publié: (2025)
par: Li, Shiju, et autres
Publié: (2025)
MAGNUS: Generating Data Locality to Accelerate Sparse Matrix-Matrix Multiplication on CPUs
par: Wolfson-Pou, Jordi, et autres
Publié: (2025)
par: Wolfson-Pou, Jordi, et autres
Publié: (2025)
Is Sparse Matrix Reordering Effective for Sparse Matrix-Vector Multiplication?
par: Asudeh, Omid, et autres
Publié: (2025)
par: Asudeh, Omid, et autres
Publié: (2025)
LOw-cOst yet High-Performant Sparse Matrix-Matrix Multiplication on Arm SME Architectures
par: Lei, Kelun, et autres
Publié: (2025)
par: Lei, Kelun, et autres
Publié: (2025)
Distributed-Memory Parallel Algorithms for Sparse Matrix and Sparse Tall-and-Skinny Matrix Multiplication
par: Ranawaka, Isuru, et autres
Publié: (2024)
par: Ranawaka, Isuru, et autres
Publié: (2024)
Ocean: Fast Estimation-Based Sparse General Matrix-Matrix Multiplication on GPU
par: Li, Yifan, et autres
Publié: (2026)
par: Li, Yifan, et autres
Publié: (2026)
Sparsity-Aware Roofline Models for Sparse Matrix-Matrix Multiplication
par: Qian, Matthew, et autres
Publié: (2026)
par: Qian, Matthew, et autres
Publié: (2026)
Acc-SpMM: Accelerating General-purpose Sparse Matrix-Matrix Multiplication with GPU Tensor Cores
par: Zhao, Haisha, et autres
Publié: (2025)
par: Zhao, Haisha, et autres
Publié: (2025)
SpArch: Efficient Architecture for Sparse Matrix Multiplication
par: Zhang, Zhekai, et autres
Publié: (2020)
par: Zhang, Zhekai, et autres
Publié: (2020)
Improving Locality in Sparse and Dense Matrix Multiplications
par: Dezfuli, Mohammad Mahdi Salehi, et autres
Publié: (2024)
par: Dezfuli, Mohammad Mahdi Salehi, et autres
Publié: (2024)
ParamSpMM: Adaptive and Efficient Sparse Matrix-Matrix Multiplication on GPUs for GNNs
par: Zhang, Lixing, et autres
Publié: (2026)
par: Zhang, Lixing, et autres
Publié: (2026)
RDMA-Based Algorithms for Sparse Matrix Multiplication on GPUs
par: Brock, Benjamin, et autres
Publié: (2023)
par: Brock, Benjamin, et autres
Publié: (2023)
Exploring Sparse Matrix Multiplication Kernels on the Cerebras CS-3
par: Shah, Milan, et autres
Publié: (2026)
par: Shah, Milan, et autres
Publié: (2026)
GPU Accelerated Sparse Cholesky Factorization
par: Karsavuran, M. Ozan, et autres
Publié: (2024)
par: Karsavuran, M. Ozan, et autres
Publié: (2024)
RSH-SpMM: A Row-Structured Hybrid Kernel for Sparse Matrix-Matrix Multiplication on GPUs
par: Li, Aiying, et autres
Publié: (2026)
par: Li, Aiying, et autres
Publié: (2026)
SHIRO: Near-Optimal Communication Strategies for Distributed Sparse Matrix Multiplication
par: Zhuang, Chen, et autres
Publié: (2025)
par: Zhuang, Chen, et autres
Publié: (2025)
Accelerating Sparse MTTKRP for Small Tensor Decomposition on GPU
par: Wijeratne, Sasindu, et autres
Publié: (2025)
par: Wijeratne, Sasindu, et autres
Publié: (2025)
Selection of Supervised Learning-based Sparse Matrix Reordering Algorithms
par: Tang, Tao, et autres
Publié: (2025)
par: Tang, Tao, et autres
Publié: (2025)
Fantasy: Efficient Large-scale Vector Search on GPU Clusters with GPUDirect Async
par: Liu, Yi, et autres
Publié: (2025)
par: Liu, Yi, et autres
Publié: (2025)
PARS3: Parallel Sparse Skew-Symmetric Matrix-Vector Multiplication with Reverse Cuthill-McKee Reordering
par: Yildirim, Selin, et autres
Publié: (2024)
par: Yildirim, Selin, et autres
Publié: (2024)
An Auto-tuning Method for Run-time Data Transformation for Sparse Matrix-Vector Multiplication
par: Katagiri, Takahiro, et autres
Publié: (2024)
par: Katagiri, Takahiro, et autres
Publié: (2024)
Arrow Matrix Decomposition: A Novel Approach for Communication-Efficient Sparse Matrix Multiplication
par: Gianinazzi, Lukas, et autres
Publié: (2024)
par: Gianinazzi, Lukas, et autres
Publié: (2024)
Fast Kronecker Matrix-Matrix Multiplication on GPUs
par: Jangda, Abhinav, et autres
Publié: (2024)
par: Jangda, Abhinav, et autres
Publié: (2024)
Sparse MTTKRP Acceleration for Tensor Decomposition on GPU
par: Wijeratne, Sasindu, et autres
Publié: (2024)
par: Wijeratne, Sasindu, et autres
Publié: (2024)
Fast Sparse Matrix Permutation for Mesh-Based Direct Solvers
par: Zarebavami, Behrooz, et autres
Publié: (2026)
par: Zarebavami, Behrooz, et autres
Publié: (2026)
AsyncMesh: Fully Asynchronous Optimization for Data and Pipeline Parallelism
par: Ajanthan, Thalaiyasingam, et autres
Publié: (2026)
par: Ajanthan, Thalaiyasingam, et autres
Publié: (2026)
GPU-Accelerated Vecchia Approximations of Gaussian Processes for Geospatial Data using Batched Matrix Computations
par: Pan, Qilong, et autres
Publié: (2024)
par: Pan, Qilong, et autres
Publié: (2024)
AMPED: Accelerating MTTKRP for Billion-Scale Sparse Tensor Decomposition on Multiple GPUs
par: Wijeratne, Sasindu, et autres
Publié: (2025)
par: Wijeratne, Sasindu, et autres
Publié: (2025)
Matrix representation and GPU-optimized parallel B-spline computing
par: Wu, Jiayu, et autres
Publié: (2025)
par: Wu, Jiayu, et autres
Publié: (2025)
DGEMM on Integer Matrix Multiplication Unit
par: Ootomo, Hiroyuki, et autres
Publié: (2023)
par: Ootomo, Hiroyuki, et autres
Publié: (2023)
Hello SME! Generating Fast Matrix Multiplication Kernels Using the Scalable Matrix Extension
par: Remke, Stefan, et autres
Publié: (2024)
par: Remke, Stefan, et autres
Publié: (2024)
GPU-Accelerated Batch-Dynamic Subgraph Matching
par: Qiu, Linshan, et autres
Publié: (2024)
par: Qiu, Linshan, et autres
Publié: (2024)
High-Performance and Power-Efficient Emulation of Matrix Multiplication using INT8 Matrix Engines
par: Uchino, Yuki, et autres
Publié: (2025)
par: Uchino, Yuki, et autres
Publié: (2025)
VDCores: Resource Decoupled Programming and Execution for Asynchronous GPU
par: He, Zijian, et autres
Publié: (2026)
par: He, Zijian, et autres
Publié: (2026)
AsyncSC: An Asynchronous Sidechain for Multi-Domain Data Exchange in Internet of Things
par: Yang, Lingxiao, et autres
Publié: (2024)
par: Yang, Lingxiao, et autres
Publié: (2024)
Mapping Parallel Matrix Multiplication in GotoBLAS2 to the AMD Versal ACAP for Deep Learning
par: Lei, Jie, et autres
Publié: (2024)
par: Lei, Jie, et autres
Publié: (2024)
Accelerating Sparse DNNs Based on Tiled GEMM
par: Guo, Cong, et autres
Publié: (2024)
par: Guo, Cong, et autres
Publié: (2024)
Analysis of the Performance of the Matrix Multiplication Algorithm on the Cirrus Supercomputer
par: Adefemi, Temitayo
Publié: (2024)
par: Adefemi, Temitayo
Publié: (2024)
Demystifying ARM SME to Optimize General Matrix Multiplications
par: Deng, Chencheng, et autres
Publié: (2025)
par: Deng, Chencheng, et autres
Publié: (2025)
Documents similaires
-
HC-SpMM: Accelerating Sparse Matrix-Matrix Multiplication for Graphs with Hybrid GPU Cores
par: Li, Zhonggen, et autres
Publié: (2024) -
Accelerating Sparse Matrix-Matrix Multiplication on GPUs with Processing Near HBMs
par: Li, Shiju, et autres
Publié: (2025) -
MAGNUS: Generating Data Locality to Accelerate Sparse Matrix-Matrix Multiplication on CPUs
par: Wolfson-Pou, Jordi, et autres
Publié: (2025) -
Is Sparse Matrix Reordering Effective for Sparse Matrix-Vector Multiplication?
par: Asudeh, Omid, et autres
Publié: (2025) -
LOw-cOst yet High-Performant Sparse Matrix-Matrix Multiplication on Arm SME Architectures
par: Lei, Kelun, et autres
Publié: (2025)