AsyncSparse: Accelerating Sparse Matrix-Matrix Multiplication on Asynchronous GPU Architectures
Fuente:
arXiv
Guardado en:
| Autores principales: | Liu, Jie, Pu, Huanzhi, Zhang, Zhiru |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
HC-SpMM: Accelerating Sparse Matrix-Matrix Multiplication for Graphs with Hybrid GPU Cores
por: Li, Zhonggen, et al.
Publicado: (2024)
por: Li, Zhonggen, et al.
Publicado: (2024)
Accelerating Sparse Matrix-Matrix Multiplication on GPUs with Processing Near HBMs
por: Li, Shiju, et al.
Publicado: (2025)
por: Li, Shiju, et al.
Publicado: (2025)
MAGNUS: Generating Data Locality to Accelerate Sparse Matrix-Matrix Multiplication on CPUs
por: Wolfson-Pou, Jordi, et al.
Publicado: (2025)
por: Wolfson-Pou, Jordi, et al.
Publicado: (2025)
Is Sparse Matrix Reordering Effective for Sparse Matrix-Vector Multiplication?
por: Asudeh, Omid, et al.
Publicado: (2025)
por: Asudeh, Omid, et al.
Publicado: (2025)
LOw-cOst yet High-Performant Sparse Matrix-Matrix Multiplication on Arm SME Architectures
por: Lei, Kelun, et al.
Publicado: (2025)
por: Lei, Kelun, et al.
Publicado: (2025)
Distributed-Memory Parallel Algorithms for Sparse Matrix and Sparse Tall-and-Skinny Matrix Multiplication
por: Ranawaka, Isuru, et al.
Publicado: (2024)
por: Ranawaka, Isuru, et al.
Publicado: (2024)
Ocean: Fast Estimation-Based Sparse General Matrix-Matrix Multiplication on GPU
por: Li, Yifan, et al.
Publicado: (2026)
por: Li, Yifan, et al.
Publicado: (2026)
Sparsity-Aware Roofline Models for Sparse Matrix-Matrix Multiplication
por: Qian, Matthew, et al.
Publicado: (2026)
por: Qian, Matthew, et al.
Publicado: (2026)
Acc-SpMM: Accelerating General-purpose Sparse Matrix-Matrix Multiplication with GPU Tensor Cores
por: Zhao, Haisha, et al.
Publicado: (2025)
por: Zhao, Haisha, et al.
Publicado: (2025)
SpArch: Efficient Architecture for Sparse Matrix Multiplication
por: Zhang, Zhekai, et al.
Publicado: (2020)
por: Zhang, Zhekai, et al.
Publicado: (2020)
Improving Locality in Sparse and Dense Matrix Multiplications
por: Dezfuli, Mohammad Mahdi Salehi, et al.
Publicado: (2024)
por: Dezfuli, Mohammad Mahdi Salehi, et al.
Publicado: (2024)
ParamSpMM: Adaptive and Efficient Sparse Matrix-Matrix Multiplication on GPUs for GNNs
por: Zhang, Lixing, et al.
Publicado: (2026)
por: Zhang, Lixing, et al.
Publicado: (2026)
RDMA-Based Algorithms for Sparse Matrix Multiplication on GPUs
por: Brock, Benjamin, et al.
Publicado: (2023)
por: Brock, Benjamin, et al.
Publicado: (2023)
Exploring Sparse Matrix Multiplication Kernels on the Cerebras CS-3
por: Shah, Milan, et al.
Publicado: (2026)
por: Shah, Milan, et al.
Publicado: (2026)
GPU Accelerated Sparse Cholesky Factorization
por: Karsavuran, M. Ozan, et al.
Publicado: (2024)
por: Karsavuran, M. Ozan, et al.
Publicado: (2024)
RSH-SpMM: A Row-Structured Hybrid Kernel for Sparse Matrix-Matrix Multiplication on GPUs
por: Li, Aiying, et al.
Publicado: (2026)
por: Li, Aiying, et al.
Publicado: (2026)
SHIRO: Near-Optimal Communication Strategies for Distributed Sparse Matrix Multiplication
por: Zhuang, Chen, et al.
Publicado: (2025)
por: Zhuang, Chen, et al.
Publicado: (2025)
Accelerating Sparse MTTKRP for Small Tensor Decomposition on GPU
por: Wijeratne, Sasindu, et al.
Publicado: (2025)
por: Wijeratne, Sasindu, et al.
Publicado: (2025)
Selection of Supervised Learning-based Sparse Matrix Reordering Algorithms
por: Tang, Tao, et al.
Publicado: (2025)
por: Tang, Tao, et al.
Publicado: (2025)
Fantasy: Efficient Large-scale Vector Search on GPU Clusters with GPUDirect Async
por: Liu, Yi, et al.
Publicado: (2025)
por: Liu, Yi, et al.
Publicado: (2025)
PARS3: Parallel Sparse Skew-Symmetric Matrix-Vector Multiplication with Reverse Cuthill-McKee Reordering
por: Yildirim, Selin, et al.
Publicado: (2024)
por: Yildirim, Selin, et al.
Publicado: (2024)
An Auto-tuning Method for Run-time Data Transformation for Sparse Matrix-Vector Multiplication
por: Katagiri, Takahiro, et al.
Publicado: (2024)
por: Katagiri, Takahiro, et al.
Publicado: (2024)
Arrow Matrix Decomposition: A Novel Approach for Communication-Efficient Sparse Matrix Multiplication
por: Gianinazzi, Lukas, et al.
Publicado: (2024)
por: Gianinazzi, Lukas, et al.
Publicado: (2024)
Fast Kronecker Matrix-Matrix Multiplication on GPUs
por: Jangda, Abhinav, et al.
Publicado: (2024)
por: Jangda, Abhinav, et al.
Publicado: (2024)
Sparse MTTKRP Acceleration for Tensor Decomposition on GPU
por: Wijeratne, Sasindu, et al.
Publicado: (2024)
por: Wijeratne, Sasindu, et al.
Publicado: (2024)
Fast Sparse Matrix Permutation for Mesh-Based Direct Solvers
por: Zarebavami, Behrooz, et al.
Publicado: (2026)
por: Zarebavami, Behrooz, et al.
Publicado: (2026)
AsyncMesh: Fully Asynchronous Optimization for Data and Pipeline Parallelism
por: Ajanthan, Thalaiyasingam, et al.
Publicado: (2026)
por: Ajanthan, Thalaiyasingam, et al.
Publicado: (2026)
GPU-Accelerated Vecchia Approximations of Gaussian Processes for Geospatial Data using Batched Matrix Computations
por: Pan, Qilong, et al.
Publicado: (2024)
por: Pan, Qilong, et al.
Publicado: (2024)
AMPED: Accelerating MTTKRP for Billion-Scale Sparse Tensor Decomposition on Multiple GPUs
por: Wijeratne, Sasindu, et al.
Publicado: (2025)
por: Wijeratne, Sasindu, et al.
Publicado: (2025)
Matrix representation and GPU-optimized parallel B-spline computing
por: Wu, Jiayu, et al.
Publicado: (2025)
por: Wu, Jiayu, et al.
Publicado: (2025)
DGEMM on Integer Matrix Multiplication Unit
por: Ootomo, Hiroyuki, et al.
Publicado: (2023)
por: Ootomo, Hiroyuki, et al.
Publicado: (2023)
Hello SME! Generating Fast Matrix Multiplication Kernels Using the Scalable Matrix Extension
por: Remke, Stefan, et al.
Publicado: (2024)
por: Remke, Stefan, et al.
Publicado: (2024)
GPU-Accelerated Batch-Dynamic Subgraph Matching
por: Qiu, Linshan, et al.
Publicado: (2024)
por: Qiu, Linshan, et al.
Publicado: (2024)
High-Performance and Power-Efficient Emulation of Matrix Multiplication using INT8 Matrix Engines
por: Uchino, Yuki, et al.
Publicado: (2025)
por: Uchino, Yuki, et al.
Publicado: (2025)
VDCores: Resource Decoupled Programming and Execution for Asynchronous GPU
por: He, Zijian, et al.
Publicado: (2026)
por: He, Zijian, et al.
Publicado: (2026)
AsyncSC: An Asynchronous Sidechain for Multi-Domain Data Exchange in Internet of Things
por: Yang, Lingxiao, et al.
Publicado: (2024)
por: Yang, Lingxiao, et al.
Publicado: (2024)
Mapping Parallel Matrix Multiplication in GotoBLAS2 to the AMD Versal ACAP for Deep Learning
por: Lei, Jie, et al.
Publicado: (2024)
por: Lei, Jie, et al.
Publicado: (2024)
Accelerating Sparse DNNs Based on Tiled GEMM
por: Guo, Cong, et al.
Publicado: (2024)
por: Guo, Cong, et al.
Publicado: (2024)
Analysis of the Performance of the Matrix Multiplication Algorithm on the Cirrus Supercomputer
por: Adefemi, Temitayo
Publicado: (2024)
por: Adefemi, Temitayo
Publicado: (2024)
Demystifying ARM SME to Optimize General Matrix Multiplications
por: Deng, Chencheng, et al.
Publicado: (2025)
por: Deng, Chencheng, et al.
Publicado: (2025)
Ejemplares similares
-
HC-SpMM: Accelerating Sparse Matrix-Matrix Multiplication for Graphs with Hybrid GPU Cores
por: Li, Zhonggen, et al.
Publicado: (2024) -
Accelerating Sparse Matrix-Matrix Multiplication on GPUs with Processing Near HBMs
por: Li, Shiju, et al.
Publicado: (2025) -
MAGNUS: Generating Data Locality to Accelerate Sparse Matrix-Matrix Multiplication on CPUs
por: Wolfson-Pou, Jordi, et al.
Publicado: (2025) -
Is Sparse Matrix Reordering Effective for Sparse Matrix-Vector Multiplication?
por: Asudeh, Omid, et al.
Publicado: (2025) -
LOw-cOst yet High-Performant Sparse Matrix-Matrix Multiplication on Arm SME Architectures
por: Lei, Kelun, et al.
Publicado: (2025)