NM-SpMM: Accelerating Matrix Multiplication Using N:M Sparsity with GPGPU
Fuente:
arXiv
Salvato in:
| Autori principali: | Ma, Cong, Wu, Du, Deng, Zhelang, Chen, Jiang, Huang, Xiaowen, Meng, Jintao, Zhu, Wenxi, Wang, Bingqiang, Zhou, Amelie Chi, Chen, Peng, Deng, Minwen, Wei, Yanjie, Feng, Shengzhong, Pan, Yi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
HC-SpMM: Accelerating Sparse Matrix-Matrix Multiplication for Graphs with Hybrid GPU Cores
di: Li, Zhonggen, et al.
Pubblicazione: (2024)
di: Li, Zhonggen, et al.
Pubblicazione: (2024)
AES-SpMM: Balancing Accuracy and Speed by Adaptive Edge Sampling Strategy to Accelerate SpMM in GNNs
di: Song, Yingchen, et al.
Pubblicazione: (2025)
di: Song, Yingchen, et al.
Pubblicazione: (2025)
Acc-SpMM: Accelerating General-purpose Sparse Matrix-Matrix Multiplication with GPU Tensor Cores
di: Zhao, Haisha, et al.
Pubblicazione: (2025)
di: Zhao, Haisha, et al.
Pubblicazione: (2025)
RSH-SpMM: A Row-Structured Hybrid Kernel for Sparse Matrix-Matrix Multiplication on GPUs
di: Li, Aiying, et al.
Pubblicazione: (2026)
di: Li, Aiying, et al.
Pubblicazione: (2026)
High Performance Unstructured SpMM Computation Using Tensor Cores
di: Okanovic, Patrik, et al.
Pubblicazione: (2024)
di: Okanovic, Patrik, et al.
Pubblicazione: (2024)
FlexVector: A SpMM Vector Processor with Flexible VRF for GCNs on Varying-Sparsity Graphs
di: Li, Bohan, et al.
Pubblicazione: (2026)
di: Li, Bohan, et al.
Pubblicazione: (2026)
Low-Bandwidth Matrix Multiplication: Faster Algorithms and More General Forms of Sparsity
di: Gupta, Chetan, et al.
Pubblicazione: (2024)
di: Gupta, Chetan, et al.
Pubblicazione: (2024)
Arrow Matrix Decomposition: A Novel Approach for Communication-Efficient Sparse Matrix Multiplication
di: Gianinazzi, Lukas, et al.
Pubblicazione: (2024)
di: Gianinazzi, Lukas, et al.
Pubblicazione: (2024)
Efficient Column-Wise N:M Pruning on RISC-V CPU
di: Chu, Chi-Wei, et al.
Pubblicazione: (2025)
di: Chu, Chi-Wei, et al.
Pubblicazione: (2025)
ParamSpMM: Adaptive and Efficient Sparse Matrix-Matrix Multiplication on GPUs for GNNs
di: Zhang, Lixing, et al.
Pubblicazione: (2026)
di: Zhang, Lixing, et al.
Pubblicazione: (2026)
AutoTSMM: An Auto-tuning Framework for Building High-Performance Tall-and-Skinny Matrix-Matrix Multiplication on CPUs
di: Li, Chendi, et al.
Pubblicazione: (2022)
di: Li, Chendi, et al.
Pubblicazione: (2022)
FalconGEMM: Surpassing Hardware Peaks with Lower-Complexity Matrix Multiplication
di: Zhu, Honglin, et al.
Pubblicazione: (2026)
di: Zhu, Honglin, et al.
Pubblicazione: (2026)
Computational Power of Opaque Robots
di: Feletti, Caterina, et al.
Pubblicazione: (2024)
di: Feletti, Caterina, et al.
Pubblicazione: (2024)
PackSELL: A Sparse Matrix Format for Precision-Agnostic High-Performance SpMV
di: Suzuki, Kengo, et al.
Pubblicazione: (2026)
di: Suzuki, Kengo, et al.
Pubblicazione: (2026)
Vortex: Efficient Sample-Free Dynamic Tensor Program Optimization via Hardware-aware Strategy Space Hierarchization
di: Zhou, Yangjie, et al.
Pubblicazione: (2024)
di: Zhou, Yangjie, et al.
Pubblicazione: (2024)
Sparsity-Aware Roofline Models for Sparse Matrix-Matrix Multiplication
di: Qian, Matthew, et al.
Pubblicazione: (2026)
di: Qian, Matthew, et al.
Pubblicazione: (2026)
Challenging Portability Paradigms: FPGA Acceleration Using SYCL and OpenCL
di: de Castro, Manuel, et al.
Pubblicazione: (2024)
di: de Castro, Manuel, et al.
Pubblicazione: (2024)
Utilizing Sparsity in the GPU-accelerated Assembly of Schur Complement Matrices in Domain Decomposition Methods
di: Homola, Jakub, et al.
Pubblicazione: (2025)
di: Homola, Jakub, et al.
Pubblicazione: (2025)
A Systematic Literature Survey of Sparse Matrix-Vector Multiplication
di: Gao, Jianhua, et al.
Pubblicazione: (2024)
di: Gao, Jianhua, et al.
Pubblicazione: (2024)
Navigating Fog Federation: Classifying Current Research and Identifying Challenges
di: Patel, Dhairya, et al.
Pubblicazione: (2024)
di: Patel, Dhairya, et al.
Pubblicazione: (2024)
Interactive and Urgent HPC: State of the Research
di: Reuther, Albert, et al.
Pubblicazione: (2026)
di: Reuther, Albert, et al.
Pubblicazione: (2026)
SpArch: Efficient Architecture for Sparse Matrix Multiplication
di: Zhang, Zhekai, et al.
Pubblicazione: (2020)
di: Zhang, Zhekai, et al.
Pubblicazione: (2020)
FlashSparse: Minimizing Computation Redundancy for Fast Sparse Matrix Multiplications on Tensor Cores
di: Shi, Jinliang, et al.
Pubblicazione: (2024)
di: Shi, Jinliang, et al.
Pubblicazione: (2024)
A C++17 Thread Pool for High-Performance Scientific Computing
di: Shoshany, Barak
Pubblicazione: (2021)
di: Shoshany, Barak
Pubblicazione: (2021)
Libra: Unleashing GPU Heterogeneity for High-Performance Sparse Matrix Multiplication
di: Shi, Jinliang, et al.
Pubblicazione: (2025)
di: Shi, Jinliang, et al.
Pubblicazione: (2025)
Semaphores Augmented with a Waiting Array
di: Dice, Dave, et al.
Pubblicazione: (2025)
di: Dice, Dave, et al.
Pubblicazione: (2025)
Introducing SWIRL: An Intermediate Representation Language for Scientific Workflows
di: Colonnelli, Iacopo, et al.
Pubblicazione: (2024)
di: Colonnelli, Iacopo, et al.
Pubblicazione: (2024)
Optimizing Fine-Grained Parallelism Through Dynamic Load Balancing on Multi-Socket Many-Core Systems
di: Wang, Wenyi, et al.
Pubblicazione: (2025)
di: Wang, Wenyi, et al.
Pubblicazione: (2025)
Joint Training on AMD and NVIDIA GPUs
di: Hu, Jon, et al.
Pubblicazione: (2026)
di: Hu, Jon, et al.
Pubblicazione: (2026)
Reciprocating Locks
di: Dice, Dave, et al.
Pubblicazione: (2025)
di: Dice, Dave, et al.
Pubblicazione: (2025)
Hapax Locks : Value-Based Mutual Exclusion
di: Dice, Dave, et al.
Pubblicazione: (2025)
di: Dice, Dave, et al.
Pubblicazione: (2025)
Conflict-Freedom as a Progress Condition
di: Kuznetsov, Petr, et al.
Pubblicazione: (2026)
di: Kuznetsov, Petr, et al.
Pubblicazione: (2026)
Enabling Practical Transparent Checkpointing for MPI: A Topological Sort Approach
di: Xu, Yao, et al.
Pubblicazione: (2024)
di: Xu, Yao, et al.
Pubblicazione: (2024)
CB-SpMV:A Data Aggregating and Balance Algorithm for Cache-Friendly Block-Based SpMV on GPUs
di: Cong, Xing, et al.
Pubblicazione: (2026)
di: Cong, Xing, et al.
Pubblicazione: (2026)
Demystifying ARM SME to Optimize General Matrix Multiplications
di: Deng, Chencheng, et al.
Pubblicazione: (2025)
di: Deng, Chencheng, et al.
Pubblicazione: (2025)
Accelerating Matrix Multiplication: A Performance Comparison Between Multi-Core CPU and GPU
di: Ansari, Mufakir Qamar, et al.
Pubblicazione: (2025)
di: Ansari, Mufakir Qamar, et al.
Pubblicazione: (2025)
Simulating Dynamic Cloud Marketspaces: Modeling Spot Instance Behavior and Scheduling with CloudSim Plus
di: Goldgruber, Christoph, et al.
Pubblicazione: (2025)
di: Goldgruber, Christoph, et al.
Pubblicazione: (2025)
Efficient and Portable Support for Overdecomposition on Distributed Memory GPGPU Platforms
di: Bhosale, Aditya, et al.
Pubblicazione: (2026)
di: Bhosale, Aditya, et al.
Pubblicazione: (2026)
Accelerating Sparse Matrix-Matrix Multiplication on GPUs with Processing Near HBMs
di: Li, Shiju, et al.
Pubblicazione: (2025)
di: Li, Shiju, et al.
Pubblicazione: (2025)
EPIC: An Energy-Efficient, High-Performance GPGPU Computing Research Infrastructure
di: Själander, Magnus, et al.
Pubblicazione: (2019)
di: Själander, Magnus, et al.
Pubblicazione: (2019)
Documenti analoghi
-
HC-SpMM: Accelerating Sparse Matrix-Matrix Multiplication for Graphs with Hybrid GPU Cores
di: Li, Zhonggen, et al.
Pubblicazione: (2024) -
AES-SpMM: Balancing Accuracy and Speed by Adaptive Edge Sampling Strategy to Accelerate SpMM in GNNs
di: Song, Yingchen, et al.
Pubblicazione: (2025) -
Acc-SpMM: Accelerating General-purpose Sparse Matrix-Matrix Multiplication with GPU Tensor Cores
di: Zhao, Haisha, et al.
Pubblicazione: (2025) -
RSH-SpMM: A Row-Structured Hybrid Kernel for Sparse Matrix-Matrix Multiplication on GPUs
di: Li, Aiying, et al.
Pubblicazione: (2026) -
High Performance Unstructured SpMM Computation Using Tensor Cores
di: Okanovic, Patrik, et al.
Pubblicazione: (2024)