Fast Kronecker Matrix-Matrix Multiplication on GPUs
Fuente:
arXiv
Salvato in:
| Autori principali: | Jangda, Abhinav, Yadav, Mohit |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Accelerating Sparse Matrix-Matrix Multiplication on GPUs with Processing Near HBMs
di: Li, Shiju, et al.
Pubblicazione: (2025)
di: Li, Shiju, et al.
Pubblicazione: (2025)
RDMA-Based Algorithms for Sparse Matrix Multiplication on GPUs
di: Brock, Benjamin, et al.
Pubblicazione: (2023)
di: Brock, Benjamin, et al.
Pubblicazione: (2023)
ParamSpMM: Adaptive and Efficient Sparse Matrix-Matrix Multiplication on GPUs for GNNs
di: Zhang, Lixing, et al.
Pubblicazione: (2026)
di: Zhang, Lixing, et al.
Pubblicazione: (2026)
RSH-SpMM: A Row-Structured Hybrid Kernel for Sparse Matrix-Matrix Multiplication on GPUs
di: Li, Aiying, et al.
Pubblicazione: (2026)
di: Li, Aiying, et al.
Pubblicazione: (2026)
Hello SME! Generating Fast Matrix Multiplication Kernels Using the Scalable Matrix Extension
di: Remke, Stefan, et al.
Pubblicazione: (2024)
di: Remke, Stefan, et al.
Pubblicazione: (2024)
Sparsity-Aware Roofline Models for Sparse Matrix-Matrix Multiplication
di: Qian, Matthew, et al.
Pubblicazione: (2026)
di: Qian, Matthew, et al.
Pubblicazione: (2026)
A Framework for Fine-Grained Synchronization of Dependent GPU Kernels
di: Jangda, Abhinav, et al.
Pubblicazione: (2023)
di: Jangda, Abhinav, et al.
Pubblicazione: (2023)
AsyncSparse: Accelerating Sparse Matrix-Matrix Multiplication on Asynchronous GPU Architectures
di: Liu, Jie, et al.
Pubblicazione: (2026)
di: Liu, Jie, et al.
Pubblicazione: (2026)
MAGNUS: Generating Data Locality to Accelerate Sparse Matrix-Matrix Multiplication on CPUs
di: Wolfson-Pou, Jordi, et al.
Pubblicazione: (2025)
di: Wolfson-Pou, Jordi, et al.
Pubblicazione: (2025)
Ocean: Fast Estimation-Based Sparse General Matrix-Matrix Multiplication on GPU
di: Li, Yifan, et al.
Pubblicazione: (2026)
di: Li, Yifan, et al.
Pubblicazione: (2026)
DGEMM on Integer Matrix Multiplication Unit
di: Ootomo, Hiroyuki, et al.
Pubblicazione: (2023)
di: Ootomo, Hiroyuki, et al.
Pubblicazione: (2023)
Distributed-Memory Parallel Algorithms for Sparse Matrix and Sparse Tall-and-Skinny Matrix Multiplication
di: Ranawaka, Isuru, et al.
Pubblicazione: (2024)
di: Ranawaka, Isuru, et al.
Pubblicazione: (2024)
HC-SpMM: Accelerating Sparse Matrix-Matrix Multiplication for Graphs with Hybrid GPU Cores
di: Li, Zhonggen, et al.
Pubblicazione: (2024)
di: Li, Zhonggen, et al.
Pubblicazione: (2024)
High-Performance and Power-Efficient Emulation of Matrix Multiplication using INT8 Matrix Engines
di: Uchino, Yuki, et al.
Pubblicazione: (2025)
di: Uchino, Yuki, et al.
Pubblicazione: (2025)
Improving Locality in Sparse and Dense Matrix Multiplications
di: Dezfuli, Mohammad Mahdi Salehi, et al.
Pubblicazione: (2024)
di: Dezfuli, Mohammad Mahdi Salehi, et al.
Pubblicazione: (2024)
Is Sparse Matrix Reordering Effective for Sparse Matrix-Vector Multiplication?
di: Asudeh, Omid, et al.
Pubblicazione: (2025)
di: Asudeh, Omid, et al.
Pubblicazione: (2025)
LOw-cOst yet High-Performant Sparse Matrix-Matrix Multiplication on Arm SME Architectures
di: Lei, Kelun, et al.
Pubblicazione: (2025)
di: Lei, Kelun, et al.
Pubblicazione: (2025)
Analysis of the Performance of the Matrix Multiplication Algorithm on the Cirrus Supercomputer
di: Adefemi, Temitayo
Pubblicazione: (2024)
di: Adefemi, Temitayo
Pubblicazione: (2024)
Demystifying ARM SME to Optimize General Matrix Multiplications
di: Deng, Chencheng, et al.
Pubblicazione: (2025)
di: Deng, Chencheng, et al.
Pubblicazione: (2025)
Performance Enhancement of the Ozaki Scheme on Integer Matrix Multiplication Unit
di: Uchino, Yuki, et al.
Pubblicazione: (2024)
di: Uchino, Yuki, et al.
Pubblicazione: (2024)
Exploring Sparse Matrix Multiplication Kernels on the Cerebras CS-3
di: Shah, Milan, et al.
Pubblicazione: (2026)
di: Shah, Milan, et al.
Pubblicazione: (2026)
Emulation of Complex Matrix Multiplication based on the Chinese Remainder Theorem
di: Uchino, Yuki, et al.
Pubblicazione: (2025)
di: Uchino, Yuki, et al.
Pubblicazione: (2025)
Matrix Multiplication in the MPC Model
di: Joshi, Lakshya, et al.
Pubblicazione: (2025)
di: Joshi, Lakshya, et al.
Pubblicazione: (2025)
Efficiently Parallelizable Strassen-Based Multiplication of a Matrix by its Transpose
di: Arrigoni, Viviana, et al.
Pubblicazione: (2021)
di: Arrigoni, Viviana, et al.
Pubblicazione: (2021)
Stencil Matrixization
di: Zhao, Wenxuan, et al.
Pubblicazione: (2023)
di: Zhao, Wenxuan, et al.
Pubblicazione: (2023)
Fast Matrix Multiplications for Lookup Table-Quantized LLMs
di: Guo, Han, et al.
Pubblicazione: (2024)
di: Guo, Han, et al.
Pubblicazione: (2024)
Matrix-PIC: Harnessing Matrix Outer-product for High-Performance Particle-in-Cell Simulations
di: Rao, Yizhuo, et al.
Pubblicazione: (2026)
di: Rao, Yizhuo, et al.
Pubblicazione: (2026)
Fast Sparse Matrix Permutation for Mesh-Based Direct Solvers
di: Zarebavami, Behrooz, et al.
Pubblicazione: (2026)
di: Zarebavami, Behrooz, et al.
Pubblicazione: (2026)
Mapping Parallel Matrix Multiplication in GotoBLAS2 to the AMD Versal ACAP for Deep Learning
di: Lei, Jie, et al.
Pubblicazione: (2024)
di: Lei, Jie, et al.
Pubblicazione: (2024)
Double-Precision Matrix Multiplication Emulation via Ozaki-II Scheme with FP8 Quantization
di: Uchino, Yuki, et al.
Pubblicazione: (2026)
di: Uchino, Yuki, et al.
Pubblicazione: (2026)
FlashSketch: Sketch-Kernel Co-Design for Fast Sparse Sketching on GPUs
di: Dwaraknath, Rajat Vadiraj, et al.
Pubblicazione: (2026)
di: Dwaraknath, Rajat Vadiraj, et al.
Pubblicazione: (2026)
AMPED: Accelerating MTTKRP for Billion-Scale Sparse Tensor Decomposition on Multiple GPUs
di: Wijeratne, Sasindu, et al.
Pubblicazione: (2025)
di: Wijeratne, Sasindu, et al.
Pubblicazione: (2025)
FlashMP: Fast Discrete Transform-Based Solver for Preconditioning Maxwell's Equations on GPUs
di: Zhang, Haoyuan, et al.
Pubblicazione: (2025)
di: Zhang, Haoyuan, et al.
Pubblicazione: (2025)
SHIRO: Near-Optimal Communication Strategies for Distributed Sparse Matrix Multiplication
di: Zhuang, Chen, et al.
Pubblicazione: (2025)
di: Zhuang, Chen, et al.
Pubblicazione: (2025)
PARS3: Parallel Sparse Skew-Symmetric Matrix-Vector Multiplication with Reverse Cuthill-McKee Reordering
di: Yildirim, Selin, et al.
Pubblicazione: (2024)
di: Yildirim, Selin, et al.
Pubblicazione: (2024)
TurboFFT: Co-Designed High-Performance and Fault-Tolerant Fast Fourier Transform on GPUs
di: Wu, Shixun, et al.
Pubblicazione: (2024)
di: Wu, Shixun, et al.
Pubblicazione: (2024)
RTop-K: Ultra-Fast Row-Wise Top-K Selection for Neural Network Acceleration on GPUs
di: Xie, Xi, et al.
Pubblicazione: (2024)
di: Xie, Xi, et al.
Pubblicazione: (2024)
SpArch: Efficient Architecture for Sparse Matrix Multiplication
di: Zhang, Zhekai, et al.
Pubblicazione: (2020)
di: Zhang, Zhekai, et al.
Pubblicazione: (2020)
An Auto-tuning Method for Run-time Data Transformation for Sparse Matrix-Vector Multiplication
di: Katagiri, Takahiro, et al.
Pubblicazione: (2024)
di: Katagiri, Takahiro, et al.
Pubblicazione: (2024)
W4A16 Mixed-Precision Matrix Multiplication on Decoupled Architecture: Kernel Design and Memory Bottleneck Analysis for Ascend NPUs
di: He, Yuanhong, et al.
Pubblicazione: (2026)
di: He, Yuanhong, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Accelerating Sparse Matrix-Matrix Multiplication on GPUs with Processing Near HBMs
di: Li, Shiju, et al.
Pubblicazione: (2025) -
RDMA-Based Algorithms for Sparse Matrix Multiplication on GPUs
di: Brock, Benjamin, et al.
Pubblicazione: (2023) -
ParamSpMM: Adaptive and Efficient Sparse Matrix-Matrix Multiplication on GPUs for GNNs
di: Zhang, Lixing, et al.
Pubblicazione: (2026) -
RSH-SpMM: A Row-Structured Hybrid Kernel for Sparse Matrix-Matrix Multiplication on GPUs
di: Li, Aiying, et al.
Pubblicazione: (2026) -
Hello SME! Generating Fast Matrix Multiplication Kernels Using the Scalable Matrix Extension
di: Remke, Stefan, et al.
Pubblicazione: (2024)