Exploring Sparse Matrix Multiplication Kernels on the Cerebras CS-3
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Shah, Milan, Di, Sheng, Becchi, Michela |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Improving the Efficiency of OpenCL Kernels through Pipes
par: Zarch, Mostafa Eghbali, et autres
Publié: (2022)
par: Zarch, Mostafa Eghbali, et autres
Publié: (2022)
RSH-SpMM: A Row-Structured Hybrid Kernel for Sparse Matrix-Matrix Multiplication on GPUs
par: Li, Aiying, et autres
Publié: (2026)
par: Li, Aiying, et autres
Publié: (2026)
AsyncSparse: Accelerating Sparse Matrix-Matrix Multiplication on Asynchronous GPU Architectures
par: Liu, Jie, et autres
Publié: (2026)
par: Liu, Jie, et autres
Publié: (2026)
Benchmarking the Performance of Large Language Models on the Cerebras Wafer Scale Engine
par: Zhang, Zuoning, et autres
Publié: (2024)
par: Zhang, Zuoning, et autres
Publié: (2024)
Distributed-Memory Parallel Algorithms for Sparse Matrix and Sparse Tall-and-Skinny Matrix Multiplication
par: Ranawaka, Isuru, et autres
Publié: (2024)
par: Ranawaka, Isuru, et autres
Publié: (2024)
Sparsity-Aware Roofline Models for Sparse Matrix-Matrix Multiplication
par: Qian, Matthew, et autres
Publié: (2026)
par: Qian, Matthew, et autres
Publié: (2026)
Improving Locality in Sparse and Dense Matrix Multiplications
par: Dezfuli, Mohammad Mahdi Salehi, et autres
Publié: (2024)
par: Dezfuli, Mohammad Mahdi Salehi, et autres
Publié: (2024)
Accelerating Sparse Matrix-Matrix Multiplication on GPUs with Processing Near HBMs
par: Li, Shiju, et autres
Publié: (2025)
par: Li, Shiju, et autres
Publié: (2025)
Is Sparse Matrix Reordering Effective for Sparse Matrix-Vector Multiplication?
par: Asudeh, Omid, et autres
Publié: (2025)
par: Asudeh, Omid, et autres
Publié: (2025)
Hello SME! Generating Fast Matrix Multiplication Kernels Using the Scalable Matrix Extension
par: Remke, Stefan, et autres
Publié: (2024)
par: Remke, Stefan, et autres
Publié: (2024)
RDMA-Based Algorithms for Sparse Matrix Multiplication on GPUs
par: Brock, Benjamin, et autres
Publié: (2023)
par: Brock, Benjamin, et autres
Publié: (2023)
MAGNUS: Generating Data Locality to Accelerate Sparse Matrix-Matrix Multiplication on CPUs
par: Wolfson-Pou, Jordi, et autres
Publié: (2025)
par: Wolfson-Pou, Jordi, et autres
Publié: (2025)
ParamSpMM: Adaptive and Efficient Sparse Matrix-Matrix Multiplication on GPUs for GNNs
par: Zhang, Lixing, et autres
Publié: (2026)
par: Zhang, Lixing, et autres
Publié: (2026)
Fused Breadth-First Probabilistic Traversals on Distributed GPU Systems
par: Neff, Reece, et autres
Publié: (2023)
par: Neff, Reece, et autres
Publié: (2023)
HC-SpMM: Accelerating Sparse Matrix-Matrix Multiplication for Graphs with Hybrid GPU Cores
par: Li, Zhonggen, et autres
Publié: (2024)
par: Li, Zhonggen, et autres
Publié: (2024)
Beyond Exascale: Dataflow Domain Translation on a Cerebras Cluster
par: Oppelstrup, Tomas, et autres
Publié: (2025)
par: Oppelstrup, Tomas, et autres
Publié: (2025)
LOw-cOst yet High-Performant Sparse Matrix-Matrix Multiplication on Arm SME Architectures
par: Lei, Kelun, et autres
Publié: (2025)
par: Lei, Kelun, et autres
Publié: (2025)
PARS3: Parallel Sparse Skew-Symmetric Matrix-Vector Multiplication with Reverse Cuthill-McKee Reordering
par: Yildirim, Selin, et autres
Publié: (2024)
par: Yildirim, Selin, et autres
Publié: (2024)
Picasso: Memory-Efficient Graph Coloring Using Palettes With Applications in Quantum Computing
par: Ferdous, S M, et autres
Publié: (2024)
par: Ferdous, S M, et autres
Publié: (2024)
SpComm3D: A Framework for Enabling Sparse Communication in 3D Sparse Kernels
par: Abubaker, Nabil, et autres
Publié: (2024)
par: Abubaker, Nabil, et autres
Publié: (2024)
Fast Kronecker Matrix-Matrix Multiplication on GPUs
par: Jangda, Abhinav, et autres
Publié: (2024)
par: Jangda, Abhinav, et autres
Publié: (2024)
SHIRO: Near-Optimal Communication Strategies for Distributed Sparse Matrix Multiplication
par: Zhuang, Chen, et autres
Publié: (2025)
par: Zhuang, Chen, et autres
Publié: (2025)
W4A16 Mixed-Precision Matrix Multiplication on Decoupled Architecture: Kernel Design and Memory Bottleneck Analysis for Ascend NPUs
par: He, Yuanhong, et autres
Publié: (2026)
par: He, Yuanhong, et autres
Publié: (2026)
HiCoCS: High Concurrency Cross-Sharding on Permissioned Blockchains
par: Yang, Lingxiao, et autres
Publié: (2025)
par: Yang, Lingxiao, et autres
Publié: (2025)
SpArch: Efficient Architecture for Sparse Matrix Multiplication
par: Zhang, Zhekai, et autres
Publié: (2020)
par: Zhang, Zhekai, et autres
Publié: (2020)
Ocean: Fast Estimation-Based Sparse General Matrix-Matrix Multiplication on GPU
par: Li, Yifan, et autres
Publié: (2026)
par: Li, Yifan, et autres
Publié: (2026)
DGEMM on Integer Matrix Multiplication Unit
par: Ootomo, Hiroyuki, et autres
Publié: (2023)
par: Ootomo, Hiroyuki, et autres
Publié: (2023)
An Auto-tuning Method for Run-time Data Transformation for Sparse Matrix-Vector Multiplication
par: Katagiri, Takahiro, et autres
Publié: (2024)
par: Katagiri, Takahiro, et autres
Publié: (2024)
Selection of Supervised Learning-based Sparse Matrix Reordering Algorithms
par: Tang, Tao, et autres
Publié: (2025)
par: Tang, Tao, et autres
Publié: (2025)
FlashSketch: Sketch-Kernel Co-Design for Fast Sparse Sketching on GPUs
par: Dwaraknath, Rajat Vadiraj, et autres
Publié: (2026)
par: Dwaraknath, Rajat Vadiraj, et autres
Publié: (2026)
Popcorn: Accelerating Kernel K-means on GPUs through Sparse Linear Algebra
par: Bellavita, Julian, et autres
Publié: (2025)
par: Bellavita, Julian, et autres
Publié: (2025)
Analysis of the Performance of the Matrix Multiplication Algorithm on the Cirrus Supercomputer
par: Adefemi, Temitayo
Publié: (2024)
par: Adefemi, Temitayo
Publié: (2024)
Demystifying ARM SME to Optimize General Matrix Multiplications
par: Deng, Chencheng, et autres
Publié: (2025)
par: Deng, Chencheng, et autres
Publié: (2025)
High-Performance and Power-Efficient Emulation of Matrix Multiplication using INT8 Matrix Engines
par: Uchino, Yuki, et autres
Publié: (2025)
par: Uchino, Yuki, et autres
Publié: (2025)
Can Tensor Cores Benefit Memory-Bound Kernels? (No!)
par: Zhang, Lingqi, et autres
Publié: (2025)
par: Zhang, Lingqi, et autres
Publié: (2025)
Emulation of Complex Matrix Multiplication based on the Chinese Remainder Theorem
par: Uchino, Yuki, et autres
Publié: (2025)
par: Uchino, Yuki, et autres
Publié: (2025)
Performance Enhancement of the Ozaki Scheme on Integer Matrix Multiplication Unit
par: Uchino, Yuki, et autres
Publié: (2024)
par: Uchino, Yuki, et autres
Publié: (2024)
Efficiently Parallelizable Strassen-Based Multiplication of a Matrix by its Transpose
par: Arrigoni, Viviana, et autres
Publié: (2021)
par: Arrigoni, Viviana, et autres
Publié: (2021)
Cache Blocking of Distributed-Memory Parallel Matrix Power Kernels
par: Lacey, Dane C., et autres
Publié: (2024)
par: Lacey, Dane C., et autres
Publié: (2024)
Stencil Computations on Cerebras Wafer-Scale Engine
par: Belli, Elia, et autres
Publié: (2026)
par: Belli, Elia, et autres
Publié: (2026)
Documents similaires
-
Improving the Efficiency of OpenCL Kernels through Pipes
par: Zarch, Mostafa Eghbali, et autres
Publié: (2022) -
RSH-SpMM: A Row-Structured Hybrid Kernel for Sparse Matrix-Matrix Multiplication on GPUs
par: Li, Aiying, et autres
Publié: (2026) -
AsyncSparse: Accelerating Sparse Matrix-Matrix Multiplication on Asynchronous GPU Architectures
par: Liu, Jie, et autres
Publié: (2026) -
Benchmarking the Performance of Large Language Models on the Cerebras Wafer Scale Engine
par: Zhang, Zuoning, et autres
Publié: (2024) -
Distributed-Memory Parallel Algorithms for Sparse Matrix and Sparse Tall-and-Skinny Matrix Multiplication
par: Ranawaka, Isuru, et autres
Publié: (2024)