AutoTSMM: An Auto-tuning Framework for Building High-Performance Tall-and-Skinny Matrix-Matrix Multiplication on CPUs
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Li, Chendi, Jia, Haipeng, Cao, Hang, Yao, Jianyu, Shi, Boqian, Xiang, Chunyang, Sun, Jinbo, Lu, Pengqi, Zhang, Yunquan |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2022
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Distributed-Memory Parallel Algorithms for Sparse Matrix and Sparse Tall-and-Skinny Matrix Multiplication
von: Ranawaka, Isuru, et al.
Veröffentlicht: (2024)
von: Ranawaka, Isuru, et al.
Veröffentlicht: (2024)
MAGNUS: Generating Data Locality to Accelerate Sparse Matrix-Matrix Multiplication on CPUs
von: Wolfson-Pou, Jordi, et al.
Veröffentlicht: (2025)
von: Wolfson-Pou, Jordi, et al.
Veröffentlicht: (2025)
An Auto-tuning Method for Run-time Data Transformation for Sparse Matrix-Vector Multiplication
von: Katagiri, Takahiro, et al.
Veröffentlicht: (2024)
von: Katagiri, Takahiro, et al.
Veröffentlicht: (2024)
Stencil Matrixization
von: Zhao, Wenxuan, et al.
Veröffentlicht: (2023)
von: Zhao, Wenxuan, et al.
Veröffentlicht: (2023)
PATSMA: Parameter Auto-tuning for Shared Memory Algorithms
von: Fernandes, Joao B., et al.
Veröffentlicht: (2024)
von: Fernandes, Joao B., et al.
Veröffentlicht: (2024)
Fast Kronecker Matrix-Matrix Multiplication on GPUs
von: Jangda, Abhinav, et al.
Veröffentlicht: (2024)
von: Jangda, Abhinav, et al.
Veröffentlicht: (2024)
Sparsity-Aware Roofline Models for Sparse Matrix-Matrix Multiplication
von: Qian, Matthew, et al.
Veröffentlicht: (2026)
von: Qian, Matthew, et al.
Veröffentlicht: (2026)
Accelerating Sparse Matrix-Matrix Multiplication on GPUs with Processing Near HBMs
von: Li, Shiju, et al.
Veröffentlicht: (2025)
von: Li, Shiju, et al.
Veröffentlicht: (2025)
AsyncSparse: Accelerating Sparse Matrix-Matrix Multiplication on Asynchronous GPU Architectures
von: Liu, Jie, et al.
Veröffentlicht: (2026)
von: Liu, Jie, et al.
Veröffentlicht: (2026)
DGEMM on Integer Matrix Multiplication Unit
von: Ootomo, Hiroyuki, et al.
Veröffentlicht: (2023)
von: Ootomo, Hiroyuki, et al.
Veröffentlicht: (2023)
ParamSpMM: Adaptive and Efficient Sparse Matrix-Matrix Multiplication on GPUs for GNNs
von: Zhang, Lixing, et al.
Veröffentlicht: (2026)
von: Zhang, Lixing, et al.
Veröffentlicht: (2026)
Hello SME! Generating Fast Matrix Multiplication Kernels Using the Scalable Matrix Extension
von: Remke, Stefan, et al.
Veröffentlicht: (2024)
von: Remke, Stefan, et al.
Veröffentlicht: (2024)
High-Performance and Power-Efficient Emulation of Matrix Multiplication using INT8 Matrix Engines
von: Uchino, Yuki, et al.
Veröffentlicht: (2025)
von: Uchino, Yuki, et al.
Veröffentlicht: (2025)
HC-SpMM: Accelerating Sparse Matrix-Matrix Multiplication for Graphs with Hybrid GPU Cores
von: Li, Zhonggen, et al.
Veröffentlicht: (2024)
von: Li, Zhonggen, et al.
Veröffentlicht: (2024)
Improving Locality in Sparse and Dense Matrix Multiplications
von: Dezfuli, Mohammad Mahdi Salehi, et al.
Veröffentlicht: (2024)
von: Dezfuli, Mohammad Mahdi Salehi, et al.
Veröffentlicht: (2024)
Is Sparse Matrix Reordering Effective for Sparse Matrix-Vector Multiplication?
von: Asudeh, Omid, et al.
Veröffentlicht: (2025)
von: Asudeh, Omid, et al.
Veröffentlicht: (2025)
RSH-SpMM: A Row-Structured Hybrid Kernel for Sparse Matrix-Matrix Multiplication on GPUs
von: Li, Aiying, et al.
Veröffentlicht: (2026)
von: Li, Aiying, et al.
Veröffentlicht: (2026)
LOw-cOst yet High-Performant Sparse Matrix-Matrix Multiplication on Arm SME Architectures
von: Lei, Kelun, et al.
Veröffentlicht: (2025)
von: Lei, Kelun, et al.
Veröffentlicht: (2025)
RDMA-Based Algorithms for Sparse Matrix Multiplication on GPUs
von: Brock, Benjamin, et al.
Veröffentlicht: (2023)
von: Brock, Benjamin, et al.
Veröffentlicht: (2023)
Analysis of the Performance of the Matrix Multiplication Algorithm on the Cirrus Supercomputer
von: Adefemi, Temitayo
Veröffentlicht: (2024)
von: Adefemi, Temitayo
Veröffentlicht: (2024)
Demystifying ARM SME to Optimize General Matrix Multiplications
von: Deng, Chencheng, et al.
Veröffentlicht: (2025)
von: Deng, Chencheng, et al.
Veröffentlicht: (2025)
Exploring Sparse Matrix Multiplication Kernels on the Cerebras CS-3
von: Shah, Milan, et al.
Veröffentlicht: (2026)
von: Shah, Milan, et al.
Veröffentlicht: (2026)
Emulation of Complex Matrix Multiplication based on the Chinese Remainder Theorem
von: Uchino, Yuki, et al.
Veröffentlicht: (2025)
von: Uchino, Yuki, et al.
Veröffentlicht: (2025)
Performance Enhancement of the Ozaki Scheme on Integer Matrix Multiplication Unit
von: Uchino, Yuki, et al.
Veröffentlicht: (2024)
von: Uchino, Yuki, et al.
Veröffentlicht: (2024)
Bringing Auto-tuning to HIP: Analysis of Tuning Impact and Difficulty on AMD and Nvidia GPUs
von: Lurati, Milo, et al.
Veröffentlicht: (2024)
von: Lurati, Milo, et al.
Veröffentlicht: (2024)
Efficiently Parallelizable Strassen-Based Multiplication of a Matrix by its Transpose
von: Arrigoni, Viviana, et al.
Veröffentlicht: (2021)
von: Arrigoni, Viviana, et al.
Veröffentlicht: (2021)
Distributed Inference Performance Optimization for LLMs on CPUs
von: He, Pujiang, et al.
Veröffentlicht: (2024)
von: He, Pujiang, et al.
Veröffentlicht: (2024)
AGD: an Auto-switchable Optimizer using Stepwise Gradient Difference for Preconditioning Matrix
von: Yue, Yun, et al.
Veröffentlicht: (2023)
von: Yue, Yun, et al.
Veröffentlicht: (2023)
Matrix Multiplication in the MPC Model
von: Joshi, Lakshya, et al.
Veröffentlicht: (2025)
von: Joshi, Lakshya, et al.
Veröffentlicht: (2025)
Ocean: Fast Estimation-Based Sparse General Matrix-Matrix Multiplication on GPU
von: Li, Yifan, et al.
Veröffentlicht: (2026)
von: Li, Yifan, et al.
Veröffentlicht: (2026)
Xabclib:A Fully Auto-tuned Sparse Iterative Solver
von: Katagiri, Takahiro, et al.
Veröffentlicht: (2024)
von: Katagiri, Takahiro, et al.
Veröffentlicht: (2024)
Unfolding an Atomistic World: Atomistic Simulation of Reactor Pressure Vessel Steel Across Year-and-Meter Scales
von: Han, Haozhi, et al.
Veröffentlicht: (2026)
von: Han, Haozhi, et al.
Veröffentlicht: (2026)
Matrix-PIC: Harnessing Matrix Outer-product for High-Performance Particle-in-Cell Simulations
von: Rao, Yizhuo, et al.
Veröffentlicht: (2026)
von: Rao, Yizhuo, et al.
Veröffentlicht: (2026)
Mapping Parallel Matrix Multiplication in GotoBLAS2 to the AMD Versal ACAP for Deep Learning
von: Lei, Jie, et al.
Veröffentlicht: (2024)
von: Lei, Jie, et al.
Veröffentlicht: (2024)
Double-Precision Matrix Multiplication Emulation via Ozaki-II Scheme with FP8 Quantization
von: Uchino, Yuki, et al.
Veröffentlicht: (2026)
von: Uchino, Yuki, et al.
Veröffentlicht: (2026)
Humas: A Heterogeneity- and Upgrade-aware Microservice Auto-scaling Framework in Large-scale Data Centers
von: Hua, Qin, et al.
Veröffentlicht: (2024)
von: Hua, Qin, et al.
Veröffentlicht: (2024)
Resilient Auto-Scaling of Microservice Architectures with Efficient Resource Management
von: Ahmad, Hussain, et al.
Veröffentlicht: (2025)
von: Ahmad, Hussain, et al.
Veröffentlicht: (2025)
AutoAppendix: Towards one-click Reproduction of Computational Artifacts
von: Kraßnitzer, Klaus
Veröffentlicht: (2025)
von: Kraßnitzer, Klaus
Veröffentlicht: (2025)
Auto-scaling Approaches for Microservice Applications: A Survey and Taxonomy
von: Xu, Minxian, et al.
Veröffentlicht: (2025)
von: Xu, Minxian, et al.
Veröffentlicht: (2025)
Accelerating Drug Discovery in AutoDock-GPU with Tensor Cores
von: Schieffer, Gabin, et al.
Veröffentlicht: (2024)
von: Schieffer, Gabin, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Distributed-Memory Parallel Algorithms for Sparse Matrix and Sparse Tall-and-Skinny Matrix Multiplication
von: Ranawaka, Isuru, et al.
Veröffentlicht: (2024) -
MAGNUS: Generating Data Locality to Accelerate Sparse Matrix-Matrix Multiplication on CPUs
von: Wolfson-Pou, Jordi, et al.
Veröffentlicht: (2025) -
An Auto-tuning Method for Run-time Data Transformation for Sparse Matrix-Vector Multiplication
von: Katagiri, Takahiro, et al.
Veröffentlicht: (2024) -
Stencil Matrixization
von: Zhao, Wenxuan, et al.
Veröffentlicht: (2023) -
PATSMA: Parameter Auto-tuning for Shared Memory Algorithms
von: Fernandes, Joao B., et al.
Veröffentlicht: (2024)