Efficiently Parallelizable Strassen-Based Multiplication of a Matrix by its Transpose
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Arrigoni, Viviana, Maggioli, Filippo, Massini, Annalisa, Rodolà, Emanuele |
|---|---|
| Format: | Preprint |
| Publié: |
2021
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Asymptotically Optimal Scheduling of Multiple Parallelizable Job Classes
par: Berg, Benjamin, et autres
Publié: (2024)
par: Berg, Benjamin, et autres
Publié: (2024)
Mangrove: Fast and Parallelizable State Replication for Blockchains
par: Paramonov, Anton, et autres
Publié: (2025)
par: Paramonov, Anton, et autres
Publié: (2025)
ParamSpMM: Adaptive and Efficient Sparse Matrix-Matrix Multiplication on GPUs for GNNs
par: Zhang, Lixing, et autres
Publié: (2026)
par: Zhang, Lixing, et autres
Publié: (2026)
High-Performance and Power-Efficient Emulation of Matrix Multiplication using INT8 Matrix Engines
par: Uchino, Yuki, et autres
Publié: (2025)
par: Uchino, Yuki, et autres
Publié: (2025)
RDMA-Based Algorithms for Sparse Matrix Multiplication on GPUs
par: Brock, Benjamin, et autres
Publié: (2023)
par: Brock, Benjamin, et autres
Publié: (2023)
Fast Kronecker Matrix-Matrix Multiplication on GPUs
par: Jangda, Abhinav, et autres
Publié: (2024)
par: Jangda, Abhinav, et autres
Publié: (2024)
New Improvements in Solving Large LABS Instances Using Massively Parallelizable Memetic Tabu Search
par: Zhang, Zhiwei, et autres
Publié: (2025)
par: Zhang, Zhiwei, et autres
Publié: (2025)
Sparsity-Aware Roofline Models for Sparse Matrix-Matrix Multiplication
par: Qian, Matthew, et autres
Publié: (2026)
par: Qian, Matthew, et autres
Publié: (2026)
DGEMM on Integer Matrix Multiplication Unit
par: Ootomo, Hiroyuki, et autres
Publié: (2023)
par: Ootomo, Hiroyuki, et autres
Publié: (2023)
Accelerating Sparse Matrix-Matrix Multiplication on GPUs with Processing Near HBMs
par: Li, Shiju, et autres
Publié: (2025)
par: Li, Shiju, et autres
Publié: (2025)
AsyncSparse: Accelerating Sparse Matrix-Matrix Multiplication on Asynchronous GPU Architectures
par: Liu, Jie, et autres
Publié: (2026)
par: Liu, Jie, et autres
Publié: (2026)
MAGNUS: Generating Data Locality to Accelerate Sparse Matrix-Matrix Multiplication on CPUs
par: Wolfson-Pou, Jordi, et autres
Publié: (2025)
par: Wolfson-Pou, Jordi, et autres
Publié: (2025)
Improving Locality in Sparse and Dense Matrix Multiplications
par: Dezfuli, Mohammad Mahdi Salehi, et autres
Publié: (2024)
par: Dezfuli, Mohammad Mahdi Salehi, et autres
Publié: (2024)
Hello SME! Generating Fast Matrix Multiplication Kernels Using the Scalable Matrix Extension
par: Remke, Stefan, et autres
Publié: (2024)
par: Remke, Stefan, et autres
Publié: (2024)
Distributed-Memory Parallel Algorithms for Sparse Matrix and Sparse Tall-and-Skinny Matrix Multiplication
par: Ranawaka, Isuru, et autres
Publié: (2024)
par: Ranawaka, Isuru, et autres
Publié: (2024)
Analysis of the Performance of the Matrix Multiplication Algorithm on the Cirrus Supercomputer
par: Adefemi, Temitayo
Publié: (2024)
par: Adefemi, Temitayo
Publié: (2024)
Demystifying ARM SME to Optimize General Matrix Multiplications
par: Deng, Chencheng, et autres
Publié: (2025)
par: Deng, Chencheng, et autres
Publié: (2025)
HC-SpMM: Accelerating Sparse Matrix-Matrix Multiplication for Graphs with Hybrid GPU Cores
par: Li, Zhonggen, et autres
Publié: (2024)
par: Li, Zhonggen, et autres
Publié: (2024)
RSH-SpMM: A Row-Structured Hybrid Kernel for Sparse Matrix-Matrix Multiplication on GPUs
par: Li, Aiying, et autres
Publié: (2026)
par: Li, Aiying, et autres
Publié: (2026)
LOw-cOst yet High-Performant Sparse Matrix-Matrix Multiplication on Arm SME Architectures
par: Lei, Kelun, et autres
Publié: (2025)
par: Lei, Kelun, et autres
Publié: (2025)
Exploring Sparse Matrix Multiplication Kernels on the Cerebras CS-3
par: Shah, Milan, et autres
Publié: (2026)
par: Shah, Milan, et autres
Publié: (2026)
Emulation of Complex Matrix Multiplication based on the Chinese Remainder Theorem
par: Uchino, Yuki, et autres
Publié: (2025)
par: Uchino, Yuki, et autres
Publié: (2025)
Performance Enhancement of the Ozaki Scheme on Integer Matrix Multiplication Unit
par: Uchino, Yuki, et autres
Publié: (2024)
par: Uchino, Yuki, et autres
Publié: (2024)
Is Sparse Matrix Reordering Effective for Sparse Matrix-Vector Multiplication?
par: Asudeh, Omid, et autres
Publié: (2025)
par: Asudeh, Omid, et autres
Publié: (2025)
SpArch: Efficient Architecture for Sparse Matrix Multiplication
par: Zhang, Zhekai, et autres
Publié: (2020)
par: Zhang, Zhekai, et autres
Publié: (2020)
Design of A Low-Latency and Parallelizable SVD Dataflow Architecture on FPGA
par: Du, Fangqiang, et autres
Publié: (2025)
par: Du, Fangqiang, et autres
Publié: (2025)
Matrix Multiplication in the MPC Model
par: Joshi, Lakshya, et autres
Publié: (2025)
par: Joshi, Lakshya, et autres
Publié: (2025)
Ocean: Fast Estimation-Based Sparse General Matrix-Matrix Multiplication on GPU
par: Li, Yifan, et autres
Publié: (2026)
par: Li, Yifan, et autres
Publié: (2026)
Mapping Parallel Matrix Multiplication in GotoBLAS2 to the AMD Versal ACAP for Deep Learning
par: Lei, Jie, et autres
Publié: (2024)
par: Lei, Jie, et autres
Publié: (2024)
Double-Precision Matrix Multiplication Emulation via Ozaki-II Scheme with FP8 Quantization
par: Uchino, Yuki, et autres
Publié: (2026)
par: Uchino, Yuki, et autres
Publié: (2026)
Multivariate Polynomial Codes for Efficient Matrix Chain Multiplication in Distributed Systems
par: Gómez-Vilardebò, Jesús
Publié: (2026)
par: Gómez-Vilardebò, Jesús
Publié: (2026)
PARS3: Parallel Sparse Skew-Symmetric Matrix-Vector Multiplication with Reverse Cuthill-McKee Reordering
par: Yildirim, Selin, et autres
Publié: (2024)
par: Yildirim, Selin, et autres
Publié: (2024)
W4A16 Mixed-Precision Matrix Multiplication on Decoupled Architecture: Kernel Design and Memory Bottleneck Analysis for Ascend NPUs
par: He, Yuanhong, et autres
Publié: (2026)
par: He, Yuanhong, et autres
Publié: (2026)
SHIRO: Near-Optimal Communication Strategies for Distributed Sparse Matrix Multiplication
par: Zhuang, Chen, et autres
Publié: (2025)
par: Zhuang, Chen, et autres
Publié: (2025)
Stencil Matrixization
par: Zhao, Wenxuan, et autres
Publié: (2023)
par: Zhao, Wenxuan, et autres
Publié: (2023)
Chopin: An Open Source R-language Tool to Support Spatial Analysis on Parallelizable Infrastructure
par: Song, Insang, et autres
Publié: (2024)
par: Song, Insang, et autres
Publié: (2024)
LUT-GEMM: Quantized Matrix Multiplication based on LUTs for Efficient Inference in Large-Scale Generative Language Models
par: Park, Gunho, et autres
Publié: (2022)
par: Park, Gunho, et autres
Publié: (2022)
DiP: A Scalable, Energy-Efficient Systolic Array for Matrix Multiplication Acceleration
par: Abdelmaksoud, Ahmed J., et autres
Publié: (2024)
par: Abdelmaksoud, Ahmed J., et autres
Publié: (2024)
Unveiling Crowdfunding Futures: Analyzing Campaign Outcomes through Distributed Models and Big Data Perspectives
par: Pipitò, Giuseppe, et autres
Publié: (2024)
par: Pipitò, Giuseppe, et autres
Publié: (2024)
Arrow Matrix Decomposition: A Novel Approach for Communication-Efficient Sparse Matrix Multiplication
par: Gianinazzi, Lukas, et autres
Publié: (2024)
par: Gianinazzi, Lukas, et autres
Publié: (2024)
Documents similaires
-
Asymptotically Optimal Scheduling of Multiple Parallelizable Job Classes
par: Berg, Benjamin, et autres
Publié: (2024) -
Mangrove: Fast and Parallelizable State Replication for Blockchains
par: Paramonov, Anton, et autres
Publié: (2025) -
ParamSpMM: Adaptive and Efficient Sparse Matrix-Matrix Multiplication on GPUs for GNNs
par: Zhang, Lixing, et autres
Publié: (2026) -
High-Performance and Power-Efficient Emulation of Matrix Multiplication using INT8 Matrix Engines
par: Uchino, Yuki, et autres
Publié: (2025) -
RDMA-Based Algorithms for Sparse Matrix Multiplication on GPUs
par: Brock, Benjamin, et autres
Publié: (2023)