Mapping Parallel Matrix Multiplication in GotoBLAS2 to the AMD Versal ACAP for Deep Learning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Lei, Jie, Quintana-Ortí, Enrique S. |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
LOw-cOst yet High-Performant Sparse Matrix-Matrix Multiplication on Arm SME Architectures
par: Lei, Kelun, et autres
Publié: (2025)
par: Lei, Kelun, et autres
Publié: (2025)
Developing a BLAS library for the AMD AI Engine
par: Laan, Tristan, et autres
Publié: (2024)
par: Laan, Tristan, et autres
Publié: (2024)
DMRlib: Easy-coding and Efficient Resource Management for Job Malleability
par: Iserte, Sergio, et autres
Publié: (2026)
par: Iserte, Sergio, et autres
Publié: (2026)
Distributed-Memory Parallel Algorithms for Sparse Matrix and Sparse Tall-and-Skinny Matrix Multiplication
par: Ranawaka, Isuru, et autres
Publié: (2024)
par: Ranawaka, Isuru, et autres
Publié: (2024)
Nonlinear spectral clustering with C++ GraphBLAS
par: Pasadakis, Dimosthenis, et autres
Publié: (2026)
par: Pasadakis, Dimosthenis, et autres
Publié: (2026)
AsyncSparse: Accelerating Sparse Matrix-Matrix Multiplication on Asynchronous GPU Architectures
par: Liu, Jie, et autres
Publié: (2026)
par: Liu, Jie, et autres
Publié: (2026)
Evaluating Versal AI Engines for option price discovery in market risk analysis
par: Klaisoongnoen, Mark, et autres
Publié: (2024)
par: Klaisoongnoen, Mark, et autres
Publié: (2024)
Parallel Reduced Order Modeling for Digital Twins using High-Performance Computing Workflows
par: de Parga, S. Ares, et autres
Publié: (2024)
par: de Parga, S. Ares, et autres
Publié: (2024)
Effective implementation of the High Performance Conjugate Gradient benchmark on GraphBLAS
par: Scolari, Alberto, et autres
Publié: (2023)
par: Scolari, Alberto, et autres
Publié: (2023)
Fast Truncated SVD of Sparse and Dense Matrices on Graphics Processors
par: Tomas, Andres E., et autres
Publié: (2024)
par: Tomas, Andres E., et autres
Publié: (2024)
Hypersparse Traffic Matrices from Suricata Network Flows using GraphBLAS
par: Houle, Michael, et autres
Publié: (2024)
par: Houle, Michael, et autres
Publié: (2024)
tritonBLAS: Triton-based Analytical Approach for GEMM Kernel Parameter Selection
par: Swann, Ryan, et autres
Publié: (2025)
par: Swann, Ryan, et autres
Publié: (2025)
PARS3: Parallel Sparse Skew-Symmetric Matrix-Vector Multiplication with Reverse Cuthill-McKee Reordering
par: Yildirim, Selin, et autres
Publié: (2024)
par: Yildirim, Selin, et autres
Publié: (2024)
Fast Kronecker Matrix-Matrix Multiplication on GPUs
par: Jangda, Abhinav, et autres
Publié: (2024)
par: Jangda, Abhinav, et autres
Publié: (2024)
Automatic BLAS Offloading on Unified Memory Architecture: A Study on NVIDIA Grace-Hopper
par: Li, Junjie, et autres
Publié: (2024)
par: Li, Junjie, et autres
Publié: (2024)
Optimizing sDTW for AMD GPUs
par: Latta-Lin, Daniel, et autres
Publié: (2024)
par: Latta-Lin, Daniel, et autres
Publié: (2024)
Sparsity-Aware Roofline Models for Sparse Matrix-Matrix Multiplication
par: Qian, Matthew, et autres
Publié: (2026)
par: Qian, Matthew, et autres
Publié: (2026)
Inter-APU Communication on AMD MI300A Systems via Infinity Fabric: a Deep Dive
par: Schieffer, Gabin, et autres
Publié: (2025)
par: Schieffer, Gabin, et autres
Publié: (2025)
DGEMM on Integer Matrix Multiplication Unit
par: Ootomo, Hiroyuki, et autres
Publié: (2023)
par: Ootomo, Hiroyuki, et autres
Publié: (2023)
Accelerating Sparse Matrix-Matrix Multiplication on GPUs with Processing Near HBMs
par: Li, Shiju, et autres
Publié: (2025)
par: Li, Shiju, et autres
Publié: (2025)
Enabling Mixed criticality applications for the Versal AI-Engines
par: Sprave, Vincent, et autres
Publié: (2026)
par: Sprave, Vincent, et autres
Publié: (2026)
Performance optimization of BLAS algorithms with band matrices for RISC-V processors
par: Pirova, Anna, et autres
Publié: (2025)
par: Pirova, Anna, et autres
Publié: (2025)
MAGNUS: Generating Data Locality to Accelerate Sparse Matrix-Matrix Multiplication on CPUs
par: Wolfson-Pou, Jordi, et autres
Publié: (2025)
par: Wolfson-Pou, Jordi, et autres
Publié: (2025)
Improving Locality in Sparse and Dense Matrix Multiplications
par: Dezfuli, Mohammad Mahdi Salehi, et autres
Publié: (2024)
par: Dezfuli, Mohammad Mahdi Salehi, et autres
Publié: (2024)
Hello SME! Generating Fast Matrix Multiplication Kernels Using the Scalable Matrix Extension
par: Remke, Stefan, et autres
Publié: (2024)
par: Remke, Stefan, et autres
Publié: (2024)
ParamSpMM: Adaptive and Efficient Sparse Matrix-Matrix Multiplication on GPUs for GNNs
par: Zhang, Lixing, et autres
Publié: (2026)
par: Zhang, Lixing, et autres
Publié: (2026)
A Pilot Study on Tunable Precision Emulation via Automatic BLAS Offloading
par: Liu, Hang, et autres
Publié: (2025)
par: Liu, Hang, et autres
Publié: (2025)
Understanding Data Movement in AMD Multi-GPU Systems with Infinity Fabric
par: Schieffer, Gabin, et autres
Publié: (2024)
par: Schieffer, Gabin, et autres
Publié: (2024)
Analysis of the Performance of the Matrix Multiplication Algorithm on the Cirrus Supercomputer
par: Adefemi, Temitayo
Publié: (2024)
par: Adefemi, Temitayo
Publié: (2024)
RDMA-Based Algorithms for Sparse Matrix Multiplication on GPUs
par: Brock, Benjamin, et autres
Publié: (2023)
par: Brock, Benjamin, et autres
Publié: (2023)
Demystifying ARM SME to Optimize General Matrix Multiplications
par: Deng, Chencheng, et autres
Publié: (2025)
par: Deng, Chencheng, et autres
Publié: (2025)
HC-SpMM: Accelerating Sparse Matrix-Matrix Multiplication for Graphs with Hybrid GPU Cores
par: Li, Zhonggen, et autres
Publié: (2024)
par: Li, Zhonggen, et autres
Publié: (2024)
High-Performance and Power-Efficient Emulation of Matrix Multiplication using INT8 Matrix Engines
par: Uchino, Yuki, et autres
Publié: (2025)
par: Uchino, Yuki, et autres
Publié: (2025)
Enhancing ASIC Technology Mapping via Parallel Supergate Computing
par: Cai, Ye, et autres
Publié: (2024)
par: Cai, Ye, et autres
Publié: (2024)
RSH-SpMM: A Row-Structured Hybrid Kernel for Sparse Matrix-Matrix Multiplication on GPUs
par: Li, Aiying, et autres
Publié: (2026)
par: Li, Aiying, et autres
Publié: (2026)
Performance Portable Monte Carlo Particle Transport on Intel, NVIDIA, and AMD GPUs
par: Tramm, John, et autres
Publié: (2024)
par: Tramm, John, et autres
Publié: (2024)
Zen-Attention: A Compiler Framework for Dynamic Attention Folding on AMD NPUs
par: Deshmukh, Aadesh, et autres
Publié: (2025)
par: Deshmukh, Aadesh, et autres
Publié: (2025)
Performance Enhancement of the Ozaki Scheme on Integer Matrix Multiplication Unit
par: Uchino, Yuki, et autres
Publié: (2024)
par: Uchino, Yuki, et autres
Publié: (2024)
Exploring Sparse Matrix Multiplication Kernels on the Cerebras CS-3
par: Shah, Milan, et autres
Publié: (2026)
par: Shah, Milan, et autres
Publié: (2026)
Emulation of Complex Matrix Multiplication based on the Chinese Remainder Theorem
par: Uchino, Yuki, et autres
Publié: (2025)
par: Uchino, Yuki, et autres
Publié: (2025)
Documents similaires
-
LOw-cOst yet High-Performant Sparse Matrix-Matrix Multiplication on Arm SME Architectures
par: Lei, Kelun, et autres
Publié: (2025) -
Developing a BLAS library for the AMD AI Engine
par: Laan, Tristan, et autres
Publié: (2024) -
DMRlib: Easy-coding and Efficient Resource Management for Job Malleability
par: Iserte, Sergio, et autres
Publié: (2026) -
Distributed-Memory Parallel Algorithms for Sparse Matrix and Sparse Tall-and-Skinny Matrix Multiplication
par: Ranawaka, Isuru, et autres
Publié: (2024) -
Nonlinear spectral clustering with C++ GraphBLAS
par: Pasadakis, Dimosthenis, et autres
Publié: (2026)