The Ubiquitous Sparse Matrix-Matrix Products
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Buluç, Aydın |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Parallel Sparse and Data-Sparse Factorization-based Linear Solvers
par: Li, Xiaoye Sherry, et autres
Publié: (2026)
par: Li, Xiaoye Sherry, et autres
Publié: (2026)
Fully-Automated Code Generation for Efficient Computation of Sparse Matrix Permanents on GPUs
par: Elbek, Deniz, et autres
Publié: (2025)
par: Elbek, Deniz, et autres
Publié: (2025)
Ocean: Fast Estimation-Based Sparse General Matrix-Matrix Multiplication on GPU
par: Li, Yifan, et autres
Publié: (2026)
par: Li, Yifan, et autres
Publié: (2026)
Distributed Matrix-Based Sampling for Graph Neural Network Training
par: Tripathy, Alok, et autres
Publié: (2023)
par: Tripathy, Alok, et autres
Publié: (2023)
RDMA-Based Algorithms for Sparse Matrix Multiplication on GPUs
par: Brock, Benjamin, et autres
Publié: (2023)
par: Brock, Benjamin, et autres
Publié: (2023)
GPU Accelerated Newton for Taylor Series Solutions of Polynomial Homotopies in Multiple Double Precision
par: Verschelde, Jan
Publié: (2023)
par: Verschelde, Jan
Publié: (2023)
Distributed-memory Algorithms for Sparse Matrix Permutation, Extraction, and Assignment
par: Hassani, Elaheh, et autres
Publié: (2025)
par: Hassani, Elaheh, et autres
Publié: (2025)
FalconGEMM: Surpassing Hardware Peaks with Lower-Complexity Matrix Multiplication
par: Zhu, Honglin, et autres
Publié: (2026)
par: Zhu, Honglin, et autres
Publié: (2026)
Near Real-time Adaptive Isotropic and Anisotropic Image-to-mesh Conversion for Numerical Simulations Involving Cerebral Aneurysms
par: Garner, Kevin, et autres
Publié: (2024)
par: Garner, Kevin, et autres
Publié: (2024)
Error Analysis of Matrix Multiplication Emulation Using Ozaki-II Scheme
par: Uchino, Yuki, et autres
Publié: (2026)
par: Uchino, Yuki, et autres
Publié: (2026)
Verification Challenges in Sparse Matrix Vector Multiplication in High Performance Computing: Part I
par: Zhang, Junchao
Publié: (2025)
par: Zhang, Junchao
Publié: (2025)
Performance Evaluation of General Purpose Large Language Models for Basic Linear Algebra Subprograms Code Generation
par: Mukunoki, Daichi, et autres
Publié: (2025)
par: Mukunoki, Daichi, et autres
Publié: (2025)
Parallelization of Software Systems Test Case Selection Algorithm Based on Singular Value Decomposition
par: Moghaddam, Mahdi Movahedian
Publié: (2022)
par: Moghaddam, Mahdi Movahedian
Publié: (2022)
Code Generation for Near-Roofline Finite Element Actions on GPUs from Symbolic Variational Forms
par: Kulkarni, Kaushik, et autres
Publié: (2025)
par: Kulkarni, Kaushik, et autres
Publié: (2025)
HYLU: Hybrid Parallel Sparse LU Factorization
par: Chen, Xiaoming
Publié: (2025)
par: Chen, Xiaoming
Publié: (2025)
TTrace: Lightweight Error Checking and Diagnosis for Distributed Training
par: Jiang, Haitian, et autres
Publié: (2025)
par: Jiang, Haitian, et autres
Publié: (2025)
A Distributed Block Chebyshev-Davidson Algorithm for Parallel Spectral Clustering
par: Pang, Qiyuan, et autres
Publié: (2022)
par: Pang, Qiyuan, et autres
Publié: (2022)
Accelerating Diffusion Models with Parallel Sampling: Inference at Sub-Linear Time Complexity
par: Chen, Haoxuan, et autres
Publié: (2024)
par: Chen, Haoxuan, et autres
Publié: (2024)
Improved Analysis of the Accelerated Noisy Power Method with Applications to Decentralized PCA
par: Aguié, Pierre, et autres
Publié: (2026)
par: Aguié, Pierre, et autres
Publié: (2026)
Distributed computing for physics-based data-driven reduced modeling at scale: Application to a rotating detonation rocket engine
par: Farcas, Ionut-Gabriel, et autres
Publié: (2024)
par: Farcas, Ionut-Gabriel, et autres
Publié: (2024)
Improving SpGEMM Performance Through Matrix Reordering and Cluster-wise Computation
par: Islam, Abdullah Al Raqibul, et autres
Publié: (2025)
par: Islam, Abdullah Al Raqibul, et autres
Publié: (2025)
SUperman: Efficient Permanent Computation on GPUs
par: Elbek, Deniz, et autres
Publié: (2025)
par: Elbek, Deniz, et autres
Publié: (2025)
Parallel GPU-Accelerated Randomized Construction of Approximate Cholesky Preconditioners
par: Liang, Tianyu, et autres
Publié: (2025)
par: Liang, Tianyu, et autres
Publié: (2025)
Distributed Matrix-Vector Multiplication: A Convolutional Coding Approach
par: Das, Anindya Bijoy, et autres
Publié: (2019)
par: Das, Anindya Bijoy, et autres
Publié: (2019)
Algebraic Temporal Blocking for Sparse Iterative Solvers on Multi-Core CPUs
par: Alappat, Christie, et autres
Publié: (2023)
par: Alappat, Christie, et autres
Publié: (2023)
Xabclib:A Fully Auto-tuned Sparse Iterative Solver
par: Katagiri, Takahiro, et autres
Publié: (2024)
par: Katagiri, Takahiro, et autres
Publié: (2024)
Sampling on Metric Graphs
par: Dwaraknath, Rajat Vadiraj, et autres
Publié: (2025)
par: Dwaraknath, Rajat Vadiraj, et autres
Publié: (2025)
Hierarchical Transformer Preconditioning for Interactive Physics Simulation
par: Osborne, Carl, et autres
Publié: (2026)
par: Osborne, Carl, et autres
Publié: (2026)
A sparsity-aware distributed-memory algorithm for sparse-sparse matrix multiplication
par: Hong, Yuxi, et autres
Publié: (2024)
par: Hong, Yuxi, et autres
Publié: (2024)
pyGinkgo: A Sparse Linear Algebra Operator Framework for Python
par: Tuteja, Keshvi, et autres
Publié: (2025)
par: Tuteja, Keshvi, et autres
Publié: (2025)
Enabling mixed-precision in spectral element codes
par: Chen, Yanxiang, et autres
Publié: (2025)
par: Chen, Yanxiang, et autres
Publié: (2025)
Pipelined Dense Symmetric Eigenvalue Decomposition on Multi-GPU Architectures
par: Wang, Hansheng, et autres
Publié: (2025)
par: Wang, Hansheng, et autres
Publié: (2025)
Toward Portable GPU Performance: Julia Recursive Implementation of TRMM and TRSM
par: Carrica, Vicki, et autres
Publié: (2025)
par: Carrica, Vicki, et autres
Publié: (2025)
Performant Unified GPU Kernels for Portable Singular Value Computation Across Hardware and Precision
par: Ringoot, Evelyne, et autres
Publié: (2025)
par: Ringoot, Evelyne, et autres
Publié: (2025)
Implementing Multi-GPU Scientific Computing Miniapps Across Performance Portable Frameworks
par: Villalobos, Johansell, et autres
Publié: (2025)
par: Villalobos, Johansell, et autres
Publié: (2025)
Accelerating Bidiagonalization of Banded Matrices through Memory-Aware Bulge-Chasing on GPUs
par: Ringoot, Evelyne, et autres
Publié: (2025)
par: Ringoot, Evelyne, et autres
Publié: (2025)
On the Challenges of Energy-Efficiency Analysis in HPC Systems: Evaluating Synthetic Benchmarks and Gromacs
par: Machado, Rafael Ravedutti Lucio, et autres
Publié: (2025)
par: Machado, Rafael Ravedutti Lucio, et autres
Publié: (2025)
Integrating Odeint Time Stepping into OpenFPM for Distributed and GPU Accelerated Numerical Solvers
par: Singh, Abhinav, et autres
Publié: (2023)
par: Singh, Abhinav, et autres
Publié: (2023)
High-Performance Star-M SVD for Big Data Compression
par: Hussain, Md Taufique, et autres
Publié: (2026)
par: Hussain, Md Taufique, et autres
Publié: (2026)
A shared compilation stack for distributed-memory parallelism in stencil DSLs
par: Bisbas, George, et autres
Publié: (2024)
par: Bisbas, George, et autres
Publié: (2024)
Documents similaires
-
Parallel Sparse and Data-Sparse Factorization-based Linear Solvers
par: Li, Xiaoye Sherry, et autres
Publié: (2026) -
Fully-Automated Code Generation for Efficient Computation of Sparse Matrix Permanents on GPUs
par: Elbek, Deniz, et autres
Publié: (2025) -
Ocean: Fast Estimation-Based Sparse General Matrix-Matrix Multiplication on GPU
par: Li, Yifan, et autres
Publié: (2026) -
Distributed Matrix-Based Sampling for Graph Neural Network Training
par: Tripathy, Alok, et autres
Publié: (2023) -
RDMA-Based Algorithms for Sparse Matrix Multiplication on GPUs
par: Brock, Benjamin, et autres
Publié: (2023)