Parallel GPU-Enabled Algorithms for SpGEMM on Arbitrary Semirings with Hybrid Communication
Fuente:
arXiv
Salvato in:
| Autori principali: | McFarland, Thomas, Bellavita, Julian, Guidi, Giulia |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Communication-Avoiding SpGEMM via Trident Partitioning on Hierarchical GPU Interconnects
di: Bellavita, Julian, et al.
Pubblicazione: (2026)
di: Bellavita, Julian, et al.
Pubblicazione: (2026)
Improving SpGEMM Performance Through Matrix Reordering and Cluster-wise Computation
di: Islam, Abdullah Al Raqibul, et al.
Pubblicazione: (2025)
di: Islam, Abdullah Al Raqibul, et al.
Pubblicazione: (2025)
Popcorn: Accelerating Kernel K-means on GPUs through Sparse Linear Algebra
di: Bellavita, Julian, et al.
Pubblicazione: (2025)
di: Bellavita, Julian, et al.
Pubblicazione: (2025)
High-Performance Sorting-Based k-mer Counting in Distributed Memory with Flexible Hybrid Parallelism
di: Li, Yifan, et al.
Pubblicazione: (2024)
di: Li, Yifan, et al.
Pubblicazione: (2024)
Communication-Avoiding Linear Algebraic Kernel K-Means on GPUs
di: Bellavita, Julian, et al.
Pubblicazione: (2026)
di: Bellavita, Julian, et al.
Pubblicazione: (2026)
Ocean: Fast Estimation-Based Sparse General Matrix-Matrix Multiplication on GPU
di: Li, Yifan, et al.
Pubblicazione: (2026)
di: Li, Yifan, et al.
Pubblicazione: (2026)
HC-SpMM: Accelerating Sparse Matrix-Matrix Multiplication for Graphs with Hybrid GPU Cores
di: Li, Zhonggen, et al.
Pubblicazione: (2024)
di: Li, Zhonggen, et al.
Pubblicazione: (2024)
TurboFNO: High-Performance Fourier Neural Operator with Fused FFT-GEMM-iFFT on GPU
di: Wu, Shixun, et al.
Pubblicazione: (2025)
di: Wu, Shixun, et al.
Pubblicazione: (2025)
Distributed And Parallel Low-Diameter Decompositions for Arbitrary and Restricted Graphs
di: Dou, Jinfeng, et al.
Pubblicazione: (2024)
di: Dou, Jinfeng, et al.
Pubblicazione: (2024)
MERBIT: A GPU-Based SpMV Method for Iterative Workloads
di: Zhang, Qi, et al.
Pubblicazione: (2026)
di: Zhang, Qi, et al.
Pubblicazione: (2026)
SpComm3D: A Framework for Enabling Sparse Communication in 3D Sparse Kernels
di: Abubaker, Nabil, et al.
Pubblicazione: (2024)
di: Abubaker, Nabil, et al.
Pubblicazione: (2024)
Accelerating Sparse DNNs Based on Tiled GEMM
di: Guo, Cong, et al.
Pubblicazione: (2024)
di: Guo, Cong, et al.
Pubblicazione: (2024)
Concurrent Scheduling of High-Level Parallel Programs on Multi-GPU Systems
di: Knorr, Fabian, et al.
Pubblicazione: (2025)
di: Knorr, Fabian, et al.
Pubblicazione: (2025)
CB-SpMV:A Data Aggregating and Balance Algorithm for Cache-Friendly Block-Based SpMV on GPUs
di: Cong, Xing, et al.
Pubblicazione: (2026)
di: Cong, Xing, et al.
Pubblicazione: (2026)
MixServe: An Automatic Distributed Serving System for MoE Models with Hybrid Parallelism Based on Fused Communication Algorithm
di: Zhou, Bowen, et al.
Pubblicazione: (2026)
di: Zhou, Bowen, et al.
Pubblicazione: (2026)
FastGraph: Optimized GPU-Enabled Algorithms for Fast Graph Building and Message Passing
di: Agarwal, Aarush, et al.
Pubblicazione: (2025)
di: Agarwal, Aarush, et al.
Pubblicazione: (2025)
GRNND: A GPU-Parallel Relative NN-Descent Algorithm for Efficient Approximate Nearest Neighbor Graph Construction
di: Li, Xiang, et al.
Pubblicazione: (2025)
di: Li, Xiang, et al.
Pubblicazione: (2025)
HARP: Orchestrating Automated Parallel Training on Heterogeneous GPU Clusters
di: Liang, Antian, et al.
Pubblicazione: (2025)
di: Liang, Antian, et al.
Pubblicazione: (2025)
tritonBLAS: Triton-based Analytical Approach for GEMM Kernel Parameter Selection
di: Swann, Ryan, et al.
Pubblicazione: (2025)
di: Swann, Ryan, et al.
Pubblicazione: (2025)
GPU-Based Parallel Computing Methods for Medical Photoacoustic Image Reconstruction
di: Yi, Xinyao, et al.
Pubblicazione: (2024)
di: Yi, Xinyao, et al.
Pubblicazione: (2024)
Parallel Track Transformers: Enabling Fast GPU Inference with Reduced Synchronization
di: Wang, Chong, et al.
Pubblicazione: (2026)
di: Wang, Chong, et al.
Pubblicazione: (2026)
Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism
di: Mo, Zizhao, et al.
Pubblicazione: (2025)
di: Mo, Zizhao, et al.
Pubblicazione: (2025)
Multi-GPU Acceleration of PALABOS Fluid Solver using C++ Standard Parallelism
di: Latt, Jonas, et al.
Pubblicazione: (2025)
di: Latt, Jonas, et al.
Pubblicazione: (2025)
Heimdall++: Optimizing GPU Utilization and Pipeline Parallelism for Efficient Single-Pulse Detection
di: Xia, Bingzheng, et al.
Pubblicazione: (2025)
di: Xia, Bingzheng, et al.
Pubblicazione: (2025)
High-Performance Portable GPU Primitives for Arbitrary Types and Operators in Julia
di: Pilliat, Emmanuel
Pubblicazione: (2026)
di: Pilliat, Emmanuel
Pubblicazione: (2026)
RSH-SpMM: A Row-Structured Hybrid Kernel for Sparse Matrix-Matrix Multiplication on GPUs
di: Li, Aiying, et al.
Pubblicazione: (2026)
di: Li, Aiying, et al.
Pubblicazione: (2026)
APEX: Asynchronous Parallel CPU-GPU Execution for Online LLM Inference on Constrained GPUs
di: Fan, Jiakun, et al.
Pubblicazione: (2025)
di: Fan, Jiakun, et al.
Pubblicazione: (2025)
Parallel Collaborative ADMM Privacy Computing and Adaptive GPU Acceleration for Distributed Edge Networks
di: Xia, Mengchun, et al.
Pubblicazione: (2026)
di: Xia, Mengchun, et al.
Pubblicazione: (2026)
Accelerating Intra-Node GPU-to-GPU Communication Through Multi-Path Transfers with CUDA Graphs
di: Sojoodi, Amirhossein, et al.
Pubblicazione: (2026)
di: Sojoodi, Amirhossein, et al.
Pubblicazione: (2026)
AES-SpMM: Balancing Accuracy and Speed by Adaptive Edge Sampling Strategy to Accelerate SpMM in GNNs
di: Song, Yingchen, et al.
Pubblicazione: (2025)
di: Song, Yingchen, et al.
Pubblicazione: (2025)
HAS-GPU: Efficient Hybrid Auto-scaling with Fine-grained GPU Allocation for SLO-aware Serverless Inferences
di: Gu, Jianfeng, et al.
Pubblicazione: (2025)
di: Gu, Jianfeng, et al.
Pubblicazione: (2025)
Neutron particle transport 3D method of characteristic Multi GPU platform Parallel Computing
di: Zhou, Faguo, et al.
Pubblicazione: (2025)
di: Zhou, Faguo, et al.
Pubblicazione: (2025)
SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference
di: He, Yongchao, et al.
Pubblicazione: (2025)
di: He, Yongchao, et al.
Pubblicazione: (2025)
Large Scale Multi-GPU Based Parallel Traffic Simulation for Accelerated Traffic Assignment and Propagation
di: Jiang, Xuan, et al.
Pubblicazione: (2024)
di: Jiang, Xuan, et al.
Pubblicazione: (2024)
Understanding GPU Triggering APIs for MPI+X Communication
di: Bridges, Patrick G., et al.
Pubblicazione: (2024)
di: Bridges, Patrick G., et al.
Pubblicazione: (2024)
SGEMM-cube: Precision-Recovery FP32 GEMM Approximation on Ascend NPUs with FP16 Matrix Engines
di: Xue, Weicheng, et al.
Pubblicazione: (2025)
di: Xue, Weicheng, et al.
Pubblicazione: (2025)
NCCLZ: Compression-Enabled GPU Collectives with Decoupled Quantization and Entropy Coding
di: Wang, Jiamin, et al.
Pubblicazione: (2026)
di: Wang, Jiamin, et al.
Pubblicazione: (2026)
A Multi-Objective Framework for Optimizing GPU-Enabled VM Placement in Cloud Data Centers with Multi-Instance GPU Technology
di: Siavashi, Ahmad, et al.
Pubblicazione: (2025)
di: Siavashi, Ahmad, et al.
Pubblicazione: (2025)
PPipe: Efficient Video Analytics Serving on Heterogeneous GPU Clusters via Pool-Based Pipeline Parallelism
di: Kong, Z. Jonny, et al.
Pubblicazione: (2025)
di: Kong, Z. Jonny, et al.
Pubblicazione: (2025)
EXaCTz: Guaranteed Extremum Graph and Contour Tree Preservation for Distributed- and GPU-Parallel Lossy Compression
di: Li, Yuxiao, et al.
Pubblicazione: (2026)
di: Li, Yuxiao, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Communication-Avoiding SpGEMM via Trident Partitioning on Hierarchical GPU Interconnects
di: Bellavita, Julian, et al.
Pubblicazione: (2026) -
Improving SpGEMM Performance Through Matrix Reordering and Cluster-wise Computation
di: Islam, Abdullah Al Raqibul, et al.
Pubblicazione: (2025) -
Popcorn: Accelerating Kernel K-means on GPUs through Sparse Linear Algebra
di: Bellavita, Julian, et al.
Pubblicazione: (2025) -
High-Performance Sorting-Based k-mer Counting in Distributed Memory with Flexible Hybrid Parallelism
di: Li, Yifan, et al.
Pubblicazione: (2024) -
Communication-Avoiding Linear Algebraic Kernel K-Means on GPUs
di: Bellavita, Julian, et al.
Pubblicazione: (2026)