Accelerating Intra-Node GPU-to-GPU Communication Through Multi-Path Transfers with CUDA Graphs
Fuente:
arXiv
Salvato in:
| Autori principali: | Sojoodi, Amirhossein, Temucin, Yiltan Hassan, Baratisedeh, Amirreza, Sharifian, Hamed, Afsahi, Ahmad |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Improving GPU Multi-Tenancy Through Dynamic Multi-Instance GPU Reconfiguration
di: Wang, Tianyu, et al.
Pubblicazione: (2024)
di: Wang, Tianyu, et al.
Pubblicazione: (2024)
Efficient Accelerated Graph Edit Distance Computation on GPU
di: Dabah, Adel, et al.
Pubblicazione: (2026)
di: Dabah, Adel, et al.
Pubblicazione: (2026)
A Multi-Objective Framework for Optimizing GPU-Enabled VM Placement in Cloud Data Centers with Multi-Instance GPU Technology
di: Siavashi, Ahmad, et al.
Pubblicazione: (2025)
di: Siavashi, Ahmad, et al.
Pubblicazione: (2025)
Accelerating Biclique Counting on GPU
di: Qiu, Linshan, et al.
Pubblicazione: (2024)
di: Qiu, Linshan, et al.
Pubblicazione: (2024)
SOLANET: Distributed Neighbor Graph Construction on GPU-Accelerated Systems
di: Iwabuchi, Keita, et al.
Pubblicazione: (2026)
di: Iwabuchi, Keita, et al.
Pubblicazione: (2026)
gZCCL: Compression-Accelerated Collective Communication Framework for GPU Clusters
di: Huang, Jiajun, et al.
Pubblicazione: (2023)
di: Huang, Jiajun, et al.
Pubblicazione: (2023)
GPU Accelerated Sparse Cholesky Factorization
di: Karsavuran, M. Ozan, et al.
Pubblicazione: (2024)
di: Karsavuran, M. Ozan, et al.
Pubblicazione: (2024)
RAPID-Serve: Resource-efficient and Accelerated P/D Intra-GPU Disaggregation
di: Masood, Amna, et al.
Pubblicazione: (2026)
di: Masood, Amna, et al.
Pubblicazione: (2026)
PathWeaver: A High-Throughput Multi-GPU System for Graph-Based Approximate Nearest Neighbor Search
di: Kim, Sukjin, et al.
Pubblicazione: (2025)
di: Kim, Sukjin, et al.
Pubblicazione: (2025)
City-Scale Visibility Graph Analysis via GPU-Accelerated HyperBall
di: Hodge, Alex, et al.
Pubblicazione: (2026)
di: Hodge, Alex, et al.
Pubblicazione: (2026)
CRIUgpu: Transparent Checkpointing of GPU-Accelerated Workloads
di: Stoyanov, Radostin, et al.
Pubblicazione: (2025)
di: Stoyanov, Radostin, et al.
Pubblicazione: (2025)
GPU-Accelerated Batch-Dynamic Subgraph Matching
di: Qiu, Linshan, et al.
Pubblicazione: (2024)
di: Qiu, Linshan, et al.
Pubblicazione: (2024)
Multi-GPU Acceleration of PALABOS Fluid Solver using C++ Standard Parallelism
di: Latt, Jonas, et al.
Pubblicazione: (2025)
di: Latt, Jonas, et al.
Pubblicazione: (2025)
Accelerating Sparse MTTKRP for Small Tensor Decomposition on GPU
di: Wijeratne, Sasindu, et al.
Pubblicazione: (2025)
di: Wijeratne, Sasindu, et al.
Pubblicazione: (2025)
PICO: Accelerating All k-Core Paradigms on GPU
di: Zhao, Chen, et al.
Pubblicazione: (2024)
di: Zhao, Chen, et al.
Pubblicazione: (2024)
GPZ: GPU-Accelerated Lossy Compressor for Particle Data
di: Li, Ruoyu, et al.
Pubblicazione: (2025)
di: Li, Ruoyu, et al.
Pubblicazione: (2025)
Characterizing Compute-Communication Overlap in GPU-Accelerated Distributed Deep Learning: Performance and Power Implications
di: Lee, Seonho, et al.
Pubblicazione: (2025)
di: Lee, Seonho, et al.
Pubblicazione: (2025)
HC-SpMM: Accelerating Sparse Matrix-Matrix Multiplication for Graphs with Hybrid GPU Cores
di: Li, Zhonggen, et al.
Pubblicazione: (2024)
di: Li, Zhonggen, et al.
Pubblicazione: (2024)
A Preliminary Study on Accelerating Simulation Optimization with GPU Implementation
di: He, Jinghai, et al.
Pubblicazione: (2024)
di: He, Jinghai, et al.
Pubblicazione: (2024)
GPU-Accelerated Distributed QAOA on Large-scale HPC Ecosystems
di: Xu, Zhihao, et al.
Pubblicazione: (2025)
di: Xu, Zhihao, et al.
Pubblicazione: (2025)
PilotANN: Memory-Bounded GPU Acceleration for Vector Search
di: Gui, Yuntao, et al.
Pubblicazione: (2025)
di: Gui, Yuntao, et al.
Pubblicazione: (2025)
A Practical GPU-Accelerated Implementation of Orthogonal Matching Pursuit
di: Lubonja, Ariel, et al.
Pubblicazione: (2024)
di: Lubonja, Ariel, et al.
Pubblicazione: (2024)
GPU Acceleration for Faster Evolutionary Spatial Cyclic Game Systems
di: Sinadjan, Louie
Pubblicazione: (2025)
di: Sinadjan, Louie
Pubblicazione: (2025)
Accelerating Drug Discovery in AutoDock-GPU with Tensor Cores
di: Schieffer, Gabin, et al.
Pubblicazione: (2024)
di: Schieffer, Gabin, et al.
Pubblicazione: (2024)
Multi-core & GPU-based Balanced Butterfly Counting in Signed Bipartite Graphs
di: Kiran, Mekala, et al.
Pubblicazione: (2026)
di: Kiran, Mekala, et al.
Pubblicazione: (2026)
RAFI -- A Ray/Work Forwarding Infrastructure for Data Parallel Multi-Node/Multi-GPU Computing
di: Wald, Ingo, et al.
Pubblicazione: (2026)
di: Wald, Ingo, et al.
Pubblicazione: (2026)
Six Times to Spare: Characterizing GPU-Accelerated 5G LDPC Decoding for Edge-RSU Communications
di: Barker, Ryan, et al.
Pubblicazione: (2026)
di: Barker, Ryan, et al.
Pubblicazione: (2026)
Large Scale Multi-GPU Based Parallel Traffic Simulation for Accelerated Traffic Assignment and Propagation
di: Jiang, Xuan, et al.
Pubblicazione: (2024)
di: Jiang, Xuan, et al.
Pubblicazione: (2024)
Understanding GPU Triggering APIs for MPI+X Communication
di: Bridges, Patrick G., et al.
Pubblicazione: (2024)
di: Bridges, Patrick G., et al.
Pubblicazione: (2024)
Adaptive Multidimensional Quadrature on Multi-GPU Systems
di: Tonarelli, Melanie, et al.
Pubblicazione: (2025)
di: Tonarelli, Melanie, et al.
Pubblicazione: (2025)
Debunking the CUDA Myth Towards GPU-based AI Systems
di: Lee, Yunjae, et al.
Pubblicazione: (2024)
di: Lee, Yunjae, et al.
Pubblicazione: (2024)
Dataflow-Oriented Classification and Performance Analysis of GPU-Accelerated Homomorphic Encryption
di: Nozaki, Ai, et al.
Pubblicazione: (2026)
di: Nozaki, Ai, et al.
Pubblicazione: (2026)
A GPU Accelerated Temporal Window-Based Random Walk Sampler
di: Salehin, Md Ashfaq, et al.
Pubblicazione: (2026)
di: Salehin, Md Ashfaq, et al.
Pubblicazione: (2026)
GPU-Accelerated Modified Bessel Function of the Second Kind for Gaussian Processes
di: Geng, Zipei, et al.
Pubblicazione: (2025)
di: Geng, Zipei, et al.
Pubblicazione: (2025)
GPU-Accelerated Selected Basis Diagonalization with Thrust for SQD-based Algorithms
di: Doi, Jun, et al.
Pubblicazione: (2026)
di: Doi, Jun, et al.
Pubblicazione: (2026)
FaaSTube: Optimizing GPU-oriented Data Transfer for Serverless Computing
di: Wu, Hao, et al.
Pubblicazione: (2024)
di: Wu, Hao, et al.
Pubblicazione: (2024)
From Skew to Symmetry: Node-Interconnect Multi-Path Balancing with Execution-time Planning for Modern GPU Clusters
di: Yao, Jinghan, et al.
Pubblicazione: (2026)
di: Yao, Jinghan, et al.
Pubblicazione: (2026)
Guardian: Safe GPU Sharing in Multi-Tenant Environments
di: Pavlidakis, Manos, et al.
Pubblicazione: (2024)
di: Pavlidakis, Manos, et al.
Pubblicazione: (2024)
Cuckoo-GPU: Accelerating Cuckoo Filters on Modern GPUs
di: Dortmann, Tim, et al.
Pubblicazione: (2026)
di: Dortmann, Tim, et al.
Pubblicazione: (2026)
FastTrack: GPU-Accelerated Tracking for Visual SLAM
di: Khabiri, Kimia, et al.
Pubblicazione: (2025)
di: Khabiri, Kimia, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Improving GPU Multi-Tenancy Through Dynamic Multi-Instance GPU Reconfiguration
di: Wang, Tianyu, et al.
Pubblicazione: (2024) -
Efficient Accelerated Graph Edit Distance Computation on GPU
di: Dabah, Adel, et al.
Pubblicazione: (2026) -
A Multi-Objective Framework for Optimizing GPU-Enabled VM Placement in Cloud Data Centers with Multi-Instance GPU Technology
di: Siavashi, Ahmad, et al.
Pubblicazione: (2025) -
Accelerating Biclique Counting on GPU
di: Qiu, Linshan, et al.
Pubblicazione: (2024) -
SOLANET: Distributed Neighbor Graph Construction on GPU-Accelerated Systems
di: Iwabuchi, Keita, et al.
Pubblicazione: (2026)