MaxK-GNN: Extremely Fast GPU Kernel Design for Accelerating Graph Neural Networks Training
Fuente:
arXiv
Salvato in:
| Autori principali: | Peng, Hongwu, Xie, Xi, Shivdikar, Kaustubh, Hasan, MD Amit, Zhao, Jiahui, Huang, Shaoyi, Khan, Omer, Kaeli, David, Ding, Caiwen |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
RTop-K: Ultra-Fast Row-Wise Top-K Selection for Neural Network Acceleration on GPUs
di: Xie, Xi, et al.
Pubblicazione: (2024)
di: Xie, Xi, et al.
Pubblicazione: (2024)
Enabling Accelerators for Graph Computing
di: Shivdikar, Kaustubh
Pubblicazione: (2023)
di: Shivdikar, Kaustubh
Pubblicazione: (2023)
NeuraChip: Accelerating GNN Computations with a Hash-based Decoupled Spatial Accelerator
di: Shivdikar, Kaustubh, et al.
Pubblicazione: (2024)
di: Shivdikar, Kaustubh, et al.
Pubblicazione: (2024)
GPU Acceleration of Sparse Fully Homomorphic Encrypted DNNs
di: D'Agata, Lara, et al.
Pubblicazione: (2026)
di: D'Agata, Lara, et al.
Pubblicazione: (2026)
A Unified CPU-GPU Protocol for GNN Training
di: Lin, Yi-Chien, et al.
Pubblicazione: (2024)
di: Lin, Yi-Chien, et al.
Pubblicazione: (2024)
FastGL: A GPU-Efficient Framework for Accelerating Sampling-Based GNN Training at Large Scale
di: Zhu, Zeyu, et al.
Pubblicazione: (2024)
di: Zhu, Zeyu, et al.
Pubblicazione: (2024)
Towards Affordable, Adaptive and Automatic GNN Training on CPU-GPU Heterogeneous Platforms
di: Qiao, Tong, et al.
Pubblicazione: (2025)
di: Qiao, Tong, et al.
Pubblicazione: (2025)
LSM-GNN: Large-scale Storage-based Multi-GPU GNN Training by Optimizing Data Transfer Scheme
di: Park, Jeongmin Brian, et al.
Pubblicazione: (2024)
di: Park, Jeongmin Brian, et al.
Pubblicazione: (2024)
FastTrack: GPU-Accelerated Tracking for Visual SLAM
di: Khabiri, Kimia, et al.
Pubblicazione: (2025)
di: Khabiri, Kimia, et al.
Pubblicazione: (2025)
AcOrch: Accelerating Sampling-based GNN Training under CPU-NPU Heterogeneous Environments
di: Chen, Kefu, et al.
Pubblicazione: (2026)
di: Chen, Kefu, et al.
Pubblicazione: (2026)
A Granularity Characterization of Task Scheduling Effectiveness
di: Anvari, Sana Taghipour, et al.
Pubblicazione: (2026)
di: Anvari, Sana Taghipour, et al.
Pubblicazione: (2026)
Single-GPU GNN Systems: Traps and Pitfalls
di: Gong, Yidong, et al.
Pubblicazione: (2024)
di: Gong, Yidong, et al.
Pubblicazione: (2024)
AGAThA: Fast and Efficient GPU Acceleration of Guided Sequence Alignment for Long Read Mapping
di: Park, Seongyeon, et al.
Pubblicazione: (2024)
di: Park, Seongyeon, et al.
Pubblicazione: (2024)
GreenDyGNN: Runtime-Adaptive Energy-Efficient Communication for Distributed GNN Training
di: Niam, Arefin, et al.
Pubblicazione: (2026)
di: Niam, Arefin, et al.
Pubblicazione: (2026)
Accelerating Biclique Counting on GPU
di: Qiu, Linshan, et al.
Pubblicazione: (2024)
di: Qiu, Linshan, et al.
Pubblicazione: (2024)
Popcorn: Accelerating Kernel K-means on GPUs through Sparse Linear Algebra
di: Bellavita, Julian, et al.
Pubblicazione: (2025)
di: Bellavita, Julian, et al.
Pubblicazione: (2025)
FPTC: A Fast Parallel Transform-based Codec for Efficient Asymmetric Signal Compression
di: Mechels, Ben, et al.
Pubblicazione: (2026)
di: Mechels, Ben, et al.
Pubblicazione: (2026)
HopGNN: Boosting Distributed GNN Training Efficiency via Feature-Centric Model Migration
di: Chen, Weijian, et al.
Pubblicazione: (2024)
di: Chen, Weijian, et al.
Pubblicazione: (2024)
PipeMax: Enhancing Offline LLM Inference on Commodity GPU Servers
di: Zhang, Hongbin, et al.
Pubblicazione: (2026)
di: Zhang, Hongbin, et al.
Pubblicazione: (2026)
GPU Accelerated Sparse Cholesky Factorization
di: Karsavuran, M. Ozan, et al.
Pubblicazione: (2024)
di: Karsavuran, M. Ozan, et al.
Pubblicazione: (2024)
Evaluating Emerging AI/ML Accelerators: IPU, RDU, and NVIDIA/AMD GPUs
di: Peng, Hongwu, et al.
Pubblicazione: (2023)
di: Peng, Hongwu, et al.
Pubblicazione: (2023)
A Framework for Fine-Grained Synchronization of Dependent GPU Kernels
di: Jangda, Abhinav, et al.
Pubblicazione: (2023)
di: Jangda, Abhinav, et al.
Pubblicazione: (2023)
GNNBENCH: Fair and Productive Benchmarking for Single-GPU GNN System
di: Gong, Yidong, et al.
Pubblicazione: (2024)
di: Gong, Yidong, et al.
Pubblicazione: (2024)
Morphling: Fast, Fused, and Flexible GNN Training at Scale
di: Anubhab, et al.
Pubblicazione: (2025)
di: Anubhab, et al.
Pubblicazione: (2025)
CRIUgpu: Transparent Checkpointing of GPU-Accelerated Workloads
di: Stoyanov, Radostin, et al.
Pubblicazione: (2025)
di: Stoyanov, Radostin, et al.
Pubblicazione: (2025)
GPU-Accelerated Batch-Dynamic Subgraph Matching
di: Qiu, Linshan, et al.
Pubblicazione: (2024)
di: Qiu, Linshan, et al.
Pubblicazione: (2024)
ACC Saturator: Automatic Kernel Optimization for Directive-Based GPU Code
di: Matsumura, Kazuaki, et al.
Pubblicazione: (2023)
di: Matsumura, Kazuaki, et al.
Pubblicazione: (2023)
Accelerating Intra-Node GPU-to-GPU Communication Through Multi-Path Transfers with CUDA Graphs
di: Sojoodi, Amirhossein, et al.
Pubblicazione: (2026)
di: Sojoodi, Amirhossein, et al.
Pubblicazione: (2026)
Towards Scalable GPU-Accelerated SNN Training via Temporal Fusion
di: Li, Yanchen, et al.
Pubblicazione: (2024)
di: Li, Yanchen, et al.
Pubblicazione: (2024)
Accelerating Large Language Model Training with Hybrid GPU-based Compression
di: Xu, Lang, et al.
Pubblicazione: (2024)
di: Xu, Lang, et al.
Pubblicazione: (2024)
Accelerating Sparse MTTKRP for Small Tensor Decomposition on GPU
di: Wijeratne, Sasindu, et al.
Pubblicazione: (2025)
di: Wijeratne, Sasindu, et al.
Pubblicazione: (2025)
PICO: Accelerating All k-Core Paradigms on GPU
di: Zhao, Chen, et al.
Pubblicazione: (2024)
di: Zhao, Chen, et al.
Pubblicazione: (2024)
GPZ: GPU-Accelerated Lossy Compressor for Particle Data
di: Li, Ruoyu, et al.
Pubblicazione: (2025)
di: Li, Ruoyu, et al.
Pubblicazione: (2025)
Efficient Accelerated Graph Edit Distance Computation on GPU
di: Dabah, Adel, et al.
Pubblicazione: (2026)
di: Dabah, Adel, et al.
Pubblicazione: (2026)
FastGraph: Optimized GPU-Enabled Algorithms for Fast Graph Building and Message Passing
di: Agarwal, Aarush, et al.
Pubblicazione: (2025)
di: Agarwal, Aarush, et al.
Pubblicazione: (2025)
KEET: Explaining Performance of GPU Kernels Using LLM Agents
di: Davis, Joshua H., et al.
Pubblicazione: (2026)
di: Davis, Joshua H., et al.
Pubblicazione: (2026)
The Fused Kernel Library: A C++ API to Develop Highly-Efficient GPU Libraries
di: Amoros, Oscar, et al.
Pubblicazione: (2025)
di: Amoros, Oscar, et al.
Pubblicazione: (2025)
A Preliminary Study on Accelerating Simulation Optimization with GPU Implementation
di: He, Jinghai, et al.
Pubblicazione: (2024)
di: He, Jinghai, et al.
Pubblicazione: (2024)
GPU-Accelerated Distributed QAOA on Large-scale HPC Ecosystems
di: Xu, Zhihao, et al.
Pubblicazione: (2025)
di: Xu, Zhihao, et al.
Pubblicazione: (2025)
PilotANN: Memory-Bounded GPU Acceleration for Vector Search
di: Gui, Yuntao, et al.
Pubblicazione: (2025)
di: Gui, Yuntao, et al.
Pubblicazione: (2025)
Documenti analoghi
-
RTop-K: Ultra-Fast Row-Wise Top-K Selection for Neural Network Acceleration on GPUs
di: Xie, Xi, et al.
Pubblicazione: (2024) -
Enabling Accelerators for Graph Computing
di: Shivdikar, Kaustubh
Pubblicazione: (2023) -
NeuraChip: Accelerating GNN Computations with a Hash-based Decoupled Spatial Accelerator
di: Shivdikar, Kaustubh, et al.
Pubblicazione: (2024) -
GPU Acceleration of Sparse Fully Homomorphic Encrypted DNNs
di: D'Agata, Lara, et al.
Pubblicazione: (2026) -
A Unified CPU-GPU Protocol for GNN Training
di: Lin, Yi-Chien, et al.
Pubblicazione: (2024)