A Unified CPU-GPU Protocol for GNN Training
Fuente:
arXiv
Salvato in:
| Autori principali: | Lin, Yi-Chien, Deng, Gangda, Prasanna, Viktor |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
ARGO: An Auto-Tuning Runtime System for Scalable GNN Training on Multi-Core Processor
di: Lin, Yi-Chien, et al.
Pubblicazione: (2024)
di: Lin, Yi-Chien, et al.
Pubblicazione: (2024)
Towards Affordable, Adaptive and Automatic GNN Training on CPU-GPU Heterogeneous Platforms
di: Qiao, Tong, et al.
Pubblicazione: (2025)
di: Qiao, Tong, et al.
Pubblicazione: (2025)
Accelerating Sparse MTTKRP for Small Tensor Decomposition on GPU
di: Wijeratne, Sasindu, et al.
Pubblicazione: (2025)
di: Wijeratne, Sasindu, et al.
Pubblicazione: (2025)
A Study of Performance Programming of CPU, GPU accelerated Computers and SIMD Architecture
di: Yi, Xinyao
Pubblicazione: (2024)
di: Yi, Xinyao
Pubblicazione: (2024)
AcOrch: Accelerating Sampling-based GNN Training under CPU-NPU Heterogeneous Environments
di: Chen, Kefu, et al.
Pubblicazione: (2026)
di: Chen, Kefu, et al.
Pubblicazione: (2026)
Efficient CPU-GPU Collaborative Inference for MoE-based LLMs on Memory-Limited Systems
di: Huang, En-Ming, et al.
Pubblicazione: (2025)
di: Huang, En-Ming, et al.
Pubblicazione: (2025)
Scaling Large-scale GNN Training to Thousands of Processors on CPU-based Supercomputers
di: Zhuang, Chen, et al.
Pubblicazione: (2024)
di: Zhuang, Chen, et al.
Pubblicazione: (2024)
Cost-Performance Analysis: A Comparative Study of CPU-Based Serverless and GPU-Based Training Architectures
di: Barrak, Amine, et al.
Pubblicazione: (2025)
di: Barrak, Amine, et al.
Pubblicazione: (2025)
TURNIP: A "Nondeterministic" GPU Runtime with CPU RAM Offload
di: Ding, Zhimin, et al.
Pubblicazione: (2024)
di: Ding, Zhimin, et al.
Pubblicazione: (2024)
Combining GPU and CPU for accelerating evolutionary computing workloads
di: Eynaliyev, Rustam, et al.
Pubblicazione: (2025)
di: Eynaliyev, Rustam, et al.
Pubblicazione: (2025)
Dissecting CPU-GPU Unified Physical Memory on AMD MI300A APUs
di: Wahlgren, Jacob, et al.
Pubblicazione: (2025)
di: Wahlgren, Jacob, et al.
Pubblicazione: (2025)
Sparse MTTKRP Acceleration for Tensor Decomposition on GPU
di: Wijeratne, Sasindu, et al.
Pubblicazione: (2024)
di: Wijeratne, Sasindu, et al.
Pubblicazione: (2024)
Efficient Graph Embedding at Scale: Optimizing CPU-GPU-SSD Integration
di: Li, Zhonggen, et al.
Pubblicazione: (2025)
di: Li, Zhonggen, et al.
Pubblicazione: (2025)
Taming GPU Underutilization via Static Partitioning and Fine-grained CPU Offloading
di: Schieffer, Gabin, et al.
Pubblicazione: (2026)
di: Schieffer, Gabin, et al.
Pubblicazione: (2026)
HeteroSTA: A CPU-GPU Heterogeneous Static Timing Analysis Engine with Holistic Industrial Design Support
di: Guo, Zizheng, et al.
Pubblicazione: (2025)
di: Guo, Zizheng, et al.
Pubblicazione: (2025)
Breaking the Memory Wall: A Study of I/O Patterns and GPU Memory Utilization for Hybrid CPU-GPU Offloaded Optimizers
di: Maurya, Avinash, et al.
Pubblicazione: (2024)
di: Maurya, Avinash, et al.
Pubblicazione: (2024)
APEX: Asynchronous Parallel CPU-GPU Execution for Online LLM Inference on Constrained GPUs
di: Fan, Jiakun, et al.
Pubblicazione: (2025)
di: Fan, Jiakun, et al.
Pubblicazione: (2025)
Co-Design and Evaluation of a CPU-Free MPI GPU Communication Abstraction and Implementation
di: Bridges, Patrick G., et al.
Pubblicazione: (2026)
di: Bridges, Patrick G., et al.
Pubblicazione: (2026)
Serving Hybrid LLM Loads with SLO Guarantees Using CPU-GPU Attention Piggybacking
di: Mo, Zizhao, et al.
Pubblicazione: (2026)
di: Mo, Zizhao, et al.
Pubblicazione: (2026)
A Unified Programming Model for Heterogeneous Computing with CPU and Accelerator Technologies
di: Xiong, Yuqing
Pubblicazione: (2022)
di: Xiong, Yuqing
Pubblicazione: (2022)
HybridGen: Efficient LLM Generative Inference via CPU-GPU Hybrid Computing
di: Lin, Mao, et al.
Pubblicazione: (2026)
di: Lin, Mao, et al.
Pubblicazione: (2026)
Harnessing Integrated CPU-GPU System Memory for HPC: a first look into Grace Hopper
di: Schieffer, Gabin, et al.
Pubblicazione: (2024)
di: Schieffer, Gabin, et al.
Pubblicazione: (2024)
SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference
di: He, Yongchao, et al.
Pubblicazione: (2025)
di: He, Yongchao, et al.
Pubblicazione: (2025)
GraphLeap: Decoupling Graph Construction and Convolution for Vision GNN Acceleration on FPGA
di: Ramachandran, Anvitha, et al.
Pubblicazione: (2026)
di: Ramachandran, Anvitha, et al.
Pubblicazione: (2026)
LSM-GNN: Large-scale Storage-based Multi-GPU GNN Training by Optimizing Data Transfer Scheme
di: Park, Jeongmin Brian, et al.
Pubblicazione: (2024)
di: Park, Jeongmin Brian, et al.
Pubblicazione: (2024)
Orchestrated Co-scheduling, Resource Partitioning, and Power Capping on CPU-GPU Heterogeneous Systems via Machine Learning
di: Saba, Issa, et al.
Pubblicazione: (2024)
di: Saba, Issa, et al.
Pubblicazione: (2024)
GreenDyGNN: Runtime-Adaptive Energy-Efficient Communication for Distributed GNN Training
di: Niam, Arefin, et al.
Pubblicazione: (2026)
di: Niam, Arefin, et al.
Pubblicazione: (2026)
AMPED: Accelerating MTTKRP for Billion-Scale Sparse Tensor Decomposition on Multiple GPUs
di: Wijeratne, Sasindu, et al.
Pubblicazione: (2025)
di: Wijeratne, Sasindu, et al.
Pubblicazione: (2025)
Accelerating Dynamic Image Graph Construction on FPGA for Vision GNNs
di: Ramachandran, Anvitha, et al.
Pubblicazione: (2025)
di: Ramachandran, Anvitha, et al.
Pubblicazione: (2025)
HopGNN: Boosting Distributed GNN Training Efficiency via Feature-Centric Model Migration
di: Chen, Weijian, et al.
Pubblicazione: (2024)
di: Chen, Weijian, et al.
Pubblicazione: (2024)
DiT-HC: Enabling Efficient Training of Visual Generation Model DiT on HPC-oriented CPU Cluster
di: Zhang, Jinxiao, et al.
Pubblicazione: (2026)
di: Zhang, Jinxiao, et al.
Pubblicazione: (2026)
Characterizing CPU-Induced Slowdowns in Multi-GPU LLM Inference
di: Chung, Euijun, et al.
Pubblicazione: (2026)
di: Chung, Euijun, et al.
Pubblicazione: (2026)
WindVE: Collaborative CPU-NPU Vector Embedding
di: Huang, Jinqi, et al.
Pubblicazione: (2025)
di: Huang, Jinqi, et al.
Pubblicazione: (2025)
Single-GPU GNN Systems: Traps and Pitfalls
di: Gong, Yidong, et al.
Pubblicazione: (2024)
di: Gong, Yidong, et al.
Pubblicazione: (2024)
Benchmarking the Performance of Large Language Models on the Cerebras Wafer Scale Engine
di: Zhang, Zuoning, et al.
Pubblicazione: (2024)
di: Zhang, Zuoning, et al.
Pubblicazione: (2024)
Towards CXL Resilience to CPU Failures
di: Psistakis, Antonis, et al.
Pubblicazione: (2026)
di: Psistakis, Antonis, et al.
Pubblicazione: (2026)
Comparing CPU and GPU compute of PERMANOVA on MI300A
di: Sfiligoi, Igor
Pubblicazione: (2025)
di: Sfiligoi, Igor
Pubblicazione: (2025)
HAP: SPMD DNN Training on Heterogeneous GPU Clusters with Automated Program Synthesis
di: Zhang, Shiwei, et al.
Pubblicazione: (2024)
di: Zhang, Shiwei, et al.
Pubblicazione: (2024)
Understanding and Reducing Metadata-Driven Host Overheads in Sampling-Based GNN Training
di: Gong, Yidong, et al.
Pubblicazione: (2026)
di: Gong, Yidong, et al.
Pubblicazione: (2026)
A Distributed-memory Tridiagonal Solver Based on a Specialised Data Structure Optimised for CPU and GPU Architectures
di: Akkurt, Semih, et al.
Pubblicazione: (2024)
di: Akkurt, Semih, et al.
Pubblicazione: (2024)
Documenti analoghi
-
ARGO: An Auto-Tuning Runtime System for Scalable GNN Training on Multi-Core Processor
di: Lin, Yi-Chien, et al.
Pubblicazione: (2024) -
Towards Affordable, Adaptive and Automatic GNN Training on CPU-GPU Heterogeneous Platforms
di: Qiao, Tong, et al.
Pubblicazione: (2025) -
Accelerating Sparse MTTKRP for Small Tensor Decomposition on GPU
di: Wijeratne, Sasindu, et al.
Pubblicazione: (2025) -
A Study of Performance Programming of CPU, GPU accelerated Computers and SIMD Architecture
di: Yi, Xinyao
Pubblicazione: (2024) -
AcOrch: Accelerating Sampling-based GNN Training under CPU-NPU Heterogeneous Environments
di: Chen, Kefu, et al.
Pubblicazione: (2026)