Harnessing Integrated CPU-GPU System Memory for HPC: a first look into Grace Hopper
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Schieffer, Gabin, Wahlgren, Jacob, Ren, Jie, Faj, Jennifer, Peng, Ivy |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Kub: Enabling Elastic HPC Workloads on Containerized Environments
par: Medeiros, Daniel, et autres
Publié: (2024)
par: Medeiros, Daniel, et autres
Publié: (2024)
Understanding Layered Portability from HPC to Cloud in Containerized Environments
par: Medeiros, Daniel, et autres
Publié: (2024)
par: Medeiros, Daniel, et autres
Publié: (2024)
A GPU-accelerated Molecular Docking Workflow with Kubernetes and Apache Airflow
par: Medeiros, Daniel, et autres
Publié: (2024)
par: Medeiros, Daniel, et autres
Publié: (2024)
Taming GPU Underutilization via Static Partitioning and Fine-grained CPU Offloading
par: Schieffer, Gabin, et autres
Publié: (2026)
par: Schieffer, Gabin, et autres
Publié: (2026)
Dissecting CPU-GPU Unified Physical Memory on AMD MI300A APUs
par: Wahlgren, Jacob, et autres
Publié: (2025)
par: Wahlgren, Jacob, et autres
Publié: (2025)
Understanding Data Movement in AMD Multi-GPU Systems with Infinity Fabric
par: Schieffer, Gabin, et autres
Publié: (2024)
par: Schieffer, Gabin, et autres
Publié: (2024)
Disaggregated Memory with SmartNIC Offloading: a Case Study on Graph Processing
par: Wahlgren, Jacob, et autres
Publié: (2024)
par: Wahlgren, Jacob, et autres
Publié: (2024)
Accelerating Drug Discovery in AutoDock-GPU with Tensor Cores
par: Schieffer, Gabin, et autres
Publié: (2024)
par: Schieffer, Gabin, et autres
Publié: (2024)
Multi-level Memory-Centric Profiling on ARM Processors with ARM SPE
par: Miksits, Samuel, et autres
Publié: (2024)
par: Miksits, Samuel, et autres
Publié: (2024)
ARM SVE Unleashed: Performance and Insights Across HPC Applications on Nvidia Grace
par: Shi, Ruimin, et autres
Publié: (2025)
par: Shi, Ruimin, et autres
Publié: (2025)
Harnessing CUDA-Q's MPS for Tensor Network Simulations of Large-Scale Quantum Circuits
par: Schieffer, Gabin, et autres
Publié: (2025)
par: Schieffer, Gabin, et autres
Publié: (2025)
Inter-APU Communication on AMD MI300A Systems via Infinity Fabric: a Deep Dive
par: Schieffer, Gabin, et autres
Publié: (2025)
par: Schieffer, Gabin, et autres
Publié: (2025)
ARC-V: Vertical Resource Adaptivity for HPC Workloads in Containerized Environments
par: Medeiros, Daniel, et autres
Publié: (2025)
par: Medeiros, Daniel, et autres
Publié: (2025)
OpenCUBE: Building an Open Source Cloud Blueprint with EPI Systems
par: Peng, Ivy, et autres
Publié: (2024)
par: Peng, Ivy, et autres
Publié: (2024)
Automatic BLAS Offloading on Unified Memory Architecture: A Study on NVIDIA Grace-Hopper
par: Li, Junjie, et autres
Publié: (2024)
par: Li, Junjie, et autres
Publié: (2024)
High-performance Vector-length Agnostic Quantum Circuit Simulations on ARM Processors
par: Shi, Ruimin, et autres
Publié: (2026)
par: Shi, Ruimin, et autres
Publié: (2026)
Communication Offloading on SmartNIC DPUs: A Quantitative Approach
par: Wahlgren, Jacob, et autres
Publié: (2026)
par: Wahlgren, Jacob, et autres
Publié: (2026)
Cross-Layer Energy Analysis of Multimodal Training on Grace Hopper Superchips
par: Ahmed, Mahmoud, et autres
Publié: (2026)
par: Ahmed, Mahmoud, et autres
Publié: (2026)
Adventures with Grace Hopper AI Super Chip and the National Research Platform
par: Hurt, J. Alex, et autres
Publié: (2024)
par: Hurt, J. Alex, et autres
Publié: (2024)
Understanding Data Movement in Tightly Coupled Heterogeneous Systems: A Case Study with the Grace Hopper Superchip
par: Fusco, Luigi, et autres
Publié: (2024)
par: Fusco, Luigi, et autres
Publié: (2024)
Breaking the Memory Wall: A Study of I/O Patterns and GPU Memory Utilization for Hybrid CPU-GPU Offloaded Optimizers
par: Maurya, Avinash, et autres
Publié: (2024)
par: Maurya, Avinash, et autres
Publié: (2024)
Efficient CPU-GPU Collaborative Inference for MoE-based LLMs on Memory-Limited Systems
par: Huang, En-Ming, et autres
Publié: (2025)
par: Huang, En-Ming, et autres
Publié: (2025)
Efficient Graph Embedding at Scale: Optimizing CPU-GPU-SSD Integration
par: Li, Zhonggen, et autres
Publié: (2025)
par: Li, Zhonggen, et autres
Publié: (2025)
DOLMA: A Data Object Level Memory Disaggregation Framework for HPC Applications
par: Zheng, Haoyu, et autres
Publié: (2025)
par: Zheng, Haoyu, et autres
Publié: (2025)
Performance characterisation of the 64-core SG2042 RISC-V CPU for HPC
par: Brown, Nick, et autres
Publié: (2024)
par: Brown, Nick, et autres
Publié: (2024)
A Unified CPU-GPU Protocol for GNN Training
par: Lin, Yi-Chien, et autres
Publié: (2024)
par: Lin, Yi-Chien, et autres
Publié: (2024)
Combining GPU and CPU for accelerating evolutionary computing workloads
par: Eynaliyev, Rustam, et autres
Publié: (2025)
par: Eynaliyev, Rustam, et autres
Publié: (2025)
Harnessing Deep Learning and HPC Kernels via High-Level Loop and Tensor Abstractions on CPU Architectures
par: Georganas, Evangelos, et autres
Publié: (2023)
par: Georganas, Evangelos, et autres
Publié: (2023)
Integrating and Characterizing HPC Task Runtime Systems for hybrid AI-HPC workloads
par: Merzky, Andre, et autres
Publié: (2025)
par: Merzky, Andre, et autres
Publié: (2025)
TURNIP: A "Nondeterministic" GPU Runtime with CPU RAM Offload
par: Ding, Zhimin, et autres
Publié: (2024)
par: Ding, Zhimin, et autres
Publié: (2024)
Evaluating HPC-Style CPU Performance and Cost in Virtualized Cloud Infrastructures
par: Tharwani, Jay, et autres
Publié: (2025)
par: Tharwani, Jay, et autres
Publié: (2025)
DiT-HC: Enabling Efficient Training of Visual Generation Model DiT on HPC-oriented CPU Cluster
par: Zhang, Jinxiao, et autres
Publié: (2026)
par: Zhang, Jinxiao, et autres
Publié: (2026)
GPU-Accelerated Distributed QAOA on Large-scale HPC Ecosystems
par: Xu, Zhihao, et autres
Publié: (2025)
par: Xu, Zhihao, et autres
Publié: (2025)
GICC: A High-Performance Runtime for GPU-Initiated Communication and Coordination in Modern HPC Systems
par: Shan, Baodi, et autres
Publié: (2026)
par: Shan, Baodi, et autres
Publié: (2026)
Towards Affordable, Adaptive and Automatic GNN Training on CPU-GPU Heterogeneous Platforms
par: Qiao, Tong, et autres
Publié: (2025)
par: Qiao, Tong, et autres
Publié: (2025)
A Study of Performance Programming of CPU, GPU accelerated Computers and SIMD Architecture
par: Yi, Xinyao
Publié: (2024)
par: Yi, Xinyao
Publié: (2024)
Orchestrated Co-scheduling, Resource Partitioning, and Power Capping on CPU-GPU Heterogeneous Systems via Machine Learning
par: Saba, Issa, et autres
Publié: (2024)
par: Saba, Issa, et autres
Publié: (2024)
Leveraging HPC Profiling & Tracing Tools to Understand the Performance of Particle-in-Cell Monte Carlo Simulations
par: Williams, Jeremy J., et autres
Publié: (2023)
par: Williams, Jeremy J., et autres
Publié: (2023)
Host-Side Telemetry for Performance Diagnosis in Cloud and HPC GPU Infrastructure
par: Darzi, Erfan, et autres
Publié: (2025)
par: Darzi, Erfan, et autres
Publié: (2025)
APEX: Asynchronous Parallel CPU-GPU Execution for Online LLM Inference on Constrained GPUs
par: Fan, Jiakun, et autres
Publié: (2025)
par: Fan, Jiakun, et autres
Publié: (2025)
Documents similaires
-
Kub: Enabling Elastic HPC Workloads on Containerized Environments
par: Medeiros, Daniel, et autres
Publié: (2024) -
Understanding Layered Portability from HPC to Cloud in Containerized Environments
par: Medeiros, Daniel, et autres
Publié: (2024) -
A GPU-accelerated Molecular Docking Workflow with Kubernetes and Apache Airflow
par: Medeiros, Daniel, et autres
Publié: (2024) -
Taming GPU Underutilization via Static Partitioning and Fine-grained CPU Offloading
par: Schieffer, Gabin, et autres
Publié: (2026) -
Dissecting CPU-GPU Unified Physical Memory on AMD MI300A APUs
par: Wahlgren, Jacob, et autres
Publié: (2025)