Evaluation of Programming Models and Performance for Stencil Computation on Current GPU Architectures
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Shan, Baodi, Araya-Polo, Mauricio |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
GICC: A High-Performance Runtime for GPU-Initiated Communication and Coordination in Modern HPC Systems
par: Shan, Baodi, et autres
Publié: (2026)
par: Shan, Baodi, et autres
Publié: (2026)
A Portable Framework for Accelerating Stencil Computations on Modern Node Architectures
par: Sai, Ryuichi, et autres
Publié: (2023)
par: Sai, Ryuichi, et autres
Publié: (2023)
DiOMP-Offloading: Toward Portable Distributed Heterogeneous OpenMP
par: Shan, Baodi, et autres
Publié: (2025)
par: Shan, Baodi, et autres
Publié: (2025)
Towards a Scalable and Efficient PGAS-based Distributed OpenMP
par: Shan, Baodi, et autres
Publié: (2024)
par: Shan, Baodi, et autres
Publié: (2024)
A Study of Performance Programming of CPU, GPU accelerated Computers and SIMD Architecture
par: Yi, Xinyao
Publié: (2024)
par: Yi, Xinyao
Publié: (2024)
Stencil Matrixization
par: Zhao, Wenxuan, et autres
Publié: (2023)
par: Zhao, Wenxuan, et autres
Publié: (2023)
Do We Need Tensor Cores for Stencil Computations?
par: Gu, Qiqi, et autres
Publié: (2026)
par: Gu, Qiqi, et autres
Publié: (2026)
Stencil Computations on Tenstorrent Wormhole
par: Piarulli, Lorenzo, et autres
Publié: (2026)
par: Piarulli, Lorenzo, et autres
Publié: (2026)
SPIDER: Unleashing Sparse Tensor Cores for Stencil Computation via Strided Swapping
par: GU, Qiqi, et autres
Publié: (2025)
par: GU, Qiqi, et autres
Publié: (2025)
Persistent and Partitioned MPI for Stencil Communication
par: Collom, Gerald, et autres
Publié: (2025)
par: Collom, Gerald, et autres
Publié: (2025)
An Adaptive Distributed Stencil Abstraction for GPUs
par: Bhosale, Aditya, et autres
Publié: (2025)
par: Bhosale, Aditya, et autres
Publié: (2025)
To Repair or Not to Repair: Assessing Fault Resilience in MPI Stencil Applications
par: Rocco, Roberto, et autres
Publié: (2024)
par: Rocco, Roberto, et autres
Publié: (2024)
Taking GPU Programming Models to Task for Performance Portability
par: Davis, Joshua H., et autres
Publié: (2024)
par: Davis, Joshua H., et autres
Publié: (2024)
Performance Characterization of Distributed Deep Learning Strategies: A Quantitative Evaluation of DDP, FSDP, and Parameter Server Architectures on GPU Clusters
par: Ovi, Md Sultanul Islam
Publié: (2025)
par: Ovi, Md Sultanul Islam
Publié: (2025)
MMStencil: Optimizing High-order Stencils on Multicore CPU using Matrix Unit
par: Wang, Yinuo, et autres
Publié: (2025)
par: Wang, Yinuo, et autres
Publié: (2025)
HAS-GPU: Efficient Hybrid Auto-scaling with Fine-grained GPU Allocation for SLO-aware Serverless Inferences
par: Gu, Jianfeng, et autres
Publié: (2025)
par: Gu, Jianfeng, et autres
Publié: (2025)
Optimizing Bloom Filters for Modern GPU Architectures
par: Jünger, Daniel, et autres
Publié: (2025)
par: Jünger, Daniel, et autres
Publié: (2025)
Cost-Performance Analysis: A Comparative Study of CPU-Based Serverless and GPU-Based Training Architectures
par: Barrak, Amine, et autres
Publié: (2025)
par: Barrak, Amine, et autres
Publié: (2025)
QPU Micro-Kernels for Stencil Computation
par: Markidis, Stefano, et autres
Publié: (2025)
par: Markidis, Stefano, et autres
Publié: (2025)
Towards Portability at Scale: A Cross-Architecture Performance Evaluation of a GPU-enabled Shallow Water Solver
par: Villalobos, Johansell, et autres
Publié: (2025)
par: Villalobos, Johansell, et autres
Publié: (2025)
Characterizing Compute-Communication Overlap in GPU-Accelerated Distributed Deep Learning: Performance and Power Implications
par: Lee, Seonho, et autres
Publié: (2025)
par: Lee, Seonho, et autres
Publié: (2025)
VDCores: Resource Decoupled Programming and Execution for Asynchronous GPU
par: He, Zijian, et autres
Publié: (2026)
par: He, Zijian, et autres
Publié: (2026)
Microbenchmark-Driven Analytical Performance Modeling Across Modern GPU Architectures
par: Jarmusch, Aaron, et autres
Publié: (2026)
par: Jarmusch, Aaron, et autres
Publié: (2026)
Evaluating Cross-Architecture Performance Modeling of Distributed ML Workloads Using StableHLO
par: Svedas, Jonas, et autres
Publié: (2026)
par: Svedas, Jonas, et autres
Publié: (2026)
Cyclic Data Streaming on GPUs for Short Range Stencils Applied to Molecular Dynamics
par: Rose, Martin, et autres
Publié: (2025)
par: Rose, Martin, et autres
Publié: (2025)
Efficient Accelerated Graph Edit Distance Computation on GPU
par: Dabah, Adel, et autres
Publié: (2026)
par: Dabah, Adel, et autres
Publié: (2026)
Optimizing Allreduce Operations for Modern Heterogeneous Architectures with Multiple Processes per GPU
par: Adams, Michael, et autres
Publié: (2025)
par: Adams, Michael, et autres
Publié: (2025)
AsyncSparse: Accelerating Sparse Matrix-Matrix Multiplication on Asynchronous GPU Architectures
par: Liu, Jie, et autres
Publié: (2026)
par: Liu, Jie, et autres
Publié: (2026)
Concurrent Scheduling of High-Level Parallel Programs on Multi-GPU Systems
par: Knorr, Fabian, et autres
Publié: (2025)
par: Knorr, Fabian, et autres
Publié: (2025)
Towards Fast Setup and High Throughput of GPU Serverless Computing
par: Zhao, Han, et autres
Publié: (2024)
par: Zhao, Han, et autres
Publié: (2024)
HAP: SPMD DNN Training on Heterogeneous GPU Clusters with Automated Program Synthesis
par: Zhang, Shiwei, et autres
Publié: (2024)
par: Zhang, Shiwei, et autres
Publié: (2024)
HiRace: Accurate and Fast Source-Level Race Checking of GPU Programs
par: Jacobson, John, et autres
Publié: (2024)
par: Jacobson, John, et autres
Publié: (2024)
GPU Programming for AI Workflow Development on AWS SageMaker: An Instructional Approach
par: Srinivasan, Sriram, et autres
Publié: (2025)
par: Srinivasan, Sriram, et autres
Publié: (2025)
GPU-Based Parallel Computing Methods for Medical Photoacoustic Image Reconstruction
par: Yi, Xinyao, et autres
Publié: (2024)
par: Yi, Xinyao, et autres
Publié: (2024)
FaaSTube: Optimizing GPU-oriented Data Transfer for Serverless Computing
par: Wu, Hao, et autres
Publié: (2024)
par: Wu, Hao, et autres
Publié: (2024)
Host-Side Telemetry for Performance Diagnosis in Cloud and HPC GPU Infrastructure
par: Darzi, Erfan, et autres
Publié: (2025)
par: Darzi, Erfan, et autres
Publié: (2025)
Dataflow-Oriented Classification and Performance Analysis of GPU-Accelerated Homomorphic Encryption
par: Nozaki, Ai, et autres
Publié: (2026)
par: Nozaki, Ai, et autres
Publié: (2026)
TX-Digital Twin: Visualizing Supercomputer GPU Performance Data Stream
par: Baskakova, Elena, et autres
Publié: (2026)
par: Baskakova, Elena, et autres
Publié: (2026)
Automating Multi-Tenancy Performance Evaluation on Edge Compute Nodes
par: Georgiou, Joanna, et autres
Publié: (2025)
par: Georgiou, Joanna, et autres
Publié: (2025)
An AD based library for Efficient Hessian and Hessian-Vector Product Computation on GPU
par: Ranjan, Desh, et autres
Publié: (2024)
par: Ranjan, Desh, et autres
Publié: (2024)
Documents similaires
-
GICC: A High-Performance Runtime for GPU-Initiated Communication and Coordination in Modern HPC Systems
par: Shan, Baodi, et autres
Publié: (2026) -
A Portable Framework for Accelerating Stencil Computations on Modern Node Architectures
par: Sai, Ryuichi, et autres
Publié: (2023) -
DiOMP-Offloading: Toward Portable Distributed Heterogeneous OpenMP
par: Shan, Baodi, et autres
Publié: (2025) -
Towards a Scalable and Efficient PGAS-based Distributed OpenMP
par: Shan, Baodi, et autres
Publié: (2024) -
A Study of Performance Programming of CPU, GPU accelerated Computers and SIMD Architecture
par: Yi, Xinyao
Publié: (2024)