Performance Portable Monte Carlo Particle Transport on Intel, NVIDIA, and AMD GPUs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Tramm, John, Romano, Paul, Shriwise, Patrick, Lund, Amanda, Doerfert, Johannes, Steinbrecher, Patrick, Siegel, Andrew, Ridley, Gavin |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Joint Training on AMD and NVIDIA GPUs
par: Hu, Jon, et autres
Publié: (2026)
par: Hu, Jon, et autres
Publié: (2026)
Optimizing sDTW for AMD GPUs
par: Latta-Lin, Daniel, et autres
Publié: (2024)
par: Latta-Lin, Daniel, et autres
Publié: (2024)
GPU Acceleration of Monte Carlo Tallies on Unstructured Meshes in OpenMC with PUMI-Tally
par: Hasan, Fuad, et autres
Publié: (2025)
par: Hasan, Fuad, et autres
Publié: (2025)
MT4G: A Tool for Reliable Auto-Discovery of NVIDIA and AMD GPU Compute and Memory Topologies
par: Vanecek, Stepan, et autres
Publié: (2025)
par: Vanecek, Stepan, et autres
Publié: (2025)
Analyzing the Performance Portability of SYCL across CPUs, GPUs, and Hybrid Systems with SW Sequence Alignment
par: Costanzo, Manuel, et autres
Publié: (2024)
par: Costanzo, Manuel, et autres
Publié: (2024)
Confidential Computing on NVIDIA Hopper GPUs: A Performance Benchmark Study
par: Zhu, Jianwei, et autres
Publié: (2024)
par: Zhu, Jianwei, et autres
Publié: (2024)
Evaluating Emerging AI/ML Accelerators: IPU, RDU, and NVIDIA/AMD GPUs
par: Peng, Hongwu, et autres
Publié: (2023)
par: Peng, Hongwu, et autres
Publié: (2023)
Evaluation of Intel Max GPUs for CGYRO-based fusion simulations
par: Sfiligoi, Igor, et autres
Publié: (2024)
par: Sfiligoi, Igor, et autres
Publié: (2024)
Preliminary report: Initial evaluation of StdPar implementations on AMD GPUs for HPC
par: Lin, Wei-Chen, et autres
Publié: (2024)
par: Lin, Wei-Chen, et autres
Publié: (2024)
HP-MDR: High-performance and Portable Data Refactoring and Progressive Retrieval with Advanced GPUs
par: Li, Yanliang, et autres
Publié: (2025)
par: Li, Yanliang, et autres
Publié: (2025)
Portability Efficiency Approach for Calculating Performance Portability
par: Marowka, Ami
Publié: (2024)
par: Marowka, Ami
Publié: (2024)
Leveraging HPC Profiling & Tracing Tools to Understand the Performance of Particle-in-Cell Monte Carlo Simulations
par: Williams, Jeremy J., et autres
Publié: (2023)
par: Williams, Jeremy J., et autres
Publié: (2023)
Bringing Auto-tuning to HIP: Analysis of Tuning Impact and Difficulty on AMD and Nvidia GPUs
par: Lurati, Milo, et autres
Publié: (2024)
par: Lurati, Milo, et autres
Publié: (2024)
Dissecting the NVIDIA Blackwell Architecture with Microbenchmarks
par: Jarmusch, Aaron, et autres
Publié: (2025)
par: Jarmusch, Aaron, et autres
Publié: (2025)
Black-Scholes Option Pricing on Intel CPUs and GPUs: Implementation on SYCL and Optimization Techniques
par: Panova, Elena, et autres
Publié: (2022)
par: Panova, Elena, et autres
Publié: (2022)
Characterization-Guided GPU Fault Resilience in NVIDIA MPS
par: Liu, Rixin, et autres
Publié: (2026)
par: Liu, Rixin, et autres
Publié: (2026)
Analytical Performance Estimation during Code Generation on Modern GPUs
par: Ernst, Dominik, et autres
Publié: (2022)
par: Ernst, Dominik, et autres
Publié: (2022)
LAPIS: A Performance Portable, High Productivity Compiler Framework
par: Kelley, Brian, et autres
Publié: (2025)
par: Kelley, Brian, et autres
Publié: (2025)
HPDR: High-Performance Portable Scientific Data Reduction Framework
par: Chen, Jieyang, et autres
Publié: (2025)
par: Chen, Jieyang, et autres
Publié: (2025)
XaaS Containers: Performance-Portable Representation With Source and IR Containers
par: Copik, Marcin, et autres
Publié: (2025)
par: Copik, Marcin, et autres
Publié: (2025)
Boosting Performance of Iterative Applications on GPUs: Kernel Batching with CUDA Graphs
par: Ekelund, Jonah, et autres
Publié: (2025)
par: Ekelund, Jonah, et autres
Publié: (2025)
Intel(R) SHMEM: GPU-initiated OpenSHMEM using SYCL
par: Brooks, Alex, et autres
Publié: (2024)
par: Brooks, Alex, et autres
Publié: (2024)
Closer in the Gap: Towards Portable Performance on RISC-V Vector Processors
par: Shi, Ruimin, et autres
Publié: (2026)
par: Shi, Ruimin, et autres
Publié: (2026)
miniLB: A Performance Portability Study of Lattice-Boltzmann Simulations
par: Crisci, Luigi, et autres
Publié: (2024)
par: Crisci, Luigi, et autres
Publié: (2024)
Distributed OpenMP Offloading of OpenMC on Intel GPU MAX Accelerators
par: Fridman, Yehonatan, et autres
Publié: (2024)
par: Fridman, Yehonatan, et autres
Publié: (2024)
Is RISC-V Ready for Machine Learning? Portable Gaussian Processes Using Asynchronous Tasks
par: Strack, Alexander, et autres
Publié: (2026)
par: Strack, Alexander, et autres
Publié: (2026)
BOA Constrictor: Squeezing Performance out of GPUs in the Cloud via Budget-Optimal Allocation
par: Li, Zhouzi, et autres
Publié: (2026)
par: Li, Zhouzi, et autres
Publié: (2026)
GOGH: Correlation-Guided Orchestration of GPUs in Heterogeneous Clusters
par: Raeisi, Ahmad, et autres
Publié: (2025)
par: Raeisi, Ahmad, et autres
Publié: (2025)
Automatic BLAS Offloading on Unified Memory Architecture: A Study on NVIDIA Grace-Hopper
par: Li, Junjie, et autres
Publié: (2024)
par: Li, Junjie, et autres
Publié: (2024)
TurboFFT: Co-Designed High-Performance and Fault-Tolerant Fast Fourier Transform on GPUs
par: Wu, Shixun, et autres
Publié: (2024)
par: Wu, Shixun, et autres
Publié: (2024)
Taking GPU Programming Models to Task for Performance Portability
par: Davis, Joshua H., et autres
Publié: (2024)
par: Davis, Joshua H., et autres
Publié: (2024)
An Adaptive Distributed Stencil Abstraction for GPUs
par: Bhosale, Aditya, et autres
Publié: (2025)
par: Bhosale, Aditya, et autres
Publié: (2025)
Accelerating Maximal Biclique Enumeration on GPUs
par: Hsieh, Chou-Ying, et autres
Publié: (2024)
par: Hsieh, Chou-Ying, et autres
Publié: (2024)
Parallelizing Maximal Clique Enumeration on GPUs
par: Almasri, Mohammad, et autres
Publié: (2022)
par: Almasri, Mohammad, et autres
Publié: (2022)
Combining Performance and Productivity: Accelerating the Network Sensing Graph Challenge with GPUs and Commodity Data Science Software
par: Samsi, Siddharth, et autres
Publié: (2025)
par: Samsi, Siddharth, et autres
Publié: (2025)
Understanding Data Movement in AMD Multi-GPU Systems with Infinity Fabric
par: Schieffer, Gabin, et autres
Publié: (2024)
par: Schieffer, Gabin, et autres
Publié: (2024)
Serving Compound Inference Systems on Datacenter GPUs
par: Devata, Sriram, et autres
Publié: (2026)
par: Devata, Sriram, et autres
Publié: (2026)
Fast Kronecker Matrix-Matrix Multiplication on GPUs
par: Jangda, Abhinav, et autres
Publié: (2024)
par: Jangda, Abhinav, et autres
Publié: (2024)
Optimal Workload Placement on Multi-Instance GPUs
par: Turkkan, Bekir, et autres
Publié: (2024)
par: Turkkan, Bekir, et autres
Publié: (2024)
GROMACS Unplugged: How Power Capping and Frequency Shapes Performance on GPUs
par: Afzal, Ayesha, et autres
Publié: (2025)
par: Afzal, Ayesha, et autres
Publié: (2025)
Documents similaires
-
Joint Training on AMD and NVIDIA GPUs
par: Hu, Jon, et autres
Publié: (2026) -
Optimizing sDTW for AMD GPUs
par: Latta-Lin, Daniel, et autres
Publié: (2024) -
GPU Acceleration of Monte Carlo Tallies on Unstructured Meshes in OpenMC with PUMI-Tally
par: Hasan, Fuad, et autres
Publié: (2025) -
MT4G: A Tool for Reliable Auto-Discovery of NVIDIA and AMD GPU Compute and Memory Topologies
par: Vanecek, Stepan, et autres
Publié: (2025) -
Analyzing the Performance Portability of SYCL across CPUs, GPUs, and Hybrid Systems with SW Sequence Alignment
par: Costanzo, Manuel, et autres
Publié: (2024)