Analytic Roofline Modeling and Energy Analysis of LULESH Proxy Application on Multi-Core Clusters
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Afzal, Ayesha, Hager, Georg, Wellein, Gerhard |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Wattlytics: A Web Platform for Co-Optimizing Performance, Energy, and TCO in HPC Clusters
par: Afzal, Ayesha, et autres
Publié: (2026)
par: Afzal, Ayesha, et autres
Publié: (2026)
GROMACS Unplugged: How Power Capping and Frequency Shapes Performance on GPUs
par: Afzal, Ayesha, et autres
Publié: (2025)
par: Afzal, Ayesha, et autres
Publié: (2025)
Microarchitectural comparison and in-core modeling of state-of-the-art CPUs: Grace, Sapphire Rapids, and Genoa
par: Laukemann, Jan, et autres
Publié: (2024)
par: Laukemann, Jan, et autres
Publié: (2024)
CloverLeaf on Intel Multi-Core CPUs: A Case Study in Write-Allocate Evasion
par: Laukemann, Jan, et autres
Publié: (2023)
par: Laukemann, Jan, et autres
Publié: (2023)
The Illusion of Power Capping in LLM Decode: A Phase-Aware Energy Characterisation Across Attention Architectures
par: Ma, Bole, et autres
Publié: (2026)
par: Ma, Bole, et autres
Publié: (2026)
Cache Blocking of Distributed-Memory Parallel Matrix Power Kernels
par: Lacey, Dane C., et autres
Publié: (2024)
par: Lacey, Dane C., et autres
Publié: (2024)
Ridgeline: A 2D Roofline Model for Distributed Systems
par: Checconi, Fabio, et autres
Publié: (2022)
par: Checconi, Fabio, et autres
Publié: (2022)
Analytical Performance Estimation during Code Generation on Modern GPUs
par: Ernst, Dominik, et autres
Publié: (2022)
par: Ernst, Dominik, et autres
Publié: (2022)
Synthesizing Proxy Applications for MPI Programs
par: Luo, Jiyu, et autres
Publié: (2023)
par: Luo, Jiyu, et autres
Publié: (2023)
Alya towards Exascale: Optimal OpenACC Performance of the Navier-Stokes Finite Element Assembly on GPUs
par: Owen, Herbert, et autres
Publié: (2024)
par: Owen, Herbert, et autres
Publié: (2024)
Algebraic Temporal Blocking for Sparse Iterative Solvers on Multi-Core CPUs
par: Alappat, Christie, et autres
Publié: (2023)
par: Alappat, Christie, et autres
Publié: (2023)
Exploring metrics for analyzing dynamic behavior in MPI programs via a coupled-oscillator model
par: Afzal, Ayesha, et autres
Publié: (2025)
par: Afzal, Ayesha, et autres
Publié: (2025)
On the Challenges of Energy-Efficiency Analysis in HPC Systems: Evaluating Synthetic Benchmarks and Gromacs
par: Machado, Rafael Ravedutti Lucio, et autres
Publié: (2025)
par: Machado, Rafael Ravedutti Lucio, et autres
Publié: (2025)
The Energy Cost of Execution-Idle in GPU Clusters
par: Lei, Yiran, et autres
Publié: (2026)
par: Lei, Yiran, et autres
Publié: (2026)
A Comprehensive Analysis of Process Energy Consumption on Multi-Socket Systems with GPUs
par: León-Vega, Luis G., et autres
Publié: (2024)
par: León-Vega, Luis G., et autres
Publié: (2024)
THEAS: Efficient Power Management in Multi-Core CPUs via Cache-Aware Resource Scheduling
par: Muhammad, Said, et autres
Publié: (2025)
par: Muhammad, Said, et autres
Publié: (2025)
Inductive Loop Analysis for Practical HPC Application Optimization
par: Schaad, Philipp, et autres
Publié: (2025)
par: Schaad, Philipp, et autres
Publié: (2025)
Denoising Application Performance Models with Noise-Resilient Priors
par: de Morais, Gustavo, et autres
Publié: (2025)
par: de Morais, Gustavo, et autres
Publié: (2025)
Can Tensor Cores Benefit Memory-Bound Kernels? (No!)
par: Zhang, Lingqi, et autres
Publié: (2025)
par: Zhang, Lingqi, et autres
Publié: (2025)
Serving Chain-structured Jobs with Large Memory Footprints with Application to Large Foundation Model Serving
par: Sun, Tingyang, et autres
Publié: (2026)
par: Sun, Tingyang, et autres
Publié: (2026)
Minos: Systematically Classifying Performance and Power Characteristics of GPU Workloads on HPC Clusters
par: Jain, Rutwik, et autres
Publié: (2026)
par: Jain, Rutwik, et autres
Publié: (2026)
Energy-Aware Computing in the Year 2026
par: Tchakoute, Roblex Nana, et autres
Publié: (2026)
par: Tchakoute, Roblex Nana, et autres
Publié: (2026)
Fast and Scalable Mixed Precision Euclidean Distance Calculations Using GPU Tensor Cores
par: Curless, Brian, et autres
Publié: (2025)
par: Curless, Brian, et autres
Publié: (2025)
"Two-Stagification": Job Dispatching in Large-Scale Clusters via a Two-Stage Architecture
par: Yildiz, Mert, et autres
Publié: (2025)
par: Yildiz, Mert, et autres
Publié: (2025)
Usability Evaluation of Cloud for HPC Applications
par: Sochat, Vanessa, et autres
Publié: (2025)
par: Sochat, Vanessa, et autres
Publié: (2025)
Modeling the Impact of Fiber Latency on Compute-Communication Overlap in Geo-Distributed Multi-Datacenter AI Training
par: Papavasileiou, Ioannis, et autres
Publié: (2026)
par: Papavasileiou, Ioannis, et autres
Publié: (2026)
A Multi-Port Concurrent Communication Model for handling Compute Intensive Tasks on Distributed Satellite System Constellations
par: Veeravalli, Bharadwaj
Publié: (2026)
par: Veeravalli, Bharadwaj
Publié: (2026)
Extracting Practical, Actionable Energy Insights from Supercomputer Telemetry and Logs
par: Cornelius, Melanie, et autres
Publié: (2025)
par: Cornelius, Melanie, et autres
Publié: (2025)
Fine-Grained Energy Prediction For Parallellized LLM Inference With PIE-P
par: Dutt, Anurag, et autres
Publié: (2025)
par: Dutt, Anurag, et autres
Publié: (2025)
Terabyte-Scale Analytics in the Blink of an Eye
par: Wu, Bowen, et autres
Publié: (2025)
par: Wu, Bowen, et autres
Publié: (2025)
Optimizations on Graph-Level for Domain Specific Computations in Julia and Application to QED
par: Reinhard, Anton, et autres
Publié: (2025)
par: Reinhard, Anton, et autres
Publié: (2025)
On the Partitioning of GPU Power among Multi-Instances
par: Vamja, Tirth, et autres
Publié: (2025)
par: Vamja, Tirth, et autres
Publié: (2025)
Efficient Fault Localization in a Cloud Stack Using End-to-End Application Service Topology
par: Mathews, Dhanya R, et autres
Publié: (2025)
par: Mathews, Dhanya R, et autres
Publié: (2025)
A Performance Analysis of BFT Consensus for Blockchains
par: Chan, J. D., et autres
Publié: (2024)
par: Chan, J. D., et autres
Publié: (2024)
Automated Programmatic Performance Analysis of Parallel Programs
par: Cankur, Onur, et autres
Publié: (2024)
par: Cankur, Onur, et autres
Publié: (2024)
Scalable GPU Performance Variability Analysis framework
par: Lahiry, Ankur, et autres
Publié: (2025)
par: Lahiry, Ankur, et autres
Publié: (2025)
Towards a Peer-to-Peer Data Distribution Layer for Efficient and Collaborative Resource Optimization of Distributed Dataflow Applications
par: Scheinert, Dominik, et autres
Publié: (2023)
par: Scheinert, Dominik, et autres
Publié: (2023)
Performance Debugging through Microarchitectural Sensitivity and Causality Analysis
par: Dutilleul, Alban, et autres
Publié: (2024)
par: Dutilleul, Alban, et autres
Publié: (2024)
Recorder: Comprehensive Parallel I/O Tracing and Analysis
par: Wang, Chen, et autres
Publié: (2025)
par: Wang, Chen, et autres
Publié: (2025)
Collaborative Processing for Multi-Tenant Inference on Memory-Constrained Edge TPUs
par: Ng, Nathan, et autres
Publié: (2026)
par: Ng, Nathan, et autres
Publié: (2026)
Documents similaires
-
Wattlytics: A Web Platform for Co-Optimizing Performance, Energy, and TCO in HPC Clusters
par: Afzal, Ayesha, et autres
Publié: (2026) -
GROMACS Unplugged: How Power Capping and Frequency Shapes Performance on GPUs
par: Afzal, Ayesha, et autres
Publié: (2025) -
Microarchitectural comparison and in-core modeling of state-of-the-art CPUs: Grace, Sapphire Rapids, and Genoa
par: Laukemann, Jan, et autres
Publié: (2024) -
CloverLeaf on Intel Multi-Core CPUs: A Case Study in Write-Allocate Evasion
par: Laukemann, Jan, et autres
Publié: (2023) -
The Illusion of Power Capping in LLM Decode: A Phase-Aware Energy Characterisation Across Attention Architectures
par: Ma, Bole, et autres
Publié: (2026)