Cache Blocking of Distributed-Memory Parallel Matrix Power Kernels
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Lacey, Dane C., Alappat, Christie L., Lange, Florian, Hager, Georg, Fehske, Holger, Wellein, Gerhard |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Algebraic Temporal Blocking for Sparse Iterative Solvers on Multi-Core CPUs
par: Alappat, Christie, et autres
Publié: (2023)
par: Alappat, Christie, et autres
Publié: (2023)
GROMACS Unplugged: How Power Capping and Frequency Shapes Performance on GPUs
par: Afzal, Ayesha, et autres
Publié: (2025)
par: Afzal, Ayesha, et autres
Publié: (2025)
Microarchitectural comparison and in-core modeling of state-of-the-art CPUs: Grace, Sapphire Rapids, and Genoa
par: Laukemann, Jan, et autres
Publié: (2024)
par: Laukemann, Jan, et autres
Publié: (2024)
Analytic Roofline Modeling and Energy Analysis of LULESH Proxy Application on Multi-Core Clusters
par: Afzal, Ayesha, et autres
Publié: (2024)
par: Afzal, Ayesha, et autres
Publié: (2024)
CloverLeaf on Intel Multi-Core CPUs: A Case Study in Write-Allocate Evasion
par: Laukemann, Jan, et autres
Publié: (2023)
par: Laukemann, Jan, et autres
Publié: (2023)
Wattlytics: A Web Platform for Co-Optimizing Performance, Energy, and TCO in HPC Clusters
par: Afzal, Ayesha, et autres
Publié: (2026)
par: Afzal, Ayesha, et autres
Publié: (2026)
Alya towards Exascale: Optimal OpenACC Performance of the Navier-Stokes Finite Element Assembly on GPUs
par: Owen, Herbert, et autres
Publié: (2024)
par: Owen, Herbert, et autres
Publié: (2024)
CARAT: Client-Side Adaptive RPC and Cache Co-Tuning for Parallel File Systems
par: Rashid, Md Hasanur, et autres
Publié: (2026)
par: Rashid, Md Hasanur, et autres
Publié: (2026)
Can Tensor Cores Benefit Memory-Bound Kernels? (No!)
par: Zhang, Lingqi, et autres
Publié: (2025)
par: Zhang, Lingqi, et autres
Publié: (2025)
On Orchestrating Parallel Broadcasts for Distributed Ledgers
par: Sheng, Peiyao, et autres
Publié: (2024)
par: Sheng, Peiyao, et autres
Publié: (2024)
The Illusion of Power Capping in LLM Decode: A Phase-Aware Energy Characterisation Across Attention Architectures
par: Ma, Bole, et autres
Publié: (2026)
par: Ma, Bole, et autres
Publié: (2026)
AcceleratedKernels.jl: Cross-Architecture Parallel Algorithms from a Unified, Transpiled Codebase
par: Nicusan, Andrei-Leonard, et autres
Publié: (2025)
par: Nicusan, Andrei-Leonard, et autres
Publié: (2025)
THEAS: Efficient Power Management in Multi-Core CPUs via Cache-Aware Resource Scheduling
par: Muhammad, Said, et autres
Publié: (2025)
par: Muhammad, Said, et autres
Publié: (2025)
Automated Calibration of Parallel and Distributed Computing Simulators: A Case Study
par: McDonald, Jesse, et autres
Publié: (2024)
par: McDonald, Jesse, et autres
Publié: (2024)
Understanding Power Consumption Metric on Heterogeneous Memory Systems
par: Proaño, Andrès Rubio, et autres
Publié: (2024)
par: Proaño, Andrès Rubio, et autres
Publié: (2024)
SHIRO: Near-Optimal Communication Strategies for Distributed Sparse Matrix Multiplication
par: Zhuang, Chen, et autres
Publié: (2025)
par: Zhuang, Chen, et autres
Publié: (2025)
Analytical Performance Estimation during Code Generation on Modern GPUs
par: Ernst, Dominik, et autres
Publié: (2022)
par: Ernst, Dominik, et autres
Publié: (2022)
Is Sparse Matrix Reordering Effective for Sparse Matrix-Vector Multiplication?
par: Asudeh, Omid, et autres
Publié: (2025)
par: Asudeh, Omid, et autres
Publié: (2025)
Automated Programmatic Performance Analysis of Parallel Programs
par: Cankur, Onur, et autres
Publié: (2024)
par: Cankur, Onur, et autres
Publié: (2024)
Staging Blocked Evaluation over Structured Sparse Matrices
par: Das, Pratyush, et autres
Publié: (2024)
par: Das, Pratyush, et autres
Publié: (2024)
KEET: Explaining Performance of GPU Kernels Using LLM Agents
par: Davis, Joshua H., et autres
Publié: (2026)
par: Davis, Joshua H., et autres
Publié: (2026)
Optimal Parallel Scheduling under Concave Speedup Functions
par: Li, Chengzhang, et autres
Publié: (2025)
par: Li, Chengzhang, et autres
Publié: (2025)
Recorder: Comprehensive Parallel I/O Tracing and Analysis
par: Wang, Chen, et autres
Publié: (2025)
par: Wang, Chen, et autres
Publié: (2025)
FACT: Compositional Kernel Synthesis with a Three-Stage Agentic Workflow
par: Heidari, Sina, et autres
Publié: (2026)
par: Heidari, Sina, et autres
Publié: (2026)
ParaLog: Consistent Host-side Logging for Parallel Checkpoints
par: Chien, Steven W. D., et autres
Publié: (2024)
par: Chien, Steven W. D., et autres
Publié: (2024)
Fine-Grained Energy Prediction For Parallellized LLM Inference With PIE-P
par: Dutt, Anurag, et autres
Publié: (2025)
par: Dutt, Anurag, et autres
Publié: (2025)
Fault-Tolerant Hybrid-Parallel Training at Scale with Reliable and Efficient In-memory Checkpointing
par: Wang, Yuxin, et autres
Publié: (2023)
par: Wang, Yuxin, et autres
Publié: (2023)
Portable High-Performance Kernel Generation for a Computational Fluid Dynamics Code with DaCe
par: Andersson, Måns I., et autres
Publié: (2025)
par: Andersson, Måns I., et autres
Publié: (2025)
Matryoshka: Optimization of Dynamic Diverse Quantum Chemistry Systems via Elastic Parallelism Transformation
par: Wang, Tuowei, et autres
Publié: (2024)
par: Wang, Tuowei, et autres
Publié: (2024)
HeteGen: Heterogeneous Parallel Inference for Large Language Models on Resource-Constrained Devices
par: Zhao, Xuanlei, et autres
Publié: (2024)
par: Zhao, Xuanlei, et autres
Publié: (2024)
Parallel I/O Characterization and Optimization on Large-Scale HPC Systems: A 360-Degree Survey
par: Ather, Hammad, et autres
Publié: (2024)
par: Ather, Hammad, et autres
Publié: (2024)
Shifting the Sweet Spot: High-Performance Matrix-Free Method for High-Order Elasticity
par: Chang, Dali, et autres
Publié: (2026)
par: Chang, Dali, et autres
Publié: (2026)
An Auto-tuning Method for Run-time Data Transformation for Sparse Matrix-Vector Multiplication
par: Katagiri, Takahiro, et autres
Publié: (2024)
par: Katagiri, Takahiro, et autres
Publié: (2024)
CUTHERMO: Understanding GPU Memory Inefficiencies with Heat Map Profiling
par: Zhao, Yanbo, et autres
Publié: (2025)
par: Zhao, Yanbo, et autres
Publié: (2025)
DIAL: Decentralized I/O AutoTuning via Learned Client-side Local Metrics for Parallel File System
par: Rashid, Md Hasanur, et autres
Publié: (2026)
par: Rashid, Md Hasanur, et autres
Publié: (2026)
On the Partitioning of GPU Power among Multi-Instances
par: Vamja, Tirth, et autres
Publié: (2025)
par: Vamja, Tirth, et autres
Publié: (2025)
Collaborative Processing for Multi-Tenant Inference on Memory-Constrained Edge TPUs
par: Ng, Nathan, et autres
Publié: (2026)
par: Ng, Nathan, et autres
Publié: (2026)
On the Challenges of Energy-Efficiency Analysis in HPC Systems: Evaluating Synthetic Benchmarks and Gromacs
par: Machado, Rafael Ravedutti Lucio, et autres
Publié: (2025)
par: Machado, Rafael Ravedutti Lucio, et autres
Publié: (2025)
Dissecting CPU-GPU Unified Physical Memory on AMD MI300A APUs
par: Wahlgren, Jacob, et autres
Publié: (2025)
par: Wahlgren, Jacob, et autres
Publié: (2025)
An Online Probabilistic Distributed Tracing System
par: Toslali, M., et autres
Publié: (2024)
par: Toslali, M., et autres
Publié: (2024)
Documents similaires
-
Algebraic Temporal Blocking for Sparse Iterative Solvers on Multi-Core CPUs
par: Alappat, Christie, et autres
Publié: (2023) -
GROMACS Unplugged: How Power Capping and Frequency Shapes Performance on GPUs
par: Afzal, Ayesha, et autres
Publié: (2025) -
Microarchitectural comparison and in-core modeling of state-of-the-art CPUs: Grace, Sapphire Rapids, and Genoa
par: Laukemann, Jan, et autres
Publié: (2024) -
Analytic Roofline Modeling and Energy Analysis of LULESH Proxy Application on Multi-Core Clusters
par: Afzal, Ayesha, et autres
Publié: (2024) -
CloverLeaf on Intel Multi-Core CPUs: A Case Study in Write-Allocate Evasion
par: Laukemann, Jan, et autres
Publié: (2023)