Optimizing Near Field Computation in the MLFMA Algorithm with Data Redundancy and Performance Modeling on a Single GPU
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Sadeghi, Morteza, Torabi, Abdolreza |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Modeling the Effect of Data Redundancy on Speedup in MLFMA Near-Field Computation
par: Sadeghi, Morteza
Publié: (2025)
par: Sadeghi, Morteza
Publié: (2025)
Taking GPU Programming Models to Task for Performance Portability
par: Davis, Joshua H., et autres
Publié: (2024)
par: Davis, Joshua H., et autres
Publié: (2024)
Data-Driven Analysis to Understand GPU Hardware Resource Usage of Optimizations
par: Islam, Tanzima Z., et autres
Publié: (2024)
par: Islam, Tanzima Z., et autres
Publié: (2024)
Scalable GPU Performance Variability Analysis framework
par: Lahiry, Ankur, et autres
Publié: (2025)
par: Lahiry, Ankur, et autres
Publié: (2025)
KEET: Explaining Performance of GPU Kernels Using LLM Agents
par: Davis, Joshua H., et autres
Publié: (2026)
par: Davis, Joshua H., et autres
Publié: (2026)
Disaggregated Design for GPU-Based Volumetric Data Structures
par: Meneghin, Massimiliano, et autres
Publié: (2025)
par: Meneghin, Massimiliano, et autres
Publié: (2025)
High-Performance Portable GPU Primitives for Arbitrary Types and Operators in Julia
par: Pilliat, Emmanuel
Publié: (2026)
par: Pilliat, Emmanuel
Publié: (2026)
Minos: Systematically Classifying Performance and Power Characteristics of GPU Workloads on HPC Clusters
par: Jain, Rutwik, et autres
Publié: (2026)
par: Jain, Rutwik, et autres
Publié: (2026)
HybridGen: Efficient LLM Generative Inference via CPU-GPU Hybrid Computing
par: Lin, Mao, et autres
Publié: (2026)
par: Lin, Mao, et autres
Publié: (2026)
Multi-GPU Hybrid Particle-in-Cell Monte Carlo Simulations for Exascale Computing Systems
par: Williams, Jeremy J., et autres
Publié: (2026)
par: Williams, Jeremy J., et autres
Publié: (2026)
Integrating Performance Tools in Model Reasoning for GPU Kernel Optimization
par: Nichols, Daniel, et autres
Publié: (2025)
par: Nichols, Daniel, et autres
Publié: (2025)
Towards Portability at Scale: A Cross-Architecture Performance Evaluation of a GPU-enabled Shallow Water Solver
par: Villalobos, Johansell, et autres
Publié: (2025)
par: Villalobos, Johansell, et autres
Publié: (2025)
Redesigning GROMACS Halo Exchange: Improving Strong Scaling with GPU-initiated NVSHMEM
par: Doijade, Mahesh, et autres
Publié: (2025)
par: Doijade, Mahesh, et autres
Publié: (2025)
A Precision Emulation Approach to the GPU Acceleration of Ab Initio Electronic Structure Calculations
par: Liu, Hang, et autres
Publié: (2026)
par: Liu, Hang, et autres
Publié: (2026)
Accelerating Particle-in-Cell Monte Carlo Simulations with MPI, OpenMP/OpenACC and Asynchronous Multi-GPU Programming
par: Williams, Jeremy J., et autres
Publié: (2024)
par: Williams, Jeremy J., et autres
Publié: (2024)
The Energy Cost of Execution-Idle in GPU Clusters
par: Lei, Yiran, et autres
Publié: (2026)
par: Lei, Yiran, et autres
Publié: (2026)
On the Partitioning of GPU Power among Multi-Instances
par: Vamja, Tirth, et autres
Publié: (2025)
par: Vamja, Tirth, et autres
Publié: (2025)
Profiling and optimization of multi-card GPU machine learning jobs
par: Lawenda, Marcin, et autres
Publié: (2025)
par: Lawenda, Marcin, et autres
Publié: (2025)
CUTHERMO: Understanding GPU Memory Inefficiencies with Heat Map Profiling
par: Zhao, Yanbo, et autres
Publié: (2025)
par: Zhao, Yanbo, et autres
Publié: (2025)
Efficient allocation of image recognition and LLM tasks on multi-GPU system
par: Lawenda, Marcin, et autres
Publié: (2025)
par: Lawenda, Marcin, et autres
Publié: (2025)
Scalable Systems and Software Architectures for High-Performance Computing on cloud platforms
par: Ramesh, Risshab Srinivas
Publié: (2024)
par: Ramesh, Risshab Srinivas
Publié: (2024)
SProBench: Stream Processing Benchmark for High Performance Computing Infrastructure
par: Kulkarni, Apurv Deepak, et autres
Publié: (2025)
par: Kulkarni, Apurv Deepak, et autres
Publié: (2025)
Portable High-Performance Kernel Generation for a Computational Fluid Dynamics Code with DaCe
par: Andersson, Måns I., et autres
Publié: (2025)
par: Andersson, Måns I., et autres
Publié: (2025)
LLMPerf: GPU Performance Modeling meets Large Language Models
par: Nguyen, Khoi N. M., et autres
Publié: (2025)
par: Nguyen, Khoi N. M., et autres
Publié: (2025)
Optimizations on Graph-Level for Domain Specific Computations in Julia and Application to QED
par: Reinhard, Anton, et autres
Publié: (2025)
par: Reinhard, Anton, et autres
Publié: (2025)
Unleashing the Power of Preemptive Priority-based Scheduling for Real-Time GPU Tasks
par: Wang, Yidi, et autres
Publié: (2024)
par: Wang, Yidi, et autres
Publié: (2024)
Efficient GPU-Centered Singular Value Decomposition Using the Divide-and-Conquer Method
par: Liu, Shifang, et autres
Publié: (2025)
par: Liu, Shifang, et autres
Publié: (2025)
Cost-Performance Evaluation of General Compute Instances: AWS, Azure, GCP, and OCI
par: Tharwani, Jay, et autres
Publié: (2024)
par: Tharwani, Jay, et autres
Publié: (2024)
Dissecting CPU-GPU Unified Physical Memory on AMD MI300A APUs
par: Wahlgren, Jacob, et autres
Publié: (2025)
par: Wahlgren, Jacob, et autres
Publié: (2025)
LEO: Tracing GPU Stall Root Causes via Cross-Vendor Backward Slicing
par: Xia, Yuning, et autres
Publié: (2026)
par: Xia, Yuning, et autres
Publié: (2026)
Fast and Scalable Mixed Precision Euclidean Distance Calculations Using GPU Tensor Cores
par: Curless, Brian, et autres
Publié: (2025)
par: Curless, Brian, et autres
Publié: (2025)
Performance Optimization in Stream Processing Systems: Experiment-Driven Configuration Tuning for Kafka Streams
par: Chen, David, et autres
Publié: (2026)
par: Chen, David, et autres
Publié: (2026)
Towards a Peer-to-Peer Data Distribution Layer for Efficient and Collaborative Resource Optimization of Distributed Dataflow Applications
par: Scheinert, Dominik, et autres
Publié: (2023)
par: Scheinert, Dominik, et autres
Publié: (2023)
Opt4GPTQ: Co-Optimizing Memory and Computation for 4-bit GPTQ Quantized LLM Inference on Heterogeneous Platforms
par: Zhang, Yaozheng, et autres
Publié: (2025)
par: Zhang, Yaozheng, et autres
Publié: (2025)
Denoising Application Performance Models with Noise-Resilient Priors
par: de Morais, Gustavo, et autres
Publié: (2025)
par: de Morais, Gustavo, et autres
Publié: (2025)
Towards Universal Performance Modeling for Machine Learning Training on Multi-GPU Platforms
par: Lin, Zhongyi, et autres
Publié: (2024)
par: Lin, Zhongyi, et autres
Publié: (2024)
SHIRO: Near-Optimal Communication Strategies for Distributed Sparse Matrix Multiplication
par: Zhuang, Chen, et autres
Publié: (2025)
par: Zhuang, Chen, et autres
Publié: (2025)
PlantD: Performance, Latency ANalysis, and Testing for Data Pipelines -- An Open Source Measurement, Testing, and Simulation Framework
par: Bogart, Christopher, et autres
Publié: (2025)
par: Bogart, Christopher, et autres
Publié: (2025)
Learning-Augmented Performance Model for Tensor Product Factorization in High-Order FEM
par: Ren, Xuanzhengbo, et autres
Publié: (2026)
par: Ren, Xuanzhengbo, et autres
Publié: (2026)
Modeling the Impact of Fiber Latency on Compute-Communication Overlap in Geo-Distributed Multi-Datacenter AI Training
par: Papavasileiou, Ioannis, et autres
Publié: (2026)
par: Papavasileiou, Ioannis, et autres
Publié: (2026)
Documents similaires
-
Modeling the Effect of Data Redundancy on Speedup in MLFMA Near-Field Computation
par: Sadeghi, Morteza
Publié: (2025) -
Taking GPU Programming Models to Task for Performance Portability
par: Davis, Joshua H., et autres
Publié: (2024) -
Data-Driven Analysis to Understand GPU Hardware Resource Usage of Optimizations
par: Islam, Tanzima Z., et autres
Publié: (2024) -
Scalable GPU Performance Variability Analysis framework
par: Lahiry, Ankur, et autres
Publié: (2025) -
KEET: Explaining Performance of GPU Kernels Using LLM Agents
par: Davis, Joshua H., et autres
Publié: (2026)