Microbenchmark-Driven Analytical Performance Modeling Across Modern GPU Architectures
Fuente:
arXiv
Salvato in:
| Autori principali: | Jarmusch, Aaron, Chandrasekaran, Sunita |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Execution-Centric Characterization of FP8 Matrix Cores, Asynchronous Execution, and Structured Sparsity on AMD MI300A
di: Jarmusch, Aaron, et al.
Pubblicazione: (2026)
di: Jarmusch, Aaron, et al.
Pubblicazione: (2026)
Dissecting the NVIDIA Blackwell Architecture with Microbenchmarks
di: Jarmusch, Aaron, et al.
Pubblicazione: (2025)
di: Jarmusch, Aaron, et al.
Pubblicazione: (2025)
Dissecting the NVIDIA Hopper Architecture through Microbenchmarking and Multiple Level Analysis
di: Luo, Weile, et al.
Pubblicazione: (2025)
di: Luo, Weile, et al.
Pubblicazione: (2025)
Microbenchmarking NVIDIA's Blackwell Architecture: An in-depth Architectural Analysis
di: Jarmusch, Aaron, et al.
Pubblicazione: (2025)
di: Jarmusch, Aaron, et al.
Pubblicazione: (2025)
Scheduling Techniques of AI Models on Modern Heterogeneous Edge GPU -- A Critical Review
di: Majeed, Ashiyana Abdul, et al.
Pubblicazione: (2025)
di: Majeed, Ashiyana Abdul, et al.
Pubblicazione: (2025)
Characterizing CPU-Induced Slowdowns in Multi-GPU LLM Inference
di: Chung, Euijun, et al.
Pubblicazione: (2026)
di: Chung, Euijun, et al.
Pubblicazione: (2026)
Application Experiences on a GPU-Accelerated Arm-based HPC Testbed
di: Elwasif, Wael, et al.
Pubblicazione: (2022)
di: Elwasif, Wael, et al.
Pubblicazione: (2022)
Multi-Partner Project: Multi-GPU Performance Portability Analysis for CFD Simulations at Scale
di: Eleftherakis, Panagiotis-Eleftherios, et al.
Pubblicazione: (2026)
di: Eleftherakis, Panagiotis-Eleftherios, et al.
Pubblicazione: (2026)
ODIN-Based CPU-GPU Architecture with Replay-Driven Simulation and Emulation
di: Dorairaj, Nij, et al.
Pubblicazione: (2026)
di: Dorairaj, Nij, et al.
Pubblicazione: (2026)
iHAC: A Hybrid Cluster Architecture for Enhanced Performance and Resilience
di: Muntaka, Siddique Abubakr, et al.
Pubblicazione: (2026)
di: Muntaka, Siddique Abubakr, et al.
Pubblicazione: (2026)
Sparse MTTKRP Acceleration for Tensor Decomposition on GPU
di: Wijeratne, Sasindu, et al.
Pubblicazione: (2024)
di: Wijeratne, Sasindu, et al.
Pubblicazione: (2024)
HetGPU: The pursuit of making binary compatibility towards GPUs
di: Yang, Yiwei, et al.
Pubblicazione: (2025)
di: Yang, Yiwei, et al.
Pubblicazione: (2025)
Optimizing ML Concurrent Computation and Communication with GPU DMA Engines
di: Agrawal, Anirudha, et al.
Pubblicazione: (2024)
di: Agrawal, Anirudha, et al.
Pubblicazione: (2024)
A Modern Primer on Processing in Memory
di: Mutlu, Onur, et al.
Pubblicazione: (2020)
di: Mutlu, Onur, et al.
Pubblicazione: (2020)
Analyzing Reverse Address Translation Overheads in Multi-GPU Scale-Up Pods
di: Fatima, Amel, et al.
Pubblicazione: (2026)
di: Fatima, Amel, et al.
Pubblicazione: (2026)
FinGraV: Methodology for Fine-Grain GPU Power Visibility and Insights
di: Singhania, Varsha, et al.
Pubblicazione: (2024)
di: Singhania, Varsha, et al.
Pubblicazione: (2024)
Towards Compute-Aware In-Switch Computing for LLMs Tensor-Parallelism on Multi-GPU Systems
di: Zhang, Chen, et al.
Pubblicazione: (2026)
di: Zhang, Chen, et al.
Pubblicazione: (2026)
Fine-Grained Power and Energy Attribution on AMD GPU/APU-Based Exascale Nodes
di: McDaniel, Adam, et al.
Pubblicazione: (2026)
di: McDaniel, Adam, et al.
Pubblicazione: (2026)
An Evaluation and Comparison of GPU Hardware and Solver Libraries for Accelerating the OPM Flow Reservoir Simulator
di: Qiu, Tong Dong, et al.
Pubblicazione: (2023)
di: Qiu, Tong Dong, et al.
Pubblicazione: (2023)
Improving Multi-Instance GPU Efficiency via Sub-Entry Sharing TLB Design
di: Li, Bingyao, et al.
Pubblicazione: (2024)
di: Li, Bingyao, et al.
Pubblicazione: (2024)
A Heterogeneous Chiplet Architecture for Accelerating End-to-End Transformer Models
di: Sharma, Harsh, et al.
Pubblicazione: (2023)
di: Sharma, Harsh, et al.
Pubblicazione: (2023)
New Tools, Programming Models, and System Support for Processing-in-Memory Architectures
di: Oliveira, Geraldo F.
Pubblicazione: (2025)
di: Oliveira, Geraldo F.
Pubblicazione: (2025)
Chopper: A Multi-Level GPU Characterization Tool & Derived Insights Into LLM Training Inefficiency
di: Kurzynski, Marco, et al.
Pubblicazione: (2025)
di: Kurzynski, Marco, et al.
Pubblicazione: (2025)
SwarmIO: Towards 100 Million IOPS SSD Emulation for Next-generation GPU-centric Storage Systems
di: Kim, Hyeseong, et al.
Pubblicazione: (2026)
di: Kim, Hyeseong, et al.
Pubblicazione: (2026)
Evaluation of computational and energy performance in matrix multiplication algorithms on CPU and GPU using MKL, cuBLAS and SYCL
di: Torres, L. A., et al.
Pubblicazione: (2024)
di: Torres, L. A., et al.
Pubblicazione: (2024)
General-Purpose Multicore Architectures
di: Ghose, Saugata
Pubblicazione: (2024)
di: Ghose, Saugata
Pubblicazione: (2024)
Dynamic Simultaneous Multithreaded Architecture
di: Ortiz-Arroyo, Daniel, et al.
Pubblicazione: (2024)
di: Ortiz-Arroyo, Daniel, et al.
Pubblicazione: (2024)
DeFiNES: Enabling Fast Exploration of the Depth-first Scheduling Space for DNN Accelerators through Analytical Modeling
di: Mei, Linyan, et al.
Pubblicazione: (2022)
di: Mei, Linyan, et al.
Pubblicazione: (2022)
MoE-Hub: Taming Software Complexity for Seamless MoE Overlap with Hardware-Accelerated Communication on Multi-GPU Systems
di: Zhou, Zhuoshan, et al.
Pubblicazione: (2026)
di: Zhou, Zhuoshan, et al.
Pubblicazione: (2026)
PIUMA: Programmable Integrated Unified Memory Architecture
di: Aananthakrishnan, Sriram, et al.
Pubblicazione: (2020)
di: Aananthakrishnan, Sriram, et al.
Pubblicazione: (2020)
UniFormer: Unified and Efficient Transformer for Reasoning Across General and Custom Computing
di: Ran, Zhuoheng, et al.
Pubblicazione: (2025)
di: Ran, Zhuoheng, et al.
Pubblicazione: (2025)
GigaAPI for GPU Parallelization
di: Suvarna, M., et al.
Pubblicazione: (2025)
di: Suvarna, M., et al.
Pubblicazione: (2025)
SpArch: Efficient Architecture for Sparse Matrix Multiplication
di: Zhang, Zhekai, et al.
Pubblicazione: (2020)
di: Zhang, Zhekai, et al.
Pubblicazione: (2020)
Efficient Architecture for RISC-V Vector Memory Access
di: Guan, Hongyi, et al.
Pubblicazione: (2025)
di: Guan, Hongyi, et al.
Pubblicazione: (2025)
FpgaHub: Fpga-centric Hyper-heterogeneous Computing Platform for Big Data Analytics
di: Wang, Zeke, et al.
Pubblicazione: (2025)
di: Wang, Zeke, et al.
Pubblicazione: (2025)
PAM: Processing Across Memory Hierarchy for Efficient KV-centric LLM Serving System
di: Liu, Lian, et al.
Pubblicazione: (2026)
di: Liu, Lian, et al.
Pubblicazione: (2026)
Navigating the Landscape of Distributed File Systems: Architectures, Implementations, and Considerations
di: Pan, Xueting, et al.
Pubblicazione: (2024)
di: Pan, Xueting, et al.
Pubblicazione: (2024)
Parallelizing a modern GPU simulator
di: Huerta, Rodrigo, et al.
Pubblicazione: (2025)
di: Huerta, Rodrigo, et al.
Pubblicazione: (2025)
DCRA: A Distributed Chiplet-based Reconfigurable Architecture for Irregular Applications
di: Orenes-Vera, Marcelo, et al.
Pubblicazione: (2023)
di: Orenes-Vera, Marcelo, et al.
Pubblicazione: (2023)
How Fast Can Graph Computations Go on Fine-grained Parallel Architectures
di: Wang, Yuqing, et al.
Pubblicazione: (2025)
di: Wang, Yuqing, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Execution-Centric Characterization of FP8 Matrix Cores, Asynchronous Execution, and Structured Sparsity on AMD MI300A
di: Jarmusch, Aaron, et al.
Pubblicazione: (2026) -
Dissecting the NVIDIA Blackwell Architecture with Microbenchmarks
di: Jarmusch, Aaron, et al.
Pubblicazione: (2025) -
Dissecting the NVIDIA Hopper Architecture through Microbenchmarking and Multiple Level Analysis
di: Luo, Weile, et al.
Pubblicazione: (2025) -
Microbenchmarking NVIDIA's Blackwell Architecture: An in-depth Architectural Analysis
di: Jarmusch, Aaron, et al.
Pubblicazione: (2025) -
Scheduling Techniques of AI Models on Modern Heterogeneous Edge GPU -- A Critical Review
di: Majeed, Ashiyana Abdul, et al.
Pubblicazione: (2025)