LEO: Tracing GPU Stall Root Causes via Cross-Vendor Backward Slicing
Fuente:
arXiv
Salvato in:
| Autori principali: | Xia, Yuning, Mellor-Crummey, John |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Characterizing WebGPU Dispatch Overhead for LLM Inference Across Four GPU Vendors, Three Backends, and Three Browsers
di: Maczan, Jędrzej
Pubblicazione: (2026)
di: Maczan, Jędrzej
Pubblicazione: (2026)
Towards Portability at Scale: A Cross-Architecture Performance Evaluation of a GPU-enabled Shallow Water Solver
di: Villalobos, Johansell, et al.
Pubblicazione: (2025)
di: Villalobos, Johansell, et al.
Pubblicazione: (2025)
HybridGen: Efficient LLM Generative Inference via CPU-GPU Hybrid Computing
di: Lin, Mao, et al.
Pubblicazione: (2026)
di: Lin, Mao, et al.
Pubblicazione: (2026)
Arkade: k-Nearest Neighbor Search With Non-Euclidean Distances using GPU Ray Tracing
di: Mandarapu, Durga, et al.
Pubblicazione: (2023)
di: Mandarapu, Durga, et al.
Pubblicazione: (2023)
A Portable Framework for Accelerating Stencil Computations on Modern Node Architectures
di: Sai, Ryuichi, et al.
Pubblicazione: (2023)
di: Sai, Ryuichi, et al.
Pubblicazione: (2023)
The Energy Cost of Execution-Idle in GPU Clusters
di: Lei, Yiran, et al.
Pubblicazione: (2026)
di: Lei, Yiran, et al.
Pubblicazione: (2026)
Scalable GPU Performance Variability Analysis framework
di: Lahiry, Ankur, et al.
Pubblicazione: (2025)
di: Lahiry, Ankur, et al.
Pubblicazione: (2025)
On the Partitioning of GPU Power among Multi-Instances
di: Vamja, Tirth, et al.
Pubblicazione: (2025)
di: Vamja, Tirth, et al.
Pubblicazione: (2025)
Disaggregated Design for GPU-Based Volumetric Data Structures
di: Meneghin, Massimiliano, et al.
Pubblicazione: (2025)
di: Meneghin, Massimiliano, et al.
Pubblicazione: (2025)
Taking GPU Programming Models to Task for Performance Portability
di: Davis, Joshua H., et al.
Pubblicazione: (2024)
di: Davis, Joshua H., et al.
Pubblicazione: (2024)
KEET: Explaining Performance of GPU Kernels Using LLM Agents
di: Davis, Joshua H., et al.
Pubblicazione: (2026)
di: Davis, Joshua H., et al.
Pubblicazione: (2026)
Profiling and optimization of multi-card GPU machine learning jobs
di: Lawenda, Marcin, et al.
Pubblicazione: (2025)
di: Lawenda, Marcin, et al.
Pubblicazione: (2025)
CUTHERMO: Understanding GPU Memory Inefficiencies with Heat Map Profiling
di: Zhao, Yanbo, et al.
Pubblicazione: (2025)
di: Zhao, Yanbo, et al.
Pubblicazione: (2025)
THAPI: Tracing Heterogeneous APIs
di: Bekele, Solomon, et al.
Pubblicazione: (2025)
di: Bekele, Solomon, et al.
Pubblicazione: (2025)
High-Performance Portable GPU Primitives for Arbitrary Types and Operators in Julia
di: Pilliat, Emmanuel
Pubblicazione: (2026)
di: Pilliat, Emmanuel
Pubblicazione: (2026)
Efficient allocation of image recognition and LLM tasks on multi-GPU system
di: Lawenda, Marcin, et al.
Pubblicazione: (2025)
di: Lawenda, Marcin, et al.
Pubblicazione: (2025)
Data-Driven Analysis to Understand GPU Hardware Resource Usage of Optimizations
di: Islam, Tanzima Z., et al.
Pubblicazione: (2024)
di: Islam, Tanzima Z., et al.
Pubblicazione: (2024)
An Online Probabilistic Distributed Tracing System
di: Toslali, M., et al.
Pubblicazione: (2024)
di: Toslali, M., et al.
Pubblicazione: (2024)
Minos: Systematically Classifying Performance and Power Characteristics of GPU Workloads on HPC Clusters
di: Jain, Rutwik, et al.
Pubblicazione: (2026)
di: Jain, Rutwik, et al.
Pubblicazione: (2026)
Efficient GPU-Centered Singular Value Decomposition Using the Divide-and-Conquer Method
di: Liu, Shifang, et al.
Pubblicazione: (2025)
di: Liu, Shifang, et al.
Pubblicazione: (2025)
Unleashing the Power of Preemptive Priority-based Scheduling for Real-Time GPU Tasks
di: Wang, Yidi, et al.
Pubblicazione: (2024)
di: Wang, Yidi, et al.
Pubblicazione: (2024)
Dissecting CPU-GPU Unified Physical Memory on AMD MI300A APUs
di: Wahlgren, Jacob, et al.
Pubblicazione: (2025)
di: Wahlgren, Jacob, et al.
Pubblicazione: (2025)
Fast and Scalable Mixed Precision Euclidean Distance Calculations Using GPU Tensor Cores
di: Curless, Brian, et al.
Pubblicazione: (2025)
di: Curless, Brian, et al.
Pubblicazione: (2025)
Recorder: Comprehensive Parallel I/O Tracing and Analysis
di: Wang, Chen, et al.
Pubblicazione: (2025)
di: Wang, Chen, et al.
Pubblicazione: (2025)
Node Compass: Multilevel Tracing and Debugging of Request Executions in JavaScript-Based Web-Servers
di: Kabamba, Herve Mbikayi, et al.
Pubblicazione: (2023)
di: Kabamba, Herve Mbikayi, et al.
Pubblicazione: (2023)
Matryoshka: Optimization of Dynamic Diverse Quantum Chemistry Systems via Elastic Parallelism Transformation
di: Wang, Tuowei, et al.
Pubblicazione: (2024)
di: Wang, Tuowei, et al.
Pubblicazione: (2024)
AcceleratedKernels.jl: Cross-Architecture Parallel Algorithms from a Unified, Transpiled Codebase
di: Nicusan, Andrei-Leonard, et al.
Pubblicazione: (2025)
di: Nicusan, Andrei-Leonard, et al.
Pubblicazione: (2025)
The Landscape of GPU-Centric Communication
di: Unat, Didem, et al.
Pubblicazione: (2024)
di: Unat, Didem, et al.
Pubblicazione: (2024)
GigaAPI for GPU Parallelization
di: Suvarna, M., et al.
Pubblicazione: (2025)
di: Suvarna, M., et al.
Pubblicazione: (2025)
Towards Universal Performance Modeling for Machine Learning Training on Multi-GPU Platforms
di: Lin, Zhongyi, et al.
Pubblicazione: (2024)
di: Lin, Zhongyi, et al.
Pubblicazione: (2024)
Parallelizing a modern GPU simulator
di: Huerta, Rodrigo, et al.
Pubblicazione: (2025)
di: Huerta, Rodrigo, et al.
Pubblicazione: (2025)
Redesigning GROMACS Halo Exchange: Improving Strong Scaling with GPU-initiated NVSHMEM
di: Doijade, Mahesh, et al.
Pubblicazione: (2025)
di: Doijade, Mahesh, et al.
Pubblicazione: (2025)
A Pilot Study on Tunable Precision Emulation via Automatic BLAS Offloading
di: Liu, Hang, et al.
Pubblicazione: (2025)
di: Liu, Hang, et al.
Pubblicazione: (2025)
GPUVM: GPU-driven Unified Virtual Memory
di: Nazaraliyev, Nurlan, et al.
Pubblicazione: (2024)
di: Nazaraliyev, Nurlan, et al.
Pubblicazione: (2024)
"Two-Stagification": Job Dispatching in Large-Scale Clusters via a Two-Stage Architecture
di: Yildiz, Mert, et al.
Pubblicazione: (2025)
di: Yildiz, Mert, et al.
Pubblicazione: (2025)
THEAS: Efficient Power Management in Multi-Core CPUs via Cache-Aware Resource Scheduling
di: Muhammad, Said, et al.
Pubblicazione: (2025)
di: Muhammad, Said, et al.
Pubblicazione: (2025)
A Precision Emulation Approach to the GPU Acceleration of Ab Initio Electronic Structure Calculations
di: Liu, Hang, et al.
Pubblicazione: (2026)
di: Liu, Hang, et al.
Pubblicazione: (2026)
DIAL: Decentralized I/O AutoTuning via Learned Client-side Local Metrics for Parallel File System
di: Rashid, Md Hasanur, et al.
Pubblicazione: (2026)
di: Rashid, Md Hasanur, et al.
Pubblicazione: (2026)
Comparison of Vectorization Capabilities of Different Compilers for X86 and ARM CPUs
di: Sakib, Nazmus, et al.
Pubblicazione: (2025)
di: Sakib, Nazmus, et al.
Pubblicazione: (2025)
GPU Cluster Scheduling for Network-Sensitive Deep Learning
di: Sharma, Aakash, et al.
Pubblicazione: (2024)
di: Sharma, Aakash, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Characterizing WebGPU Dispatch Overhead for LLM Inference Across Four GPU Vendors, Three Backends, and Three Browsers
di: Maczan, Jędrzej
Pubblicazione: (2026) -
Towards Portability at Scale: A Cross-Architecture Performance Evaluation of a GPU-enabled Shallow Water Solver
di: Villalobos, Johansell, et al.
Pubblicazione: (2025) -
HybridGen: Efficient LLM Generative Inference via CPU-GPU Hybrid Computing
di: Lin, Mao, et al.
Pubblicazione: (2026) -
Arkade: k-Nearest Neighbor Search With Non-Euclidean Distances using GPU Ray Tracing
di: Mandarapu, Durga, et al.
Pubblicazione: (2023) -
A Portable Framework for Accelerating Stencil Computations on Modern Node Architectures
di: Sai, Ryuichi, et al.
Pubblicazione: (2023)