FinGraV: Methodology for Fine-Grain GPU Power Visibility and Insights
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Singhania, Varsha, Aga, Shaizeen, Ibrahim, Mohamed Assem |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Balanced Data Placement for GEMV Acceleration with Processing-In-Memory
par: Ibrahim, Mohamed Assem, et autres
Publié: (2024)
par: Ibrahim, Mohamed Assem, et autres
Publié: (2024)
Chopper: A Multi-Level GPU Characterization Tool & Derived Insights Into LLM Training Inefficiency
par: Kurzynski, Marco, et autres
Publié: (2025)
par: Kurzynski, Marco, et autres
Publié: (2025)
DMA-Latte: Expanding the Reach of DMA Offloads to Latency-bound ML Communication
par: Pati, Suchita, et autres
Publié: (2025)
par: Pati, Suchita, et autres
Publié: (2025)
Optimizing ML Concurrent Computation and Communication with GPU DMA Engines
par: Agrawal, Anirudha, et autres
Publié: (2024)
par: Agrawal, Anirudha, et autres
Publié: (2024)
Lit Silicon: A Case Where Thermal Imbalance Couples Concurrent Execution in Multiple GPUs
par: Kurzynski, Marco, et autres
Publié: (2025)
par: Kurzynski, Marco, et autres
Publié: (2025)
Design Space Exploration of DMA based Finer-Grain Compute Communication Overlap
par: Pal, Shagnik, et autres
Publié: (2025)
par: Pal, Shagnik, et autres
Publié: (2025)
Fine-Grained Power and Energy Attribution on AMD GPU/APU-Based Exascale Nodes
par: McDaniel, Adam, et autres
Publié: (2026)
par: McDaniel, Adam, et autres
Publié: (2026)
Global Optimizations & Lightweight Dynamic Logic for Concurrency
par: Pati, Suchita, et autres
Publié: (2024)
par: Pati, Suchita, et autres
Publié: (2024)
Sparse MTTKRP Acceleration for Tensor Decomposition on GPU
par: Wijeratne, Sasindu, et autres
Publié: (2024)
par: Wijeratne, Sasindu, et autres
Publié: (2024)
Characterizing CPU-Induced Slowdowns in Multi-GPU LLM Inference
par: Chung, Euijun, et autres
Publié: (2026)
par: Chung, Euijun, et autres
Publié: (2026)
HetGPU: The pursuit of making binary compatibility towards GPUs
par: Yang, Yiwei, et autres
Publié: (2025)
par: Yang, Yiwei, et autres
Publié: (2025)
Application Experiences on a GPU-Accelerated Arm-based HPC Testbed
par: Elwasif, Wael, et autres
Publié: (2022)
par: Elwasif, Wael, et autres
Publié: (2022)
Microbenchmark-Driven Analytical Performance Modeling Across Modern GPU Architectures
par: Jarmusch, Aaron, et autres
Publié: (2026)
par: Jarmusch, Aaron, et autres
Publié: (2026)
Analyzing Reverse Address Translation Overheads in Multi-GPU Scale-Up Pods
par: Fatima, Amel, et autres
Publié: (2026)
par: Fatima, Amel, et autres
Publié: (2026)
Improving Multi-Instance GPU Efficiency via Sub-Entry Sharing TLB Design
par: Li, Bingyao, et autres
Publié: (2024)
par: Li, Bingyao, et autres
Publié: (2024)
An Evaluation and Comparison of GPU Hardware and Solver Libraries for Accelerating the OPM Flow Reservoir Simulator
par: Qiu, Tong Dong, et autres
Publié: (2023)
par: Qiu, Tong Dong, et autres
Publié: (2023)
Towards Compute-Aware In-Switch Computing for LLMs Tensor-Parallelism on Multi-GPU Systems
par: Zhang, Chen, et autres
Publié: (2026)
par: Zhang, Chen, et autres
Publié: (2026)
Scheduling Techniques of AI Models on Modern Heterogeneous Edge GPU -- A Critical Review
par: Majeed, Ashiyana Abdul, et autres
Publié: (2025)
par: Majeed, Ashiyana Abdul, et autres
Publié: (2025)
Multi-Partner Project: Multi-GPU Performance Portability Analysis for CFD Simulations at Scale
par: Eleftherakis, Panagiotis-Eleftherios, et autres
Publié: (2026)
par: Eleftherakis, Panagiotis-Eleftherios, et autres
Publié: (2026)
Evaluation of computational and energy performance in matrix multiplication algorithms on CPU and GPU using MKL, cuBLAS and SYCL
par: Torres, L. A., et autres
Publié: (2024)
par: Torres, L. A., et autres
Publié: (2024)
SwarmIO: Towards 100 Million IOPS SSD Emulation for Next-generation GPU-centric Storage Systems
par: Kim, Hyeseong, et autres
Publié: (2026)
par: Kim, Hyeseong, et autres
Publié: (2026)
T3: Transparent Tracking & Triggering for Fine-grained Overlap of Compute & Collectives
par: Pati, Suchita, et autres
Publié: (2024)
par: Pati, Suchita, et autres
Publié: (2024)
MoE-Hub: Taming Software Complexity for Seamless MoE Overlap with Hardware-Accelerated Communication on Multi-GPU Systems
par: Zhou, Zhuoshan, et autres
Publié: (2026)
par: Zhou, Zhuoshan, et autres
Publié: (2026)
Simopt-Power: Leveraging Simulation Metadata for Low-Power Design Synthesis
par: Wadhwa, Eashan, et autres
Publié: (2025)
par: Wadhwa, Eashan, et autres
Publié: (2025)
GigaAPI for GPU Parallelization
par: Suvarna, M., et autres
Publié: (2025)
par: Suvarna, M., et autres
Publié: (2025)
Parallelizing a modern GPU simulator
par: Huerta, Rodrigo, et autres
Publié: (2025)
par: Huerta, Rodrigo, et autres
Publié: (2025)
Sustainable Supercomputing for AI: GPU Power Capping at HPC Scale
par: Zhao, Dan, et autres
Publié: (2024)
par: Zhao, Dan, et autres
Publié: (2024)
How Fast Can Graph Computations Go on Fine-grained Parallel Architectures
par: Wang, Yuqing, et autres
Publié: (2025)
par: Wang, Yuqing, et autres
Publié: (2025)
Part-time Power Measurements: nvidia-smi's Lack of Attention
par: Yang, Zeyu, et autres
Publié: (2023)
par: Yang, Zeyu, et autres
Publié: (2023)
xPUE: Extending Power Usage Effectiveness Metrics for Cloud Infrastructures
par: Fieni, Guillaume, et autres
Publié: (2025)
par: Fieni, Guillaume, et autres
Publié: (2025)
Survey of Disaggregated Memory: Cross-layer Technique Insights for Next-Generation Datacenters
par: Wang, Jing, et autres
Publié: (2025)
par: Wang, Jing, et autres
Publié: (2025)
Deep Learning and Machine Learning with GPGPU and CUDA: Unlocking the Power of Parallel Computing
par: Li, Ming, et autres
Publié: (2024)
par: Li, Ming, et autres
Publié: (2024)
Efficient Architecture for RISC-V Vector Memory Access
par: Guan, Hongyi, et autres
Publié: (2025)
par: Guan, Hongyi, et autres
Publié: (2025)
Context-aware Simopt-Power: Using structural data with simulation metadata to optimise FPGA designs
par: Wadhwa, Eashan, et autres
Publié: (2026)
par: Wadhwa, Eashan, et autres
Publié: (2026)
RISC-V Word-Size Modular Instructions for Residue Number Systems
par: Didier, Laurent-Stéphane, et autres
Publié: (2024)
par: Didier, Laurent-Stéphane, et autres
Publié: (2024)
MemPool Flavors: Between Versatility and Specialization in a RISC-V Manycore Cluster
par: Mazzola, Sergio, et autres
Publié: (2025)
par: Mazzola, Sergio, et autres
Publié: (2025)
On-Package Memory with Universal Chiplet Interconnect Express (UCIe): A Low Power, High Bandwidth, Low Latency and Low Cost Approach
par: Sharma, Debendra Das, et autres
Publié: (2025)
par: Sharma, Debendra Das, et autres
Publié: (2025)
Taming Offload Overheads in a Massively Parallel Open-Source RISC-V MPSoC: Analysis and Optimization
par: Colagrande, Luca, et autres
Publié: (2025)
par: Colagrande, Luca, et autres
Publié: (2025)
Cloud-Native Operation of Roadside Infrastructure Enabling Demand-Driven Collective Perception via V2X
par: Zanger, Lukas, et autres
Publié: (2026)
par: Zanger, Lukas, et autres
Publié: (2026)
TeraPool: A Physical Design Aware, 1024 RISC-V Cores Shared-L1-Memory Scaled-up Cluster Design with High Bandwidth Main Memory Link
par: Zhang, Yichao, et autres
Publié: (2026)
par: Zhang, Yichao, et autres
Publié: (2026)
Documents similaires
-
Balanced Data Placement for GEMV Acceleration with Processing-In-Memory
par: Ibrahim, Mohamed Assem, et autres
Publié: (2024) -
Chopper: A Multi-Level GPU Characterization Tool & Derived Insights Into LLM Training Inefficiency
par: Kurzynski, Marco, et autres
Publié: (2025) -
DMA-Latte: Expanding the Reach of DMA Offloads to Latency-bound ML Communication
par: Pati, Suchita, et autres
Publié: (2025) -
Optimizing ML Concurrent Computation and Communication with GPU DMA Engines
par: Agrawal, Anirudha, et autres
Publié: (2024) -
Lit Silicon: A Case Where Thermal Imbalance Couples Concurrent Execution in Multiple GPUs
par: Kurzynski, Marco, et autres
Publié: (2025)