DSO: A GPU Energy Efficiency Optimizer by Fusing Dynamic and Static Information
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Qiang, Li, Laiyi, Luo, Weile, Zhang, Yijia, Wang, Bingqiang |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
FlipFlop: A Static Analysis-based Energy Optimization Framework for GPU Kernels
par: Rajput, Saurabhsingh, et autres
Publié: (2026)
par: Rajput, Saurabhsingh, et autres
Publié: (2026)
Automating Energy-Efficient GPU Kernel Generation: A Fast Search-Based Compilation Approach
par: Zhang, Yijia, et autres
Publié: (2024)
par: Zhang, Yijia, et autres
Publié: (2024)
AGIPC: Adaptive In-Solve Algebraic Coarsening for GPU IPC
par: Wang, Xuan, et autres
Publié: (2026)
par: Wang, Xuan, et autres
Publié: (2026)
Dissecting the NVIDIA Hopper Architecture through Microbenchmarking and Multiple Level Analysis
par: Luo, Weile, et autres
Publié: (2025)
par: Luo, Weile, et autres
Publié: (2025)
ZipServ: Fast and Memory-Efficient LLM Inference with Hardware-Aware Lossless Compression
par: Fan, Ruibo, et autres
Publié: (2026)
par: Fan, Ruibo, et autres
Publié: (2026)
Energy Efficiency Analysis of Active RIS-enhanced Wireless Network under Power-Sum Constraint
par: Xin, Jingdie, et autres
Publié: (2025)
par: Xin, Jingdie, et autres
Publié: (2025)
On Combining Two Server Control Policies for Energy Efficiency
par: Dai, Jingze, et autres
Publié: (2025)
par: Dai, Jingze, et autres
Publié: (2025)
KernelBenchX: A Comprehensive Benchmark for Evaluating LLM-Generated GPU Kernels
par: Wang, Han, et autres
Publié: (2026)
par: Wang, Han, et autres
Publié: (2026)
Insum: Sparse GPU Kernels Simplified and Optimized with Indirect Einsums
par: Won, Jaeyeon, et autres
Publié: (2025)
par: Won, Jaeyeon, et autres
Publié: (2025)
The Energy Cost of Execution-Idle in GPU Clusters
par: Lei, Yiran, et autres
Publié: (2026)
par: Lei, Yiran, et autres
Publié: (2026)
GCL-Sampler: Discovering Kernel Similarity for Sampled GPU Simulation via Graph Contrastive Learning
par: Wang, Jiaqi, et autres
Publié: (2026)
par: Wang, Jiaqi, et autres
Publié: (2026)
Static Reuse Profile Estimation for Array Applications
par: Razzak, Abdur, et autres
Publié: (2024)
par: Razzak, Abdur, et autres
Publié: (2024)
Static Estimation of Reuse Profiles for Arrays in Nested Loops
par: Razzak, Abdur, et autres
Publié: (2025)
par: Razzak, Abdur, et autres
Publié: (2025)
AMD MI300X GPU Performance Analysis
par: Ambati, Chandrish, et autres
Publié: (2025)
par: Ambati, Chandrish, et autres
Publié: (2025)
PipeWeave: Synergizing Analytical and Learning Models for Unified GPU Performance Prediction
par: Zhang, Kaixuan, et autres
Publié: (2026)
par: Zhang, Kaixuan, et autres
Publié: (2026)
Two-Timescale Dynamic Service Deployment and Task Scheduling with Spatiotemporal Collaboration in Mobile Edge Networks
par: Li, Yang, et autres
Publié: (2025)
par: Li, Yang, et autres
Publié: (2025)
AutoKernel: Autonomous GPU Kernel Optimization via Iterative Agent-Driven Search
par: Jaber, Jaber, et autres
Publié: (2026)
par: Jaber, Jaber, et autres
Publié: (2026)
It's Not Easy Being Green: On the Energy Efficiency of Programming Languages
par: van Kempen, Nicolas, et autres
Publié: (2024)
par: van Kempen, Nicolas, et autres
Publié: (2024)
WaveTune: Wave-aware Bilinear Modeling for Efficient GPU Kernel Auto-tuning
par: Zhang, Kaixuan, et autres
Publié: (2026)
par: Zhang, Kaixuan, et autres
Publié: (2026)
gDist: Efficient Distance Computation between 3D Meshes on GPU
par: Fang, Peng, et autres
Publié: (2024)
par: Fang, Peng, et autres
Publié: (2024)
StiffGIPC: Advancing GPU IPC for stiff affine-deformable simulation
par: Huang, Kemeng, et autres
Publié: (2024)
par: Huang, Kemeng, et autres
Publié: (2024)
ZO2: Scalable Zeroth-Order Fine-Tuning for Extremely Large Language Models with Limited GPU Memory
par: Wang, Liangyu, et autres
Publié: (2025)
par: Wang, Liangyu, et autres
Publié: (2025)
How to Increase Energy Efficiency with a Single Linux Command
par: Jelvani, Alborz, et autres
Publié: (2025)
par: Jelvani, Alborz, et autres
Publié: (2025)
SweetSpot: An Analytical Model for Predicting Energy Efficiency of LLM Inference
par: Cavagna, Hiari Pizzini, et autres
Publié: (2026)
par: Cavagna, Hiari Pizzini, et autres
Publié: (2026)
Data-Driven Analysis to Understand GPU Hardware Resource Usage of Optimizations
par: Islam, Tanzima Z., et autres
Publié: (2024)
par: Islam, Tanzima Z., et autres
Publié: (2024)
Revealing NVIDIA Closed-Source Driver Command Streams for CPU-GPU Runtime Behavior Insight
par: Yan, Yuang, et autres
Publié: (2026)
par: Yan, Yuang, et autres
Publié: (2026)
Benchmark-based Study of CPU/GPU Power-Related Features through JAX and TensorFlow
par: Tchakoute, Roblex Nana, et autres
Publié: (2025)
par: Tchakoute, Roblex Nana, et autres
Publié: (2025)
Optimizing Winograd Convolution on ARMv8 processors
par: Gui, Haoyuan, et autres
Publié: (2024)
par: Gui, Haoyuan, et autres
Publié: (2024)
HD-MoE: Hybrid and Dynamic Parallelism for Mixture-of-Expert LLMs with 3D Near-Memory Processing
par: Huang, Haochen, et autres
Publié: (2025)
par: Huang, Haochen, et autres
Publié: (2025)
Pattern Tree: Enhancing Efficiency in Quantum Circuit Optimization Based on Pattern-matching
par: Chen, Mingyu, et autres
Publié: (2024)
par: Chen, Mingyu, et autres
Publié: (2024)
GreenLLM: SLO-Aware Dynamic Frequency Scaling for Energy-Efficient LLM Serving
par: Liu, Qunyou, et autres
Publié: (2025)
par: Liu, Qunyou, et autres
Publié: (2025)
cuTeSpMM: Accelerating Sparse-Dense Matrix Multiplication using GPU Tensor Cores
par: Xiang, Lizhi, et autres
Publié: (2025)
par: Xiang, Lizhi, et autres
Publié: (2025)
HybridGen: Efficient LLM Generative Inference via CPU-GPU Hybrid Computing
par: Lin, Mao, et autres
Publié: (2026)
par: Lin, Mao, et autres
Publié: (2026)
A Precision Emulation Approach to the GPU Acceleration of Ab Initio Electronic Structure Calculations
par: Liu, Hang, et autres
Publié: (2026)
par: Liu, Hang, et autres
Publié: (2026)
An Efficient Hybrid Sparse Attention with CPU-GPU Parallelism for Long-Context Inference
par: Yao, Feiyu, et autres
Publié: (2026)
par: Yao, Feiyu, et autres
Publié: (2026)
Greener Deep Reinforcement Learning: Analysis of Energy and Carbon Efficiency Across Atari Benchmarks
par: Gardner, Jason, et autres
Publié: (2025)
par: Gardner, Jason, et autres
Publié: (2025)
Systematic Performance Evaluation Framework for LEO Mega-Constellation Satellite Networks
par: Wang, Yu, et autres
Publié: (2024)
par: Wang, Yu, et autres
Publié: (2024)
From 8 Seconds to 370ms: Kernel-Fused SAR Imaging on Apple Silicon via Single-Dispatch FFT Pipelines
par: Bergach, Mohamed Amine
Publié: (2026)
par: Bergach, Mohamed Amine
Publié: (2026)
GPU-Accelerated Parallel Selected Inversion for Structured Matrices Using sTiles
par: Fattah, Esmail Abdul, et autres
Publié: (2025)
par: Fattah, Esmail Abdul, et autres
Publié: (2025)
Forecasting GPU Performance for Deep Learning Training and Inference
par: Lee, Seonho, et autres
Publié: (2024)
par: Lee, Seonho, et autres
Publié: (2024)
Documents similaires
-
FlipFlop: A Static Analysis-based Energy Optimization Framework for GPU Kernels
par: Rajput, Saurabhsingh, et autres
Publié: (2026) -
Automating Energy-Efficient GPU Kernel Generation: A Fast Search-Based Compilation Approach
par: Zhang, Yijia, et autres
Publié: (2024) -
AGIPC: Adaptive In-Solve Algebraic Coarsening for GPU IPC
par: Wang, Xuan, et autres
Publié: (2026) -
Dissecting the NVIDIA Hopper Architecture through Microbenchmarking and Multiple Level Analysis
par: Luo, Weile, et autres
Publié: (2025) -
ZipServ: Fast and Memory-Efficient LLM Inference with Hardware-Aware Lossless Compression
par: Fan, Ruibo, et autres
Publié: (2026)