Power- and Fragmentation-aware Online Scheduling for GPU Datacenters
Fuente:
arXiv
Salvato in:
| Autori principali: | Lettich, Francesco, Carlini, Emanuele, Nardini, Franco Maria, Perego, Raffaele, Trani, Salvatore |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Exact Nearest-Neighbor Search on Energy-Efficient FPGA Devices
di: Dazzi, Patrizio, et al.
Pubblicazione: (2025)
di: Dazzi, Patrizio, et al.
Pubblicazione: (2025)
Reducing Fragmentation and Starvation in GPU Clusters through Dynamic Multi-Objective Scheduling
di: Mamirov, Akhmadillo
Pubblicazione: (2025)
di: Mamirov, Akhmadillo
Pubblicazione: (2025)
Designing Datacenter Power Delivery Hierarchies for the AI Era
di: Wilkins, Grant, et al.
Pubblicazione: (2026)
di: Wilkins, Grant, et al.
Pubblicazione: (2026)
Power Stabilization for AI Training Datacenters
di: Choukse, Esha, et al.
Pubblicazione: (2025)
di: Choukse, Esha, et al.
Pubblicazione: (2025)
Trade-offs in Decentralized Agentic AI Discovery Across the Compute Continuum
di: Dazzi, Patrizio, et al.
Pubblicazione: (2026)
di: Dazzi, Patrizio, et al.
Pubblicazione: (2026)
An Online Fragmentation-Aware Scheduler for Managing GPU-Sharing Workloads on Multi-Instance GPUs
di: Ting, Hsu-Tzu, et al.
Pubblicazione: (2025)
di: Ting, Hsu-Tzu, et al.
Pubblicazione: (2025)
Topology-aware Preemptive Scheduling for Co-located LLM Workloads
di: Zhang, Ping, et al.
Pubblicazione: (2024)
di: Zhang, Ping, et al.
Pubblicazione: (2024)
Sustainable Carbon-Aware and Water-Efficient LLM Scheduling in Geo-Distributed Cloud Datacenters
di: Moore, Hayden, et al.
Pubblicazione: (2025)
di: Moore, Hayden, et al.
Pubblicazione: (2025)
A Scheduling Framework for Efficient MoE Inference on Edge GPU-NDP Systems
di: Wu, Qi, et al.
Pubblicazione: (2026)
di: Wu, Qi, et al.
Pubblicazione: (2026)
TCM-Serve: Modality-aware Scheduling for Multimodal Large Language Model Inference
di: Papaioannou, Konstantinos, et al.
Pubblicazione: (2026)
di: Papaioannou, Konstantinos, et al.
Pubblicazione: (2026)
SparOA: Sparse and Operator-aware Hybrid Scheduling for Edge DNN Inference
di: Zhang, Ziyang, et al.
Pubblicazione: (2025)
di: Zhang, Ziyang, et al.
Pubblicazione: (2025)
Xe-Forge: Multi-Stage LLM-Powered Kernel Optimization for Intel GPU
di: Spoczynski, Marcin, et al.
Pubblicazione: (2026)
di: Spoczynski, Marcin, et al.
Pubblicazione: (2026)
TAPAS: Thermal- and Power-Aware Scheduling for LLM Inference in Cloud Platforms
di: Stojkovic, Jovan, et al.
Pubblicazione: (2025)
di: Stojkovic, Jovan, et al.
Pubblicazione: (2025)
Usable Agent Discovery for Decentralized AI Systems
di: Dazzi, Patrizio, et al.
Pubblicazione: (2026)
di: Dazzi, Patrizio, et al.
Pubblicazione: (2026)
Datacenter Energy Optimized Power Profiles
di: Narayanaswamy, Sreedhar, et al.
Pubblicazione: (2025)
di: Narayanaswamy, Sreedhar, et al.
Pubblicazione: (2025)
LeMix: Unified Scheduling for LLM Training and Inference on Multi-GPU Systems
di: Li, Yufei, et al.
Pubblicazione: (2025)
di: Li, Yufei, et al.
Pubblicazione: (2025)
GPU-Virt-Bench: A Comprehensive Benchmarking Framework for Software-Based GPU Virtualization Systems
di: VG, Jithin, et al.
Pubblicazione: (2025)
di: VG, Jithin, et al.
Pubblicazione: (2025)
Boosting Asynchronous Decentralized Learning with Model Fragmentation
di: Biswas, Sayan, et al.
Pubblicazione: (2024)
di: Biswas, Sayan, et al.
Pubblicazione: (2024)
CrossPipe: Towards Optimal Pipeline Schedules for Cross-Datacenter Training
di: Chen, Tiancheng, et al.
Pubblicazione: (2025)
di: Chen, Tiancheng, et al.
Pubblicazione: (2025)
Mixture-of-Schedulers: An Adaptive Scheduling Agent as a Learned Router for Expert Policies
di: Wang, Xinbo, et al.
Pubblicazione: (2025)
di: Wang, Xinbo, et al.
Pubblicazione: (2025)
Rearchitecting Datacenter Lifecycle for AI: A TCO-Driven Framework
di: Stojkovic, Jovan, et al.
Pubblicazione: (2025)
di: Stojkovic, Jovan, et al.
Pubblicazione: (2025)
Duration-Informed Workload Scheduler
di: Loreti, Daniela, et al.
Pubblicazione: (2026)
di: Loreti, Daniela, et al.
Pubblicazione: (2026)
UCCL-Zip: Lossless Compression Supercharged GPU Communication
di: Ma, Shuang, et al.
Pubblicazione: (2026)
di: Ma, Shuang, et al.
Pubblicazione: (2026)
MSCCL++: Rethinking GPU Communication Abstractions for AI Inference
di: Hwang, Changho, et al.
Pubblicazione: (2025)
di: Hwang, Changho, et al.
Pubblicazione: (2025)
Workload Schedulers -- Genesis, Algorithms and Differences
di: Sliwko, Leszek, et al.
Pubblicazione: (2025)
di: Sliwko, Leszek, et al.
Pubblicazione: (2025)
Beyond the GPU: The Strategic Role of FPGAs in the Next Wave of AI
di: Jiménez, Arturo Urías
Pubblicazione: (2025)
di: Jiménez, Arturo Urías
Pubblicazione: (2025)
Hybrid Learning and Optimization-Based Dynamic Scheduling for DL Workloads on Heterogeneous GPU Clusters
di: Dongare, Shruti, et al.
Pubblicazione: (2025)
di: Dongare, Shruti, et al.
Pubblicazione: (2025)
An Online Fragmentation-Aware GPU Scheduler for Multi-Tenant MIG-based Clouds
di: Zambianco, Marco, et al.
Pubblicazione: (2025)
di: Zambianco, Marco, et al.
Pubblicazione: (2025)
Towards Scalable GPU-Accelerated SNN Training via Temporal Fusion
di: Li, Yanchen, et al.
Pubblicazione: (2024)
di: Li, Yanchen, et al.
Pubblicazione: (2024)
Accelerating Large Language Model Training with Hybrid GPU-based Compression
di: Xu, Lang, et al.
Pubblicazione: (2024)
di: Xu, Lang, et al.
Pubblicazione: (2024)
SwizzlePerf: Hardware-Aware LLMs for GPU Kernel Performance Optimization
di: Tschand, Arya, et al.
Pubblicazione: (2025)
di: Tschand, Arya, et al.
Pubblicazione: (2025)
An Efficient Heterogeneous Co-Design for Fine-Tuning on a Single GPU
di: Yang, Ruijia, et al.
Pubblicazione: (2026)
di: Yang, Ruijia, et al.
Pubblicazione: (2026)
PowerTrip: Exploiting Federated Heterogeneous Datacenter Power for Distributed ML Training
di: Mehboob, Talha, et al.
Pubblicazione: (2025)
di: Mehboob, Talha, et al.
Pubblicazione: (2025)
Speeding up Local Optimization in Vehicle Routing with Tensor-based GPU Acceleration
di: Lei, Zhenyu, et al.
Pubblicazione: (2025)
di: Lei, Zhenyu, et al.
Pubblicazione: (2025)
Accurate GPU Memory Prediction for Deep Learning Jobs through Dynamic Analysis
di: Shi, Jiabo, et al.
Pubblicazione: (2025)
di: Shi, Jiabo, et al.
Pubblicazione: (2025)
Dynamic Scheduling Strategies for Resource Optimization in Computing Environments
di: Wang, Xiaoye
Pubblicazione: (2024)
di: Wang, Xiaoye
Pubblicazione: (2024)
Taming Asynchronous CPU-GPU Coupling for Frequency-aware Latency Estimation on Mobile Edge
di: Chen, Jiesong, et al.
Pubblicazione: (2026)
di: Chen, Jiesong, et al.
Pubblicazione: (2026)
Sustainable Supercomputing for AI: GPU Power Capping at HPC Scale
di: Zhao, Dan, et al.
Pubblicazione: (2024)
di: Zhao, Dan, et al.
Pubblicazione: (2024)
Practical offloading for fine-tuning LLM on commodity GPU via learned sparse projectors
di: Chen, Siyuan, et al.
Pubblicazione: (2024)
di: Chen, Siyuan, et al.
Pubblicazione: (2024)
Accelerated Digital Twin Learning for Edge AI: A Comparison of FPGA and Mobile GPU
di: Xu, Bin, et al.
Pubblicazione: (2025)
di: Xu, Bin, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Exact Nearest-Neighbor Search on Energy-Efficient FPGA Devices
di: Dazzi, Patrizio, et al.
Pubblicazione: (2025) -
Reducing Fragmentation and Starvation in GPU Clusters through Dynamic Multi-Objective Scheduling
di: Mamirov, Akhmadillo
Pubblicazione: (2025) -
Designing Datacenter Power Delivery Hierarchies for the AI Era
di: Wilkins, Grant, et al.
Pubblicazione: (2026) -
Power Stabilization for AI Training Datacenters
di: Choukse, Esha, et al.
Pubblicazione: (2025) -
Trade-offs in Decentralized Agentic AI Discovery Across the Compute Continuum
di: Dazzi, Patrizio, et al.
Pubblicazione: (2026)