Prediction-Assisted Online Distributed Deep Learning Workload Scheduling in GPU Clusters
Fuente:
arXiv
Salvato in:
| Autori principali: | Luo, Ziyue, Liu, Jia, Lee, Myungjin, Shroff, Ness B. |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
GPU Cluster Scheduling for Network-Sensitive Deep Learning
di: Sharma, Aakash, et al.
Pubblicazione: (2024)
di: Sharma, Aakash, et al.
Pubblicazione: (2024)
Hybrid Learning and Optimization-Based Dynamic Scheduling for DL Workloads on Heterogeneous GPU Clusters
di: Dongare, Shruti, et al.
Pubblicazione: (2025)
di: Dongare, Shruti, et al.
Pubblicazione: (2025)
Maya: Optimizing Deep Learning Training Workloads using GPU Runtime Emulation
di: Yarlagadda, Srihas, et al.
Pubblicazione: (2025)
di: Yarlagadda, Srihas, et al.
Pubblicazione: (2025)
Aryl: An Elastic Cluster Scheduler for Deep Learning
di: Li, Jiamin, et al.
Pubblicazione: (2022)
di: Li, Jiamin, et al.
Pubblicazione: (2022)
Semantic-Aware Scheduling for GPU Clusters with Large Language Models
di: Wang, Zerui, et al.
Pubblicazione: (2025)
di: Wang, Zerui, et al.
Pubblicazione: (2025)
LIFL: A Lightweight, Event-driven Serverless Platform for Federated Learning
di: Qi, Shixiong, et al.
Pubblicazione: (2024)
di: Qi, Shixiong, et al.
Pubblicazione: (2024)
An Advanced Reinforcement Learning Framework for Online Scheduling of Deferrable Workloads in Cloud Computing
di: Dong, Hang, et al.
Pubblicazione: (2024)
di: Dong, Hang, et al.
Pubblicazione: (2024)
Agent.xpu: Efficient Scheduling of Agentic LLM Workloads on Heterogeneous SoC
di: Wei, Xinming, et al.
Pubblicazione: (2025)
di: Wei, Xinming, et al.
Pubblicazione: (2025)
PAL: A Variability-Aware Policy for Scheduling ML Workloads in GPU Clusters
di: Jain, Rutwik, et al.
Pubblicazione: (2024)
di: Jain, Rutwik, et al.
Pubblicazione: (2024)
Learning to Schedule Online Tasks with Bandit Feedback
di: Xu, Yongxin, et al.
Pubblicazione: (2024)
di: Xu, Yongxin, et al.
Pubblicazione: (2024)
xMem: A CPU-Based Approach for Accurate Estimation of GPU Memory in Deep Learning Training Workloads
di: Shi, Jiabo, et al.
Pubblicazione: (2025)
di: Shi, Jiabo, et al.
Pubblicazione: (2025)
Optimal Parallel Scheduling under Concave Speedup Functions
di: Li, Chengzhang, et al.
Pubblicazione: (2025)
di: Li, Chengzhang, et al.
Pubblicazione: (2025)
An Online Fragmentation-Aware Scheduler for Managing GPU-Sharing Workloads on Multi-Instance GPUs
di: Ting, Hsu-Tzu, et al.
Pubblicazione: (2025)
di: Ting, Hsu-Tzu, et al.
Pubblicazione: (2025)
FlashMem: Supporting Modern DNN Workloads on Mobile with GPU Memory Hierarchy Optimizations
di: Shu, Zhihao, et al.
Pubblicazione: (2026)
di: Shu, Zhihao, et al.
Pubblicazione: (2026)
Priority-Aware Preemptive Scheduling for Mixed-Priority Workloads in MoE Inference
di: Siavashi, Mohammad, et al.
Pubblicazione: (2025)
di: Siavashi, Mohammad, et al.
Pubblicazione: (2025)
Scheduling for On-Board Federated Learning with Satellite Clusters
di: Razmi, Nasrin, et al.
Pubblicazione: (2024)
di: Razmi, Nasrin, et al.
Pubblicazione: (2024)
Taming Unbalanced Training Workloads in Deep Learning with Partial Collective Operations
di: Li, Shigang, et al.
Pubblicazione: (2019)
di: Li, Shigang, et al.
Pubblicazione: (2019)
Not All Federated Learning Algorithms Are Created Equal: A Performance Evaluation Study
di: Baumgart, Gustav A., et al.
Pubblicazione: (2024)
di: Baumgart, Gustav A., et al.
Pubblicazione: (2024)
Stream-CQSA: Avoiding Out-of-Memory in Attention Computation via Flexible Workload Scheduling
di: Bian, Yiming, et al.
Pubblicazione: (2026)
di: Bian, Yiming, et al.
Pubblicazione: (2026)
Flame: Simplifying Topology Extension in Federated Learning
di: Daga, Harshit, et al.
Pubblicazione: (2023)
di: Daga, Harshit, et al.
Pubblicazione: (2023)
Cornserve: A Distributed Serving System for Any-to-Any Multimodal Models
di: Chung, Jae-Won, et al.
Pubblicazione: (2026)
di: Chung, Jae-Won, et al.
Pubblicazione: (2026)
Scheduling Deep Learning Jobs in Multi-Tenant GPU Clusters via Wise Resource Sharing
di: Luo, Yizhou, et al.
Pubblicazione: (2024)
di: Luo, Yizhou, et al.
Pubblicazione: (2024)
Deadline-Aware Online Scheduling for LLM Fine-Tuning with Spot Market Predictions
di: Kong, Linggao, et al.
Pubblicazione: (2025)
di: Kong, Linggao, et al.
Pubblicazione: (2025)
FedAuxHMTL: Federated Auxiliary Hard-Parameter Sharing Multi-Task Learning for Network Edge Traffic Classification
di: Ahmed, Faisal, et al.
Pubblicazione: (2024)
di: Ahmed, Faisal, et al.
Pubblicazione: (2024)
GraNNDis: Efficient Unified Distributed Training Framework for Deep GNNs on Large Clusters
di: Song, Jaeyong, et al.
Pubblicazione: (2023)
di: Song, Jaeyong, et al.
Pubblicazione: (2023)
A Heavy-Load-Enhanced and Changeable-Periodicity-Perceived Workload Prediction Network
di: Chen, Feiyi, et al.
Pubblicazione: (2023)
di: Chen, Feiyi, et al.
Pubblicazione: (2023)
Andes: Defining and Enhancing Quality-of-Experience in LLM-Based Text Streaming Services
di: Liu, Jiachen, et al.
Pubblicazione: (2024)
di: Liu, Jiachen, et al.
Pubblicazione: (2024)
Making MoE-based LLM Inference Resilient with Tarragon
di: Zhang, Songyu, et al.
Pubblicazione: (2026)
di: Zhang, Songyu, et al.
Pubblicazione: (2026)
Time-Series Learning for Proactive Fault Prediction in Distributed Systems with Deep Neural Structures
di: Wang, Yang, et al.
Pubblicazione: (2025)
di: Wang, Yang, et al.
Pubblicazione: (2025)
FIKIT: Priority-Based Real-time GPU Multi-tasking Scheduling with Kernel Identification
di: Wu, Wenqing
Pubblicazione: (2023)
di: Wu, Wenqing
Pubblicazione: (2023)
Enabling Disaggregated Multi-Stage MLLM Inference via GPU-Internal Scheduling and Resource Sharing
di: Zhao, Lingxiao, et al.
Pubblicazione: (2025)
di: Zhao, Lingxiao, et al.
Pubblicazione: (2025)
SkipPredict: When to Invest in Predictions for Scheduling
di: Shahout, Rana, et al.
Pubblicazione: (2024)
di: Shahout, Rana, et al.
Pubblicazione: (2024)
On Harnessing Idle Compute at the Edge for Foundation Model Training
di: Xue, Leyang, et al.
Pubblicazione: (2025)
di: Xue, Leyang, et al.
Pubblicazione: (2025)
HybriMoE: Hybrid CPU-GPU Scheduling and Cache Management for Efficient MoE Inference
di: Zhong, Shuzhang, et al.
Pubblicazione: (2025)
di: Zhong, Shuzhang, et al.
Pubblicazione: (2025)
Flexible Clustered Federated Learning for Client-Level Data Distribution Shift
di: Duan, Moming, et al.
Pubblicazione: (2021)
di: Duan, Moming, et al.
Pubblicazione: (2021)
PecSched: Preemptive and Efficient Cluster Scheduling for LLM Inference
di: Zhang, Zeyu, et al.
Pubblicazione: (2024)
di: Zhang, Zeyu, et al.
Pubblicazione: (2024)
SuperFedNAS: Cost-Efficient Federated Neural Architecture Search for On-Device Inference
di: Khare, Alind, et al.
Pubblicazione: (2023)
di: Khare, Alind, et al.
Pubblicazione: (2023)
FedMOA: Federated GRPO for Personalized Reasoning LLMs under Heterogeneous Rewards
di: Wang, Ziyao, et al.
Pubblicazione: (2026)
di: Wang, Ziyao, et al.
Pubblicazione: (2026)
G-Meta: Distributed Meta Learning in GPU Clusters for Large-Scale Recommender Systems
di: Xiao, Youshao, et al.
Pubblicazione: (2024)
di: Xiao, Youshao, et al.
Pubblicazione: (2024)
Enhancing Convergence, Privacy and Fairness for Wireless Personalized Federated Learning: Quantization-Assisted Min-Max Fair Scheduling
di: Zhao, Xiyu, et al.
Pubblicazione: (2025)
di: Zhao, Xiyu, et al.
Pubblicazione: (2025)
Documenti analoghi
-
GPU Cluster Scheduling for Network-Sensitive Deep Learning
di: Sharma, Aakash, et al.
Pubblicazione: (2024) -
Hybrid Learning and Optimization-Based Dynamic Scheduling for DL Workloads on Heterogeneous GPU Clusters
di: Dongare, Shruti, et al.
Pubblicazione: (2025) -
Maya: Optimizing Deep Learning Training Workloads using GPU Runtime Emulation
di: Yarlagadda, Srihas, et al.
Pubblicazione: (2025) -
Aryl: An Elastic Cluster Scheduler for Deep Learning
di: Li, Jiamin, et al.
Pubblicazione: (2022) -
Semantic-Aware Scheduling for GPU Clusters with Large Language Models
di: Wang, Zerui, et al.
Pubblicazione: (2025)