Resource Heterogeneity-Aware and Utilization-Enhanced Scheduling for Deep Learning Clusters
Fuente:
arXiv
Salvato in:
| Autori principali: | Sultana, Abeda, Pakka, Nabin, Xu, Fei, Yuan, Xu, Chen, Li, Tzeng, Nian-Feng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Prima.cpp: Fast 30-70B LLM Inference on Heterogeneous and Low-Resource Home Clusters
di: Li, Zonghang, et al.
Pubblicazione: (2025)
di: Li, Zonghang, et al.
Pubblicazione: (2025)
Aergia: Leveraging Heterogeneity in Federated Learning Systems
di: Cox, Bart, et al.
Pubblicazione: (2022)
di: Cox, Bart, et al.
Pubblicazione: (2022)
FedPLT: Scalable, Resource-Efficient, and Heterogeneity-Aware Federated Learning via Partial Layer Training
di: Dabaja, Ahmad, et al.
Pubblicazione: (2026)
di: Dabaja, Ahmad, et al.
Pubblicazione: (2026)
Towards Optimal Heterogeneous Client Sampling in Multi-Model Federated Learning
di: Zhang, Haoran, et al.
Pubblicazione: (2025)
di: Zhang, Haoran, et al.
Pubblicazione: (2025)
Connecting Large Language Model Agent to High Performance Computing Resource
di: Ma, Heng, et al.
Pubblicazione: (2025)
di: Ma, Heng, et al.
Pubblicazione: (2025)
How Machine Learning-Data Driven Replication Strategies Enhance Fault Tolerance in Large-Scale Distributed Systems
di: Murimi, Almond Kiruthu
Pubblicazione: (2025)
di: Murimi, Almond Kiruthu
Pubblicazione: (2025)
AutoDDL: Automatic Distributed Deep Learning with Near-Optimal Bandwidth Cost
di: Chen, Jinfan, et al.
Pubblicazione: (2023)
di: Chen, Jinfan, et al.
Pubblicazione: (2023)
AMP4EC: Adaptive Model Partitioning Framework for Efficient Deep Learning Inference in Edge Computing Environments
di: Zhang, Guilin, et al.
Pubblicazione: (2025)
di: Zhang, Guilin, et al.
Pubblicazione: (2025)
SparkAttention: High-Performance Multi-Head Attention for Large Models on Volta GPU Architecture
di: Xu, Youxuan, et al.
Pubblicazione: (2025)
di: Xu, Youxuan, et al.
Pubblicazione: (2025)
Roadmap for Edge AI: A Dagstuhl Perspective
di: Ding, Aaron Yi, et al.
Pubblicazione: (2021)
di: Ding, Aaron Yi, et al.
Pubblicazione: (2021)
Parameterizing Federated Continual Learning for Reproducible Research
di: Cox, Bart, et al.
Pubblicazione: (2024)
di: Cox, Bart, et al.
Pubblicazione: (2024)
Asynchronous Byzantine Federated Learning
di: Cox, Bart, et al.
Pubblicazione: (2024)
di: Cox, Bart, et al.
Pubblicazione: (2024)
Hyper-parameter Optimization for Federated Learning with Step-wise Adaptive Mechanism
di: Saadati, Yasaman, et al.
Pubblicazione: (2024)
di: Saadati, Yasaman, et al.
Pubblicazione: (2024)
Training Diffusion Models with Federated Learning
di: de Goede, Matthijs, et al.
Pubblicazione: (2024)
di: de Goede, Matthijs, et al.
Pubblicazione: (2024)
Quantize Once, Train Fast: Allreduce-Compatible Compression with Provable Guarantees
di: Xin, Jihao, et al.
Pubblicazione: (2023)
di: Xin, Jihao, et al.
Pubblicazione: (2023)
Comparison of Autoscaling Frameworks for Containerised Machine-Learning-Applications in a Local and Cloud Environment
di: Schroeder, Christian, et al.
Pubblicazione: (2023)
di: Schroeder, Christian, et al.
Pubblicazione: (2023)
Asynchronous Multi-Server Federated Learning for Geo-Distributed Clients
di: Zuo, Yuncong, et al.
Pubblicazione: (2024)
di: Zuo, Yuncong, et al.
Pubblicazione: (2024)
Accelerating Geo-distributed Machine Learning with Network-Aware Adaptive Tree and Auxiliary Route
di: Li, Zonghang, et al.
Pubblicazione: (2024)
di: Li, Zonghang, et al.
Pubblicazione: (2024)
SI-ChainFL: Shapley-Incentivized Secure Federated Learning for High-Speed Rail Data Sharing
di: Zhao, Mingjie, et al.
Pubblicazione: (2026)
di: Zhao, Mingjie, et al.
Pubblicazione: (2026)
ADF-LoRA: Alternating Low-Rank Aggregation for Decentralized Federated Fine-Tuning
di: Wang, Xiaoyu, et al.
Pubblicazione: (2025)
di: Wang, Xiaoyu, et al.
Pubblicazione: (2025)
DAGER: Exact Gradient Inversion for Large Language Models
di: Petrov, Ivo, et al.
Pubblicazione: (2024)
di: Petrov, Ivo, et al.
Pubblicazione: (2024)
CodeCRDT: Observation-Driven Coordination for Multi-Agent LLM Code Generation
di: Pugachev, Sergey
Pubblicazione: (2025)
di: Pugachev, Sergey
Pubblicazione: (2025)
Separating Intelligence from Execution: A Workflow Engine for the Model Context Protocol
di: Parmar, Abhinav Singh
Pubblicazione: (2026)
di: Parmar, Abhinav Singh
Pubblicazione: (2026)
A Full Compression Pipeline for Green Federated Learning in Communication-Constrained Environments
di: Colybes, Elouan, et al.
Pubblicazione: (2026)
di: Colybes, Elouan, et al.
Pubblicazione: (2026)
TPI-LLM: Serving 70B-scale LLMs Efficiently on Low-resource Edge Devices
di: Li, Zonghang, et al.
Pubblicazione: (2024)
di: Li, Zonghang, et al.
Pubblicazione: (2024)
Libra: Unleashing GPU Heterogeneity for High-Performance Sparse Matrix Multiplication
di: Shi, Jinliang, et al.
Pubblicazione: (2025)
di: Shi, Jinliang, et al.
Pubblicazione: (2025)
Agentic Compilation: Mitigating the LLM Rerun Crisis for Minimized-Inference-Cost Web Automation
di: Chundru, Jagadeesh
Pubblicazione: (2026)
di: Chundru, Jagadeesh
Pubblicazione: (2026)
Learning In Chaos: Efficient Autoscaling and Self-Healing for Multi-Party Distributed Training
di: Feng, Wenjiao, et al.
Pubblicazione: (2025)
di: Feng, Wenjiao, et al.
Pubblicazione: (2025)
A Framework for the Interoperability of Cloud Platforms: Towards FAIR Data in SAFE Environments
di: Grossman, Robert L., et al.
Pubblicazione: (2022)
di: Grossman, Robert L., et al.
Pubblicazione: (2022)
Federated Learning Model Aggregation in Heterogenous Aerial and Space Networks
di: Dong, Fan, et al.
Pubblicazione: (2023)
di: Dong, Fan, et al.
Pubblicazione: (2023)
Near-Optimal Sparse Allreduce for Distributed Deep Learning
di: Li, Shigang, et al.
Pubblicazione: (2022)
di: Li, Shigang, et al.
Pubblicazione: (2022)
HFedATM: Hierarchical Federated Domain Generalization via Optimal Transport and Regularized Mean Aggregation
di: Nguyen, Thinh, et al.
Pubblicazione: (2025)
di: Nguyen, Thinh, et al.
Pubblicazione: (2025)
TokenCake: A KV-Cache-centric Serving Framework for LLM-based Multi-Agent Applications
di: Bian, Zhuohang, et al.
Pubblicazione: (2025)
di: Bian, Zhuohang, et al.
Pubblicazione: (2025)
Combinatorial Client-Master Multiagent Deep Reinforcement Learning for Task Offloading in Mobile Edge Computing
di: Gebrekidan, Tesfay Zemuy, et al.
Pubblicazione: (2024)
di: Gebrekidan, Tesfay Zemuy, et al.
Pubblicazione: (2024)
FlashSparse: Minimizing Computation Redundancy for Fast Sparse Matrix Multiplications on Tensor Cores
di: Shi, Jinliang, et al.
Pubblicazione: (2024)
di: Shi, Jinliang, et al.
Pubblicazione: (2024)
Uncertainty Estimation in Multi-Agent Distributed Learning for AI-Enabled Edge Devices
di: Radchenko, Gleb, et al.
Pubblicazione: (2024)
di: Radchenko, Gleb, et al.
Pubblicazione: (2024)
Edge AI Collaborative Learning: Bayesian Approaches to Uncertainty Estimation
di: Radchenko, Gleb, et al.
Pubblicazione: (2024)
di: Radchenko, Gleb, et al.
Pubblicazione: (2024)
SPEAR++: Scaling Gradient Inversion via Sparsely-Used Dictionary Learning
di: Bakarsky, Alexander, et al.
Pubblicazione: (2025)
di: Bakarsky, Alexander, et al.
Pubblicazione: (2025)
WLB-LLM: Workload-Balanced 4D Parallelism for Large Language Model Training
di: Wang, Zheng, et al.
Pubblicazione: (2025)
di: Wang, Zheng, et al.
Pubblicazione: (2025)
SPEAR:Exact Gradient Inversion of Batches in Federated Learning
di: Dimitrov, Dimitar I., et al.
Pubblicazione: (2024)
di: Dimitrov, Dimitar I., et al.
Pubblicazione: (2024)
Documenti analoghi
-
Prima.cpp: Fast 30-70B LLM Inference on Heterogeneous and Low-Resource Home Clusters
di: Li, Zonghang, et al.
Pubblicazione: (2025) -
Aergia: Leveraging Heterogeneity in Federated Learning Systems
di: Cox, Bart, et al.
Pubblicazione: (2022) -
FedPLT: Scalable, Resource-Efficient, and Heterogeneity-Aware Federated Learning via Partial Layer Training
di: Dabaja, Ahmad, et al.
Pubblicazione: (2026) -
Towards Optimal Heterogeneous Client Sampling in Multi-Model Federated Learning
di: Zhang, Haoran, et al.
Pubblicazione: (2025) -
Connecting Large Language Model Agent to High Performance Computing Resource
di: Ma, Heng, et al.
Pubblicazione: (2025)