Maple: A Multi-agent System for Portable Deep Learning across Clusters
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wu, Molang, Zhang, Zhao |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Syndeo: Portable Ray Clusters with Secure Containerization
par: Li, William, et autres
Publié: (2024)
par: Li, William, et autres
Publié: (2024)
Analyzing the Performance Portability of SYCL across CPUs, GPUs, and Hybrid Systems with SW Sequence Alignment
par: Costanzo, Manuel, et autres
Publié: (2024)
par: Costanzo, Manuel, et autres
Publié: (2024)
Portability Efficiency Approach for Calculating Performance Portability
par: Marowka, Ami
Publié: (2024)
par: Marowka, Ami
Publié: (2024)
Rubick: Exploiting Job Reconfigurability for Deep Learning Cluster Scheduling
par: Zhang, Xinyi, et autres
Publié: (2024)
par: Zhang, Xinyi, et autres
Publié: (2024)
Scheduling Deep Learning Jobs in Multi-Tenant GPU Clusters via Wise Resource Sharing
par: Luo, Yizhou, et autres
Publié: (2024)
par: Luo, Yizhou, et autres
Publié: (2024)
Multi-agent Reinforcement Learning-based In-place Scaling Engine for Edge-cloud Systems
par: Prodanov, Jovan, et autres
Publié: (2025)
par: Prodanov, Jovan, et autres
Publié: (2025)
STRATUS: A Multi-agent System for Autonomous Reliability Engineering of Modern Clouds
par: Chen, Yinfang, et autres
Publié: (2025)
par: Chen, Yinfang, et autres
Publié: (2025)
A Logic for Repair and State Recovery in Byzantine Fault-tolerant Multi-agent Systems
par: van Ditmarsch, Hans, et autres
Publié: (2024)
par: van Ditmarsch, Hans, et autres
Publié: (2024)
LAPIS: A Performance Portable, High Productivity Compiler Framework
par: Kelley, Brian, et autres
Publié: (2025)
par: Kelley, Brian, et autres
Publié: (2025)
DeepVM: Integrating Spot and On-Demand VMs for Cost-Efficient Deep Learning Clusters in the Cloud
par: Kim, Yoochan, et autres
Publié: (2024)
par: Kim, Yoochan, et autres
Publié: (2024)
PSI/J: A Portable Interface for Submitting, Monitoring, and Managing Jobs
par: Hategan-Marandiuc, Mihael, et autres
Publié: (2023)
par: Hategan-Marandiuc, Mihael, et autres
Publié: (2023)
A Portable Framework for Accelerating Stencil Computations on Modern Node Architectures
par: Sai, Ryuichi, et autres
Publié: (2023)
par: Sai, Ryuichi, et autres
Publié: (2023)
miniLB: A Performance Portability Study of Lattice-Boltzmann Simulations
par: Crisci, Luigi, et autres
Publié: (2024)
par: Crisci, Luigi, et autres
Publié: (2024)
HPDR: High-Performance Portable Scientific Data Reduction Framework
par: Chen, Jieyang, et autres
Publié: (2025)
par: Chen, Jieyang, et autres
Publié: (2025)
XaaS Containers: Performance-Portable Representation With Source and IR Containers
par: Copik, Marcin, et autres
Publié: (2025)
par: Copik, Marcin, et autres
Publié: (2025)
Efficient and Portable Support for Overdecomposition on Distributed Memory GPGPU Platforms
par: Bhosale, Aditya, et autres
Publié: (2026)
par: Bhosale, Aditya, et autres
Publié: (2026)
Understanding Layered Portability from HPC to Cloud in Containerized Environments
par: Medeiros, Daniel, et autres
Publié: (2024)
par: Medeiros, Daniel, et autres
Publié: (2024)
Portable, heterogeneous ensemble workflows at scale using libEnsemble
par: Hudson, Stephen, et autres
Publié: (2024)
par: Hudson, Stephen, et autres
Publié: (2024)
A Parallel and Highly-Portable HPC Poisson Solver: Preconditioned Bi-CGSTAB with alpaka
par: Pennati, Luca, et autres
Publié: (2025)
par: Pennati, Luca, et autres
Publié: (2025)
DiOMP-Offloading: Toward Portable Distributed Heterogeneous OpenMP
par: Shan, Baodi, et autres
Publié: (2025)
par: Shan, Baodi, et autres
Publié: (2025)
HPC Containers for EBRAINS: Towards Portable Cross-Domain Software Environment
par: Singh, Krishna Kant, et autres
Publié: (2026)
par: Singh, Krishna Kant, et autres
Publié: (2026)
Closer in the Gap: Towards Portable Performance on RISC-V Vector Processors
par: Shi, Ruimin, et autres
Publié: (2026)
par: Shi, Ruimin, et autres
Publié: (2026)
A Reinforcement Learning-Driven Task Scheduling Algorithm for Multi-Tenant Distributed Systems
par: Zhang, Xiaopei, et autres
Publié: (2025)
par: Zhang, Xiaopei, et autres
Publié: (2025)
DeepOps & SLURM: Your GPU Cluster Guide
par: Majee, Arindam
Publié: (2024)
par: Majee, Arindam
Publié: (2024)
Workflow Mini-Apps: Portable, Scalable, Tunable & Faithful Representations of Scientific Workflows
par: Kilic, Ozgur Ozan, et autres
Publié: (2024)
par: Kilic, Ozgur Ozan, et autres
Publié: (2024)
Performance Portable Monte Carlo Particle Transport on Intel, NVIDIA, and AMD GPUs
par: Tramm, John, et autres
Publié: (2024)
par: Tramm, John, et autres
Publié: (2024)
Performance Characterization of Distributed Deep Learning Strategies: A Quantitative Evaluation of DDP, FSDP, and Parameter Server Architectures on GPU Clusters
par: Ovi, Md Sultanul Islam
Publié: (2025)
par: Ovi, Md Sultanul Islam
Publié: (2025)
HP-MDR: High-performance and Portable Data Refactoring and Progressive Retrieval with Advanced GPUs
par: Li, Yanliang, et autres
Publié: (2025)
par: Li, Yanliang, et autres
Publié: (2025)
Deep Back-Filling: a Split Window Technique for Deep Online Cluster Job Scheduling
par: Wang, Lingfei, et autres
Publié: (2024)
par: Wang, Lingfei, et autres
Publié: (2024)
NL-CPS: Reinforcement Learning-Based Kubernetes Control Plane Placement in Multi-Region Clusters
par: Alam, Sajid, et autres
Publié: (2026)
par: Alam, Sajid, et autres
Publié: (2026)
SchEdge: A Dynamic, Multi-agent, and Scalable Scheduling Simulator for IoT Edge
par: Hamedi, Ali, et autres
Publié: (2025)
par: Hamedi, Ali, et autres
Publié: (2025)
QONNECT: A QoS-Aware Orchestration System for Distributed Kubernetes Clusters
par: Aslan, Haci Ismail, et autres
Publié: (2025)
par: Aslan, Haci Ismail, et autres
Publié: (2025)
A Taxonomy of Schedulers -- Operating Systems, Clusters and Big Data Frameworks
par: Sliwko, Leszek
Publié: (2025)
par: Sliwko, Leszek
Publié: (2025)
Propius: A Platform for Collaborative Machine Learning across the Edge and the Cloud
par: Ding, Eric
Publié: (2025)
par: Ding, Eric
Publié: (2025)
Tally: Non-Intrusive Performance Isolation for Concurrent Deep Learning Workloads
par: Zhao, Wei, et autres
Publié: (2024)
par: Zhao, Wei, et autres
Publié: (2024)
A Deep Dive into the Google Cluster Workload Traces: Analyzing the Application Failure Characteristics and User Behaviors
par: Bappy, Faisal Haque, et autres
Publié: (2023)
par: Bappy, Faisal Haque, et autres
Publié: (2023)
Taking GPU Programming Models to Task for Performance Portability
par: Davis, Joshua H., et autres
Publié: (2024)
par: Davis, Joshua H., et autres
Publié: (2024)
Applying Large-Scale Distributed Computing to Structural Bioinformatics -- Bridging Legacy HPC Clusters With Big Data Technologies Using kafka-slurm-agent
par: Rubach, Pawel
Publié: (2025)
par: Rubach, Pawel
Publié: (2025)
The National Research Platform: Stretched, Multi-Tenant, Scientific Kubernetes Cluster
par: Weitzel, Derek, et autres
Publié: (2025)
par: Weitzel, Derek, et autres
Publié: (2025)
Frenzy: A Memory-Aware Serverless LLM Training System for Heterogeneous GPU Clusters
par: Chang, Zihan, et autres
Publié: (2024)
par: Chang, Zihan, et autres
Publié: (2024)
Documents similaires
-
Syndeo: Portable Ray Clusters with Secure Containerization
par: Li, William, et autres
Publié: (2024) -
Analyzing the Performance Portability of SYCL across CPUs, GPUs, and Hybrid Systems with SW Sequence Alignment
par: Costanzo, Manuel, et autres
Publié: (2024) -
Portability Efficiency Approach for Calculating Performance Portability
par: Marowka, Ami
Publié: (2024) -
Rubick: Exploiting Job Reconfigurability for Deep Learning Cluster Scheduling
par: Zhang, Xinyi, et autres
Publié: (2024) -
Scheduling Deep Learning Jobs in Multi-Tenant GPU Clusters via Wise Resource Sharing
par: Luo, Yizhou, et autres
Publié: (2024)