An Online Fragmentation-Aware GPU Scheduler for Multi-Tenant MIG-based Clouds
Fuente:
arXiv
Salvato in:
| Autori principali: | Zambianco, Marco, Fasol, Lorenzo, Doriguzzi-Corin, Roberto |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Closing the HPC-Cloud Convergence Gap: Multi-Tenant Slingshot RDMA for Kubernetes
di: Friese, Philipp A., et al.
Pubblicazione: (2025)
di: Friese, Philipp A., et al.
Pubblicazione: (2025)
Causal Inference for Quantifying Noisy Neighbor Effects in Multi-Tenant Cloud Environments
di: Schiavo, Philipe S., et al.
Pubblicazione: (2026)
di: Schiavo, Philipe S., et al.
Pubblicazione: (2026)
Palladium: A DPU-enabled Multi-Tenant Serverless Cloud over Zero-copy Multi-node RDMA Fabrics
di: Qi, Shixiong, et al.
Pubblicazione: (2025)
di: Qi, Shixiong, et al.
Pubblicazione: (2025)
Carbon-Aware Temporal Data Transfer Scheduling Across Cloud Datacenters
di: Rodrigues, Elvis, et al.
Pubblicazione: (2025)
di: Rodrigues, Elvis, et al.
Pubblicazione: (2025)
FAST: An Efficient Scheduler for All-to-All GPU Communication
di: Lei, Yiran, et al.
Pubblicazione: (2025)
di: Lei, Yiran, et al.
Pubblicazione: (2025)
PerLLM: Personalized Inference Scheduling with Edge-Cloud Collaboration for Diverse LLM Services
di: Yang, Zheming, et al.
Pubblicazione: (2024)
di: Yang, Zheming, et al.
Pubblicazione: (2024)
Temporal-Aware GPU Resource Allocation for Distributed LLM Inference via Reinforcement Learning
di: Du, Chengze, et al.
Pubblicazione: (2025)
di: Du, Chengze, et al.
Pubblicazione: (2025)
Multi-stage Flow Scheduling for LLM Serving
di: Sun, Yijun, et al.
Pubblicazione: (2026)
di: Sun, Yijun, et al.
Pubblicazione: (2026)
SAKURAONE: An Open Ethernet-Based AI HPC System and Its Observed Workload Dynamics in a Single-Tenant LLM Development Environment
di: Konishi, Fumikazu, et al.
Pubblicazione: (2026)
di: Konishi, Fumikazu, et al.
Pubblicazione: (2026)
Multi-Source Coflow Scheduling in Collaborative Edge Computing with Multihop Network
di: Sahni, Yuvraj, et al.
Pubblicazione: (2024)
di: Sahni, Yuvraj, et al.
Pubblicazione: (2024)
Dynamic DAG-Application Scheduling for Multi-Tier Edge Computing in Heterogeneous Networks
di: Li, Xiang, et al.
Pubblicazione: (2024)
di: Li, Xiang, et al.
Pubblicazione: (2024)
From Skew to Symmetry: Node-Interconnect Multi-Path Balancing with Execution-time Planning for Modern GPU Clusters
di: Yao, Jinghan, et al.
Pubblicazione: (2026)
di: Yao, Jinghan, et al.
Pubblicazione: (2026)
EdgeTimer: Adaptive Multi-Timescale Scheduling in Mobile Edge Computing with Deep Reinforcement Learning
di: Hao, Yijun, et al.
Pubblicazione: (2024)
di: Hao, Yijun, et al.
Pubblicazione: (2024)
TriCloudEdge: A multi-layer Cloud Continuum
di: Violettas, George, et al.
Pubblicazione: (2026)
di: Violettas, George, et al.
Pubblicazione: (2026)
Dynamic Hierarchical Birkhoff-von Neumann Decomposition for All-to-All GPU Communication
di: Wu, Yen-Chieh, et al.
Pubblicazione: (2026)
di: Wu, Yen-Chieh, et al.
Pubblicazione: (2026)
AllReduce Scheduling with Hierarchical Deep Reinforcement Learning
di: Wei, Yufan, et al.
Pubblicazione: (2025)
di: Wei, Yufan, et al.
Pubblicazione: (2025)
Optimal Multi-Constrained Workflow Scheduling for Cyber-Physical Systems in the Edge-Cloud Continuum
di: Kouloumpris, Andreas, et al.
Pubblicazione: (2025)
di: Kouloumpris, Andreas, et al.
Pubblicazione: (2025)
QoS-Aware Load Balancing in the Computing Continuum via Multi-Player Bandits
di: Čilić, Ivan, et al.
Pubblicazione: (2025)
di: Čilić, Ivan, et al.
Pubblicazione: (2025)
Cooperative Graceful Degradation In Containerized Clouds
di: Agrawal, Kapil, et al.
Pubblicazione: (2023)
di: Agrawal, Kapil, et al.
Pubblicazione: (2023)
Efficient All-to-All Collective Communication Schedules for Direct-Connect Topologies
di: Basu, Prithwish, et al.
Pubblicazione: (2023)
di: Basu, Prithwish, et al.
Pubblicazione: (2023)
Harvest: Adaptive Photonic Switching Schedules for Collective Communication in Scale-up Domains
di: Rahman, Mahir, et al.
Pubblicazione: (2026)
di: Rahman, Mahir, et al.
Pubblicazione: (2026)
RouterWise: Joint Resource Allocation and Routing for Latency-Aware Multi-Model LLM Serving
di: Kasnavieh, Hossein Hosseini, et al.
Pubblicazione: (2026)
di: Kasnavieh, Hossein Hosseini, et al.
Pubblicazione: (2026)
An Open-Source Experimentation Framework for the Edge Cloud Continuum
di: Koukis, Georgios, et al.
Pubblicazione: (2024)
di: Koukis, Georgios, et al.
Pubblicazione: (2024)
Meili: Enabling SmartNIC as a Service in the Cloud
di: Su, Qiang, et al.
Pubblicazione: (2023)
di: Su, Qiang, et al.
Pubblicazione: (2023)
MultiPath Memory Access: Breaking Host-GPU Bandwidth Bottlenecks in LLM Services
di: Tang, Lingfeng, et al.
Pubblicazione: (2025)
di: Tang, Lingfeng, et al.
Pubblicazione: (2025)
A Hybrid Cloud Management Plane for Data Processing Pipelines
di: Babu, Vignesh, et al.
Pubblicazione: (2025)
di: Babu, Vignesh, et al.
Pubblicazione: (2025)
YUHENG-OS: A Cloud-Native Space Cluster Operating System
di: Zhang, Jin, et al.
Pubblicazione: (2026)
di: Zhang, Jin, et al.
Pubblicazione: (2026)
Arcturus: A Cloud Overlay Network for Global Accelerator with Enhanced Performance and Stability
di: Liu, Matthew Yang, et al.
Pubblicazione: (2025)
di: Liu, Matthew Yang, et al.
Pubblicazione: (2025)
ClusterSlice: A Zero-touch Deployment Platform for the Edge Cloud Continuum
di: Mamatas, Lefteris, et al.
Pubblicazione: (2024)
di: Mamatas, Lefteris, et al.
Pubblicazione: (2024)
Real-Time Scheduling for 802.1Qbv Time-Sensitive Networking (TSN): A Systematic Review and Experimental Study
di: Xue, Chuanyu, et al.
Pubblicazione: (2023)
di: Xue, Chuanyu, et al.
Pubblicazione: (2023)
OptiReduce: Resilient and Tail-Optimal AllReduce for Distributed Deep Learning in the Cloud
di: Warraich, Ertza, et al.
Pubblicazione: (2023)
di: Warraich, Ertza, et al.
Pubblicazione: (2023)
Decentralized Stratified Sampling for Low-Latency Approximate Geospatial Data Stream Processing in Edge-Cloud Architectures
di: Jawarneh, Isam Mashhour Al, et al.
Pubblicazione: (2026)
di: Jawarneh, Isam Mashhour Al, et al.
Pubblicazione: (2026)
FODT: Fast, Online, Distributed and Temporary Failure Recovery Approach for MEC
di: Yuan, Xin, et al.
Pubblicazione: (2023)
di: Yuan, Xin, et al.
Pubblicazione: (2023)
A Study on 5G Network Slice Isolation Based on Native Cloud and Edge Computing Tools
di: Andrade, Maiko, et al.
Pubblicazione: (2025)
di: Andrade, Maiko, et al.
Pubblicazione: (2025)
POSMAC: Powering Up In-Network AR/CG Traffic Classification with Online Learning
di: Shirmarz, Alireza, et al.
Pubblicazione: (2025)
di: Shirmarz, Alireza, et al.
Pubblicazione: (2025)
Hierarchical Online-Scheduling for Energy-Efficient Split Inference with Progressive Transmission
di: Tang, Zengzipeng, et al.
Pubblicazione: (2026)
di: Tang, Zengzipeng, et al.
Pubblicazione: (2026)
Varuna: Enabling Failure-Type Aware RDMA Failover
di: Wang, Xiaoyang, et al.
Pubblicazione: (2026)
di: Wang, Xiaoyang, et al.
Pubblicazione: (2026)
Legible Consensus: Topology-Aware Quorum Geometry for Asymmetric Networks
di: Mason, Tony
Pubblicazione: (2026)
di: Mason, Tony
Pubblicazione: (2026)
Contention-Aware Microservice Deployment in Collaborative Mobile Edge Networks
di: Ge, Xinlei, et al.
Pubblicazione: (2024)
di: Ge, Xinlei, et al.
Pubblicazione: (2024)
Resource Allocation Driven by Large Models in Future Semantic-Aware Networks
di: Zhang, Haijun, et al.
Pubblicazione: (2025)
di: Zhang, Haijun, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Closing the HPC-Cloud Convergence Gap: Multi-Tenant Slingshot RDMA for Kubernetes
di: Friese, Philipp A., et al.
Pubblicazione: (2025) -
Causal Inference for Quantifying Noisy Neighbor Effects in Multi-Tenant Cloud Environments
di: Schiavo, Philipe S., et al.
Pubblicazione: (2026) -
Palladium: A DPU-enabled Multi-Tenant Serverless Cloud over Zero-copy Multi-node RDMA Fabrics
di: Qi, Shixiong, et al.
Pubblicazione: (2025) -
Carbon-Aware Temporal Data Transfer Scheduling Across Cloud Datacenters
di: Rodrigues, Elvis, et al.
Pubblicazione: (2025) -
FAST: An Efficient Scheduler for All-to-All GPU Communication
di: Lei, Yiran, et al.
Pubblicazione: (2025)