Closing the HPC-Cloud Convergence Gap: Multi-Tenant Slingshot RDMA for Kubernetes
Fuente:
arXiv
Salvato in:
| Autori principali: | Friese, Philipp A., Eleliemy, Ahmed, Haus, Utz-Uwe, Schulz, Martin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Palladium: A DPU-enabled Multi-Tenant Serverless Cloud over Zero-copy Multi-node RDMA Fabrics
di: Qi, Shixiong, et al.
Pubblicazione: (2025)
di: Qi, Shixiong, et al.
Pubblicazione: (2025)
An Online Fragmentation-Aware GPU Scheduler for Multi-Tenant MIG-based Clouds
di: Zambianco, Marco, et al.
Pubblicazione: (2025)
di: Zambianco, Marco, et al.
Pubblicazione: (2025)
Causal Inference for Quantifying Noisy Neighbor Effects in Multi-Tenant Cloud Environments
di: Schiavo, Philipe S., et al.
Pubblicazione: (2026)
di: Schiavo, Philipe S., et al.
Pubblicazione: (2026)
Reimagining RDMA Through the Lens of ML
di: Warraich, Ertza, et al.
Pubblicazione: (2025)
di: Warraich, Ertza, et al.
Pubblicazione: (2025)
SAKURAONE: An Open Ethernet-Based AI HPC System and Its Observed Workload Dynamics in a Single-Tenant LLM Development Environment
di: Konishi, Fumikazu, et al.
Pubblicazione: (2026)
di: Konishi, Fumikazu, et al.
Pubblicazione: (2026)
Varuna: Enabling Failure-Type Aware RDMA Failover
di: Wang, Xiaoyang, et al.
Pubblicazione: (2026)
di: Wang, Xiaoyang, et al.
Pubblicazione: (2026)
OptiNIC: A Resilient and Tail-Optimal RDMA NIC for Distributed ML Workloads
di: Warraich, Ertza, et al.
Pubblicazione: (2025)
di: Warraich, Ertza, et al.
Pubblicazione: (2025)
FedRDMA: Communication-Efficient Cross-Silo Federated LLM via Chunked RDMA Transmission
di: Zhang, Zeling, et al.
Pubblicazione: (2024)
di: Zhang, Zeling, et al.
Pubblicazione: (2024)
To Stream or Not to Stream: Towards A Quantitative Model for Remote HPC Processing Decisions
di: Castro, Flavio, et al.
Pubblicazione: (2025)
di: Castro, Flavio, et al.
Pubblicazione: (2025)
TriCloudEdge: A multi-layer Cloud Continuum
di: Violettas, George, et al.
Pubblicazione: (2026)
di: Violettas, George, et al.
Pubblicazione: (2026)
Over-the-Top Resource Broker System for Split Computing: An Approach to Distribute Cloud Computing Infrastructure
di: Friese, Ingo, et al.
Pubblicazione: (2025)
di: Friese, Ingo, et al.
Pubblicazione: (2025)
Cooperative Graceful Degradation In Containerized Clouds
di: Agrawal, Kapil, et al.
Pubblicazione: (2023)
di: Agrawal, Kapil, et al.
Pubblicazione: (2023)
An Open-Source Experimentation Framework for the Edge Cloud Continuum
di: Koukis, Georgios, et al.
Pubblicazione: (2024)
di: Koukis, Georgios, et al.
Pubblicazione: (2024)
Meili: Enabling SmartNIC as a Service in the Cloud
di: Su, Qiang, et al.
Pubblicazione: (2023)
di: Su, Qiang, et al.
Pubblicazione: (2023)
A Hybrid Cloud Management Plane for Data Processing Pipelines
di: Babu, Vignesh, et al.
Pubblicazione: (2025)
di: Babu, Vignesh, et al.
Pubblicazione: (2025)
Carbon-Aware Temporal Data Transfer Scheduling Across Cloud Datacenters
di: Rodrigues, Elvis, et al.
Pubblicazione: (2025)
di: Rodrigues, Elvis, et al.
Pubblicazione: (2025)
YUHENG-OS: A Cloud-Native Space Cluster Operating System
di: Zhang, Jin, et al.
Pubblicazione: (2026)
di: Zhang, Jin, et al.
Pubblicazione: (2026)
ClusterSlice: A Zero-touch Deployment Platform for the Edge Cloud Continuum
di: Mamatas, Lefteris, et al.
Pubblicazione: (2024)
di: Mamatas, Lefteris, et al.
Pubblicazione: (2024)
Arcturus: A Cloud Overlay Network for Global Accelerator with Enhanced Performance and Stability
di: Liu, Matthew Yang, et al.
Pubblicazione: (2025)
di: Liu, Matthew Yang, et al.
Pubblicazione: (2025)
OptiReduce: Resilient and Tail-Optimal AllReduce for Distributed Deep Learning in the Cloud
di: Warraich, Ertza, et al.
Pubblicazione: (2023)
di: Warraich, Ertza, et al.
Pubblicazione: (2023)
PerLLM: Personalized Inference Scheduling with Edge-Cloud Collaboration for Diverse LLM Services
di: Yang, Zheming, et al.
Pubblicazione: (2024)
di: Yang, Zheming, et al.
Pubblicazione: (2024)
A Study on 5G Network Slice Isolation Based on Native Cloud and Edge Computing Tools
di: Andrade, Maiko, et al.
Pubblicazione: (2025)
di: Andrade, Maiko, et al.
Pubblicazione: (2025)
SPARC-LoRa: A Scalable, Power-efficient, Affordable, Reliable, and Cloud Service-enabled LoRa Networking System for Agriculture Applications
di: Wang, Xi, et al.
Pubblicazione: (2024)
di: Wang, Xi, et al.
Pubblicazione: (2024)
Multi-stage Flow Scheduling for LLM Serving
di: Sun, Yijun, et al.
Pubblicazione: (2026)
di: Sun, Yijun, et al.
Pubblicazione: (2026)
MDTP -- An Adaptive Multi-Source Data Transfer Protocol
di: Abdollah, Sepideh, et al.
Pubblicazione: (2025)
di: Abdollah, Sepideh, et al.
Pubblicazione: (2025)
Recursive Offloading for LLM Serving in Multi-tier Networks
di: Wu, Zhiyuan, et al.
Pubblicazione: (2025)
di: Wu, Zhiyuan, et al.
Pubblicazione: (2025)
Multi-Source Coflow Scheduling in Collaborative Edge Computing with Multihop Network
di: Sahni, Yuvraj, et al.
Pubblicazione: (2024)
di: Sahni, Yuvraj, et al.
Pubblicazione: (2024)
A Multi-Layered Distributed Computing Framework for Enhanced Edge Computing
di: Ma, Ke, et al.
Pubblicazione: (2024)
di: Ma, Ke, et al.
Pubblicazione: (2024)
QoS-Aware Load Balancing in the Computing Continuum via Multi-Player Bandits
di: Čilić, Ivan, et al.
Pubblicazione: (2025)
di: Čilić, Ivan, et al.
Pubblicazione: (2025)
Dynamic DAG-Application Scheduling for Multi-Tier Edge Computing in Heterogeneous Networks
di: Li, Xiang, et al.
Pubblicazione: (2024)
di: Li, Xiang, et al.
Pubblicazione: (2024)
PSMOA: Policy Support Multi-Objective Optimization Algorithm for Decentralized Data Replication
di: Wang, Xi, et al.
Pubblicazione: (2025)
di: Wang, Xi, et al.
Pubblicazione: (2025)
Q-adaptive: A Multi-Agent Reinforcement Learning Based Routing on Dragonfly Network
di: Kang, Yao, et al.
Pubblicazione: (2024)
di: Kang, Yao, et al.
Pubblicazione: (2024)
LIDC: A Location Independent Multi-Cluster Computing Framework for Data Intensive Science
di: Timilsina, Sankalpa, et al.
Pubblicazione: (2025)
di: Timilsina, Sankalpa, et al.
Pubblicazione: (2025)
EdgeTimer: Adaptive Multi-Timescale Scheduling in Mobile Edge Computing with Deep Reinforcement Learning
di: Hao, Yijun, et al.
Pubblicazione: (2024)
di: Hao, Yijun, et al.
Pubblicazione: (2024)
RouterWise: Joint Resource Allocation and Routing for Latency-Aware Multi-Model LLM Serving
di: Kasnavieh, Hossein Hosseini, et al.
Pubblicazione: (2026)
di: Kasnavieh, Hossein Hosseini, et al.
Pubblicazione: (2026)
Toward Edge General Intelligence with Multiple-Large Language Model (Multi-LLM): Architecture, Trust, and Orchestration
di: Luo, Haoxiang, et al.
Pubblicazione: (2025)
di: Luo, Haoxiang, et al.
Pubblicazione: (2025)
From Skew to Symmetry: Node-Interconnect Multi-Path Balancing with Execution-time Planning for Modern GPU Clusters
di: Yao, Jinghan, et al.
Pubblicazione: (2026)
di: Yao, Jinghan, et al.
Pubblicazione: (2026)
A Multi-Cloud Framework for Zero-Trust Workload Authentication
di: Deochake, Saurabh, et al.
Pubblicazione: (2025)
di: Deochake, Saurabh, et al.
Pubblicazione: (2025)
FogROS2-PLR: Probabilistic Latency-Reliability For Cloud Robotics
di: Chen, Kaiyuan, et al.
Pubblicazione: (2024)
di: Chen, Kaiyuan, et al.
Pubblicazione: (2024)
Decentralized Stratified Sampling for Low-Latency Approximate Geospatial Data Stream Processing in Edge-Cloud Architectures
di: Jawarneh, Isam Mashhour Al, et al.
Pubblicazione: (2026)
di: Jawarneh, Isam Mashhour Al, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Palladium: A DPU-enabled Multi-Tenant Serverless Cloud over Zero-copy Multi-node RDMA Fabrics
di: Qi, Shixiong, et al.
Pubblicazione: (2025) -
An Online Fragmentation-Aware GPU Scheduler for Multi-Tenant MIG-based Clouds
di: Zambianco, Marco, et al.
Pubblicazione: (2025) -
Causal Inference for Quantifying Noisy Neighbor Effects in Multi-Tenant Cloud Environments
di: Schiavo, Philipe S., et al.
Pubblicazione: (2026) -
Reimagining RDMA Through the Lens of ML
di: Warraich, Ertza, et al.
Pubblicazione: (2025) -
SAKURAONE: An Open Ethernet-Based AI HPC System and Its Observed Workload Dynamics in a Single-Tenant LLM Development Environment
di: Konishi, Fumikazu, et al.
Pubblicazione: (2026)