KIS-S: A GPU-Aware Kubernetes Inference Simulator with RL-Based Auto-Scaling
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Guilin, Guo, Wulan, Tan, Ziqi, Guan, Qiang, Jiang, Hailong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
AAPA: An Archetype-Aware Predictive Autoscaler with Uncertainty Quantification for Serverless Workloads on Kubernetes
di: Zhang, Guilin, et al.
Pubblicazione: (2025)
di: Zhang, Guilin, et al.
Pubblicazione: (2025)
AMP4EC: Adaptive Model Partitioning Framework for Efficient Deep Learning Inference in Edge Computing Environments
di: Zhang, Guilin, et al.
Pubblicazione: (2025)
di: Zhang, Guilin, et al.
Pubblicazione: (2025)
CarbonEdge: Carbon-Aware Deep Learning Inference Framework for Sustainable Edge Computing
di: Zhang, Guilin, et al.
Pubblicazione: (2026)
di: Zhang, Guilin, et al.
Pubblicazione: (2026)
Adaptive GPU Resource Allocation for Multi-Agent Collaborative Reasoning in Serverless Environments
di: Zhang, Guilin, et al.
Pubblicazione: (2025)
di: Zhang, Guilin, et al.
Pubblicazione: (2025)
A GPU-accelerated Molecular Docking Workflow with Kubernetes and Apache Airflow
di: Medeiros, Daniel, et al.
Pubblicazione: (2024)
di: Medeiros, Daniel, et al.
Pubblicazione: (2024)
Large Scale Multi-GPU Based Parallel Traffic Simulation for Accelerated Traffic Assignment and Propagation
di: Jiang, Xuan, et al.
Pubblicazione: (2024)
di: Jiang, Xuan, et al.
Pubblicazione: (2024)
HAS-GPU: Efficient Hybrid Auto-scaling with Fine-grained GPU Allocation for SLO-aware Serverless Inferences
di: Gu, Jianfeng, et al.
Pubblicazione: (2025)
di: Gu, Jianfeng, et al.
Pubblicazione: (2025)
Readout-Side Bypass for Residual Hybrid Quantum-Classical Models
di: Zhang, Guilin, et al.
Pubblicazione: (2025)
di: Zhang, Guilin, et al.
Pubblicazione: (2025)
QONNECT: A QoS-Aware Orchestration System for Distributed Kubernetes Clusters
di: Aslan, Haci Ismail, et al.
Pubblicazione: (2025)
di: Aslan, Haci Ismail, et al.
Pubblicazione: (2025)
Adaptive Resource Allocation for Workflow Containerization on Kubernetes
di: Shan, Chenggang, et al.
Pubblicazione: (2023)
di: Shan, Chenggang, et al.
Pubblicazione: (2023)
PRISM: Dynamic Primitive-Based Forecasting for Large-Scale GPU Cluster Workloads
di: Wu, Xin, et al.
Pubblicazione: (2026)
di: Wu, Xin, et al.
Pubblicazione: (2026)
ParvaGPU: Efficient Spatial GPU Sharing for Large-Scale DNN Inference in Cloud Environments
di: Lee, Munkyu, et al.
Pubblicazione: (2024)
di: Lee, Munkyu, et al.
Pubblicazione: (2024)
Serverless GPU Architecture for Enterprise HR Analytics: A Production-Scale BDaaS Implementation
di: Zhang, Guilin, et al.
Pubblicazione: (2025)
di: Zhang, Guilin, et al.
Pubblicazione: (2025)
PipeMax: Enhancing Offline LLM Inference on Commodity GPU Servers
di: Zhang, Hongbin, et al.
Pubblicazione: (2026)
di: Zhang, Hongbin, et al.
Pubblicazione: (2026)
Kubernetes in Action: Exploring the Performance of Kubernetes Distributions in the Cloud
di: Aqasizade, Hossein, et al.
Pubblicazione: (2024)
di: Aqasizade, Hossein, et al.
Pubblicazione: (2024)
Accelerating Drug Discovery in AutoDock-GPU with Tensor Cores
di: Schieffer, Gabin, et al.
Pubblicazione: (2024)
di: Schieffer, Gabin, et al.
Pubblicazione: (2024)
MERBIT: A GPU-Based SpMV Method for Iterative Workloads
di: Zhang, Qi, et al.
Pubblicazione: (2026)
di: Zhang, Qi, et al.
Pubblicazione: (2026)
BandPilot: Towards Performance- and Contention-Aware GPU Dispatching in AI Clusters
di: Zhang, Kunming, et al.
Pubblicazione: (2025)
di: Zhang, Kunming, et al.
Pubblicazione: (2025)
A Contention-Free Model for Converged Kubernetes on HPC
di: Sochat, Vanessa, et al.
Pubblicazione: (2024)
di: Sochat, Vanessa, et al.
Pubblicazione: (2024)
Priority Matters: Optimising Kubernetes Clusters Usage with Constraint-Based Pod Packing
di: Christensen, Henrik Daniel, et al.
Pubblicazione: (2025)
di: Christensen, Henrik Daniel, et al.
Pubblicazione: (2025)
Bandwidth-Aware LLM Inference on Heterogeneous Many-Core Supercomputers
di: Lu, Yao, et al.
Pubblicazione: (2026)
di: Lu, Yao, et al.
Pubblicazione: (2026)
DAK: Direct-Access-Enabled GPU Memory Offloading with Optimal Efficiency for LLM Inference
di: Lin, Shouxu, et al.
Pubblicazione: (2026)
di: Lin, Shouxu, et al.
Pubblicazione: (2026)
Signalling Health for Improved Kubernetes Microservice Availability
di: Roberts, Jacob, et al.
Pubblicazione: (2025)
di: Roberts, Jacob, et al.
Pubblicazione: (2025)
A Kubernetes custom scheduler based on reinforcement learning for compute-intensive pods
di: Zhou, Hanlin, et al.
Pubblicazione: (2026)
di: Zhou, Hanlin, et al.
Pubblicazione: (2026)
Loki: A System for Serving ML Inference Pipelines with Hardware and Accuracy Scaling
di: Ahmad, Sohaib, et al.
Pubblicazione: (2024)
di: Ahmad, Sohaib, et al.
Pubblicazione: (2024)
SpecInF: Exploiting Idle GPU Resources in Distributed DL Training via Speculative Inference Filling
di: Lv, Cunchi, et al.
Pubblicazione: (2025)
di: Lv, Cunchi, et al.
Pubblicazione: (2025)
Syncopate: Efficient Multi-GPU AI Kernels via Automatic Chunk-Centric Compute-Communication Overlap
di: Qiang, Xinwei, et al.
Pubblicazione: (2026)
di: Qiang, Xinwei, et al.
Pubblicazione: (2026)
Enhancing Kubernetes Resilience through Anomaly Detection and Prediction
di: Anemogiannis, V., et al.
Pubblicazione: (2025)
di: Anemogiannis, V., et al.
Pubblicazione: (2025)
Polar: Agentic RL on Any Harness at Scale
di: Xu, Binfeng, et al.
Pubblicazione: (2026)
di: Xu, Binfeng, et al.
Pubblicazione: (2026)
Scaling Up Throughput-oriented LLM Inference Applications on Heterogeneous Opportunistic GPU Clusters with Pervasive Context Management
di: Phung, Thanh Son, et al.
Pubblicazione: (2025)
di: Phung, Thanh Son, et al.
Pubblicazione: (2025)
A User-centric Kubernetes-based Architecture for Green Cloud Computing
di: Zanotto, Matteo, et al.
Pubblicazione: (2025)
di: Zanotto, Matteo, et al.
Pubblicazione: (2025)
NL-CPS: Reinforcement Learning-Based Kubernetes Control Plane Placement in Multi-Region Clusters
di: Alam, Sajid, et al.
Pubblicazione: (2026)
di: Alam, Sajid, et al.
Pubblicazione: (2026)
SageServe: Optimizing LLM Serving on Cloud Data Centers with Forecast Aware Auto-Scaling
di: Jaiswal, Shashwat, et al.
Pubblicazione: (2025)
di: Jaiswal, Shashwat, et al.
Pubblicazione: (2025)
Matrix representation and GPU-optimized parallel B-spline computing
di: Wu, Jiayu, et al.
Pubblicazione: (2025)
di: Wu, Jiayu, et al.
Pubblicazione: (2025)
An SLO Driven and Cost-Aware Autoscaling Framework for Kubernetes
di: Punniyamoorthy, Vinoth, et al.
Pubblicazione: (2025)
di: Punniyamoorthy, Vinoth, et al.
Pubblicazione: (2025)
AntBatchInfer: Elastic Batch Inference in the Kubernetes Cluster
di: Li, Siyuan, et al.
Pubblicazione: (2024)
di: Li, Siyuan, et al.
Pubblicazione: (2024)
Running Cloud-native Workloads on HPC with High-Performance Kubernetes
di: Chazapis, Antony, et al.
Pubblicazione: (2024)
di: Chazapis, Antony, et al.
Pubblicazione: (2024)
A Preliminary Study on Accelerating Simulation Optimization with GPU Implementation
di: He, Jinghai, et al.
Pubblicazione: (2024)
di: He, Jinghai, et al.
Pubblicazione: (2024)
Kubernetes in the Cloud vs. Bare Metal: A Comparative Study of Network Costs
di: Redoli, Rodrigo Mompo, et al.
Pubblicazione: (2025)
di: Redoli, Rodrigo Mompo, et al.
Pubblicazione: (2025)
PPipe: Efficient Video Analytics Serving on Heterogeneous GPU Clusters via Pool-Based Pipeline Parallelism
di: Kong, Z. Jonny, et al.
Pubblicazione: (2025)
di: Kong, Z. Jonny, et al.
Pubblicazione: (2025)
Documenti analoghi
-
AAPA: An Archetype-Aware Predictive Autoscaler with Uncertainty Quantification for Serverless Workloads on Kubernetes
di: Zhang, Guilin, et al.
Pubblicazione: (2025) -
AMP4EC: Adaptive Model Partitioning Framework for Efficient Deep Learning Inference in Edge Computing Environments
di: Zhang, Guilin, et al.
Pubblicazione: (2025) -
CarbonEdge: Carbon-Aware Deep Learning Inference Framework for Sustainable Edge Computing
di: Zhang, Guilin, et al.
Pubblicazione: (2026) -
Adaptive GPU Resource Allocation for Multi-Agent Collaborative Reasoning in Serverless Environments
di: Zhang, Guilin, et al.
Pubblicazione: (2025) -
A GPU-accelerated Molecular Docking Workflow with Kubernetes and Apache Airflow
di: Medeiros, Daniel, et al.
Pubblicazione: (2024)