SAIR: Cost-Efficient Multi-Stage ML Pipeline Autoscaling via In-Context Reinforcement Learning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Su, Jianchang, Zhang, Yifan, Lin, Shengkai, Zhao, Shizhen, Zheng, Yusheng, Yang, Yiwei, Zhang, Wei |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
LiveR: Fine-Grained Elasticity via Live Reconfiguration for Model Training
par: Liu, Haoyuan, et autres
Publié: (2026)
par: Liu, Haoyuan, et autres
Publié: (2026)
SpotKube: Cost-Optimal Microservices Deployment with Cluster Autoscaling and Spot Pricing
par: Edirisinghe, Dasith, et autres
Publié: (2024)
par: Edirisinghe, Dasith, et autres
Publié: (2024)
Multi-Objective Optimization of Consumer Group Autoscaling in Message Broker Systems
par: Landau, Diogo, et autres
Publié: (2024)
par: Landau, Diogo, et autres
Publié: (2024)
An SLO Driven and Cost-Aware Autoscaling Framework for Kubernetes
par: Punniyamoorthy, Vinoth, et autres
Publié: (2025)
par: Punniyamoorthy, Vinoth, et autres
Publié: (2025)
Bandwidth-Aware and Cost-Efficient Pipeline Parallel Scheduling in Geo-Distributed LLM Training
par: Zhang, Han, et autres
Publié: (2026)
par: Zhang, Han, et autres
Publié: (2026)
Self-adaptive, Requirements-driven Autoscaling of Microservices
par: Nunes, João Paulo Karol Santos, et autres
Publié: (2024)
par: Nunes, João Paulo Karol Santos, et autres
Publié: (2024)
Proactive and Reactive Autoscaling Techniques for Edge Computing
par: Gupta, Suhrid, et autres
Publié: (2025)
par: Gupta, Suhrid, et autres
Publié: (2025)
TokenScale: Timely and Accurate Autoscaling for Disaggregated LLM Serving with Token Velocity
par: Lai, Ruiqi, et autres
Publié: (2025)
par: Lai, Ruiqi, et autres
Publié: (2025)
ENOVA: Autoscaling towards Cost-effective and Stable Serverless LLM Serving
par: Huang, Tao, et autres
Publié: (2024)
par: Huang, Tao, et autres
Publié: (2024)
FEPLB: Exploiting Copy Engines for Nearly Free MoE Load Balancing in Distributed Training
par: Qi, Shuyao, et autres
Publié: (2026)
par: Qi, Shuyao, et autres
Publié: (2026)
Declarative Data Pipeline for Large Scale ML Services
par: Yang, Yunzhao, et autres
Publié: (2025)
par: Yang, Yunzhao, et autres
Publié: (2025)
ORACL: Optimized Reasoning for Autoscaling via Chain of Thought with LLMs for Microservices
par: Bai, Haoyu, et autres
Publié: (2026)
par: Bai, Haoyu, et autres
Publié: (2026)
TridentServe: A Stage-level Serving System for Diffusion Pipelines
par: Xia, Yifei, et autres
Publié: (2025)
par: Xia, Yifei, et autres
Publié: (2025)
SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference
par: He, Yongchao, et autres
Publié: (2025)
par: He, Yongchao, et autres
Publié: (2025)
Daedalus: Self-Adaptive Horizontal Autoscaling for Resource Efficiency of Distributed Stream Processing Systems
par: Pfister, Benjamin J. J., et autres
Publié: (2024)
par: Pfister, Benjamin J. J., et autres
Publié: (2024)
EPS-MoE: Expert Pipeline Scheduler for Cost-Efficient MoE Inference
par: Qian, Yulei, et autres
Publié: (2024)
par: Qian, Yulei, et autres
Publié: (2024)
Loki: A System for Serving ML Inference Pipelines with Hardware and Accuracy Scaling
par: Ahmad, Sohaib, et autres
Publié: (2024)
par: Ahmad, Sohaib, et autres
Publié: (2024)
BLITZSCALE: Fast and Live Large Model Autoscaling with O(1) Host Caching
par: Zhang, Dingyan, et autres
Publié: (2024)
par: Zhang, Dingyan, et autres
Publié: (2024)
HetGPU: The pursuit of making binary compatibility towards GPUs
par: Yang, Yiwei, et autres
Publié: (2025)
par: Yang, Yiwei, et autres
Publié: (2025)
HGraphScale: Hierarchical Graph Learning for Autoscaling Microservice Applications in Container-based Cloud Computing
par: Fang, Zhengxin, et autres
Publié: (2025)
par: Fang, Zhengxin, et autres
Publié: (2025)
LSRAM: A Lightweight Autoscaling and SLO Resource Allocation Framework for Microservices Based on Gradient Descent
par: Hu, Kan, et autres
Publié: (2024)
par: Hu, Kan, et autres
Publié: (2024)
SPPO:Efficient Long-sequence LLM Training via Adaptive Sequence Pipeline Parallel Offloading
par: Chen, Qiaoling, et autres
Publié: (2025)
par: Chen, Qiaoling, et autres
Publié: (2025)
Efficient Long Context Fine-tuning with Chunk Flow
par: Yuan, Xiulong, et autres
Publié: (2025)
par: Yuan, Xiulong, et autres
Publié: (2025)
MPipeMoE: Memory Efficient MoE for Pre-trained Models with Adaptive Pipeline Parallelism
par: Zhang, Zheng, et autres
Publié: (2025)
par: Zhang, Zheng, et autres
Publié: (2025)
TD-Pipe: Temporally-Disaggregated Pipeline Parallelism Architecture for High-Throughput LLM Inference
par: Zhang, Hongbin, et autres
Publié: (2025)
par: Zhang, Hongbin, et autres
Publié: (2025)
LA-IMR: Latency-Aware, Predictive In-Memory Routing and Proactive Autoscaling for Tail-Latency-Sensitive Cloud Robotics
par: Seo, Eunil, et autres
Publié: (2025)
par: Seo, Eunil, et autres
Publié: (2025)
Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference
par: Li, Rongzhi, et autres
Publié: (2025)
par: Li, Rongzhi, et autres
Publié: (2025)
Cicada: A Pipeline-Efficient Approach to Serverless Inference with Decoupled Management
par: Wu, Z., et autres
Publié: (2025)
par: Wu, Z., et autres
Publié: (2025)
The High Cost of Keeping Warm: Characterizing Overhead in Serverless Autoscaling Policies
par: Kondrashov, Leonid, et autres
Publié: (2025)
par: Kondrashov, Leonid, et autres
Publié: (2025)
Seq1F1B: Efficient Sequence-Level Pipeline Parallelism for Large Language Model Training
par: Sun, Ao, et autres
Publié: (2024)
par: Sun, Ao, et autres
Publié: (2024)
A Pipelined Collaborative Speculative Decoding Framework for Efficient Edge-Cloud LLM Inference
par: Zhang, Yida, et autres
Publié: (2026)
par: Zhang, Yida, et autres
Publié: (2026)
NCCLbpf: Verified, Composable Policy Execution for GPU Collective Communication
par: Zheng, Yusheng
Publié: (2026)
par: Zheng, Yusheng
Publié: (2026)
Hierarchical Autoscaling for Large Language Model Serving with Chiron
par: Patke, Archit, et autres
Publié: (2025)
par: Patke, Archit, et autres
Publié: (2025)
PARD: Enhancing Goodput for Inference Pipeline via Proactive Request Dropping
par: Zhao, Zhixin, et autres
Publié: (2026)
par: Zhao, Zhixin, et autres
Publié: (2026)
Multi-Modal Style Transfer-based Prompt Tuning for Efficient Federated Domain Generalization
par: Chen, Yuliang, et autres
Publié: (2026)
par: Chen, Yuliang, et autres
Publié: (2026)
CASA: A Framework for SLO and Carbon-Aware Autoscaling and Scheduling in Serverless Cloud Computing
par: Qi, S., et autres
Publié: (2024)
par: Qi, S., et autres
Publié: (2024)
PipeSD: An Efficient Cloud-Edge Collaborative Pipeline Inference Framework with Speculative Decoding
par: Han, Yunhe, et autres
Publié: (2026)
par: Han, Yunhe, et autres
Publié: (2026)
MAS-H2: A Hierarchical Multi-Agent System for Holistic Cloud-Native Autoscaling
par: Hamzeh, Hamed, et autres
Publié: (2026)
par: Hamzeh, Hamed, et autres
Publié: (2026)
Adaptra: Straggler-Resilient Hybrid-Parallel Training with Pipeline Adaptation
par: Wu, Tianyuan, et autres
Publié: (2025)
par: Wu, Tianyuan, et autres
Publié: (2025)
DawnPiper: A Memory-scablable Pipeline Parallel Training Framework
par: Peng, Xuan, et autres
Publié: (2025)
par: Peng, Xuan, et autres
Publié: (2025)
Documents similaires
-
LiveR: Fine-Grained Elasticity via Live Reconfiguration for Model Training
par: Liu, Haoyuan, et autres
Publié: (2026) -
SpotKube: Cost-Optimal Microservices Deployment with Cluster Autoscaling and Spot Pricing
par: Edirisinghe, Dasith, et autres
Publié: (2024) -
Multi-Objective Optimization of Consumer Group Autoscaling in Message Broker Systems
par: Landau, Diogo, et autres
Publié: (2024) -
An SLO Driven and Cost-Aware Autoscaling Framework for Kubernetes
par: Punniyamoorthy, Vinoth, et autres
Publié: (2025) -
Bandwidth-Aware and Cost-Efficient Pipeline Parallel Scheduling in Geo-Distributed LLM Training
par: Zhang, Han, et autres
Publié: (2026)