LLMSched: Uncertainty-Aware Workload Scheduling for Compound LLM Applications
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhu, Botao, Chen, Chen, Fan, Xiaoyi, Zhu, Yifei |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Accelerating Compound LLM Training Workloads with Maestro
por: Yuan, Xiulong, et al.
Publicado: (2026)
por: Yuan, Xiulong, et al.
Publicado: (2026)
SageSched: Efficient LLM Scheduling Confronting Demand Uncertainty and Hybridity
por: Gan, Zhenghao, et al.
Publicado: (2026)
por: Gan, Zhenghao, et al.
Publicado: (2026)
S-HPLB: Efficient LLM Attention Serving via Sparsity-Aware Head Parallelism Load Balance
por: Liu, Di, et al.
Publicado: (2026)
por: Liu, Di, et al.
Publicado: (2026)
PAL: A Variability-Aware Policy for Scheduling ML Workloads in GPU Clusters
por: Jain, Rutwik, et al.
Publicado: (2024)
por: Jain, Rutwik, et al.
Publicado: (2024)
An Online Fragmentation-Aware Scheduler for Managing GPU-Sharing Workloads on Multi-Instance GPUs
por: Ting, Hsu-Tzu, et al.
Publicado: (2025)
por: Ting, Hsu-Tzu, et al.
Publicado: (2025)
Learning to Schedule: A Supervised Learning Framework for Network-Aware Scheduling of Data-Intensive Workloads
por: Timilsina, Sankalpa, et al.
Publicado: (2025)
por: Timilsina, Sankalpa, et al.
Publicado: (2025)
Topology-aware Preemptive Scheduling for Co-located LLM Workloads
por: Zhang, Ping, et al.
Publicado: (2024)
por: Zhang, Ping, et al.
Publicado: (2024)
AAPA: An Archetype-Aware Predictive Autoscaler with Uncertainty Quantification for Serverless Workloads on Kubernetes
por: Zhang, Guilin, et al.
Publicado: (2025)
por: Zhang, Guilin, et al.
Publicado: (2025)
Eventually-Consistent Federated Scheduling for Data Center Workloads
por: Thiyyakat, Meghana, et al.
Publicado: (2023)
por: Thiyyakat, Meghana, et al.
Publicado: (2023)
Agent.xpu: Efficient Scheduling of Agentic LLM Workloads on Heterogeneous SoC
por: Wei, Xinming, et al.
Publicado: (2025)
por: Wei, Xinming, et al.
Publicado: (2025)
Argus: Token Aware Distributed LLM Inference Optimization
por: Wu, Panlong, et al.
Publicado: (2025)
por: Wu, Panlong, et al.
Publicado: (2025)
Inference without Interference: Disaggregate LLM Inference for Mixed Downstream Workloads
por: Hu, Cunchen, et al.
Publicado: (2024)
por: Hu, Cunchen, et al.
Publicado: (2024)
HexAGenT: Efficient Agentic LLM Serving via Workflow- and Heterogeneity-Aware Scheduling
por: Peng, You, et al.
Publicado: (2026)
por: Peng, You, et al.
Publicado: (2026)
Quantifying the Carbon Reduction of DAG Workloads: A Job Shop Scheduling Perspective
por: Bostandoost, Roozbeh, et al.
Publicado: (2025)
por: Bostandoost, Roozbeh, et al.
Publicado: (2025)
Scheduling Data-Intensive Workloads in Large-Scale Distributed Systems: Trends and Challenges
por: Stavrinides, Georgios L., et al.
Publicado: (2025)
por: Stavrinides, Georgios L., et al.
Publicado: (2025)
Evaluating Malleable Job Scheduling in HPC Clusters using Real-World Workloads
por: Zojer, Patrick, et al.
Publicado: (2026)
por: Zojer, Patrick, et al.
Publicado: (2026)
Duration-Informed Workload Scheduler
por: Loreti, Daniela, et al.
Publicado: (2026)
por: Loreti, Daniela, et al.
Publicado: (2026)
FATE: Future-State-Aware Scheduling for Heterogeneous LLM Workflows
por: Huang, Zirui, et al.
Publicado: (2026)
por: Huang, Zirui, et al.
Publicado: (2026)
Zeppelin: Balancing Variable-length Workloads in Data Parallel Large Model Training
por: Chen, Chang, et al.
Publicado: (2025)
por: Chen, Chang, et al.
Publicado: (2025)
HiveMind: OS-Inspired Scheduling for Concurrent LLM Agent Workloads
por: Agyemang, Justice Owusu, et al.
Publicado: (2026)
por: Agyemang, Justice Owusu, et al.
Publicado: (2026)
Workflow-Driven Modeling for the Compute Continuum: An Optimization Approach to Automated System and Workload Scheduling
por: Sharma, Aasish Kumar, et al.
Publicado: (2025)
por: Sharma, Aasish Kumar, et al.
Publicado: (2025)
A Review of Tools and Techniques for Optimization of Workload Mapping and Scheduling in Heterogeneous HPC System
por: Sharma, Aasish Kumar, et al.
Publicado: (2025)
por: Sharma, Aasish Kumar, et al.
Publicado: (2025)
Sustainable Graph Analytics Workload Scheduling with Evolutionary Reinforcement Learning in Edge-Cloud Systems
por: Ramicetty, P., et al.
Publicado: (2026)
por: Ramicetty, P., et al.
Publicado: (2026)
Intelligent Router for LLM Workloads: Improving Performance Through Workload-Aware Load Balancing
por: Jain, Kunal, et al.
Publicado: (2024)
por: Jain, Kunal, et al.
Publicado: (2024)
SYMPHONY: Improving Memory Management for LLM Inference Workloads
por: Agarwal, Saurabh, et al.
Publicado: (2024)
por: Agarwal, Saurabh, et al.
Publicado: (2024)
Priority-Aware Preemptive Scheduling for Mixed-Priority Workloads in MoE Inference
por: Siavashi, Mohammad, et al.
Publicado: (2025)
por: Siavashi, Mohammad, et al.
Publicado: (2025)
Taming Request Imbalance: SLO-Aware Scheduling for Disaggregated LLM Inference
por: Wang, Qipeng
Publicado: (2026)
por: Wang, Qipeng
Publicado: (2026)
Collaborative Resource Management and Workloads Scheduling in Cloud-Assisted Mobile Edge Computing across Timescales
por: Tang, Lujie, et al.
Publicado: (2024)
por: Tang, Lujie, et al.
Publicado: (2024)
OCTOPINF: Workload-Aware Inference Serving for Edge Video Analytics
por: Nguyen, Thanh-Tung, et al.
Publicado: (2025)
por: Nguyen, Thanh-Tung, et al.
Publicado: (2025)
Workload Schedulers -- Genesis, Algorithms and Differences
por: Sliwko, Leszek, et al.
Publicado: (2025)
por: Sliwko, Leszek, et al.
Publicado: (2025)
GoodServe: Towards High-Goodput Serving of Agentic LLM Inferences over Heterogeneous Resources
por: Du, Boxiao, et al.
Publicado: (2026)
por: Du, Boxiao, et al.
Publicado: (2026)
Towards Cloud Efficiency with Large-scale Workload Characterization
por: Parayil, Anjaly, et al.
Publicado: (2024)
por: Parayil, Anjaly, et al.
Publicado: (2024)
MegaScale-Omni: A Hyper-Scale, Workload-Resilient System for MultiModal LLM Training in Production
por: Xue, Chunyu, et al.
Publicado: (2026)
por: Xue, Chunyu, et al.
Publicado: (2026)
SLO-Aware Scheduling for Large Language Model Inferences
por: Huang, Jinqi, et al.
Publicado: (2025)
por: Huang, Jinqi, et al.
Publicado: (2025)
Night-Window Batching versus Carbon-Aware Scheduling for Clinical AI GPU Workloads
por: Doshi, Nishi, et al.
Publicado: (2026)
por: Doshi, Nishi, et al.
Publicado: (2026)
PrefillOnly: An Inference Engine for Prefill-only Workloads in Large Language Model Applications
por: Du, Kuntai, et al.
Publicado: (2025)
por: Du, Kuntai, et al.
Publicado: (2025)
CascadeInfer: Length-Aware Scheduling of LLM Serving with Low Latency and Load Balancing
por: Yuan, Yitao, et al.
Publicado: (2025)
por: Yuan, Yitao, et al.
Publicado: (2025)
Bandwidth-Aware and Cost-Efficient Pipeline Parallel Scheduling in Geo-Distributed LLM Training
por: Zhang, Han, et al.
Publicado: (2026)
por: Zhang, Han, et al.
Publicado: (2026)
Data-Locality-Aware Task Assignment and Scheduling for Distributed Job Executions
por: Zhao, Hailiang, et al.
Publicado: (2024)
por: Zhao, Hailiang, et al.
Publicado: (2024)
OServe: Accelerating LLM Serving via Spatial-Temporal Workload Orchestration
por: Jiang, Youhe, et al.
Publicado: (2026)
por: Jiang, Youhe, et al.
Publicado: (2026)
Ejemplares similares
-
Accelerating Compound LLM Training Workloads with Maestro
por: Yuan, Xiulong, et al.
Publicado: (2026) -
SageSched: Efficient LLM Scheduling Confronting Demand Uncertainty and Hybridity
por: Gan, Zhenghao, et al.
Publicado: (2026) -
S-HPLB: Efficient LLM Attention Serving via Sparsity-Aware Head Parallelism Load Balance
por: Liu, Di, et al.
Publicado: (2026) -
PAL: A Variability-Aware Policy for Scheduling ML Workloads in GPU Clusters
por: Jain, Rutwik, et al.
Publicado: (2024) -
An Online Fragmentation-Aware Scheduler for Managing GPU-Sharing Workloads on Multi-Instance GPUs
por: Ting, Hsu-Tzu, et al.
Publicado: (2025)