SLO-Aware Scheduling for Large Language Model Inferences
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Huang, Jinqi, Xiong, Yi, Yu, Xuebing, Huang, Wenjie, Li, Entong, Zeng, Li, Chen, Xin |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
WindVE: Collaborative CPU-NPU Vector Embedding
von: Huang, Jinqi, et al.
Veröffentlicht: (2025)
von: Huang, Jinqi, et al.
Veröffentlicht: (2025)
High-Throughput LLM inference on Heterogeneous Clusters
von: Xiong, Yi, et al.
Veröffentlicht: (2025)
von: Xiong, Yi, et al.
Veröffentlicht: (2025)
Taming Request Imbalance: SLO-Aware Scheduling for Disaggregated LLM Inference
von: Wang, Qipeng
Veröffentlicht: (2026)
von: Wang, Qipeng
Veröffentlicht: (2026)
Memory Offloading for Large Language Model Inference with Latency SLO Guarantees
von: Ma, Chenxiang, et al.
Veröffentlicht: (2025)
von: Ma, Chenxiang, et al.
Veröffentlicht: (2025)
SLICE: SLO-Driven Scheduling for LLM Inference on Edge Computing Devices
von: Chow, Will
Veröffentlicht: (2025)
von: Chow, Will
Veröffentlicht: (2025)
HarmonyBatch: Batching multi-SLO DNN Inference with Heterogeneous Serverless Functions
von: Chen, Jiabin, et al.
Veröffentlicht: (2024)
von: Chen, Jiabin, et al.
Veröffentlicht: (2024)
SCOOT: SLO-Oriented Performance Tuning for LLM Inference Engines
von: Cheng, Ke, et al.
Veröffentlicht: (2024)
von: Cheng, Ke, et al.
Veröffentlicht: (2024)
SeaLLM: Service-Aware and Latency-Optimized Resource Sharing for Large Language Model Inference
von: Zhao, Yihao, et al.
Veröffentlicht: (2025)
von: Zhao, Yihao, et al.
Veröffentlicht: (2025)
A House United Within Itself: SLO-Awareness for On-Premises Containerized ML Inference Clusters via Faro
von: Jeon, Beomyeol, et al.
Veröffentlicht: (2024)
von: Jeon, Beomyeol, et al.
Veröffentlicht: (2024)
CASA: A Framework for SLO and Carbon-Aware Autoscaling and Scheduling in Serverless Cloud Computing
von: Qi, S., et al.
Veröffentlicht: (2024)
von: Qi, S., et al.
Veröffentlicht: (2024)
FATE: Future-State-Aware Scheduling for Heterogeneous LLM Workflows
von: Huang, Zirui, et al.
Veröffentlicht: (2026)
von: Huang, Zirui, et al.
Veröffentlicht: (2026)
SuperInfer: SLO-Aware Rotary Scheduling and Memory Management for LLM Inference on Superchips
von: Yu, Jiahuan, et al.
Veröffentlicht: (2026)
von: Yu, Jiahuan, et al.
Veröffentlicht: (2026)
BrownoutServe: SLO-Aware Inference Serving under Bursty Workloads for MoE-based LLMs
von: Hu, Jianmin, et al.
Veröffentlicht: (2025)
von: Hu, Jianmin, et al.
Veröffentlicht: (2025)
Arrow: Adaptive Scheduling Mechanisms for Disaggregated LLM Inference Architecture
von: Wu, Yu, et al.
Veröffentlicht: (2025)
von: Wu, Yu, et al.
Veröffentlicht: (2025)
HAS-GPU: Efficient Hybrid Auto-scaling with Fine-grained GPU Allocation for SLO-aware Serverless Inferences
von: Gu, Jianfeng, et al.
Veröffentlicht: (2025)
von: Gu, Jianfeng, et al.
Veröffentlicht: (2025)
Aladdin: Joint Placement and Scaling for SLO-Aware LLM Serving
von: Nie, Chengyi, et al.
Veröffentlicht: (2024)
von: Nie, Chengyi, et al.
Veröffentlicht: (2024)
SLO-Aware Task Offloading within Collaborative Vehicle Platoons
von: Sedlak, Boris, et al.
Veröffentlicht: (2024)
von: Sedlak, Boris, et al.
Veröffentlicht: (2024)
Harli: SLO-Aware Co-location of LLM Inference and PEFT-based Finetuning on Model-as-a-Service Platforms
von: Xu, Ao, et al.
Veröffentlicht: (2025)
von: Xu, Ao, et al.
Veröffentlicht: (2025)
HydraInfer: Hybrid Disaggregated Scheduling for Multimodal Large Language Model Serving
von: Dong, Xianzhe, et al.
Veröffentlicht: (2025)
von: Dong, Xianzhe, et al.
Veröffentlicht: (2025)
SLO-Aware Compute Resource Allocation for Prefill-Decode Disaggregated LLM Inference
von: Li, Luchang, et al.
Veröffentlicht: (2026)
von: Li, Luchang, et al.
Veröffentlicht: (2026)
PromptTuner: SLO-Aware Elastic System for LLM Prompt Tuning
von: Gao, Wei, et al.
Veröffentlicht: (2026)
von: Gao, Wei, et al.
Veröffentlicht: (2026)
Hummingbird: SLO-Oriented GPU Preemption at Microsecond-scale
von: Hu, Tiancheng, et al.
Veröffentlicht: (2026)
von: Hu, Tiancheng, et al.
Veröffentlicht: (2026)
SneakPeek: Data-Aware Model Selection and Scheduling for Inference Serving on the Edge
von: Wolfrath, Joel, et al.
Veröffentlicht: (2025)
von: Wolfrath, Joel, et al.
Veröffentlicht: (2025)
SPIN: Accelerating Large Language Model Inference with Heterogeneous Speculative Models
von: Chen, Fahao, et al.
Veröffentlicht: (2025)
von: Chen, Fahao, et al.
Veröffentlicht: (2025)
Tangram: High-resolution Video Analytics on Serverless Platform with SLO-aware Batching
von: Peng, Haosong, et al.
Veröffentlicht: (2024)
von: Peng, Haosong, et al.
Veröffentlicht: (2024)
MaaSO: SLO-aware Orchestration of Heterogeneous Model Instances for MaaS
von: Xuan, Mo, et al.
Veröffentlicht: (2025)
von: Xuan, Mo, et al.
Veröffentlicht: (2025)
SERFLOW: A Cross-Service Cost Optimization Framework for SLO-Aware Dynamic ML Inference
von: Zhang, Zongshun, et al.
Veröffentlicht: (2025)
von: Zhang, Zongshun, et al.
Veröffentlicht: (2025)
Minions: Accelerating Large Language Model Inference with Aggregated Speculative Execution
von: Wang, Siqi, et al.
Veröffentlicht: (2024)
von: Wang, Siqi, et al.
Veröffentlicht: (2024)
An SLO Driven and Cost-Aware Autoscaling Framework for Kubernetes
von: Punniyamoorthy, Vinoth, et al.
Veröffentlicht: (2025)
von: Punniyamoorthy, Vinoth, et al.
Veröffentlicht: (2025)
RingAda: Pipelining Large Model Fine-Tuning on Edge Devices with Scheduled Layer Unfreezing
von: Li, Liang, et al.
Veröffentlicht: (2025)
von: Li, Liang, et al.
Veröffentlicht: (2025)
DeInfer: Efficient Parallel Inferencing for Decomposed Large Language Models
von: Huang, You-Liang, et al.
Veröffentlicht: (2026)
von: Huang, You-Liang, et al.
Veröffentlicht: (2026)
Serving Hybrid LLM Loads with SLO Guarantees Using CPU-GPU Attention Piggybacking
von: Mo, Zizhao, et al.
Veröffentlicht: (2026)
von: Mo, Zizhao, et al.
Veröffentlicht: (2026)
Equinox: Holistic Fair Scheduling in Serving Large Language Models
von: Wei, Zhixiang, et al.
Veröffentlicht: (2025)
von: Wei, Zhixiang, et al.
Veröffentlicht: (2025)
Semantic-Aware Scheduling for GPU Clusters with Large Language Models
von: Wang, Zerui, et al.
Veröffentlicht: (2025)
von: Wang, Zerui, et al.
Veröffentlicht: (2025)
InternEvo: Efficient Long-sequence Large Language Model Training via Hybrid Parallelism and Redundant Sharding
von: Chen, Qiaoling, et al.
Veröffentlicht: (2024)
von: Chen, Qiaoling, et al.
Veröffentlicht: (2024)
Not All Errors Are Equal: A Systematic Study of Error Propagation in Large Language Model Inference
von: Huang, Yafan, et al.
Veröffentlicht: (2026)
von: Huang, Yafan, et al.
Veröffentlicht: (2026)
ACE-GNN: Adaptive GNN Co-Inference with System-Aware Scheduling in Dynamic Edge Environments
von: Zhou, Ao, et al.
Veröffentlicht: (2025)
von: Zhou, Ao, et al.
Veröffentlicht: (2025)
λScale: Enabling Fast Scaling for Serverless Large Language Model Inference
von: Yu, Minchen, et al.
Veröffentlicht: (2025)
von: Yu, Minchen, et al.
Veröffentlicht: (2025)
iScheduler: Reinforcement Learning-Driven Continual Optimization for Large-Scale Resource Investment Problems
von: Hu, Yi-Xiang, et al.
Veröffentlicht: (2026)
von: Hu, Yi-Xiang, et al.
Veröffentlicht: (2026)
Network Edge Inference for Large Language Models: Principles, Techniques, and Opportunities
von: Chen, Zhixiong, et al.
Veröffentlicht: (2026)
von: Chen, Zhixiong, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
WindVE: Collaborative CPU-NPU Vector Embedding
von: Huang, Jinqi, et al.
Veröffentlicht: (2025) -
High-Throughput LLM inference on Heterogeneous Clusters
von: Xiong, Yi, et al.
Veröffentlicht: (2025) -
Taming Request Imbalance: SLO-Aware Scheduling for Disaggregated LLM Inference
von: Wang, Qipeng
Veröffentlicht: (2026) -
Memory Offloading for Large Language Model Inference with Latency SLO Guarantees
von: Ma, Chenxiang, et al.
Veröffentlicht: (2025) -
SLICE: SLO-Driven Scheduling for LLM Inference on Edge Computing Devices
von: Chow, Will
Veröffentlicht: (2025)