Multi-stage Flow Scheduling for LLM Serving
Fuente:
arXiv
Saved in:
| Main Authors: | Sun, Yijun, Liao, Xudong, Xie, Songrun, Chen, Hao, Tian, Han, Li, Wenxue, Zhang, Yiming, Chen, Kai |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Recursive Offloading for LLM Serving in Multi-tier Networks
by: Wu, Zhiyuan, et al.
Published: (2025)
by: Wu, Zhiyuan, et al.
Published: (2025)
EdgeTimer: Adaptive Multi-Timescale Scheduling in Mobile Edge Computing with Deep Reinforcement Learning
by: Hao, Yijun, et al.
Published: (2024)
by: Hao, Yijun, et al.
Published: (2024)
Design and Operation of Shared Machine Learning Clusters on Campus
by: Xu, Kaiqiang, et al.
Published: (2021)
by: Xu, Kaiqiang, et al.
Published: (2021)
RouterWise: Joint Resource Allocation and Routing for Latency-Aware Multi-Model LLM Serving
by: Kasnavieh, Hossein Hosseini, et al.
Published: (2026)
by: Kasnavieh, Hossein Hosseini, et al.
Published: (2026)
PerLLM: Personalized Inference Scheduling with Edge-Cloud Collaboration for Diverse LLM Services
by: Yang, Zheming, et al.
Published: (2024)
by: Yang, Zheming, et al.
Published: (2024)
A Task Decomposition and Planning Framework for Efficient LLM Inference in AI-Enabled WiFi-Offload Networks
by: Han, Mingqi, et al.
Published: (2026)
by: Han, Mingqi, et al.
Published: (2026)
Multi-Source Coflow Scheduling in Collaborative Edge Computing with Multihop Network
by: Sahni, Yuvraj, et al.
Published: (2024)
by: Sahni, Yuvraj, et al.
Published: (2024)
Dynamic DAG-Application Scheduling for Multi-Tier Edge Computing in Heterogeneous Networks
by: Li, Xiang, et al.
Published: (2024)
by: Li, Xiang, et al.
Published: (2024)
An Online Fragmentation-Aware GPU Scheduler for Multi-Tenant MIG-based Clouds
by: Zambianco, Marco, et al.
Published: (2025)
by: Zambianco, Marco, et al.
Published: (2025)
MultiPath Memory Access: Breaking Host-GPU Bandwidth Bottlenecks in LLM Services
by: Tang, Lingfeng, et al.
Published: (2025)
by: Tang, Lingfeng, et al.
Published: (2025)
Real-Time Scheduling for 802.1Qbv Time-Sensitive Networking (TSN): A Systematic Review and Experimental Study
by: Xue, Chuanyu, et al.
Published: (2023)
by: Xue, Chuanyu, et al.
Published: (2023)
Toward Edge General Intelligence with Multiple-Large Language Model (Multi-LLM): Architecture, Trust, and Orchestration
by: Luo, Haoxiang, et al.
Published: (2025)
by: Luo, Haoxiang, et al.
Published: (2025)
Distributed Simulation for Digital Twins of Large-Scale Real-World DiffServ-Based Networks
by: Huang, Zhuoyao, et al.
Published: (2024)
by: Huang, Zhuoyao, et al.
Published: (2024)
AllReduce Scheduling with Hierarchical Deep Reinforcement Learning
by: Wei, Yufan, et al.
Published: (2025)
by: Wei, Yufan, et al.
Published: (2025)
FAST: An Efficient Scheduler for All-to-All GPU Communication
by: Lei, Yiran, et al.
Published: (2025)
by: Lei, Yiran, et al.
Published: (2025)
A Multi-Layered Distributed Computing Framework for Enhanced Edge Computing
by: Ma, Ke, et al.
Published: (2024)
by: Ma, Ke, et al.
Published: (2024)
Carbon-Aware Temporal Data Transfer Scheduling Across Cloud Datacenters
by: Rodrigues, Elvis, et al.
Published: (2025)
by: Rodrigues, Elvis, et al.
Published: (2025)
Efficient All-to-All Collective Communication Schedules for Direct-Connect Topologies
by: Basu, Prithwish, et al.
Published: (2023)
by: Basu, Prithwish, et al.
Published: (2023)
Harvest: Adaptive Photonic Switching Schedules for Collective Communication in Scale-up Domains
by: Rahman, Mahir, et al.
Published: (2026)
by: Rahman, Mahir, et al.
Published: (2026)
Reliable and Resilient Collective Communication Library for LLM Training and Serving
by: Wang, Wei, et al.
Published: (2025)
by: Wang, Wei, et al.
Published: (2025)
TraDE: Network and Traffic-aware Adaptive Scheduling for Microservices Under Dynamics
by: Chen, Ming, et al.
Published: (2024)
by: Chen, Ming, et al.
Published: (2024)
YUHENG-OS: A Cloud-Native Space Cluster Operating System
by: Zhang, Jin, et al.
Published: (2026)
by: Zhang, Jin, et al.
Published: (2026)
A Survey on Resource Management in Joint Communication and Computing-Embedded SAGIN
by: Chen, Qian, et al.
Published: (2024)
by: Chen, Qian, et al.
Published: (2024)
DRDST: Low-latency DAG Consensus through Robust Dynamic Sharding and Tree-broadcasting for IoV
by: Chen, Runhua, et al.
Published: (2024)
by: Chen, Runhua, et al.
Published: (2024)
Hierarchical Online-Scheduling for Energy-Efficient Split Inference with Progressive Transmission
by: Tang, Zengzipeng, et al.
Published: (2026)
by: Tang, Zengzipeng, et al.
Published: (2026)
KVServe: Service-Aware KV Cache Compression for Communication-Efficient Disaggregated LLM Serving
by: Liu, Zedong, et al.
Published: (2026)
by: Liu, Zedong, et al.
Published: (2026)
Decentralized Network Topology Design for Task Offloading in Mobile Edge Computing
by: Ma, Ke, et al.
Published: (2024)
by: Ma, Ke, et al.
Published: (2024)
FlowTracer: A Tool for Uncovering Network Path Usage Imbalance in AI Training Clusters
by: Jamil, Hasibul, et al.
Published: (2024)
by: Jamil, Hasibul, et al.
Published: (2024)
Arcturus: A Cloud Overlay Network for Global Accelerator with Enhanced Performance and Stability
by: Liu, Matthew Yang, et al.
Published: (2025)
by: Liu, Matthew Yang, et al.
Published: (2025)
A Density-Delay Law for Stable Event-Driven State Progression in Open Distributed Systems
by: Chen, Bin, et al.
Published: (2026)
by: Chen, Bin, et al.
Published: (2026)
Revolutionizing Datacenter Networks via Reconfigurable Topologies
by: Avin, Chen, et al.
Published: (2025)
by: Avin, Chen, et al.
Published: (2025)
RailX: A Flexible, Scalable, and Low-Cost Network Architecture for Hyper-Scale LLM Training Systems
by: Feng, Yinxiao, et al.
Published: (2025)
by: Feng, Yinxiao, et al.
Published: (2025)
CCL-Bench 1.0: A Trace-Based Benchmark for LLM Infrastructure
by: Ding, Eric, et al.
Published: (2026)
by: Ding, Eric, et al.
Published: (2026)
The Coverage Overlapping Problem of Serving Arbitrary Crowds in 3D Drone Cellular Networks
by: Lai, Chuan-Chi, et al.
Published: (2020)
by: Lai, Chuan-Chi, et al.
Published: (2020)
Temporal-Aware GPU Resource Allocation for Distributed LLM Inference via Reinforcement Learning
by: Du, Chengze, et al.
Published: (2025)
by: Du, Chengze, et al.
Published: (2025)
Semantic-Aware LLM Orchestration for Proactive Resource Management in Predictive Digital Twin Vehicular Networks
by: Ahmadpanah, Seyed Hossein
Published: (2025)
by: Ahmadpanah, Seyed Hossein
Published: (2025)
Palladium: A DPU-enabled Multi-Tenant Serverless Cloud over Zero-copy Multi-node RDMA Fabrics
by: Qi, Shixiong, et al.
Published: (2025)
by: Qi, Shixiong, et al.
Published: (2025)
A Mathematical Theory of Hyper-simplex Fractal Network for Blockchain: Part I
by: Yang, Kaiwen, et al.
Published: (2024)
by: Yang, Kaiwen, et al.
Published: (2024)
GORGO: Maximizing KV-Cache Reuse While Minimizing Network Latency in Cross-Region LLM Load Balancing
by: Toniolo, Alessio Ricci, et al.
Published: (2026)
by: Toniolo, Alessio Ricci, et al.
Published: (2026)
MDTP -- An Adaptive Multi-Source Data Transfer Protocol
by: Abdollah, Sepideh, et al.
Published: (2025)
by: Abdollah, Sepideh, et al.
Published: (2025)
Similar Items
-
Recursive Offloading for LLM Serving in Multi-tier Networks
by: Wu, Zhiyuan, et al.
Published: (2025) -
EdgeTimer: Adaptive Multi-Timescale Scheduling in Mobile Edge Computing with Deep Reinforcement Learning
by: Hao, Yijun, et al.
Published: (2024) -
Design and Operation of Shared Machine Learning Clusters on Campus
by: Xu, Kaiqiang, et al.
Published: (2021) -
RouterWise: Joint Resource Allocation and Routing for Latency-Aware Multi-Model LLM Serving
by: Kasnavieh, Hossein Hosseini, et al.
Published: (2026) -
PerLLM: Personalized Inference Scheduling with Edge-Cloud Collaboration for Diverse LLM Services
by: Yang, Zheming, et al.
Published: (2024)