Scheduling the Unschedulable: Taming Black-Box LLM Inference at Scale
Fuente:
arXiv
Salvato in:
| Autori principali: | Yuan, Renzhong, Zeng, Yijun, Gao, Xiaosong, Yu, Linxi, Liao, Haochun, Wang, Han |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Designing Scalable Rate Limiting Systems: Algorithms, Architecture, and Distributed Solutions
di: Guan, Bo
Pubblicazione: (2026)
di: Guan, Bo
Pubblicazione: (2026)
How Machine Learning-Data Driven Replication Strategies Enhance Fault Tolerance in Large-Scale Distributed Systems
di: Murimi, Almond Kiruthu
Pubblicazione: (2025)
di: Murimi, Almond Kiruthu
Pubblicazione: (2025)
Federated Fine-Tuning of LLMs on the Very Edge: The Good, the Bad, the Ugly
di: Woisetschläger, Herbert, et al.
Pubblicazione: (2023)
di: Woisetschläger, Herbert, et al.
Pubblicazione: (2023)
Impact of Network Topology on Byzantine Resilience in Decentralized Federated Learning
di: Bhattacharya, Siddhartha, et al.
Pubblicazione: (2024)
di: Bhattacharya, Siddhartha, et al.
Pubblicazione: (2024)
AMP4EC: Adaptive Model Partitioning Framework for Efficient Deep Learning Inference in Edge Computing Environments
di: Zhang, Guilin, et al.
Pubblicazione: (2025)
di: Zhang, Guilin, et al.
Pubblicazione: (2025)
Complex Event Processing in the Edge: A Combined Optimization Approach for Data and Code Placement
di: Uyanık, Halit, et al.
Pubblicazione: (2026)
di: Uyanık, Halit, et al.
Pubblicazione: (2026)
Accelerating Geo-distributed Machine Learning with Network-Aware Adaptive Tree and Auxiliary Route
di: Li, Zonghang, et al.
Pubblicazione: (2024)
di: Li, Zonghang, et al.
Pubblicazione: (2024)
HFedATM: Hierarchical Federated Domain Generalization via Optimal Transport and Regularized Mean Aggregation
di: Nguyen, Thinh, et al.
Pubblicazione: (2025)
di: Nguyen, Thinh, et al.
Pubblicazione: (2025)
How Can We Train Deep Learning Models Across Clouds and Continents? An Experimental Study
di: Erben, Alexander, et al.
Pubblicazione: (2023)
di: Erben, Alexander, et al.
Pubblicazione: (2023)
SAGA: Workflow-Atomic Scheduling for AI Agent Inference on GPU Clusters
di: Guo, Dongxin, et al.
Pubblicazione: (2026)
di: Guo, Dongxin, et al.
Pubblicazione: (2026)
Shattering the Ephemeral Storage Cost Barrier for Data-Intensive Serverless Workflows
di: Ustiugov, Dmitrii, et al.
Pubblicazione: (2023)
di: Ustiugov, Dmitrii, et al.
Pubblicazione: (2023)
TokenCake: A KV-Cache-centric Serving Framework for LLM-based Multi-Agent Applications
di: Bian, Zhuohang, et al.
Pubblicazione: (2025)
di: Bian, Zhuohang, et al.
Pubblicazione: (2025)
FLEdge: Benchmarking Federated Machine Learning Applications in Edge Computing Systems
di: Woisetschläger, Herbert, et al.
Pubblicazione: (2023)
di: Woisetschläger, Herbert, et al.
Pubblicazione: (2023)
Libra: Unleashing GPU Heterogeneity for High-Performance Sparse Matrix Multiplication
di: Shi, Jinliang, et al.
Pubblicazione: (2025)
di: Shi, Jinliang, et al.
Pubblicazione: (2025)
zScore: A Universal Decentralised Reputation System for the Blockchain Economy
di: Udupi, Himanshu, et al.
Pubblicazione: (2025)
di: Udupi, Himanshu, et al.
Pubblicazione: (2025)
Opportunistic Scheduling for Optimal Spot Instance Savings in the Cloud
di: Bhuyan, Neelkamal, et al.
Pubblicazione: (2026)
di: Bhuyan, Neelkamal, et al.
Pubblicazione: (2026)
Shipwright: Proving liveness of distributed systems with Byzantine participants
di: Leung, Derek, et al.
Pubblicazione: (2025)
di: Leung, Derek, et al.
Pubblicazione: (2025)
Federated Learning Model Aggregation in Heterogenous Aerial and Space Networks
di: Dong, Fan, et al.
Pubblicazione: (2023)
di: Dong, Fan, et al.
Pubblicazione: (2023)
Adaptive GPU Resource Allocation for Multi-Agent Collaborative Reasoning in Serverless Environments
di: Zhang, Guilin, et al.
Pubblicazione: (2025)
di: Zhang, Guilin, et al.
Pubblicazione: (2025)
Dodoor: Efficient Randomized Decentralized Scheduling with Load Caching for Heterogeneous Tasks and Clusters
di: Da, Wei, et al.
Pubblicazione: (2025)
di: Da, Wei, et al.
Pubblicazione: (2025)
TAGC: Optimizing Gradient Communication in Distributed Transformer Training
di: Polyakov, Igor, et al.
Pubblicazione: (2025)
di: Polyakov, Igor, et al.
Pubblicazione: (2025)
Chameleon: Adaptive Caching and Scheduling for Many-Adapter LLM Inference Environments
di: Iliakopoulou, Nikoleta, et al.
Pubblicazione: (2024)
di: Iliakopoulou, Nikoleta, et al.
Pubblicazione: (2024)
FCDP: Fully Cached Data Parallel for Communication-Avoiding Large-Scale Training
di: Park, Gyeongseo, et al.
Pubblicazione: (2026)
di: Park, Gyeongseo, et al.
Pubblicazione: (2026)
Trident: Adaptive Scheduling for Heterogeneous Multimodal Data Pipelines
di: Pan, Ding, et al.
Pubblicazione: (2026)
di: Pan, Ding, et al.
Pubblicazione: (2026)
Token Coherence: Adapting MESI Cache Protocols to Minimize Synchronization Overhead in Multi-Agent LLM Systems
di: Parakhin, Vladyslav
Pubblicazione: (2026)
di: Parakhin, Vladyslav
Pubblicazione: (2026)
Next-Generation Event-Driven Architectures: Performance, Scalability, and Intelligent Orchestration Across Messaging Frameworks
di: Arafat, Jahidul, et al.
Pubblicazione: (2025)
di: Arafat, Jahidul, et al.
Pubblicazione: (2025)
Laminar: A Probe-First Scheduling Paradigm with Deterministic Runtime Survival
di: Chu, Zhengyan
Pubblicazione: (2026)
di: Chu, Zhengyan
Pubblicazione: (2026)
Rank-Aware Resource Scheduling for Tightly-Coupled MPI Workloads on Kubernetes
di: Xie, Tianfang
Pubblicazione: (2026)
di: Xie, Tianfang
Pubblicazione: (2026)
dpBento: Benchmarking DPUs for Data Processing
di: Hu, Jiasheng, et al.
Pubblicazione: (2025)
di: Hu, Jiasheng, et al.
Pubblicazione: (2025)
Reexamining Paradigms of End-to-End Data Movement
di: Fang, Chin, et al.
Pubblicazione: (2025)
di: Fang, Chin, et al.
Pubblicazione: (2025)
Serverless Cold Starts and Where to Find Them
di: Joosen, Artjom, et al.
Pubblicazione: (2024)
di: Joosen, Artjom, et al.
Pubblicazione: (2024)
Bridging Generalization Gap of Heterogeneous Federated Clients Using Generative Models
di: Niu, Ziru, et al.
Pubblicazione: (2025)
di: Niu, Ziru, et al.
Pubblicazione: (2025)
Towards Building Private LLMs: Exploring Multi-Node Expert Parallelism on Apple Silicon for Mixture-of-Experts Large Language Model
di: Chen, Mu-Chi, et al.
Pubblicazione: (2025)
di: Chen, Mu-Chi, et al.
Pubblicazione: (2025)
DDS: DPU-optimized Disaggregated Storage [Extended Report]
di: Zhang, Qizhen, et al.
Pubblicazione: (2024)
di: Zhang, Qizhen, et al.
Pubblicazione: (2024)
OPTIMUMP2P: Fast and Reliable Gossiping in P2P Networks
di: Nicolaou, Nicolas, et al.
Pubblicazione: (2025)
di: Nicolaou, Nicolas, et al.
Pubblicazione: (2025)
Verifying In-Network Computing Systems for Design Risks
di: Bai, Tianyu, et al.
Pubblicazione: (2026)
di: Bai, Tianyu, et al.
Pubblicazione: (2026)
Studying the Effect of Schedule Preemption on Dynamic Task Graph Scheduling
di: Khodabandehlou, Mohammadali, et al.
Pubblicazione: (2026)
di: Khodabandehlou, Mohammadali, et al.
Pubblicazione: (2026)
EWSJF: An Adaptive Scheduler with Hybrid Partitioning for Mixed-Workload LLM Inference
di: Sidik, Bronislav, et al.
Pubblicazione: (2026)
di: Sidik, Bronislav, et al.
Pubblicazione: (2026)
Exploiting Spot Instances for Time-Critical Cloud Workloads Using Optimal Randomized Strategies
di: Bhuyan, Neelkamal, et al.
Pubblicazione: (2026)
di: Bhuyan, Neelkamal, et al.
Pubblicazione: (2026)
nvidia-pcm: A D-Bus-Driven Platform Configuration Manager for OpenBMC Environments
di: Singh, Harinder
Pubblicazione: (2026)
di: Singh, Harinder
Pubblicazione: (2026)
Documenti analoghi
-
Designing Scalable Rate Limiting Systems: Algorithms, Architecture, and Distributed Solutions
di: Guan, Bo
Pubblicazione: (2026) -
How Machine Learning-Data Driven Replication Strategies Enhance Fault Tolerance in Large-Scale Distributed Systems
di: Murimi, Almond Kiruthu
Pubblicazione: (2025) -
Federated Fine-Tuning of LLMs on the Very Edge: The Good, the Bad, the Ugly
di: Woisetschläger, Herbert, et al.
Pubblicazione: (2023) -
Impact of Network Topology on Byzantine Resilience in Decentralized Federated Learning
di: Bhattacharya, Siddhartha, et al.
Pubblicazione: (2024) -
AMP4EC: Adaptive Model Partitioning Framework for Efficient Deep Learning Inference in Edge Computing Environments
di: Zhang, Guilin, et al.
Pubblicazione: (2025)