Salvato in:
| Autori principali: | Harshbarger, Ian, Chidambaram, Calvin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2510.09018 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Prompt-Aware Scheduling for Efficient Text-to-Image Inferencing System
di: Agarwal, Shubham, et al.
Pubblicazione: (2025)
di: Agarwal, Shubham, et al.
Pubblicazione: (2025)
SortedRL: Accelerating RL Training for LLMs through Online Length-Aware Scheduling
di: Zhang, Yiqi, et al.
Pubblicazione: (2026)
di: Zhang, Yiqi, et al.
Pubblicazione: (2026)
AgentSlimming: Towards Efficient and Cost-Aware Multi-Agent Systems
di: Chen, Yulang, et al.
Pubblicazione: (2026)
di: Chen, Yulang, et al.
Pubblicazione: (2026)
ML Inference Scheduling with Predictable Latency
di: Zhao, Haidong, et al.
Pubblicazione: (2025)
di: Zhao, Haidong, et al.
Pubblicazione: (2025)
ExeGPT: Constraint-Aware Resource Scheduling for LLM Inference
di: Oh, Hyungjun, et al.
Pubblicazione: (2024)
di: Oh, Hyungjun, et al.
Pubblicazione: (2024)
Capacity-Aware Planning and Scheduling in Budget-Constrained Multi-Agent MDPs: A Meta-RL Approach
di: Vora, Manav, et al.
Pubblicazione: (2024)
di: Vora, Manav, et al.
Pubblicazione: (2024)
Semantic Scheduling for LLM Inference
di: Hua, Wenyue, et al.
Pubblicazione: (2025)
di: Hua, Wenyue, et al.
Pubblicazione: (2025)
Optimal Inference Schedules for Masked Diffusion Models
di: Chen, Sitan, et al.
Pubblicazione: (2025)
di: Chen, Sitan, et al.
Pubblicazione: (2025)
PecSched: Preemptive and Efficient Cluster Scheduling for LLM Inference
di: Zhang, Zeyu, et al.
Pubblicazione: (2024)
di: Zhang, Zeyu, et al.
Pubblicazione: (2024)
CNN-Enabled Scheduling for Probabilistic Real-Time Guarantees in Industrial URLLC
di: Alqudah, Eman, et al.
Pubblicazione: (2025)
di: Alqudah, Eman, et al.
Pubblicazione: (2025)
Efficient LLM Scheduling by Learning to Rank
di: Fu, Yichao, et al.
Pubblicazione: (2024)
di: Fu, Yichao, et al.
Pubblicazione: (2024)
A Data-Driven Approach to Dataflow-Aware Online Scheduling for Graph Neural Network Inference
di: Puigdemont, Pol, et al.
Pubblicazione: (2024)
di: Puigdemont, Pol, et al.
Pubblicazione: (2024)
Priority-Aware Preemptive Scheduling for Mixed-Priority Workloads in MoE Inference
di: Siavashi, Mohammad, et al.
Pubblicazione: (2025)
di: Siavashi, Mohammad, et al.
Pubblicazione: (2025)
Mamba Meets Scheduling: Learning to Solve Flexible Job Shop Scheduling with Efficient Sequence Modeling
di: Cao, Zhi, et al.
Pubblicazione: (2026)
di: Cao, Zhi, et al.
Pubblicazione: (2026)
Heterogeneity-Aware Dataset Scheduling for Efficient Audio Large Language Model Training
di: Wu, Yanru, et al.
Pubblicazione: (2026)
di: Wu, Yanru, et al.
Pubblicazione: (2026)
Energy-Efficient Scheduling with Predictions
di: Balkanski, Eric, et al.
Pubblicazione: (2024)
di: Balkanski, Eric, et al.
Pubblicazione: (2024)
Flow-Controlled Scheduling for LLM Inference with Provable Stability Guarantees
di: Dong, Zhuolun, et al.
Pubblicazione: (2026)
di: Dong, Zhuolun, et al.
Pubblicazione: (2026)
Mining--Gym: A Configurable RL Benchmarking Environment for Truck Dispatch Scheduling
di: Banerjee, Chayan, et al.
Pubblicazione: (2025)
di: Banerjee, Chayan, et al.
Pubblicazione: (2025)
Throughput-Optimal Scheduling Algorithms for LLM Inference and AI Agents
di: Dai, J. G., et al.
Pubblicazione: (2025)
di: Dai, J. G., et al.
Pubblicazione: (2025)
Hierarchical Online-Scheduling for Energy-Efficient Split Inference with Progressive Transmission
di: Tang, Zengzipeng, et al.
Pubblicazione: (2026)
di: Tang, Zengzipeng, et al.
Pubblicazione: (2026)
Duration Aware Scheduling for ASR Serving Under Workload Drift
di: Makwana, Darshan, et al.
Pubblicazione: (2026)
di: Makwana, Darshan, et al.
Pubblicazione: (2026)
Omni-Thinker: Scaling Multi-Task RL in LLMs with Hybrid Reward and Task Scheduling
di: Li, Derek, et al.
Pubblicazione: (2025)
di: Li, Derek, et al.
Pubblicazione: (2025)
CuAsmRL: Optimizing GPU SASS Schedules via Deep Reinforcement Learning
di: He, Guoliang, et al.
Pubblicazione: (2025)
di: He, Guoliang, et al.
Pubblicazione: (2025)
RL-MSA: a Reinforcement Learning-based Multi-line bus Scheduling Approach
di: Liu, Yingzhuo
Pubblicazione: (2024)
di: Liu, Yingzhuo
Pubblicazione: (2024)
SuperInfer: SLO-Aware Rotary Scheduling and Memory Management for LLM Inference on Superchips
di: Yu, Jiahuan, et al.
Pubblicazione: (2026)
di: Yu, Jiahuan, et al.
Pubblicazione: (2026)
Online Scheduling for LLM Inference with KV Cache Constraints
di: Jaillet, Patrick, et al.
Pubblicazione: (2025)
di: Jaillet, Patrick, et al.
Pubblicazione: (2025)
Optimal Scheduling Algorithms for LLM Inference: Theory and Practice
di: Bari, Agrim, et al.
Pubblicazione: (2025)
di: Bari, Agrim, et al.
Pubblicazione: (2025)
LayerScope: Predictive Cross-Layer Scheduling for Efficient Multi-Batch MoE Inference on Legacy Servers
di: Yu, Enda, et al.
Pubblicazione: (2025)
di: Yu, Enda, et al.
Pubblicazione: (2025)
Adapter-Augmented Bandits for Online Multi-Constrained Multi-Modal Inference Scheduling
di: Zhang, Xianzhi, et al.
Pubblicazione: (2026)
di: Zhang, Xianzhi, et al.
Pubblicazione: (2026)
Adaptive Slimming for Scalable and Efficient Speech Enhancement
di: Miccini, Riccardo, et al.
Pubblicazione: (2025)
di: Miccini, Riccardo, et al.
Pubblicazione: (2025)
SeamlessFlow: A Trainer Agent Isolation RL Framework Achieving Bubble-Free Pipelines via Tag Scheduling
di: Wang, Jinghui, et al.
Pubblicazione: (2025)
di: Wang, Jinghui, et al.
Pubblicazione: (2025)
Design and Scheduling of an AI-based Queueing System
di: Lee, Jiung, et al.
Pubblicazione: (2024)
di: Lee, Jiung, et al.
Pubblicazione: (2024)
Apt-Serve: Adaptive Request Scheduling on Hybrid Cache for Scalable LLM Inference Serving
di: Gao, Shihong, et al.
Pubblicazione: (2025)
di: Gao, Shihong, et al.
Pubblicazione: (2025)
Green Federated Learning via Carbon-Aware Client and Time Slot Scheduling
di: Arputharaj, Daniel Richards, et al.
Pubblicazione: (2025)
di: Arputharaj, Daniel Richards, et al.
Pubblicazione: (2025)
Score-Optimal Diffusion Schedules
di: Williams, Christopher, et al.
Pubblicazione: (2024)
di: Williams, Christopher, et al.
Pubblicazione: (2024)
MARS: Efficient, Adaptive Co-Scheduling for Heterogeneous Agentic Systems
di: Wang, Yifei, et al.
Pubblicazione: (2026)
di: Wang, Yifei, et al.
Pubblicazione: (2026)
LLM-Guided Runtime Parameter Optimization for Energy-Efficient Model Inference
di: Crumpacker, Katelyn, et al.
Pubblicazione: (2026)
di: Crumpacker, Katelyn, et al.
Pubblicazione: (2026)
HybriMoE: Hybrid CPU-GPU Scheduling and Cache Management for Efficient MoE Inference
di: Zhong, Shuzhang, et al.
Pubblicazione: (2025)
di: Zhong, Shuzhang, et al.
Pubblicazione: (2025)
ELIS: Efficient LLM Iterative Scheduling System with Response Length Predictor
di: Choi, Seungbeom, et al.
Pubblicazione: (2025)
di: Choi, Seungbeom, et al.
Pubblicazione: (2025)
Sustainable Carbon-Aware and Water-Efficient LLM Scheduling in Geo-Distributed Cloud Datacenters
di: Moore, Hayden, et al.
Pubblicazione: (2025)
di: Moore, Hayden, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Prompt-Aware Scheduling for Efficient Text-to-Image Inferencing System
di: Agarwal, Shubham, et al.
Pubblicazione: (2025) -
SortedRL: Accelerating RL Training for LLMs through Online Length-Aware Scheduling
di: Zhang, Yiqi, et al.
Pubblicazione: (2026) -
AgentSlimming: Towards Efficient and Cost-Aware Multi-Agent Systems
di: Chen, Yulang, et al.
Pubblicazione: (2026) -
ML Inference Scheduling with Predictable Latency
di: Zhao, Haidong, et al.
Pubblicazione: (2025) -
ExeGPT: Constraint-Aware Resource Scheduling for LLM Inference
di: Oh, Hyungjun, et al.
Pubblicazione: (2024)