Holistic Heterogeneous Scheduling for Autonomous Applications using Fine-grained, Multi-XPU Abstraction
Fuente:
arXiv
Salvato in:
| Autori principali: | Han, Mingcong, Shen, Weihang, Chen, Rong, Zang, Binyu, Chen, Haibo |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Towards Fully-fledged GPU Multitasking via Proactive Memory Scheduling
di: Shen, Weihang, et al.
Pubblicazione: (2025)
di: Shen, Weihang, et al.
Pubblicazione: (2025)
HeteroPod: XPU-Accelerated Infrastructure Offloading for Commodity Cloud-Native Applications
di: Yang, Bicheng, et al.
Pubblicazione: (2025)
di: Yang, Bicheng, et al.
Pubblicazione: (2025)
Microsecond-scale Dynamic Validation of Idempotency for GPU Kernels
di: Han, Mingcong, et al.
Pubblicazione: (2024)
di: Han, Mingcong, et al.
Pubblicazione: (2024)
PhoenixOS: Concurrent OS-level GPU Checkpoint and Restore with Validated Speculation
di: Wei, Xingda, et al.
Pubblicazione: (2024)
di: Wei, Xingda, et al.
Pubblicazione: (2024)
Optimizing Tree-structure Indexes for CXL-based Heterogeneous Memory with SINLK
di: Zhao, Haoru, et al.
Pubblicazione: (2025)
di: Zhao, Haoru, et al.
Pubblicazione: (2025)
Work-in-Progress: Multi-Deadline DAG Scheduling Model for Autonomous Driving Systems
di: Yano, Atsushi, et al.
Pubblicazione: (2025)
di: Yano, Atsushi, et al.
Pubblicazione: (2025)
Characterizing Network Requirements for GPU API Remoting in AI Applications
di: Wang, Tianxia, et al.
Pubblicazione: (2024)
di: Wang, Tianxia, et al.
Pubblicazione: (2024)
ParaCell: Paravirtualized Secure Containers with Lightweight Intra-Container Isolation and Intent-Driven Memory Management
di: Wu, Yiyang, et al.
Pubblicazione: (2026)
di: Wu, Yiyang, et al.
Pubblicazione: (2026)
Modeling and Scheduling of Fusion Patterns in Autonomous Driving Systems (Extended Version)
di: Sobhani, Hoora, et al.
Pubblicazione: (2025)
di: Sobhani, Hoora, et al.
Pubblicazione: (2025)
LMetric: Simple is Better - Multiplication May Be All You Need for LLM Request Scheduling
di: Zhang, Dingyan, et al.
Pubblicazione: (2026)
di: Zhang, Dingyan, et al.
Pubblicazione: (2026)
Guidelines for Building Indexes on Partially Cache-Coherent CXL Shared Memory
di: Wu, Fangnuo, et al.
Pubblicazione: (2025)
di: Wu, Fangnuo, et al.
Pubblicazione: (2025)
Puzzle: Scheduling Multiple Deep Learning Models on Mobile Device with Heterogeneous Processors
di: Kang, Duseok, et al.
Pubblicazione: (2025)
di: Kang, Duseok, et al.
Pubblicazione: (2025)
Qurator: Scheduling Hybrid Quantum-Classical Workflows Across Heterogeneous Cloud Providers
di: Pehlivanoglu, Sinan, et al.
Pubblicazione: (2026)
di: Pehlivanoglu, Sinan, et al.
Pubblicazione: (2026)
Global Scheduling of Weakly-Hard Real-Time Tasks using Job-Level Priority Classes
di: Moyano, V. Gabriel, et al.
Pubblicazione: (2024)
di: Moyano, V. Gabriel, et al.
Pubblicazione: (2024)
Leveraging OS-Level Primitives for Robotic Action Management
di: Zheng, Wenxin, et al.
Pubblicazione: (2025)
di: Zheng, Wenxin, et al.
Pubblicazione: (2025)
THEMIS: Time, Heterogeneity, and Energy Minded Scheduling for Fair Multi-Tenant Use in FPGAs
di: Karabulut, Emre, et al.
Pubblicazione: (2024)
di: Karabulut, Emre, et al.
Pubblicazione: (2024)
MARS: Efficient, Adaptive Co-Scheduling for Heterogeneous Agentic Systems
di: Wang, Yifei, et al.
Pubblicazione: (2026)
di: Wang, Yifei, et al.
Pubblicazione: (2026)
PowerInfer: Fast Large Language Model Serving with a Consumer-grade GPU
di: Song, Yixin, et al.
Pubblicazione: (2023)
di: Song, Yixin, et al.
Pubblicazione: (2023)
Exploiting Dependency and Parallelism: Real-Time Scheduling and Analysis for GPU Tasks
di: Zhang, Yuanhai, et al.
Pubblicazione: (2026)
di: Zhang, Yuanhai, et al.
Pubblicazione: (2026)
CHRONOS: Compensating Hardware Related Overheads with Native Multi Timer Support for Real-Time Operating Systems
di: Heider, Kay, et al.
Pubblicazione: (2025)
di: Heider, Kay, et al.
Pubblicazione: (2025)
BLITZSCALE: Fast and Live Large Model Autoscaling with O(1) Host Caching
di: Zhang, Dingyan, et al.
Pubblicazione: (2024)
di: Zhang, Dingyan, et al.
Pubblicazione: (2024)
GoCkpt: Gradient-Assisted Multi-Step overlapped Checkpointing for Efficient LLM Training
di: Zhang, Keyao, et al.
Pubblicazione: (2025)
di: Zhang, Keyao, et al.
Pubblicazione: (2025)
SSV: Sparse Speculative Verification for Efficient LLM Inference
di: Wang, Zhibin, et al.
Pubblicazione: (2026)
di: Wang, Zhibin, et al.
Pubblicazione: (2026)
Assessing FIFO and Round Robin Scheduling:Effects on Data Pipeline Performance and Energy Usage
di: Choudhury, Malobika Roy, et al.
Pubblicazione: (2024)
di: Choudhury, Malobika Roy, et al.
Pubblicazione: (2024)
Scheduling Analysis of UAV Flight Control Workloads using Raspberry Pi 5 Using PREEMPT_RT Linux
di: Giacomossi, Luiz, et al.
Pubblicazione: (2026)
di: Giacomossi, Luiz, et al.
Pubblicazione: (2026)
HACache: Leveraging Read Performance with Cache in a Heterogeneous Array
di: Liu, Jialin, et al.
Pubblicazione: (2026)
di: Liu, Jialin, et al.
Pubblicazione: (2026)
From Imperative to Declarative: Towards LLM-friendly OS Interfaces for Boosted Computer-Use Agents
di: Wang, Yuan, et al.
Pubblicazione: (2025)
di: Wang, Yuan, et al.
Pubblicazione: (2025)
Towards High-Goodput LLM Serving with Prefill-decode Multiplexing
di: Chen, Yukang, et al.
Pubblicazione: (2025)
di: Chen, Yukang, et al.
Pubblicazione: (2025)
Sharpen the Spec, Cut the Code: A Case for Generative File System with SYSSPEC
di: Liu, Qingyuan, et al.
Pubblicazione: (2025)
di: Liu, Qingyuan, et al.
Pubblicazione: (2025)
E-Mapper: Energy-Efficient Resource Allocation for Traditional Operating Systems on Heterogeneous Processors
di: Smejkal, Till, et al.
Pubblicazione: (2024)
di: Smejkal, Till, et al.
Pubblicazione: (2024)
TempoNet: Slack-Quantized Transformer-Guided Reinforcement Scheduler for Adaptive Deadline-Centric Real-Time Dispatchs
di: Fu, Rong, et al.
Pubblicazione: (2026)
di: Fu, Rong, et al.
Pubblicazione: (2026)
Efficient Function-as-a-Service for Large Language Models with TIDAL
di: Cui, Weihao, et al.
Pubblicazione: (2025)
di: Cui, Weihao, et al.
Pubblicazione: (2025)
Performance Isolation and Semantic Determinism in Efficient GPU Spatial Sharing
di: Yang, Zhenyuan, et al.
Pubblicazione: (2026)
di: Yang, Zhenyuan, et al.
Pubblicazione: (2026)
Ensuring Data Freshness in Multi-Rate Task Chains Scheduling
di: Hoffmann, José Luis Conradi, et al.
Pubblicazione: (2026)
di: Hoffmann, José Luis Conradi, et al.
Pubblicazione: (2026)
TUNA: Tuning Unstable and Noisy Cloud Applications
di: Freischuetz, Johannes, et al.
Pubblicazione: (2025)
di: Freischuetz, Johannes, et al.
Pubblicazione: (2025)
Flare: Anomaly Diagnostics for Divergent LLM Training in GPU Clusters of Thousand-Plus Scale
di: Cui, Weihao, et al.
Pubblicazione: (2025)
di: Cui, Weihao, et al.
Pubblicazione: (2025)
DeltaBox: Scaling Stateful AI Agents with Millisecond-Level Sandbox Checkpoint/Rollback
di: Dong, Yunpeng, et al.
Pubblicazione: (2026)
di: Dong, Yunpeng, et al.
Pubblicazione: (2026)
Exploiting Application-to-Architecture Dependencies for Designing Scalable OS
di: Xiao, Yao, et al.
Pubblicazione: (2025)
di: Xiao, Yao, et al.
Pubblicazione: (2025)
Rethinking Provenance Completeness with a Learning-Based Linux Scheduler
di: Mao, Jinsong, et al.
Pubblicazione: (2025)
di: Mao, Jinsong, et al.
Pubblicazione: (2025)
Towards Agentic OS: An LLM Agent Framework for Linux Schedulers
di: Zheng, Yusheng, et al.
Pubblicazione: (2025)
di: Zheng, Yusheng, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Towards Fully-fledged GPU Multitasking via Proactive Memory Scheduling
di: Shen, Weihang, et al.
Pubblicazione: (2025) -
HeteroPod: XPU-Accelerated Infrastructure Offloading for Commodity Cloud-Native Applications
di: Yang, Bicheng, et al.
Pubblicazione: (2025) -
Microsecond-scale Dynamic Validation of Idempotency for GPU Kernels
di: Han, Mingcong, et al.
Pubblicazione: (2024) -
PhoenixOS: Concurrent OS-level GPU Checkpoint and Restore with Validated Speculation
di: Wei, Xingda, et al.
Pubblicazione: (2024) -
Optimizing Tree-structure Indexes for CXL-based Heterogeneous Memory with SINLK
di: Zhao, Haoru, et al.
Pubblicazione: (2025)