SparOA: Sparse and Operator-aware Hybrid Scheduling for Edge DNN Inference
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Ziyang, Liu, Jie, Mottola, Luca |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Opara: Exploiting Operator Parallelism for Expediting DNN Inference on GPUs
par: Chen, Aodong, et autres
Publié: (2023)
par: Chen, Aodong, et autres
Publié: (2023)
TCM-Serve: Modality-aware Scheduling for Multimodal Large Language Model Inference
par: Papaioannou, Konstantinos, et autres
Publié: (2026)
par: Papaioannou, Konstantinos, et autres
Publié: (2026)
A Scheduling Framework for Efficient MoE Inference on Edge GPU-NDP Systems
par: Wu, Qi, et autres
Publié: (2026)
par: Wu, Qi, et autres
Publié: (2026)
Adaptive Heuristics for Scheduling DNN Inferencing on Edge and Cloud for Personalized UAV Fleets
par: Raj, Suman, et autres
Publié: (2024)
par: Raj, Suman, et autres
Publié: (2024)
Mixture-of-Schedulers: An Adaptive Scheduling Agent as a Learned Router for Expert Policies
par: Wang, Xinbo, et autres
Publié: (2025)
par: Wang, Xinbo, et autres
Publié: (2025)
Dora: QoE-Aware Hybrid Parallelism for Distributed Edge AI
par: Jin, Jianli, et autres
Publié: (2025)
par: Jin, Jianli, et autres
Publié: (2025)
Topology-aware Preemptive Scheduling for Co-located LLM Workloads
par: Zhang, Ping, et autres
Publié: (2024)
par: Zhang, Ping, et autres
Publié: (2024)
HiDP: Hierarchical DNN Partitioning for Distributed Inference on Heterogeneous Edge Platforms
par: Taufique, Zain, et autres
Publié: (2024)
par: Taufique, Zain, et autres
Publié: (2024)
Power- and Fragmentation-aware Online Scheduling for GPU Datacenters
par: Lettich, Francesco, et autres
Publié: (2024)
par: Lettich, Francesco, et autres
Publié: (2024)
Adaptive Workload Distribution for Accuracy-aware DNN Inference on Collaborative Edge Platforms
par: Taufique, Zain, et autres
Publié: (2023)
par: Taufique, Zain, et autres
Publié: (2023)
SwapNet: Efficient Swapping for DNN Inference on Edge AI Devices Beyond the Memory Budget
par: Wang, Kun, et autres
Publié: (2024)
par: Wang, Kun, et autres
Publié: (2024)
TAPAS: Thermal- and Power-Aware Scheduling for LLM Inference in Cloud Platforms
par: Stojkovic, Jovan, et autres
Publié: (2025)
par: Stojkovic, Jovan, et autres
Publié: (2025)
Equinox: Holistic Fair Scheduling in Serving Large Language Models
par: Wei, Zhixiang, et autres
Publié: (2025)
par: Wei, Zhixiang, et autres
Publié: (2025)
Shared Memory-contention-aware Concurrent DNN Execution for Diversely Heterogeneous System-on-Chips
par: Dagli, Ismet, et autres
Publié: (2023)
par: Dagli, Ismet, et autres
Publié: (2023)
KVSwap: Disk-aware KV Cache Offloading for Long-Context On-device Inference
par: Zhang, Huawei, et autres
Publié: (2025)
par: Zhang, Huawei, et autres
Publié: (2025)
Profiling-Driven Adaptive Distributed Transformer Inference on Embedded Edge Deployment
par: Qazi, Muhammad Azlan, et autres
Publié: (2026)
par: Qazi, Muhammad Azlan, et autres
Publié: (2026)
Reinforcement Learning-driven Data-intensive Workflow Scheduling for Volunteer Edge-Cloud
par: Mounesan, Motahare, et autres
Publié: (2024)
par: Mounesan, Motahare, et autres
Publié: (2024)
CoRaiS: Lightweight Real-Time Scheduler for Multi-Edge Cooperative Computing
par: Hu, Yujiao, et autres
Publié: (2024)
par: Hu, Yujiao, et autres
Publié: (2024)
TS-EoH: An Edge Server Task Scheduling Algorithm Based on Evolution of Heuristic
par: Yatong, Wang, et autres
Publié: (2024)
par: Yatong, Wang, et autres
Publié: (2024)
Reconstruction-Based Adaptive Scheduling Using AI Inferences in Safety-Critical Systems
par: Alshaer, Samer, et autres
Publié: (2025)
par: Alshaer, Samer, et autres
Publié: (2025)
Efficient MoE Inference with Fine-Grained Scheduling of Disaggregated Expert Parallelism
par: Pan, Xinglin, et autres
Publié: (2025)
par: Pan, Xinglin, et autres
Publié: (2025)
Large Language Model Partitioning for Low-Latency Inference at the Edge
par: Kafetzis, Dimitrios, et autres
Publié: (2025)
par: Kafetzis, Dimitrios, et autres
Publié: (2025)
Preemption Aware Task Scheduling for Priority and Deadline Constrained DNN Inference Task Offloading in Homogeneous Mobile-Edge Networks
par: Cotter, Jamie, et autres
Publié: (2025)
par: Cotter, Jamie, et autres
Publié: (2025)
Vec-LUT: Vector Table Lookup for Parallel Ultra-Low-Bit LLM Inference on Edge Devices
par: Li, Xiangyu, et autres
Publié: (2025)
par: Li, Xiangyu, et autres
Publié: (2025)
Learning the Optimal Path and DNN Partition for Collaborative Edge Inference
par: Huang, Yin, et autres
Publié: (2024)
par: Huang, Yin, et autres
Publié: (2024)
ECCENTRIC: Edge-Cloud Collaboration Framework for Distributed Inference Using Knowledge Adaptation
par: Kamani, Mohammad Mahdi, et autres
Publié: (2025)
par: Kamani, Mohammad Mahdi, et autres
Publié: (2025)
Hardware Utilization and Inference Performance of Edge Object Detection Under Fault Injection
par: Pasandideh, Faezeh, et autres
Publié: (2026)
par: Pasandideh, Faezeh, et autres
Publié: (2026)
Failure-Resilient Distributed Inference with Model Compression over Heterogeneous Edge Devices
par: Wang, Li, et autres
Publié: (2024)
par: Wang, Li, et autres
Publié: (2024)
Fulcrum: Optimizing Concurrent DNN Training and Inferencing on Edge Accelerators
par: K., Prashanthi S., et autres
Publié: (2025)
par: K., Prashanthi S., et autres
Publié: (2025)
ClusterFusion: Expanding Operator Fusion Scope for LLM Inference via Cluster-Level Collective Primitive
par: Luo, Xinhao, et autres
Publié: (2025)
par: Luo, Xinhao, et autres
Publié: (2025)
Performance Characterization of Containerized DNN Training and Inference on Edge Accelerators
par: K., Prashanthi S., et autres
Publié: (2023)
par: K., Prashanthi S., et autres
Publié: (2023)
Adaptive Device-Edge Collaboration on DNN Inference in AIoT: A Digital Twin-Assisted Approach
par: Hu, Shisheng, et autres
Publié: (2024)
par: Hu, Shisheng, et autres
Publié: (2024)
SPECTRE: Hybrid Ordinary-Parallel Speculative Serving for Resource-Efficient LLM Inference
par: Xie, Jincheng, et autres
Publié: (2026)
par: Xie, Jincheng, et autres
Publié: (2026)
Distributed Inference on Mobile Edge and Cloud: A Data-Cartography based Clustering Approach
par: Bajpai, Divya Jyoti, et autres
Publié: (2024)
par: Bajpai, Divya Jyoti, et autres
Publié: (2024)
ExpertFlow: Adaptive Expert Scheduling and Memory Coordination for Efficient MoE Inference
par: Shen, Zixu, et autres
Publié: (2025)
par: Shen, Zixu, et autres
Publié: (2025)
DARIS: An Oversubscribed Spatio-Temporal Scheduler for Real-Time DNN Inference on GPUs
par: Babaei, Amir Fakhim, et autres
Publié: (2025)
par: Babaei, Amir Fakhim, et autres
Publié: (2025)
Quantifying Energy and Cost Benefits of Hybrid Edge Cloud: Analysis of Traditional and Agentic Workloads
par: Alamouti, Siavash
Publié: (2025)
par: Alamouti, Siavash
Publié: (2025)
Infer-EDGE: Dynamic DNN Inference Optimization in 'Just-in-time' Edge-AI Implementations
par: Mounesan, Motahare, et autres
Publié: (2025)
par: Mounesan, Motahare, et autres
Publié: (2025)
Evaluating Multi-Instance DNN Inferencing on Multiple Accelerators of an Edge Device
par: Tayal, Mumuksh, et autres
Publié: (2025)
par: Tayal, Mumuksh, et autres
Publié: (2025)
EdgeServing: Deadline-Aware Multi-DNN Serving at the Edge
par: Cao, Jiahe, et autres
Publié: (2026)
par: Cao, Jiahe, et autres
Publié: (2026)
Documents similaires
-
Opara: Exploiting Operator Parallelism for Expediting DNN Inference on GPUs
par: Chen, Aodong, et autres
Publié: (2023) -
TCM-Serve: Modality-aware Scheduling for Multimodal Large Language Model Inference
par: Papaioannou, Konstantinos, et autres
Publié: (2026) -
A Scheduling Framework for Efficient MoE Inference on Edge GPU-NDP Systems
par: Wu, Qi, et autres
Publié: (2026) -
Adaptive Heuristics for Scheduling DNN Inferencing on Edge and Cloud for Personalized UAV Fleets
par: Raj, Suman, et autres
Publié: (2024) -
Mixture-of-Schedulers: An Adaptive Scheduling Agent as a Learned Router for Expert Policies
par: Wang, Xinbo, et autres
Publié: (2025)