Batching-Aware Joint Model Onloading and Offloading for Hierarchical Multi-Task Inference
Fuente:
arXiv
Salvato in:
| Autori principali: | Cha, Seohyeon, Chan, Kevin, de Veciana, Gustavo, Vikalo, Haris |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Online Learning for Multi-Layer Hierarchical Inference under Partial and Policy-Dependent Feedback
di: Zhang, Haoran, et al.
Pubblicazione: (2026)
di: Zhang, Haoran, et al.
Pubblicazione: (2026)
Task-Agnostic Federated Continual Learning via Replay-Free Gradient Projection
di: Cha, Seohyeon, et al.
Pubblicazione: (2025)
di: Cha, Seohyeon, et al.
Pubblicazione: (2025)
CoreQ: Learning-Free Mismatch Correction and Successive Rounding for Quantization
di: Cha, Seohyeon, et al.
Pubblicazione: (2026)
di: Cha, Seohyeon, et al.
Pubblicazione: (2026)
Optimal Resource Allocation for ML Model Training and Deployment under Concept Drift
di: Beytur, Hasan Burhan, et al.
Pubblicazione: (2025)
di: Beytur, Hasan Burhan, et al.
Pubblicazione: (2025)
FedRot-LoRA: Mitigating Rotational Misalignment in Federated LoRA
di: Zhang, Haoran, et al.
Pubblicazione: (2026)
di: Zhang, Haoran, et al.
Pubblicazione: (2026)
Heterogeneity-Guided Client Sampling: Towards Fast and Efficient Non-IID Federated Learning
di: Chen, Huancheng, et al.
Pubblicazione: (2023)
di: Chen, Huancheng, et al.
Pubblicazione: (2023)
Transformers as Implicit State Estimators: In-Context Learning in Dynamical Systems
di: Akram, Usman, et al.
Pubblicazione: (2024)
di: Akram, Usman, et al.
Pubblicazione: (2024)
Recovering Labels from Local Updates in Federated Learning
di: Chen, Huancheng, et al.
Pubblicazione: (2024)
di: Chen, Huancheng, et al.
Pubblicazione: (2024)
GeFL: Model-Agnostic Federated Learning with Generative Models
di: Kang, Honggu, et al.
Pubblicazione: (2024)
di: Kang, Honggu, et al.
Pubblicazione: (2024)
Robust Super-Capacity SRS Channel Inpainting via Diffusion Models
di: Akram, Usman, et al.
Pubblicazione: (2025)
di: Akram, Usman, et al.
Pubblicazione: (2025)
Federated Self-Supervised Learning for Automatic Modulation Classification under Non-IID and Class-Imbalanced Data
di: Akram, Usman, et al.
Pubblicazione: (2025)
di: Akram, Usman, et al.
Pubblicazione: (2025)
Optimal Scheduling Algorithms for LLM Inference: Theory and Practice
di: Bari, Agrim, et al.
Pubblicazione: (2025)
di: Bari, Agrim, et al.
Pubblicazione: (2025)
When Is Rank-1 Steering Cheap? Geometry, Granularity, and Budgeted Search
di: Robertson, John T., et al.
Pubblicazione: (2026)
di: Robertson, John T., et al.
Pubblicazione: (2026)
Multi-Agent DRL for Queue-Aware Task Offloading in Hierarchical MEC-Enabled Air-Ground Networks
di: Hevesli, Muhammet, et al.
Pubblicazione: (2025)
di: Hevesli, Muhammet, et al.
Pubblicazione: (2025)
Fed-REACT: Federated Representation Learning for Heterogeneous and Evolving Data
di: Chen, Yiyue, et al.
Pubblicazione: (2025)
di: Chen, Yiyue, et al.
Pubblicazione: (2025)
Foundation-Preserving Adaptation via Generalized Rayleigh-Quotient Optimization
di: Kim, Dongjun, et al.
Pubblicazione: (2026)
di: Kim, Dongjun, et al.
Pubblicazione: (2026)
NeFL: Nested Model Scaling for Federated Learning with System Heterogeneous Clients
di: Kang, Honggu, et al.
Pubblicazione: (2023)
di: Kang, Honggu, et al.
Pubblicazione: (2023)
Local-Cloud Inference Offloading for LLMs in Multi-Modal, Multi-Task, Multi-Dialogue Settings
di: Yuan, Liangqi, et al.
Pubblicazione: (2025)
di: Yuan, Liangqi, et al.
Pubblicazione: (2025)
Joint Task Offloading, Inference Optimization and UAV Trajectory Planning for Generative AI Empowered Intelligent Transportation Digital Twin
di: Li, Xiaohuan, et al.
Pubblicazione: (2026)
di: Li, Xiaohuan, et al.
Pubblicazione: (2026)
Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline
di: Fang, Zhiyuan, et al.
Pubblicazione: (2025)
di: Fang, Zhiyuan, et al.
Pubblicazione: (2025)
Hierarchical Task Offloading for UAV-Assisted Vehicular Edge Computing via Deep Reinforcement Learning
di: Li, Hongbao, et al.
Pubblicazione: (2025)
di: Li, Hongbao, et al.
Pubblicazione: (2025)
Multi-Turn Reasoning LLMs for Task Offloading in Mobile Edge Computing
di: Yang, Ning, et al.
Pubblicazione: (2026)
di: Yang, Ning, et al.
Pubblicazione: (2026)
Entropy-Aware Task Offloading in Mobile Edge Computing
di: Ardakani, Mohsen Sahraei, et al.
Pubblicazione: (2026)
di: Ardakani, Mohsen Sahraei, et al.
Pubblicazione: (2026)
Joint Learning of Hierarchical Neural Options and Abstract World Model
di: Piriyakulkij, Wasu Top, et al.
Pubblicazione: (2026)
di: Piriyakulkij, Wasu Top, et al.
Pubblicazione: (2026)
Joint Task Offloading and Resource Allocation in Low-Altitude MEC via Graph Attention Diffusion
di: Xue, Yifan, et al.
Pubblicazione: (2025)
di: Xue, Yifan, et al.
Pubblicazione: (2025)
Hierarchical Conditional Multi-Task Learning for Streamflow Modeling
di: Xu, Shaoming, et al.
Pubblicazione: (2024)
di: Xu, Shaoming, et al.
Pubblicazione: (2024)
BlockBatch: Multi-Scale Consensus Decoding for Efficient Diffusion Language Model Inference
di: Wu, Xiaoyou, et al.
Pubblicazione: (2026)
di: Wu, Xiaoyou, et al.
Pubblicazione: (2026)
Inference for Batched Adaptive Experiments
di: Kemper, Jan, et al.
Pubblicazione: (2025)
di: Kemper, Jan, et al.
Pubblicazione: (2025)
MOBO-OSD: Batch Multi-Objective Bayesian Optimization via Orthogonal Search Directions
di: Ngo, Lam, et al.
Pubblicazione: (2025)
di: Ngo, Lam, et al.
Pubblicazione: (2025)
Hierarchical Task Offloading and Trajectory Optimization in Low-Altitude Intelligent Networks Via Auction and Diffusion-based MARL
di: You, Jiahao, et al.
Pubblicazione: (2025)
di: You, Jiahao, et al.
Pubblicazione: (2025)
Reinforcement Learning-based Task Offloading in the Internet of Wearable Things
di: Qaim, Waleed Bin, et al.
Pubblicazione: (2025)
di: Qaim, Waleed Bin, et al.
Pubblicazione: (2025)
DAOP: Data-Aware Offloading and Predictive Pre-Calculation for Efficient MoE Inference
di: Zhang, Yujie, et al.
Pubblicazione: (2024)
di: Zhang, Yujie, et al.
Pubblicazione: (2024)
SAMO: A Lightweight Sharpness-Aware Approach for Multi-Task Optimization with Joint Global-Local Perturbation
di: Ban, Hao, et al.
Pubblicazione: (2025)
di: Ban, Hao, et al.
Pubblicazione: (2025)
Tera-SpaceCom: GNN-based Deep Reinforcement Learning for Joint Resource Allocation and Task Offloading in TeraHertz Band Space Networks
di: Hu, Zhifeng, et al.
Pubblicazione: (2024)
di: Hu, Zhifeng, et al.
Pubblicazione: (2024)
Joint Continual Learning of Local Language Models and Cloud Offloading Decisions with Budget Constraints
di: Chen, Evan, et al.
Pubblicazione: (2026)
di: Chen, Evan, et al.
Pubblicazione: (2026)
SOLARIS: Speculative Offloading of Latent-bAsed Representation for Inference Scaling
di: Liu, Zikun, et al.
Pubblicazione: (2026)
di: Liu, Zikun, et al.
Pubblicazione: (2026)
AntBatchInfer: Elastic Batch Inference in the Kubernetes Cluster
di: Li, Siyuan, et al.
Pubblicazione: (2024)
di: Li, Siyuan, et al.
Pubblicazione: (2024)
Multi-Agent Reinforcement Learning for Task Offloading in Wireless Edge Networks
di: Fox, Andrea, et al.
Pubblicazione: (2025)
di: Fox, Andrea, et al.
Pubblicazione: (2025)
DALI: A Workload-Aware Offloading Framework for Efficient MoE Inference on Local PCs
di: Zhu, Zeyu, et al.
Pubblicazione: (2026)
di: Zhu, Zeyu, et al.
Pubblicazione: (2026)
ChunkFlow: Communication-Aware Chunked Prefetching for Layerwise Offloading in Distributed Diffusion Transformer Inference
di: Meng, Han, et al.
Pubblicazione: (2026)
di: Meng, Han, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Online Learning for Multi-Layer Hierarchical Inference under Partial and Policy-Dependent Feedback
di: Zhang, Haoran, et al.
Pubblicazione: (2026) -
Task-Agnostic Federated Continual Learning via Replay-Free Gradient Projection
di: Cha, Seohyeon, et al.
Pubblicazione: (2025) -
CoreQ: Learning-Free Mismatch Correction and Successive Rounding for Quantization
di: Cha, Seohyeon, et al.
Pubblicazione: (2026) -
Optimal Resource Allocation for ML Model Training and Deployment under Concept Drift
di: Beytur, Hasan Burhan, et al.
Pubblicazione: (2025) -
FedRot-LoRA: Mitigating Rotational Misalignment in Federated LoRA
di: Zhang, Haoran, et al.
Pubblicazione: (2026)