Local-Cloud Inference Offloading for LLMs in Multi-Modal, Multi-Task, Multi-Dialogue Settings
Fuente:
arXiv
Saved in:
| Main Authors: | Yuan, Liangqi, Han, Dong-Jun, Wang, Shiqiang, Brinton, Christopher G. |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
PAAC: Privacy-Aware Agentic Device-Cloud Collaboration
by: Yuan, Liangqi, et al.
Published: (2026)
by: Yuan, Liangqi, et al.
Published: (2026)
Communication-Efficient Multimodal Federated Learning: Joint Modality and Client Selection
by: Yuan, Liangqi, et al.
Published: (2024)
by: Yuan, Liangqi, et al.
Published: (2024)
Using Diffusion Models as Generative Replay in Continual Federated Learning -- What will Happen?
by: Mei, Yongsheng, et al.
Published: (2024)
by: Mei, Yongsheng, et al.
Published: (2024)
FedMFS: Federated Multimodal Fusion Learning with Selective Modality Communication
by: Yuan, Liangqi, et al.
Published: (2023)
by: Yuan, Liangqi, et al.
Published: (2023)
Large Language Models over Networks: Collaborative Intelligence under Resource Constraints
by: Yuan, Liangqi, et al.
Published: (2026)
by: Yuan, Liangqi, et al.
Published: (2026)
Differentially-Private Multi-Tier Federated Learning
by: Chen, Evan, et al.
Published: (2024)
by: Chen, Evan, et al.
Published: (2024)
Asynchronous Multi-Model Dynamic Federated Learning over Wireless Networks: Theory, Modeling, and Optimization
by: Chang, Zhan-Lun, et al.
Published: (2023)
by: Chang, Zhan-Lun, et al.
Published: (2023)
Gradient Correction in Federated Learning with Adaptive Optimization
by: Chen, Evan, et al.
Published: (2025)
by: Chen, Evan, et al.
Published: (2025)
A Fast Task Offloading Optimization Framework for IRS-Assisted Multi-Access Edge Computing System
by: Wu, Jianqiu, et al.
Published: (2023)
by: Wu, Jianqiu, et al.
Published: (2023)
Multi-Source to Multi-Target Decentralized Federated Domain Adaptation
by: Wang, Su, et al.
Published: (2023)
by: Wang, Su, et al.
Published: (2023)
Decentralized Sporadic Federated Learning: A Unified Algorithmic Framework with Convergence Guarantees
by: Zehtabi, Shahryar, et al.
Published: (2024)
by: Zehtabi, Shahryar, et al.
Published: (2024)
Cross-Silo Federated Learning for Multi-Tier Networks with Vertical and Horizontal Data Partitioning
by: Das, Anirban, et al.
Published: (2021)
by: Das, Anirban, et al.
Published: (2021)
ChunkFlow: Communication-Aware Chunked Prefetching for Layerwise Offloading in Distributed Diffusion Transformer Inference
by: Meng, Han, et al.
Published: (2026)
by: Meng, Han, et al.
Published: (2026)
Orchestrating Federated Learning in Space-Air-Ground Integrated Networks: Adaptive Data Offloading and Seamless Handover
by: Han, Dong-Jun, et al.
Published: (2024)
by: Han, Dong-Jun, et al.
Published: (2024)
Decentralized Federated Learning: A Survey and Perspective
by: Yuan, Liangqi, et al.
Published: (2023)
by: Yuan, Liangqi, et al.
Published: (2023)
DALI: A Workload-Aware Offloading Framework for Efficient MoE Inference on Local PCs
by: Zhu, Zeyu, et al.
Published: (2026)
by: Zhu, Zeyu, et al.
Published: (2026)
MARLIN: Multi-Agent Game-Theoretic Reinforcement Learning for Sustainable LLM Inference in Cloud Datacenters
by: Moore, H., et al.
Published: (2026)
by: Moore, H., et al.
Published: (2026)
Generative AI Beyond LLMs: System Implications of Multi-Modal Generation
by: Golden, Alicia, et al.
Published: (2023)
by: Golden, Alicia, et al.
Published: (2023)
Leveraging Foundation Models for Multi-modal Federated Learning with Incomplete Modality
by: Che, Liwei, et al.
Published: (2024)
by: Che, Liwei, et al.
Published: (2024)
PIPO: Pipelined Offloading for Efficient Inference on Consumer Devices
by: Liu, Yangyijian, et al.
Published: (2025)
by: Liu, Yangyijian, et al.
Published: (2025)
MultiTASC++: A Continuously Adaptive Scheduler for Edge-Based Multi-Device Cascade Inference
by: Nikolaidis, Sokratis, et al.
Published: (2024)
by: Nikolaidis, Sokratis, et al.
Published: (2024)
Cost-Efficient LLM Serving in the Cloud: VM Selection with KV Cache Offloading
by: Kim, Kihyun, et al.
Published: (2025)
by: Kim, Kihyun, et al.
Published: (2025)
HOBBIT: A Mixed Precision Expert Offloading System for Fast MoE Inference
by: Tang, Peng, et al.
Published: (2024)
by: Tang, Peng, et al.
Published: (2024)
SLOs-Serve: Optimized Serving of Multi-SLO LLMs
by: Chen, Siyuan, et al.
Published: (2025)
by: Chen, Siyuan, et al.
Published: (2025)
Understanding and Improving Communication Performance in Multi-node LLM Inference
by: Singhania, Prajwal, et al.
Published: (2025)
by: Singhania, Prajwal, et al.
Published: (2025)
Kraken: Inherently Parallel Transformers For Efficient Multi-Device Inference
by: Prabhakar, Rohan Baskar, et al.
Published: (2024)
by: Prabhakar, Rohan Baskar, et al.
Published: (2024)
MSAO: Adaptive Modality Sparsity-Aware Offloading with Edge-Cloud Collaboration for Efficient Multimodal LLM Inference
by: Yang, Zheming, et al.
Published: (2026)
by: Yang, Zheming, et al.
Published: (2026)
Non-Federated Multi-Task Split Learning for Heterogeneous Sources
by: Zheng, Yilin, et al.
Published: (2024)
by: Zheng, Yilin, et al.
Published: (2024)
Heterogeneous Tasks Offloading in Vehicular Edge Computing: A Federated Meta Deep Reinforcement Learning Approach
by: Huang, Yaorong, et al.
Published: (2026)
by: Huang, Yaorong, et al.
Published: (2026)
DAOP: Data-Aware Offloading and Predictive Pre-Calculation for Efficient MoE Inference
by: Zhang, Yujie, et al.
Published: (2024)
by: Zhang, Yujie, et al.
Published: (2024)
Improving the End-to-End Efficiency of Offline Inference for Multi-LLM Applications Based on Sampling and Simulation
by: Fang, Jingzhi, et al.
Published: (2025)
by: Fang, Jingzhi, et al.
Published: (2025)
Spindle: Efficient Distributed Training of Multi-Task Large Models via Wavefront Scheduling
by: Wang, Yujie, et al.
Published: (2024)
by: Wang, Yujie, et al.
Published: (2024)
S2M3: Split-and-Share Multi-Modal Models for Distributed Multi-Task Inference on the Edge
by: Yoon, JinYi, et al.
Published: (2025)
by: Yoon, JinYi, et al.
Published: (2025)
MAS-H2: A Hierarchical Multi-Agent System for Holistic Cloud-Native Autoscaling
by: Hamzeh, Hamed, et al.
Published: (2026)
by: Hamzeh, Hamed, et al.
Published: (2026)
FedFisher: Leveraging Fisher Information for One-Shot Federated Learning
by: Jhunjhunwala, Divyansh, et al.
Published: (2024)
by: Jhunjhunwala, Divyansh, et al.
Published: (2024)
Intelligent Task Offloading in VANETs: A Hybrid AI-Driven Approach for Low-Latency and Energy Efficiency
by: Qayyum, Tariq, et al.
Published: (2025)
by: Qayyum, Tariq, et al.
Published: (2025)
ScalableHD: Scalable and High-Throughput Hyperdimensional Computing Inference on Multi-Core CPUs
by: Parikh, Dhruv, et al.
Published: (2025)
by: Parikh, Dhruv, et al.
Published: (2025)
CARIn: Constraint-Aware and Responsive Inference on Heterogeneous Devices for Single- and Multi-DNN Workloads
by: Panopoulos, Ioannis, et al.
Published: (2024)
by: Panopoulos, Ioannis, et al.
Published: (2024)
Eliminating Multi-GPU Performance Taxes: A Systems Approach to Efficient Distributed LLMs
by: Trifan, Octavian Alexandru, et al.
Published: (2025)
by: Trifan, Octavian Alexandru, et al.
Published: (2025)
Enabling Disaggregated Multi-Stage MLLM Inference via GPU-Internal Scheduling and Resource Sharing
by: Zhao, Lingxiao, et al.
Published: (2025)
by: Zhao, Lingxiao, et al.
Published: (2025)
Similar Items
-
PAAC: Privacy-Aware Agentic Device-Cloud Collaboration
by: Yuan, Liangqi, et al.
Published: (2026) -
Communication-Efficient Multimodal Federated Learning: Joint Modality and Client Selection
by: Yuan, Liangqi, et al.
Published: (2024) -
Using Diffusion Models as Generative Replay in Continual Federated Learning -- What will Happen?
by: Mei, Yongsheng, et al.
Published: (2024) -
FedMFS: Federated Multimodal Fusion Learning with Selective Modality Communication
by: Yuan, Liangqi, et al.
Published: (2023) -
Large Language Models over Networks: Collaborative Intelligence under Resource Constraints
by: Yuan, Liangqi, et al.
Published: (2026)