Recursive Offloading for LLM Serving in Multi-tier Networks
Fuente:
arXiv
Saved in:
| Main Authors: | Wu, Zhiyuan, Sun, Sheng, Wang, Yuwei, Liu, Min, Gao, Bo, Lu, Jinda, Yang, Zheming, Wen, Tian |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Multi-stage Flow Scheduling for LLM Serving
by: Sun, Yijun, et al.
Published: (2026)
by: Sun, Yijun, et al.
Published: (2026)
A Task Decomposition and Planning Framework for Efficient LLM Inference in AI-Enabled WiFi-Offload Networks
by: Han, Mingqi, et al.
Published: (2026)
by: Han, Mingqi, et al.
Published: (2026)
PerLLM: Personalized Inference Scheduling with Edge-Cloud Collaboration for Diverse LLM Services
by: Yang, Zheming, et al.
Published: (2024)
by: Yang, Zheming, et al.
Published: (2024)
RouterWise: Joint Resource Allocation and Routing for Latency-Aware Multi-Model LLM Serving
by: Kasnavieh, Hossein Hosseini, et al.
Published: (2026)
by: Kasnavieh, Hossein Hosseini, et al.
Published: (2026)
Decentralized Network Topology Design for Task Offloading in Mobile Edge Computing
by: Ma, Ke, et al.
Published: (2024)
by: Ma, Ke, et al.
Published: (2024)
Edge Offloading in Smart Grid
by: Arcas, Gabriel Ioan, et al.
Published: (2024)
by: Arcas, Gabriel Ioan, et al.
Published: (2024)
LIMO: Load-balanced Offloading with MAPE and Particle Swarm Optimization in Mobile Fog Networks
by: Seraj, Yasaman, et al.
Published: (2024)
by: Seraj, Yasaman, et al.
Published: (2024)
Distributed Simulation for Digital Twins of Large-Scale Real-World DiffServ-Based Networks
by: Huang, Zhuoyao, et al.
Published: (2024)
by: Huang, Zhuoyao, et al.
Published: (2024)
A Uniqueness Theorem for Distributed Computation under Physical Constraint
by: Ren, Zhiyuan, et al.
Published: (2025)
by: Ren, Zhiyuan, et al.
Published: (2025)
A Combined Environmental Monitoring Framework based on WSN Clustering and VANET Edge Computation Offloading
by: Mamalis, Basilis, et al.
Published: (2024)
by: Mamalis, Basilis, et al.
Published: (2024)
Intelligent Task Offloading: Advanced MEC Task Offloading and Resource Management in 5G Networks
by: Ebrahimi, Alireza, et al.
Published: (2025)
by: Ebrahimi, Alireza, et al.
Published: (2025)
MOFCO: Mobility- and Migration-Aware Task Offloading in Three-Layer Fog Computing Environments
by: Mahdizadeh, Soheil, et al.
Published: (2025)
by: Mahdizadeh, Soheil, et al.
Published: (2025)
Performance Analysis of Internet of Vehicles Mesh Networks Based on Actual Switch Models
by: Hu, Jialin, et al.
Published: (2024)
by: Hu, Jialin, et al.
Published: (2024)
Towards Timely Video Analytics Services at the Network Edge
by: Li, Xishuo, et al.
Published: (2024)
by: Li, Xishuo, et al.
Published: (2024)
Topology-aware Microservice Architecture in Edge Networks: Deployment Optimization and Implementation
by: Chen, Yuang, et al.
Published: (2025)
by: Chen, Yuang, et al.
Published: (2025)
Optimizing Edge Offloading Decisions for Object Detection
by: Qiu, Jiaming, et al.
Published: (2024)
by: Qiu, Jiaming, et al.
Published: (2024)
Toward Edge General Intelligence with Multiple-Large Language Model (Multi-LLM): Architecture, Trust, and Orchestration
by: Luo, Haoxiang, et al.
Published: (2025)
by: Luo, Haoxiang, et al.
Published: (2025)
Understanding Bottlenecks for Efficiently Serving LLM Inference With KV Offloading
by: Meng, William, et al.
Published: (2025)
by: Meng, William, et al.
Published: (2025)
NET-SA: An Efficient Secure Aggregation Architecture Based on In-Network Computing
by: Ren, Qingqing, et al.
Published: (2025)
by: Ren, Qingqing, et al.
Published: (2025)
A Model Consistency-Based Countermeasure to GAN-Based Data Poisoning Attack in Federated Learning
by: Sun, Wei, et al.
Published: (2024)
by: Sun, Wei, et al.
Published: (2024)
KVServe: Service-Aware KV Cache Compression for Communication-Efficient Disaggregated LLM Serving
by: Liu, Zedong, et al.
Published: (2026)
by: Liu, Zedong, et al.
Published: (2026)
Reliable and Resilient Collective Communication Library for LLM Training and Serving
by: Wang, Wei, et al.
Published: (2025)
by: Wang, Wei, et al.
Published: (2025)
Temporal-Aware GPU Resource Allocation for Distributed LLM Inference via Reinforcement Learning
by: Du, Chengze, et al.
Published: (2025)
by: Du, Chengze, et al.
Published: (2025)
Semantic-Aware LLM Orchestration for Proactive Resource Management in Predictive Digital Twin Vehicular Networks
by: Ahmadpanah, Seyed Hossein
Published: (2025)
by: Ahmadpanah, Seyed Hossein
Published: (2025)
DRL-Based Federated Self-Supervised Learning for Task Offloading and Resource Allocation in ISAC-Enabled Vehicle Edge Computing
by: Gu, Xueying, et al.
Published: (2024)
by: Gu, Xueying, et al.
Published: (2024)
D-LoRa: a Distributed Parameter Adaptation Scheme for LoRa Network
by: Wang, Ruiqi, et al.
Published: (2025)
by: Wang, Ruiqi, et al.
Published: (2025)
Multi-Source Coflow Scheduling in Collaborative Edge Computing with Multihop Network
by: Sahni, Yuvraj, et al.
Published: (2024)
by: Sahni, Yuvraj, et al.
Published: (2024)
GELATO: Generative Entropy- and Lyapunov-based Adaptive Token Offloading for Device-Edge Speculative LLM Inference
by: Tang, Zengzipeng, et al.
Published: (2026)
by: Tang, Zengzipeng, et al.
Published: (2026)
GORGO: Maximizing KV-Cache Reuse While Minimizing Network Latency in Cross-Region LLM Load Balancing
by: Toniolo, Alessio Ricci, et al.
Published: (2026)
by: Toniolo, Alessio Ricci, et al.
Published: (2026)
Dynamic DAG-Application Scheduling for Multi-Tier Edge Computing in Heterogeneous Networks
by: Li, Xiang, et al.
Published: (2024)
by: Li, Xiang, et al.
Published: (2024)
Q-adaptive: A Multi-Agent Reinforcement Learning Based Routing on Dragonfly Network
by: Kang, Yao, et al.
Published: (2024)
by: Kang, Yao, et al.
Published: (2024)
A New Broadcast Model for Several Network Topologies
by: Lu, Hongbo, et al.
Published: (2025)
by: Lu, Hongbo, et al.
Published: (2025)
Contention-Aware Microservice Deployment in Collaborative Mobile Edge Networks
by: Ge, Xinlei, et al.
Published: (2024)
by: Ge, Xinlei, et al.
Published: (2024)
Arcturus: A Cloud Overlay Network for Global Accelerator with Enhanced Performance and Stability
by: Liu, Matthew Yang, et al.
Published: (2025)
by: Liu, Matthew Yang, et al.
Published: (2025)
MultiPath Memory Access: Breaking Host-GPU Bandwidth Bottlenecks in LLM Services
by: Tang, Lingfeng, et al.
Published: (2025)
by: Tang, Lingfeng, et al.
Published: (2025)
A Hybrid Cloud Management Plane for Data Processing Pipelines
by: Babu, Vignesh, et al.
Published: (2025)
by: Babu, Vignesh, et al.
Published: (2025)
RailX: A Flexible, Scalable, and Low-Cost Network Architecture for Hyper-Scale LLM Training Systems
by: Feng, Yinxiao, et al.
Published: (2025)
by: Feng, Yinxiao, et al.
Published: (2025)
Channel Access Methods for RF-Powered IoT Networks: A Survey
by: Yu, Hang, et al.
Published: (2024)
by: Yu, Hang, et al.
Published: (2024)
YUHENG-OS: A Cloud-Native Space Cluster Operating System
by: Zhang, Jin, et al.
Published: (2026)
by: Zhang, Jin, et al.
Published: (2026)
Resource Allocation Driven by Large Models in Future Semantic-Aware Networks
by: Zhang, Haijun, et al.
Published: (2025)
by: Zhang, Haijun, et al.
Published: (2025)
Similar Items
-
Multi-stage Flow Scheduling for LLM Serving
by: Sun, Yijun, et al.
Published: (2026) -
A Task Decomposition and Planning Framework for Efficient LLM Inference in AI-Enabled WiFi-Offload Networks
by: Han, Mingqi, et al.
Published: (2026) -
PerLLM: Personalized Inference Scheduling with Edge-Cloud Collaboration for Diverse LLM Services
by: Yang, Zheming, et al.
Published: (2024) -
RouterWise: Joint Resource Allocation and Routing for Latency-Aware Multi-Model LLM Serving
by: Kasnavieh, Hossein Hosseini, et al.
Published: (2026) -
Decentralized Network Topology Design for Task Offloading in Mobile Edge Computing
by: Ma, Ke, et al.
Published: (2024)