Modular Foundation Model Inference at the Edge: Network-Aware Microservice Optimization
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhu, Juan, Wang, Zixin, Song, Shenghui, Zhang, Jun, Letaief, Khaled Ben |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Distributed On-Device LLM Inference With Over-the-Air Computation
di: Zhang, Kai, et al.
Pubblicazione: (2025)
di: Zhang, Kai, et al.
Pubblicazione: (2025)
Communication-Efficient Distributed On-Device LLM Inference Over Wireless Networks
di: Zhang, Kai, et al.
Pubblicazione: (2025)
di: Zhang, Kai, et al.
Pubblicazione: (2025)
Satellite Federated Fine-Tuning for Foundation Models in Space Computing Power Networks
di: Zhu, Yan, et al.
Pubblicazione: (2025)
di: Zhu, Yan, et al.
Pubblicazione: (2025)
FedGMI: Generative Model-Driven Federated Learning for Probabilistic Mixture Inference
di: Hou, Qijun, et al.
Pubblicazione: (2026)
di: Hou, Qijun, et al.
Pubblicazione: (2026)
Network Edge Inference for Large Language Models: Principles, Techniques, and Opportunities
di: Chen, Zhixiong, et al.
Pubblicazione: (2026)
di: Chen, Zhixiong, et al.
Pubblicazione: (2026)
Contention-Aware Microservice Deployment in Collaborative Mobile Edge Networks
di: Ge, Xinlei, et al.
Pubblicazione: (2024)
di: Ge, Xinlei, et al.
Pubblicazione: (2024)
Energy-aware Distributed Microservice Request Placement at the Edge
di: Toczé, Klervie, et al.
Pubblicazione: (2024)
di: Toczé, Klervie, et al.
Pubblicazione: (2024)
Energy Metrics for Edge Microservice Request Placement Strategies
di: Toczé, Klervie, et al.
Pubblicazione: (2025)
di: Toczé, Klervie, et al.
Pubblicazione: (2025)
Environment-Aware Dynamic Pruning for Pipelined Edge Inference
di: O'Quinn, Austin, et al.
Pubblicazione: (2025)
di: O'Quinn, Austin, et al.
Pubblicazione: (2025)
ADApt: Edge Device Anomaly Detection and Microservice Replica Prediction
di: Mehran, Narges, et al.
Pubblicazione: (2025)
di: Mehran, Narges, et al.
Pubblicazione: (2025)
Accelerating Edge Inference for Distributed MoE Models with Latency-Optimized Expert Placement
di: Wu, Tian, et al.
Pubblicazione: (2025)
di: Wu, Tian, et al.
Pubblicazione: (2025)
Online Optimization of DNN Inference Network Utility in Collaborative Edge Computing
di: Li, Rui, et al.
Pubblicazione: (2024)
di: Li, Rui, et al.
Pubblicazione: (2024)
FlexPie: Accelerate Distributed Inference on Edge Devices with Flexible Combinatorial Optimization[Technical Report]
di: Zhang, Runhua, et al.
Pubblicazione: (2025)
di: Zhang, Runhua, et al.
Pubblicazione: (2025)
Topology-aware Microservice Architecture in Edge Networks: Deployment Optimization and Implementation
di: Chen, Yuang, et al.
Pubblicazione: (2025)
di: Chen, Yuang, et al.
Pubblicazione: (2025)
REACH: Reinforcement Learning for Adaptive Microservice Rescheduling in the Cloud-Edge Continuum
di: Bai, Xu, et al.
Pubblicazione: (2025)
di: Bai, Xu, et al.
Pubblicazione: (2025)
Priority-Aware Model-Distributed Inference at Edge Networks
di: Li, Teng, et al.
Pubblicazione: (2024)
di: Li, Teng, et al.
Pubblicazione: (2024)
Toward Sustainability-Aware LLM Inference on Edge Clusters
di: Rajashekar, Kolichala, et al.
Pubblicazione: (2025)
di: Rajashekar, Kolichala, et al.
Pubblicazione: (2025)
SneakPeek: Data-Aware Model Selection and Scheduling for Inference Serving on the Edge
di: Wolfrath, Joel, et al.
Pubblicazione: (2025)
di: Wolfrath, Joel, et al.
Pubblicazione: (2025)
Failure-Resilient and Carbon-Efficient Deployment of Microservices over the Cloud-Edge Continuum
di: Ponce, Francisco, et al.
Pubblicazione: (2026)
di: Ponce, Francisco, et al.
Pubblicazione: (2026)
NotNets: Accelerating Microservices by Bypassing the Network
di: Alvaro, Peter, et al.
Pubblicazione: (2024)
di: Alvaro, Peter, et al.
Pubblicazione: (2024)
Collaborative Evolution of Intelligent Agents in Large-Scale Microservice Systems
di: Li, Yilin, et al.
Pubblicazione: (2025)
di: Li, Yilin, et al.
Pubblicazione: (2025)
OCTOPINF: Workload-Aware Inference Serving for Edge Video Analytics
di: Nguyen, Thanh-Tung, et al.
Pubblicazione: (2025)
di: Nguyen, Thanh-Tung, et al.
Pubblicazione: (2025)
A Decentralized Microservice Scheduling Approach Using Service Mesh in Cloud-Edge Systems
di: Wen, Yangyang, et al.
Pubblicazione: (2025)
di: Wen, Yangyang, et al.
Pubblicazione: (2025)
Argus: Token Aware Distributed LLM Inference Optimization
di: Wu, Panlong, et al.
Pubblicazione: (2025)
di: Wu, Panlong, et al.
Pubblicazione: (2025)
MSAO: Adaptive Modality Sparsity-Aware Offloading with Edge-Cloud Collaboration for Efficient Multimodal LLM Inference
di: Yang, Zheming, et al.
Pubblicazione: (2026)
di: Yang, Zheming, et al.
Pubblicazione: (2026)
Joint Temporal-Structural Representation Learning for Distributed Fault Discrimination in Microservice Architectures
di: Xue, Yihan, et al.
Pubblicazione: (2026)
di: Xue, Yihan, et al.
Pubblicazione: (2026)
Hestia: Hyperthread-Level Scheduling for Cloud Microservices with Interference-Aware Attention
di: Yang, Dingyu, et al.
Pubblicazione: (2026)
di: Yang, Dingyu, et al.
Pubblicazione: (2026)
Carbon-Aware Microservice Deployment for Optimal User Experience on a Budget
di: Kreutz, Kevin, et al.
Pubblicazione: (2025)
di: Kreutz, Kevin, et al.
Pubblicazione: (2025)
Two-Timescale Model Caching and Resource Allocation for Edge-Enabled AI-Generated Content Services
di: Liu, Zhang, et al.
Pubblicazione: (2024)
di: Liu, Zhang, et al.
Pubblicazione: (2024)
Fulcrum: Optimizing Concurrent DNN Training and Inferencing on Edge Accelerators
di: K., Prashanthi S., et al.
Pubblicazione: (2025)
di: K., Prashanthi S., et al.
Pubblicazione: (2025)
Infer-EDGE: Dynamic DNN Inference Optimization in 'Just-in-time' Edge-AI Implementations
di: Mounesan, Motahare, et al.
Pubblicazione: (2025)
di: Mounesan, Motahare, et al.
Pubblicazione: (2025)
Scene-Aware Latency Estimation for Microservices via Multi-Scale Graph Fusion
di: Sun, Zhichao, et al.
Pubblicazione: (2026)
di: Sun, Zhichao, et al.
Pubblicazione: (2026)
Preemption Aware Task Scheduling for Priority and Deadline Constrained DNN Inference Task Offloading in Homogeneous Mobile-Edge Networks
di: Cotter, Jamie, et al.
Pubblicazione: (2025)
di: Cotter, Jamie, et al.
Pubblicazione: (2025)
ORACL: Optimized Reasoning for Autoscaling via Chain of Thought with LLMs for Microservices
di: Bai, Haoyu, et al.
Pubblicazione: (2026)
di: Bai, Haoyu, et al.
Pubblicazione: (2026)
Decentralized LLM Inference over Edge Networks with Energy Harvesting
di: Khoshsirat, Aria, et al.
Pubblicazione: (2024)
di: Khoshsirat, Aria, et al.
Pubblicazione: (2024)
EdgeShard: Efficient LLM Inference via Collaborative Edge Computing
di: Zhang, Mingjin, et al.
Pubblicazione: (2024)
di: Zhang, Mingjin, et al.
Pubblicazione: (2024)
Adaptive Configuration Selection for Multi-Model Inference Pipelines in Edge Computing
di: Sheng, Jinhao, et al.
Pubblicazione: (2025)
di: Sheng, Jinhao, et al.
Pubblicazione: (2025)
PICE: A Semantic-Driven Progressive Inference System for LLM Serving in Cloud-Edge Networks
di: Zhan, Huiyou, et al.
Pubblicazione: (2025)
di: Zhan, Huiyou, et al.
Pubblicazione: (2025)
Bandwidth-Aware Network Topology Optimization for Decentralized Learning
di: Shen, Yipeng, et al.
Pubblicazione: (2025)
di: Shen, Yipeng, et al.
Pubblicazione: (2025)
Intelligent Orchestration of Distributed Large Foundation Model Inference at the Edge
di: Koch, Fernando, et al.
Pubblicazione: (2025)
di: Koch, Fernando, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Distributed On-Device LLM Inference With Over-the-Air Computation
di: Zhang, Kai, et al.
Pubblicazione: (2025) -
Communication-Efficient Distributed On-Device LLM Inference Over Wireless Networks
di: Zhang, Kai, et al.
Pubblicazione: (2025) -
Satellite Federated Fine-Tuning for Foundation Models in Space Computing Power Networks
di: Zhu, Yan, et al.
Pubblicazione: (2025) -
FedGMI: Generative Model-Driven Federated Learning for Probabilistic Mixture Inference
di: Hou, Qijun, et al.
Pubblicazione: (2026) -
Network Edge Inference for Large Language Models: Principles, Techniques, and Opportunities
di: Chen, Zhixiong, et al.
Pubblicazione: (2026)