Cloud Is Closer Than It Appears: Revisiting the Tradeoffs of Distributed Real-Time Inference
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Sharma, Pragya, Qiu, Hang, Srivastava, Mani |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Smaller, Smarter, Closer: The Edge of Collaborative Generative AI
par: Morabito, Roberto, et autres
Publié: (2025)
par: Morabito, Roberto, et autres
Publié: (2025)
Edge-First Language Model Inference: Models, Metrics, and Tradeoffs
par: Jang, SiYoung, et autres
Publié: (2025)
par: Jang, SiYoung, et autres
Publié: (2025)
Trust-Aware Routing for Distributed Generative AI Inference at the Edge
par: Nguyen, Chanh, et autres
Publié: (2026)
par: Nguyen, Chanh, et autres
Publié: (2026)
Early-Exit meets Model-Distributed Inference at Edge Networks
par: Colocrese, Marco, et autres
Publié: (2024)
par: Colocrese, Marco, et autres
Publié: (2024)
HALO: Semantic-Aware Distributed LLM Inference in Lossy Edge Network
par: Zheng, Peirong, et autres
Publié: (2026)
par: Zheng, Peirong, et autres
Publié: (2026)
Optimizing Resource Allocation for Geographically-Distributed Inference by Large Language Models
par: Sun, Tingyang, et autres
Publié: (2025)
par: Sun, Tingyang, et autres
Publié: (2025)
SpaceMoE: Realizing Distributed Mixture-of-Experts Inference over Space Networks
par: Wang, Zhanwei, et autres
Publié: (2026)
par: Wang, Zhanwei, et autres
Publié: (2026)
NebulaFL: Effective Asynchronous Federated Learning for JointCloud Computing
par: Gao, Fei, et autres
Publié: (2024)
par: Gao, Fei, et autres
Publié: (2024)
An Open API Architecture to Discover the Trustworthy Explanation of Cloud AI Services
par: Wang, Zerui, et autres
Publié: (2024)
par: Wang, Zerui, et autres
Publié: (2024)
$Λ$-Split: A Privacy-Preserving Split Computing Framework for Cloud-Powered Generative AI
par: Ohta, Shoki, et autres
Publié: (2023)
par: Ohta, Shoki, et autres
Publié: (2023)
AI Greenferencing: Routing AI Inferencing to Green Modular Data Centers with Heron
par: Reddy, Tella Rajashekhar, et autres
Publié: (2025)
par: Reddy, Tella Rajashekhar, et autres
Publié: (2025)
Jupiter: Fast and Resource-Efficient Collaborative Inference of Generative LLMs on Edge Devices
par: Ye, Shengyuan, et autres
Publié: (2025)
par: Ye, Shengyuan, et autres
Publié: (2025)
Cluster Topology-Driven Placement of Experts Reduces Network Traffic in MoE Inference
par: Sivtsov, Danil, et autres
Publié: (2025)
par: Sivtsov, Danil, et autres
Publié: (2025)
Galaxy: A Resource-Efficient Collaborative Edge AI System for In-situ Transformer Inference
par: Ye, Shengyuan, et autres
Publié: (2024)
par: Ye, Shengyuan, et autres
Publié: (2024)
XWind: A Cross-site Router for Large Language Model Inference Serving at Renewable Energy Farms
par: Reddy, Tella Rajashekhar, et autres
Publié: (2026)
par: Reddy, Tella Rajashekhar, et autres
Publié: (2026)
Design and Optimization of Hierarchical Gradient Coding for Distributed Learning at Edge Devices
par: Tang, Weiheng, et autres
Publié: (2024)
par: Tang, Weiheng, et autres
Publié: (2024)
Rina: Enhancing Ring-AllReduce with In-network Aggregation in Distributed Model Training
par: Chen, Zixuan, et autres
Publié: (2024)
par: Chen, Zixuan, et autres
Publié: (2024)
Dynamic and Distributed Routing in IoT Networks based on Multi-Objective Q-Learning
par: Vaishnav, Shubham, et autres
Publié: (2025)
par: Vaishnav, Shubham, et autres
Publié: (2025)
Enabling Intelligent Vehicular Networks Through Distributed Learning in the Non-Terrestrial Networks 6G Vision
par: Naseh, David, et autres
Publié: (2023)
par: Naseh, David, et autres
Publié: (2023)
Resilient by Design -- Active Inference for Distributed Continuum Intelligence
par: Donta, Praveen Kumar, et autres
Publié: (2025)
par: Donta, Praveen Kumar, et autres
Publié: (2025)
Adaptive DNN Partitioning and Offloading in Heterogeneous Edge-Cloud Continuum
par: Deng, Akuen Akoi, et autres
Publié: (2026)
par: Deng, Akuen Akoi, et autres
Publié: (2026)
FogROS2-FT: Fault Tolerant Cloud Robotics
par: Chen, Kaiyuan, et autres
Publié: (2024)
par: Chen, Kaiyuan, et autres
Publié: (2024)
Causal Inference for Quantifying Noisy Neighbor Effects in Multi-Tenant Cloud Environments
par: Schiavo, Philipe S., et autres
Publié: (2026)
par: Schiavo, Philipe S., et autres
Publié: (2026)
PerLLM: Personalized Inference Scheduling with Edge-Cloud Collaboration for Diverse LLM Services
par: Yang, Zheming, et autres
Publié: (2024)
par: Yang, Zheming, et autres
Publié: (2024)
SlimCaching: Edge Caching of Mixture-of-Experts for Distributed Inference
par: Chen, Qian, et autres
Publié: (2025)
par: Chen, Qian, et autres
Publié: (2025)
Real-time and Downtime-tolerant Fault Diagnosis for Railway Turnout Machines (RTMs) Empowered with Cloud-Edge Pipeline Parallelism
par: Wu, Fan, et autres
Publié: (2024)
par: Wu, Fan, et autres
Publié: (2024)
OptiReduce: Resilient and Tail-Optimal AllReduce for Distributed Deep Learning in the Cloud
par: Warraich, Ertza, et autres
Publié: (2023)
par: Warraich, Ertza, et autres
Publié: (2023)
Benchmarking Dynamic SLO Compliance in Distributed Computing Continuum Systems
par: Lapkovskis, Alfreds, et autres
Publié: (2025)
par: Lapkovskis, Alfreds, et autres
Publié: (2025)
Revisiting Cache Freshness for Emerging Real-Time Applications
par: Mao, Ziming, et autres
Publié: (2024)
par: Mao, Ziming, et autres
Publié: (2024)
Collective Communication Profiling of Modern-day Machine Learning Workloads
par: Gupta, Jit, et autres
Publié: (2025)
par: Gupta, Jit, et autres
Publié: (2025)
Digital Twinning of a Pressurized Water Reactor Startup Operation and Partial Computational Offloading in In-network Computing-Assisted Multiaccess Edge Computing
par: Aliyu, Ibrahim, et autres
Publié: (2024)
par: Aliyu, Ibrahim, et autres
Publié: (2024)
Context-Aware Orchestration of Energy-Efficient Gossip Learning Schemes
par: Dinani, Mina Aghaei, et autres
Publié: (2024)
par: Dinani, Mina Aghaei, et autres
Publié: (2024)
Towards Net-Zero Carbon Emissions in Network AI for 6G and Beyond
par: Zhang, Peng, et autres
Publié: (2023)
par: Zhang, Peng, et autres
Publié: (2023)
Optimizing Split Learning Latency in TinyML-Based IoT Systems
par: Jenhani, Zied, et autres
Publié: (2025)
par: Jenhani, Zied, et autres
Publié: (2025)
Agentic Performance at the Edge: Insights from Benchmarking
par: Wang, Shiqiang, et autres
Publié: (2026)
par: Wang, Shiqiang, et autres
Publié: (2026)
KVServe: Service-Aware KV Cache Compression for Communication-Efficient Disaggregated LLM Serving
par: Liu, Zedong, et autres
Publié: (2026)
par: Liu, Zedong, et autres
Publié: (2026)
When IoT Meet LLMs: Applications and Challenges
par: Kok, Ibrahim, et autres
Publié: (2024)
par: Kok, Ibrahim, et autres
Publié: (2024)
When Digital Twin Meets 6G: Concepts, Obstacles, and Research Prospects
par: Liu, Wenshuai, et autres
Publié: (2024)
par: Liu, Wenshuai, et autres
Publié: (2024)
High-speed Networking for Giga-Scale AI Factories
par: Khashab, Sajy, et autres
Publié: (2026)
par: Khashab, Sajy, et autres
Publié: (2026)
ScaleAcross Explorer: Exploring Communication Optimization for Scale-Across AI Model Training
par: Li, Minghao, et autres
Publié: (2026)
par: Li, Minghao, et autres
Publié: (2026)
Documents similaires
-
Smaller, Smarter, Closer: The Edge of Collaborative Generative AI
par: Morabito, Roberto, et autres
Publié: (2025) -
Edge-First Language Model Inference: Models, Metrics, and Tradeoffs
par: Jang, SiYoung, et autres
Publié: (2025) -
Trust-Aware Routing for Distributed Generative AI Inference at the Edge
par: Nguyen, Chanh, et autres
Publié: (2026) -
Early-Exit meets Model-Distributed Inference at Edge Networks
par: Colocrese, Marco, et autres
Publié: (2024) -
HALO: Semantic-Aware Distributed LLM Inference in Lossy Edge Network
par: Zheng, Peirong, et autres
Publié: (2026)