PICE: A Semantic-Driven Progressive Inference System for LLM Serving in Cloud-Edge Networks
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhan, Huiyou, Zhang, Xuan, Tan, Haisheng, Tian, Han, Yong, Dongping, Zhang, Junyang, Li, Xiang-Yang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Cloud Native System for LLM Inference Serving
por: Xu, Minxian, et al.
Publicado: (2025)
por: Xu, Minxian, et al.
Publicado: (2025)
EdgeServing: Deadline-Aware Multi-DNN Serving at the Edge
por: Cao, Jiahe, et al.
Publicado: (2026)
por: Cao, Jiahe, et al.
Publicado: (2026)
CALVO: Improve Serving Efficiency for LLM Inferences with Intense Network Demands
por: Wang, Weiye, et al.
Publicado: (2026)
por: Wang, Weiye, et al.
Publicado: (2026)
A Pipelined Collaborative Speculative Decoding Framework for Efficient Edge-Cloud LLM Inference
por: Zhang, Yida, et al.
Publicado: (2026)
por: Zhang, Yida, et al.
Publicado: (2026)
Embedding Samples Dispatching for Recommendation Model Training in Edge Environments
por: Li, Guopeng, et al.
Publicado: (2025)
por: Li, Guopeng, et al.
Publicado: (2025)
ThunderServe: High-performance and Cost-efficient LLM Serving in Cloud Environments
por: Jiang, Youhe, et al.
Publicado: (2025)
por: Jiang, Youhe, et al.
Publicado: (2025)
OCTOPINF: Workload-Aware Inference Serving for Edge Video Analytics
por: Nguyen, Thanh-Tung, et al.
Publicado: (2025)
por: Nguyen, Thanh-Tung, et al.
Publicado: (2025)
Efficient Routing of Inference Requests across LLM Instances in Cloud-Edge Computing
por: Yu, Shibo, et al.
Publicado: (2025)
por: Yu, Shibo, et al.
Publicado: (2025)
HydraServe: Minimizing Cold Start Latency for Serverless LLM Serving in Public Clouds
por: Lou, Chiheng, et al.
Publicado: (2025)
por: Lou, Chiheng, et al.
Publicado: (2025)
EdgeShard: Efficient LLM Inference via Collaborative Edge Computing
por: Zhang, Mingjin, et al.
Publicado: (2024)
por: Zhang, Mingjin, et al.
Publicado: (2024)
PipeSD: An Efficient Cloud-Edge Collaborative Pipeline Inference Framework with Speculative Decoding
por: Han, Yunhe, et al.
Publicado: (2026)
por: Han, Yunhe, et al.
Publicado: (2026)
SLICE: SLO-Driven Scheduling for LLM Inference on Edge Computing Devices
por: Chow, Will
Publicado: (2025)
por: Chow, Will
Publicado: (2025)
SageServe: Optimizing LLM Serving on Cloud Data Centers with Forecast Aware Auto-Scaling
por: Jaiswal, Shashwat, et al.
Publicado: (2025)
por: Jaiswal, Shashwat, et al.
Publicado: (2025)
HybridFlow: Resource-Adaptive Subtask Routing for Efficient Edge-Cloud LLM Inference
por: Dong, Jiangwen, et al.
Publicado: (2025)
por: Dong, Jiangwen, et al.
Publicado: (2025)
MoA-Off: Adaptive Heterogeneous Modality-Aware Offloading with Edge-Cloud Collaboration for Efficient Multimodal LLM Inference
por: Yang, Zheming, et al.
Publicado: (2025)
por: Yang, Zheming, et al.
Publicado: (2025)
SynergAI: Edge-to-Cloud Synergy for Architecture-Driven High-Performance Orchestration for AI Inference
por: Stathopoulou, Foteini, et al.
Publicado: (2025)
por: Stathopoulou, Foteini, et al.
Publicado: (2025)
Decentralized LLM Inference over Edge Networks with Energy Harvesting
por: Khoshsirat, Aria, et al.
Publicado: (2024)
por: Khoshsirat, Aria, et al.
Publicado: (2024)
LLM-Driven Intent-Based Privacy-Aware Orchestration Across the Cloud-Edge Continuum
por: Su, Zijie, et al.
Publicado: (2026)
por: Su, Zijie, et al.
Publicado: (2026)
SneakPeek: Data-Aware Model Selection and Scheduling for Inference Serving on the Edge
por: Wolfrath, Joel, et al.
Publicado: (2025)
por: Wolfrath, Joel, et al.
Publicado: (2025)
CaraServe: CPU-Assisted and Rank-Aware LoRA Serving for Generative LLM Inference
por: Li, Suyi, et al.
Publicado: (2024)
por: Li, Suyi, et al.
Publicado: (2024)
GoodServe: Towards High-Goodput Serving of Agentic LLM Inferences over Heterogeneous Resources
por: Du, Boxiao, et al.
Publicado: (2026)
por: Du, Boxiao, et al.
Publicado: (2026)
A Predictive and Synergistic Two-Layer Scheduling Framework for LLM Serving
por: Zhang, Yue, et al.
Publicado: (2025)
por: Zhang, Yue, et al.
Publicado: (2025)
MuxServe: Flexible Spatial-Temporal Multiplexing for Multiple LLM Serving
por: Duan, Jiangfei, et al.
Publicado: (2024)
por: Duan, Jiangfei, et al.
Publicado: (2024)
UELLM: A Unified and Efficient Approach for LLM Inference Serving
por: He, Yiyuan, et al.
Publicado: (2024)
por: He, Yiyuan, et al.
Publicado: (2024)
Efficient Multi-round LLM Inference over Disaggregated Serving
por: He, Wenhao, et al.
Publicado: (2026)
por: He, Wenhao, et al.
Publicado: (2026)
Collaborative Speculative Inference for Efficient LLM Inference Serving
por: Gao, Luyao, et al.
Publicado: (2025)
por: Gao, Luyao, et al.
Publicado: (2025)
DynaServe: Unified and Elastic Execution for Dynamic Disaggregated LLM Serving
por: Ruan, Chaoyi, et al.
Publicado: (2025)
por: Ruan, Chaoyi, et al.
Publicado: (2025)
MSAO: Adaptive Modality Sparsity-Aware Offloading with Edge-Cloud Collaboration for Efficient Multimodal LLM Inference
por: Yang, Zheming, et al.
Publicado: (2026)
por: Yang, Zheming, et al.
Publicado: (2026)
FREESH: Fair, Resource- and Energy-Efficient Scheduling for LLM Serving on Heterogeneous GPUs
por: He, Xuan, et al.
Publicado: (2025)
por: He, Xuan, et al.
Publicado: (2025)
Enabling Efficient Serverless Inference Serving for LLM (Large Language Model) in the Cloud
por: Ghosh, Himel
Publicado: (2024)
por: Ghosh, Himel
Publicado: (2024)
DuoServe-MoE: Dual-Phase Expert Prefetch and Caching for LLM Inference QoS Assurance
por: Zhang, Yuning, et al.
Publicado: (2025)
por: Zhang, Yuning, et al.
Publicado: (2025)
RAPID: Redundancy-Aware and Compatibility-Optimal Edge-Cloud Partitioned Inference for Diverse VLA Models
por: Zheng, Zihao, et al.
Publicado: (2026)
por: Zheng, Zihao, et al.
Publicado: (2026)
Collaborative Inference and Learning between Edge SLMs and Cloud LLMs: A Survey of Algorithms, Execution, and Open Challenges
por: Li, Senyao, et al.
Publicado: (2025)
por: Li, Senyao, et al.
Publicado: (2025)
Offline Energy-Optimal LLM Serving: Workload-Based Energy Models for LLM Inference on Heterogeneous Systems
por: Wilkins, Grant, et al.
Publicado: (2024)
por: Wilkins, Grant, et al.
Publicado: (2024)
LIME:Accelerating Collaborative Lossless LLM Inference on Memory-Constrained Edge Devices
por: Sun, Mingyu, et al.
Publicado: (2025)
por: Sun, Mingyu, et al.
Publicado: (2025)
Modular Foundation Model Inference at the Edge: Network-Aware Microservice Optimization
por: Zhu, Juan, et al.
Publicado: (2026)
por: Zhu, Juan, et al.
Publicado: (2026)
DOPD: A Dynamic PD-Disaggregation Architecture for Maximizing Goodput in LLM Inference Serving
por: Liao, Junhan, et al.
Publicado: (2025)
por: Liao, Junhan, et al.
Publicado: (2025)
Understanding the Performance and Power of LLM Inferencing on Edge Accelerators
por: Arya, Mayank, et al.
Publicado: (2025)
por: Arya, Mayank, et al.
Publicado: (2025)
Toward Sustainability-Aware LLM Inference on Edge Clusters
por: Rajashekar, Kolichala, et al.
Publicado: (2025)
por: Rajashekar, Kolichala, et al.
Publicado: (2025)
EcoServe: Enabling Cost-effective LLM Serving with Proactive Intra- and Inter-Instance Orchestration
por: Du, Jiangsu, et al.
Publicado: (2025)
por: Du, Jiangsu, et al.
Publicado: (2025)
Ejemplares similares
-
Cloud Native System for LLM Inference Serving
por: Xu, Minxian, et al.
Publicado: (2025) -
EdgeServing: Deadline-Aware Multi-DNN Serving at the Edge
por: Cao, Jiahe, et al.
Publicado: (2026) -
CALVO: Improve Serving Efficiency for LLM Inferences with Intense Network Demands
por: Wang, Weiye, et al.
Publicado: (2026) -
A Pipelined Collaborative Speculative Decoding Framework for Efficient Edge-Cloud LLM Inference
por: Zhang, Yida, et al.
Publicado: (2026) -
Embedding Samples Dispatching for Recommendation Model Training in Edge Environments
por: Li, Guopeng, et al.
Publicado: (2025)