CE-CoLLM: Efficient and Adaptive Large Language Models Through Cloud-Edge Collaboration
Fuente:
arXiv
Salvato in:
| Autori principali: | Jin, Hongpeng, Wu, Yanzhao |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
CoLLM: Continuous Adaptation for SLO-Aware LLM Serving on Shared GPU Clusters
di: Huang, Shaoyuan, et al.
Pubblicazione: (2026)
di: Huang, Shaoyuan, et al.
Pubblicazione: (2026)
Enabling Efficient Serverless Inference Serving for LLM (Large Language Model) in the Cloud
di: Ghosh, Himel
Pubblicazione: (2024)
di: Ghosh, Himel
Pubblicazione: (2024)
EDGE-LLM: Enabling Efficient Large Language Model Adaptation on Edge Devices via Layerwise Unified Compression and Adaptive Layer Tuning and Voting
di: Yu, Zhongzhi, et al.
Pubblicazione: (2024)
di: Yu, Zhongzhi, et al.
Pubblicazione: (2024)
Agglomerative Federated Learning: Empowering Larger Model Training via End-Edge-Cloud Collaboration
di: Wu, Zhiyuan, et al.
Pubblicazione: (2023)
di: Wu, Zhiyuan, et al.
Pubblicazione: (2023)
Arena: Efficiently Training Large Models via Dynamic Scheduling and Adaptive Parallelism Co-Design
di: Xue, Chunyu, et al.
Pubblicazione: (2024)
di: Xue, Chunyu, et al.
Pubblicazione: (2024)
DSD: A Distributed Speculative Decoding Solution for Edge-Cloud Agile Large Model Serving
di: Yu, Fengze, et al.
Pubblicazione: (2025)
di: Yu, Fengze, et al.
Pubblicazione: (2025)
RoboECC: Multi-Factor-Aware Edge-Cloud Collaborative Deployment for VLA Models
di: Zheng, Zihao, et al.
Pubblicazione: (2026)
di: Zheng, Zihao, et al.
Pubblicazione: (2026)
MSAO: Adaptive Modality Sparsity-Aware Offloading with Edge-Cloud Collaboration for Efficient Multimodal LLM Inference
di: Yang, Zheming, et al.
Pubblicazione: (2026)
di: Yang, Zheming, et al.
Pubblicazione: (2026)
LoongServe: Efficiently Serving Long-Context Large Language Models with Elastic Sequence Parallelism
di: Wu, Bingyang, et al.
Pubblicazione: (2024)
di: Wu, Bingyang, et al.
Pubblicazione: (2024)
Energy-Efficient Split Learning for Fine-Tuning Large Language Models in Edge Networks
di: Li, Zuguang, et al.
Pubblicazione: (2024)
di: Li, Zuguang, et al.
Pubblicazione: (2024)
Collaborative Speculative Inference for Efficient LLM Inference Serving
di: Gao, Luyao, et al.
Pubblicazione: (2025)
di: Gao, Luyao, et al.
Pubblicazione: (2025)
Edge-Cloud Collaborative Computing on Distributed Intelligence and Model Optimization: A Survey
di: Liu, Jing, et al.
Pubblicazione: (2025)
di: Liu, Jing, et al.
Pubblicazione: (2025)
A Survey on Collaborative DNN Inference for Edge Intelligence
di: Ren, Weiqing, et al.
Pubblicazione: (2022)
di: Ren, Weiqing, et al.
Pubblicazione: (2022)
Efficient Heterogeneous Large Language Model Decoding with Model-Attention Disaggregation
di: Chen, Shaoyuan, et al.
Pubblicazione: (2024)
di: Chen, Shaoyuan, et al.
Pubblicazione: (2024)
DG-CoLearn: An Efficient Collaborative Learning Framework for Dynamic Graphs
di: Au, Ashley Hoi-Ting, et al.
Pubblicazione: (2026)
di: Au, Ashley Hoi-Ting, et al.
Pubblicazione: (2026)
Beyond Model Scale Limits: End-Edge-Cloud Federated Learning with Self-Rectified Knowledge Agglomeration
di: Wu, Zhiyuan, et al.
Pubblicazione: (2025)
di: Wu, Zhiyuan, et al.
Pubblicazione: (2025)
SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models
di: Wu, Hang, et al.
Pubblicazione: (2025)
di: Wu, Hang, et al.
Pubblicazione: (2025)
MoA-Off: Adaptive Heterogeneous Modality-Aware Offloading with Edge-Cloud Collaboration for Efficient Multimodal LLM Inference
di: Yang, Zheming, et al.
Pubblicazione: (2025)
di: Yang, Zheming, et al.
Pubblicazione: (2025)
CoFormer: Collaborating with Heterogeneous Edge Devices for Scalable Transformer Inference
di: Xu, Guanyu, et al.
Pubblicazione: (2025)
di: Xu, Guanyu, et al.
Pubblicazione: (2025)
Cost-Efficient LLM Serving in the Cloud: VM Selection with KV Cache Offloading
di: Kim, Kihyun, et al.
Pubblicazione: (2025)
di: Kim, Kihyun, et al.
Pubblicazione: (2025)
MobiZO: Enabling Efficient LLM Fine-Tuning at the Edge via Inference Engines
di: Gao, Lei, et al.
Pubblicazione: (2024)
di: Gao, Lei, et al.
Pubblicazione: (2024)
A Pipelined Collaborative Speculative Decoding Framework for Efficient Edge-Cloud LLM Inference
di: Zhang, Yida, et al.
Pubblicazione: (2026)
di: Zhang, Yida, et al.
Pubblicazione: (2026)
DataStates-LLM: Lazy Asynchronous Checkpointing for Large Language Models
di: Maurya, Avinash, et al.
Pubblicazione: (2024)
di: Maurya, Avinash, et al.
Pubblicazione: (2024)
ServerlessLLM: Low-Latency Serverless Inference for Large Language Models
di: Fu, Yao, et al.
Pubblicazione: (2024)
di: Fu, Yao, et al.
Pubblicazione: (2024)
Fast Distributed Inference Serving for Large Language Models
di: Wu, Bingyang, et al.
Pubblicazione: (2023)
di: Wu, Bingyang, et al.
Pubblicazione: (2023)
Computing in the Era of Large Generative Models: From Cloud-Native to AI-Native
di: Lu, Yao, et al.
Pubblicazione: (2024)
di: Lu, Yao, et al.
Pubblicazione: (2024)
Learning the Optimal Path and DNN Partition for Collaborative Edge Inference
di: Huang, Yin, et al.
Pubblicazione: (2024)
di: Huang, Yin, et al.
Pubblicazione: (2024)
Robust Federated Learning against Model Perturbation in Edge Networks
di: Jin, Dongzi, et al.
Pubblicazione: (2025)
di: Jin, Dongzi, et al.
Pubblicazione: (2025)
EARL: Efficient Agentic Reinforcement Learning Systems for Large Language Models
di: Tan, Zheyue, et al.
Pubblicazione: (2025)
di: Tan, Zheyue, et al.
Pubblicazione: (2025)
Intelligent Orchestration of Distributed Large Foundation Model Inference at the Edge
di: Koch, Fernando, et al.
Pubblicazione: (2025)
di: Koch, Fernando, et al.
Pubblicazione: (2025)
HybridFlow: Resource-Adaptive Subtask Routing for Efficient Edge-Cloud LLM Inference
di: Dong, Jiangwen, et al.
Pubblicazione: (2025)
di: Dong, Jiangwen, et al.
Pubblicazione: (2025)
Leveraging Neural Graph Compilers in Machine Learning Research for Edge-Cloud Systems
di: Furutanpey, Alireza, et al.
Pubblicazione: (2025)
di: Furutanpey, Alireza, et al.
Pubblicazione: (2025)
Collaborative Learning of On-Device Small Model and Cloud-Based Large Model: Advances and Future Directions
di: Niu, Chaoyue, et al.
Pubblicazione: (2025)
di: Niu, Chaoyue, et al.
Pubblicazione: (2025)
Mélange: Cost Efficient Large Language Model Serving by Exploiting GPU Heterogeneity
di: Griggs, Tyler, et al.
Pubblicazione: (2024)
di: Griggs, Tyler, et al.
Pubblicazione: (2024)
DisCEdge: Distributed Context Management for Large Language Models at the Edge
di: Malekabbasi, Mohammadreza, et al.
Pubblicazione: (2025)
di: Malekabbasi, Mohammadreza, et al.
Pubblicazione: (2025)
Designing Large Foundation Models for Efficient Training and Inference: A Survey
di: Liu, Dong, et al.
Pubblicazione: (2024)
di: Liu, Dong, et al.
Pubblicazione: (2024)
Leveraging Foundation Models for Efficient Federated Learning in Resource-restricted Edge Networks
di: Atapour, S. Kawa, et al.
Pubblicazione: (2024)
di: Atapour, S. Kawa, et al.
Pubblicazione: (2024)
Efficient Split Learning LSTM Models for FPGA-based Edge IoT Devices
di: Molina, Romina Soledad, et al.
Pubblicazione: (2025)
di: Molina, Romina Soledad, et al.
Pubblicazione: (2025)
COSTREAM: Learned Cost Models for Operator Placement in Edge-Cloud Environments
di: Heinrich, Roman, et al.
Pubblicazione: (2024)
di: Heinrich, Roman, et al.
Pubblicazione: (2024)
CoBo: Collaborative Learning via Bilevel Optimization
di: Hashemi, Diba, et al.
Pubblicazione: (2024)
di: Hashemi, Diba, et al.
Pubblicazione: (2024)
Documenti analoghi
-
CoLLM: Continuous Adaptation for SLO-Aware LLM Serving on Shared GPU Clusters
di: Huang, Shaoyuan, et al.
Pubblicazione: (2026) -
Enabling Efficient Serverless Inference Serving for LLM (Large Language Model) in the Cloud
di: Ghosh, Himel
Pubblicazione: (2024) -
EDGE-LLM: Enabling Efficient Large Language Model Adaptation on Edge Devices via Layerwise Unified Compression and Adaptive Layer Tuning and Voting
di: Yu, Zhongzhi, et al.
Pubblicazione: (2024) -
Agglomerative Federated Learning: Empowering Larger Model Training via End-Edge-Cloud Collaboration
di: Wu, Zhiyuan, et al.
Pubblicazione: (2023) -
Arena: Efficiently Training Large Models via Dynamic Scheduling and Adaptive Parallelism Co-Design
di: Xue, Chunyu, et al.
Pubblicazione: (2024)