A Review on Edge Large Language Models: Design, Execution, and Applications
Fuente:
arXiv
Saved in:
| Main Authors: | Zheng, Yue, Chen, Yuhao, Qian, Bin, Shi, Xiufang, Shu, Yuanchao, Chen, Jiming |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Minions: Accelerating Large Language Model Inference with Aggregated Speculative Execution
by: Wang, Siqi, et al.
Published: (2024)
by: Wang, Siqi, et al.
Published: (2024)
Network Edge Inference for Large Language Models: Principles, Techniques, and Opportunities
by: Chen, Zhixiong, et al.
Published: (2026)
by: Chen, Zhixiong, et al.
Published: (2026)
Zenix: Efficient Execution of Bulky Serverless Applications
by: Guo, Zhiyuan, et al.
Published: (2022)
by: Guo, Zhiyuan, et al.
Published: (2022)
Edge System Design Using Containers and Unikernels for IoT Applications
by: Kaiser, Shahidullah, et al.
Published: (2024)
by: Kaiser, Shahidullah, et al.
Published: (2024)
Three Birds, One Stone: Solving the Communication-Memory-Privacy Trilemma in LLM Fine-tuning Over Wireless Networks with Zeroth-Order Optimization
by: Cai, Zhijie, et al.
Published: (2026)
by: Cai, Zhijie, et al.
Published: (2026)
Low-Latency Federated Fine-Tuning for Large Language Models Over Wireless Networks
by: Pang, Zhiwen, et al.
Published: (2026)
by: Pang, Zhiwen, et al.
Published: (2026)
RingAda: Pipelining Large Model Fine-Tuning on Edge Devices with Scheduled Layer Unfreezing
by: Li, Liang, et al.
Published: (2025)
by: Li, Liang, et al.
Published: (2025)
Blockchain and Edge Computing Nexus: A Large-scale Systematic Literature Review
by: Nezami, Zeinab, et al.
Published: (2025)
by: Nezami, Zeinab, et al.
Published: (2025)
Disaggregated Prefill and Decoding Inference System for Large Language Model Serving on Multi-Vendor GPUs
by: Chen, Xing, et al.
Published: (2025)
by: Chen, Xing, et al.
Published: (2025)
Redox: Improving I/O Efficiency of Model Training Through File Redirection
by: Li, Yuhao, et al.
Published: (2025)
by: Li, Yuhao, et al.
Published: (2025)
Distributed Speculative Execution for Resilient Cloud Applications
by: Li, Tianyu, et al.
Published: (2024)
by: Li, Tianyu, et al.
Published: (2024)
PrefillOnly: An Inference Engine for Prefill-only Workloads in Large Language Model Applications
by: Du, Kuntai, et al.
Published: (2025)
by: Du, Kuntai, et al.
Published: (2025)
DynaServe: Unified and Elastic Execution for Dynamic Disaggregated LLM Serving
by: Ruan, Chaoyi, et al.
Published: (2025)
by: Ruan, Chaoyi, et al.
Published: (2025)
DTVM: Revolutionizing Smart Contract Execution with Determinism and Compatibility
by: Zhou, Wei, et al.
Published: (2025)
by: Zhou, Wei, et al.
Published: (2025)
Fantasy: Efficient Large-scale Vector Search on GPU Clusters with GPUDirect Async
by: Liu, Yi, et al.
Published: (2025)
by: Liu, Yi, et al.
Published: (2025)
Collaborative Inference and Learning between Edge SLMs and Cloud LLMs: A Survey of Algorithms, Execution, and Open Challenges
by: Li, Senyao, et al.
Published: (2025)
by: Li, Senyao, et al.
Published: (2025)
Zero-Execution Retrieval-Augmented Configuration Tuning of Spark Applications
by: Suri, Raunaq, et al.
Published: (2025)
by: Suri, Raunaq, et al.
Published: (2025)
DeepServe: Serverless Large Language Model Serving at Scale
by: Hu, Junhao, et al.
Published: (2025)
by: Hu, Junhao, et al.
Published: (2025)
SPIN: Accelerating Large Language Model Inference with Heterogeneous Speculative Models
by: Chen, Fahao, et al.
Published: (2025)
by: Chen, Fahao, et al.
Published: (2025)
λScale: Enabling Fast Scaling for Serverless Large Language Model Inference
by: Yu, Minchen, et al.
Published: (2025)
by: Yu, Minchen, et al.
Published: (2025)
ESG: Pipeline-Conscious Efficient Scheduling of DNN Workflows on Serverless Platforms with Shareable GPUs
by: Hui, Xinning, et al.
Published: (2024)
by: Hui, Xinning, et al.
Published: (2024)
SLO-Aware Scheduling for Large Language Model Inferences
by: Huang, Jinqi, et al.
Published: (2025)
by: Huang, Jinqi, et al.
Published: (2025)
Split Federated Learning Empowered Vehicular Edge Intelligence: Concept, Adaptive Design and Future Directions
by: Qiang, Xianke, et al.
Published: (2024)
by: Qiang, Xianke, et al.
Published: (2024)
Federated Learning as a Service for Hierarchical Edge Networks with Heterogeneous Models
by: Gao, Wentao, et al.
Published: (2024)
by: Gao, Wentao, et al.
Published: (2024)
Accurate Performance Predictors for Edge Computing Applications
by: Giannakopoulos, Panagiotis, et al.
Published: (2025)
by: Giannakopoulos, Panagiotis, et al.
Published: (2025)
Edge AI: A Taxonomy, Systematic Review and Future Directions
by: Gill, Sukhpal Singh, et al.
Published: (2024)
by: Gill, Sukhpal Singh, et al.
Published: (2024)
HexiScale: Facilitating Large Language Model Training over Heterogeneous Hardware
by: Yan, Ran, et al.
Published: (2024)
by: Yan, Ran, et al.
Published: (2024)
ServeGen: Workload Characterization and Generation of Large Language Model Serving in Production
by: Xiang, Yuxing, et al.
Published: (2025)
by: Xiang, Yuxing, et al.
Published: (2025)
Boosting Blockchain Throughput: Parallel EVM Execution with Asynchronous Storage for Reddio
by: Qi, Xiaodong, et al.
Published: (2025)
by: Qi, Xiaodong, et al.
Published: (2025)
InfiniLoRA: Disaggregated Multi-LoRA Serving for Large Language Models
by: Chen, Hongyu, et al.
Published: (2026)
by: Chen, Hongyu, et al.
Published: (2026)
EdgeServing: Deadline-Aware Multi-DNN Serving at the Edge
by: Cao, Jiahe, et al.
Published: (2026)
by: Cao, Jiahe, et al.
Published: (2026)
GenAI at the Edge: Comprehensive Survey on Empowering Edge Devices
by: Navardi, Mozhgan, et al.
Published: (2025)
by: Navardi, Mozhgan, et al.
Published: (2025)
PVU: Design and Implementation of a Posit Vector Arithmetic Unit (PVU) for Enhanced Floating-Point Computing in Edge and AI Applications
by: Wu, Xinyu, et al.
Published: (2025)
by: Wu, Xinyu, et al.
Published: (2025)
HexGen: Generative Inference of Large Language Model over Heterogeneous Environment
by: Jiang, Youhe, et al.
Published: (2023)
by: Jiang, Youhe, et al.
Published: (2023)
Data-Locality-Aware Task Assignment and Scheduling for Distributed Job Executions
by: Zhao, Hailiang, et al.
Published: (2024)
by: Zhao, Hailiang, et al.
Published: (2024)
CoEdge-RAG: Optimizing Hierarchical Scheduling for Retrieval-Augmented LLMs in Collaborative Edge Computing
by: Hong, Guihang, et al.
Published: (2025)
by: Hong, Guihang, et al.
Published: (2025)
HE2C: A Holistic Approach for Allocating Latency-Sensitive AI Tasks across Edge-Cloud
by: Kim, Minseo, et al.
Published: (2024)
by: Kim, Minseo, et al.
Published: (2024)
High-Efficiency Split Computing for Cooperative Edge Systems: A Novel Compressed Sensing Bottleneck
by: Zhong, Hailin, et al.
Published: (2025)
by: Zhong, Hailin, et al.
Published: (2025)
Application-level observability for adaptive Edge to Cloud continuum systems
by: Sidi, Kaddour, et al.
Published: (2026)
by: Sidi, Kaddour, et al.
Published: (2026)
Object Abstraction To Streamline Edge-Cloud-Native Application Development
by: Lertpongrujikorn, Pawissanutt
Published: (2025)
by: Lertpongrujikorn, Pawissanutt
Published: (2025)
Similar Items
-
Minions: Accelerating Large Language Model Inference with Aggregated Speculative Execution
by: Wang, Siqi, et al.
Published: (2024) -
Network Edge Inference for Large Language Models: Principles, Techniques, and Opportunities
by: Chen, Zhixiong, et al.
Published: (2026) -
Zenix: Efficient Execution of Bulky Serverless Applications
by: Guo, Zhiyuan, et al.
Published: (2022) -
Edge System Design Using Containers and Unikernels for IoT Applications
by: Kaiser, Shahidullah, et al.
Published: (2024) -
Three Birds, One Stone: Solving the Communication-Memory-Privacy Trilemma in LLM Fine-tuning Over Wireless Networks with Zeroth-Order Optimization
by: Cai, Zhijie, et al.
Published: (2026)