EACO-RAG: Towards Distributed Tiered LLM Deployment using Edge-Assisted and Collaborative RAG with Adaptive Knowledge Update
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Jiaxing, Xu, Chi, Jia, Lianchen, Wang, Feng, Zhang, Cong, Liu, Jiangchuan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
CoEdge-RAG: Optimizing Hierarchical Scheduling for Retrieval-Augmented LLMs in Collaborative Edge Computing
di: Hong, Guihang, et al.
Pubblicazione: (2025)
di: Hong, Guihang, et al.
Pubblicazione: (2025)
Nitsum: Serving Tiered LLM Requests with Adaptive Tensor Parallelism
di: Srivatsa, Vikranth, et al.
Pubblicazione: (2026)
di: Srivatsa, Vikranth, et al.
Pubblicazione: (2026)
Adaptive Device-Edge Collaboration on DNN Inference in AIoT: A Digital Twin-Assisted Approach
di: Hu, Shisheng, et al.
Pubblicazione: (2024)
di: Hu, Shisheng, et al.
Pubblicazione: (2024)
EdgeSphere: A Three-Tier Architecture for Cognitive Edge Computing
di: Makaya, Christian, et al.
Pubblicazione: (2024)
di: Makaya, Christian, et al.
Pubblicazione: (2024)
On The Reproducibility Limitations of RAG Systems
di: Wang, Baiqiang, et al.
Pubblicazione: (2025)
di: Wang, Baiqiang, et al.
Pubblicazione: (2025)
HeRo: Adaptive Orchestration of Agentic RAG on Heterogeneous Mobile SoC
di: Li, Maoliang, et al.
Pubblicazione: (2026)
di: Li, Maoliang, et al.
Pubblicazione: (2026)
Barycentric Coded Distributed Computing with Flexible Recovery Threshold for Collaborative Mobile Edge Computing
di: Qiu, Houming, et al.
Pubblicazione: (2025)
di: Qiu, Houming, et al.
Pubblicazione: (2025)
Parallel Collaborative ADMM Privacy Computing and Adaptive GPU Acceleration for Distributed Edge Networks
di: Xia, Mengchun, et al.
Pubblicazione: (2026)
di: Xia, Mengchun, et al.
Pubblicazione: (2026)
CaGR-RAG: Context-aware Query Grouping for Disk-based Vector Search in RAG Systems
di: Jeong, Yeonwoo, et al.
Pubblicazione: (2025)
di: Jeong, Yeonwoo, et al.
Pubblicazione: (2025)
Collaborative Resource Management and Workloads Scheduling in Cloud-Assisted Mobile Edge Computing across Timescales
di: Tang, Lujie, et al.
Pubblicazione: (2024)
di: Tang, Lujie, et al.
Pubblicazione: (2024)
EdgeShard: Efficient LLM Inference via Collaborative Edge Computing
di: Zhang, Mingjin, et al.
Pubblicazione: (2024)
di: Zhang, Mingjin, et al.
Pubblicazione: (2024)
Profiling-Driven Adaptive Distributed Transformer Inference on Embedded Edge Deployment
di: Qazi, Muhammad Azlan, et al.
Pubblicazione: (2026)
di: Qazi, Muhammad Azlan, et al.
Pubblicazione: (2026)
MSAO: Adaptive Modality Sparsity-Aware Offloading with Edge-Cloud Collaboration for Efficient Multimodal LLM Inference
di: Yang, Zheming, et al.
Pubblicazione: (2026)
di: Yang, Zheming, et al.
Pubblicazione: (2026)
PerCache: Predictive Hierarchical Cache for RAG Applications on Mobile Devices
di: Liu, Kaiwei, et al.
Pubblicazione: (2025)
di: Liu, Kaiwei, et al.
Pubblicazione: (2025)
MoA-Off: Adaptive Heterogeneous Modality-Aware Offloading with Edge-Cloud Collaboration for Efficient Multimodal LLM Inference
di: Yang, Zheming, et al.
Pubblicazione: (2025)
di: Yang, Zheming, et al.
Pubblicazione: (2025)
LLM as HPC Expert: Extending RAG Architecture for HPC Data
di: Miyashita, Yusuke, et al.
Pubblicazione: (2024)
di: Miyashita, Yusuke, et al.
Pubblicazione: (2024)
HybridTier: an Adaptive and Lightweight CXL-Memory Tiering System
di: Song, Kevin, et al.
Pubblicazione: (2023)
di: Song, Kevin, et al.
Pubblicazione: (2023)
Toward Sustainability-Aware LLM Inference on Edge Clusters
di: Rajashekar, Kolichala, et al.
Pubblicazione: (2025)
di: Rajashekar, Kolichala, et al.
Pubblicazione: (2025)
LLM-Enhanced Deep Reinforcement Learning for Task Offloading in Collaborative Edge Computing
di: Guo, Hao, et al.
Pubblicazione: (2026)
di: Guo, Hao, et al.
Pubblicazione: (2026)
LIME:Accelerating Collaborative Lossless LLM Inference on Memory-Constrained Edge Devices
di: Sun, Mingyu, et al.
Pubblicazione: (2025)
di: Sun, Mingyu, et al.
Pubblicazione: (2025)
ECCENTRIC: Edge-Cloud Collaboration Framework for Distributed Inference Using Knowledge Adaptation
di: Kamani, Mohammad Mahdi, et al.
Pubblicazione: (2025)
di: Kamani, Mohammad Mahdi, et al.
Pubblicazione: (2025)
A Pipelined Collaborative Speculative Decoding Framework for Efficient Edge-Cloud LLM Inference
di: Zhang, Yida, et al.
Pubblicazione: (2026)
di: Zhang, Yida, et al.
Pubblicazione: (2026)
Adaptive Multi-Objective Tiered Storage Configuration for KV Cache in LLM Service
di: Zheng, Xianzhe, et al.
Pubblicazione: (2026)
di: Zheng, Xianzhe, et al.
Pubblicazione: (2026)
PCR: A Prefetch-Enhanced Cache Reuse System for Low-Latency RAG Serving
di: Wang, Wenfeng, et al.
Pubblicazione: (2026)
di: Wang, Wenfeng, et al.
Pubblicazione: (2026)
ReviveMoE: Fast Recovery for Hardware Failures in Large-Scale MoE LLM Inference Deployments
di: Li, Haley, et al.
Pubblicazione: (2026)
di: Li, Haley, et al.
Pubblicazione: (2026)
EAT: QoS-Aware Edge-Collaborative AIGC Task Scheduling via Attention-Guided Diffusion Reinforcement Learning
di: Xu, Zhifei, et al.
Pubblicazione: (2025)
di: Xu, Zhifei, et al.
Pubblicazione: (2025)
FlexSpec: Frozen Drafts Meet Evolving Targets in Edge-Cloud Collaborative LLM Speculative Decoding
di: Li, Yuchen, et al.
Pubblicazione: (2026)
di: Li, Yuchen, et al.
Pubblicazione: (2026)
HybridFlow: Resource-Adaptive Subtask Routing for Efficient Edge-Cloud LLM Inference
di: Dong, Jiangwen, et al.
Pubblicazione: (2025)
di: Dong, Jiangwen, et al.
Pubblicazione: (2025)
GoodSpeed: Optimizing Fair Goodput with Adaptive Speculative Decoding in Distributed Edge Inference
di: Tran, Phuong, et al.
Pubblicazione: (2025)
di: Tran, Phuong, et al.
Pubblicazione: (2025)
Failure-Resilient and Carbon-Efficient Deployment of Microservices over the Cloud-Edge Continuum
di: Ponce, Francisco, et al.
Pubblicazione: (2026)
di: Ponce, Francisco, et al.
Pubblicazione: (2026)
Online Optimization of DNN Inference Network Utility in Collaborative Edge Computing
di: Li, Rui, et al.
Pubblicazione: (2024)
di: Li, Rui, et al.
Pubblicazione: (2024)
Distributed Massive MIMO-Aided Task Offloading in Satellite-Terrestrial Integrated Multi-Tier VEC Networks
di: Liu, Yixin, et al.
Pubblicazione: (2024)
di: Liu, Yixin, et al.
Pubblicazione: (2024)
Contention-Aware Microservice Deployment in Collaborative Mobile Edge Networks
di: Ge, Xinlei, et al.
Pubblicazione: (2024)
di: Ge, Xinlei, et al.
Pubblicazione: (2024)
ML-ECS: A Collaborative Multimodal Learning Framework for Edge-Cloud Synergies
di: Liu, Yuze, et al.
Pubblicazione: (2026)
di: Liu, Yuze, et al.
Pubblicazione: (2026)
CE-CoLLM: Efficient and Adaptive Large Language Models Through Cloud-Edge Collaboration
di: Jin, Hongpeng, et al.
Pubblicazione: (2024)
di: Jin, Hongpeng, et al.
Pubblicazione: (2024)
HERL: Tiered Federated Learning with Adaptive Homomorphic Encryption using Reinforcement Learning
di: Tang, Jiaxang, et al.
Pubblicazione: (2024)
di: Tang, Jiaxang, et al.
Pubblicazione: (2024)
Performance Evaluation of Automated Multi-Service Deployment in Edge-Cloud Environments with the CODECO Toolkit
di: Koukis, Georgios, et al.
Pubblicazione: (2026)
di: Koukis, Georgios, et al.
Pubblicazione: (2026)
Distributed Edge Analytics in Edge-Fog-Cloud Continuum
di: Srirama, Satish Narayana
Pubblicazione: (2024)
di: Srirama, Satish Narayana
Pubblicazione: (2024)
Green by Design: Constraint-Based Adaptive Deployment in the Cloud Continuum
di: D'Iapico, Andrea, et al.
Pubblicazione: (2026)
di: D'Iapico, Andrea, et al.
Pubblicazione: (2026)
Towards Integrated Energy-Communication-Transportation Hub: A Base-Station-Centric Design in 5G and Beyond
di: Shen, Linfeng, et al.
Pubblicazione: (2025)
di: Shen, Linfeng, et al.
Pubblicazione: (2025)
Documenti analoghi
-
CoEdge-RAG: Optimizing Hierarchical Scheduling for Retrieval-Augmented LLMs in Collaborative Edge Computing
di: Hong, Guihang, et al.
Pubblicazione: (2025) -
Nitsum: Serving Tiered LLM Requests with Adaptive Tensor Parallelism
di: Srivatsa, Vikranth, et al.
Pubblicazione: (2026) -
Adaptive Device-Edge Collaboration on DNN Inference in AIoT: A Digital Twin-Assisted Approach
di: Hu, Shisheng, et al.
Pubblicazione: (2024) -
EdgeSphere: A Three-Tier Architecture for Cognitive Edge Computing
di: Makaya, Christian, et al.
Pubblicazione: (2024) -
On The Reproducibility Limitations of RAG Systems
di: Wang, Baiqiang, et al.
Pubblicazione: (2025)