HeRo: Adaptive Orchestration of Agentic RAG on Heterogeneous Mobile SoC
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Maoliang, Chen, Jiayu, Zheng, Zihao, Li, Ziqian, Sun, Xinhao, Luo, Guojie, Liu, Chenchen, Chen, Xiang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Agent.xpu: Efficient Scheduling of Agentic LLM Workloads on Heterogeneous SoC
di: Wei, Xinming, et al.
Pubblicazione: (2025)
di: Wei, Xinming, et al.
Pubblicazione: (2025)
RAPID: Redundancy-Aware and Compatibility-Optimal Edge-Cloud Partitioned Inference for Diverse VLA Models
di: Zheng, Zihao, et al.
Pubblicazione: (2026)
di: Zheng, Zihao, et al.
Pubblicazione: (2026)
RoboECC: Multi-Factor-Aware Edge-Cloud Collaborative Deployment for VLA Models
di: Zheng, Zihao, et al.
Pubblicazione: (2026)
di: Zheng, Zihao, et al.
Pubblicazione: (2026)
Characterizing Mobile SoC for Accelerating Heterogeneous LLM Inference
di: Chen, Le, et al.
Pubblicazione: (2025)
di: Chen, Le, et al.
Pubblicazione: (2025)
More is Different: Prototyping and Analyzing a New Form of Edge Server with Massive Mobile SoCs
di: Zhang, Li, et al.
Pubblicazione: (2022)
di: Zhang, Li, et al.
Pubblicazione: (2022)
MIRAGE: Runtime Scheduling for Multi-Vector Image Retrieval with Hierarchical Decomposition
di: Li, Maoliang, et al.
Pubblicazione: (2025)
di: Li, Maoliang, et al.
Pubblicazione: (2025)
Multi-DNN Inference of Sparse Models on Edge SoCs
di: Luo, Jiawei, et al.
Pubblicazione: (2026)
di: Luo, Jiawei, et al.
Pubblicazione: (2026)
A Reliable, Time-Predictable Heterogeneous SoC for AI-Enhanced Mixed-Criticality Edge Applications
di: Garofalo, Angelo, et al.
Pubblicazione: (2025)
di: Garofalo, Angelo, et al.
Pubblicazione: (2025)
GoodServe: Towards High-Goodput Serving of Agentic LLM Inferences over Heterogeneous Resources
di: Du, Boxiao, et al.
Pubblicazione: (2026)
di: Du, Boxiao, et al.
Pubblicazione: (2026)
XDMA: A Distributed, Extensible DMA Architecture for Layout-Flexible Data Movements in Heterogeneous Multi-Accelerator SoCs
di: Kong, Fanchen, et al.
Pubblicazione: (2025)
di: Kong, Fanchen, et al.
Pubblicazione: (2025)
HARP: Orchestrating Automated Parallel Training on Heterogeneous GPU Clusters
di: Liang, Antian, et al.
Pubblicazione: (2025)
di: Liang, Antian, et al.
Pubblicazione: (2025)
Memory-Efficient Split Federated Learning for LLM Fine-Tuning on Heterogeneous Mobile Devices
di: Chen, Xiaopei, et al.
Pubblicazione: (2025)
di: Chen, Xiaopei, et al.
Pubblicazione: (2025)
MATCHA: Efficient Deployment of Deep Neural Networks on Multi-Accelerator Heterogeneous Edge SoCs
di: Russo, Enrico, et al.
Pubblicazione: (2026)
di: Russo, Enrico, et al.
Pubblicazione: (2026)
HexAGenT: Efficient Agentic LLM Serving via Workflow- and Heterogeneity-Aware Scheduling
di: Peng, You, et al.
Pubblicazione: (2026)
di: Peng, You, et al.
Pubblicazione: (2026)
An Interference-aware Approach for Co-located Container Orchestration with Novel Metric
di: Li, Xiang, et al.
Pubblicazione: (2024)
di: Li, Xiang, et al.
Pubblicazione: (2024)
Sutradhara: An Intelligent Orchestrator-Engine Co-design for Tool-based Agentic Inference
di: Biswas, Anish, et al.
Pubblicazione: (2026)
di: Biswas, Anish, et al.
Pubblicazione: (2026)
A-IO: Adaptive Inference Orchestration for Memory-Bound NPUs
di: Zhang, Chen, et al.
Pubblicazione: (2026)
di: Zhang, Chen, et al.
Pubblicazione: (2026)
MegaFlow: Large-Scale Distributed Orchestration System for the Agentic Era
di: Zhang, Lei, et al.
Pubblicazione: (2026)
di: Zhang, Lei, et al.
Pubblicazione: (2026)
MaaSO: SLO-aware Orchestration of Heterogeneous Model Instances for MaaS
di: Xuan, Mo, et al.
Pubblicazione: (2025)
di: Xuan, Mo, et al.
Pubblicazione: (2025)
EACO-RAG: Towards Distributed Tiered LLM Deployment using Edge-Assisted and Collaborative RAG with Adaptive Knowledge Update
di: Li, Jiaxing, et al.
Pubblicazione: (2024)
di: Li, Jiaxing, et al.
Pubblicazione: (2024)
HybridFlow: Resource-Adaptive Subtask Routing for Efficient Edge-Cloud LLM Inference
di: Dong, Jiangwen, et al.
Pubblicazione: (2025)
di: Dong, Jiangwen, et al.
Pubblicazione: (2025)
AgentX: Towards Orchestrating Robust Agentic Workflow Patterns with FaaS-hosted MCP Services
di: Tokal, Shiva Sai Krishna Anand, et al.
Pubblicazione: (2025)
di: Tokal, Shiva Sai Krishna Anand, et al.
Pubblicazione: (2025)
Hexa-MoE: Efficient and Heterogeneous-aware Training for Mixture-of-Experts
di: Luo, Shuqing, et al.
Pubblicazione: (2024)
di: Luo, Shuqing, et al.
Pubblicazione: (2024)
SoK: Consensus for Fair Message Ordering
di: Li, Zhuolun, et al.
Pubblicazione: (2024)
di: Li, Zhuolun, et al.
Pubblicazione: (2024)
AME: An Efficient Heterogeneous Agentic Memory Engine for Smartphones
di: Zhao, Xinkui, et al.
Pubblicazione: (2025)
di: Zhao, Xinkui, et al.
Pubblicazione: (2025)
PerCache: Predictive Hierarchical Cache for RAG Applications on Mobile Devices
di: Liu, Kaiwei, et al.
Pubblicazione: (2025)
di: Liu, Kaiwei, et al.
Pubblicazione: (2025)
Flexible Vector Integration in Embedded RISC-V SoCs for End to End CNN Inference Acceleration
di: Lyalikov, Dmitri
Pubblicazione: (2025)
di: Lyalikov, Dmitri
Pubblicazione: (2025)
Knowledge-driven Reasoning for Mobile Agentic AI: Concepts, Approaches, and Directions
di: Liu, Guangyuan, et al.
Pubblicazione: (2026)
di: Liu, Guangyuan, et al.
Pubblicazione: (2026)
Adaptive Resource Orchestration for Distributed Quantum Computing Systems
di: Chen, Kuan-Cheng, et al.
Pubblicazione: (2025)
di: Chen, Kuan-Cheng, et al.
Pubblicazione: (2025)
Orchestrated Co-scheduling, Resource Partitioning, and Power Capping on CPU-GPU Heterogeneous Systems via Machine Learning
di: Saba, Issa, et al.
Pubblicazione: (2024)
di: Saba, Issa, et al.
Pubblicazione: (2024)
FATE: Future-State-Aware Scheduling for Heterogeneous LLM Workflows
di: Huang, Zirui, et al.
Pubblicazione: (2026)
di: Huang, Zirui, et al.
Pubblicazione: (2026)
HarmonyBatch: Batching multi-SLO DNN Inference with Heterogeneous Serverless Functions
di: Chen, Jiabin, et al.
Pubblicazione: (2024)
di: Chen, Jiabin, et al.
Pubblicazione: (2024)
Towards Lock Modularization for Heterogeneous Environments
di: Zhang, Hanze, et al.
Pubblicazione: (2025)
di: Zhang, Hanze, et al.
Pubblicazione: (2025)
Joint$λ$: Orchestrating Serverless Workflows on Jointcloud FaaS Systems
di: Li, Rui, et al.
Pubblicazione: (2025)
di: Li, Rui, et al.
Pubblicazione: (2025)
Orchestrating Federated Learning in Space-Air-Ground Integrated Networks: Adaptive Data Offloading and Seamless Handover
di: Han, Dong-Jun, et al.
Pubblicazione: (2024)
di: Han, Dong-Jun, et al.
Pubblicazione: (2024)
Federated Inference for Heterogeneous LLM Communication and Collaboration
di: Chen, Zihan, et al.
Pubblicazione: (2026)
di: Chen, Zihan, et al.
Pubblicazione: (2026)
QEIL v2: Heterogeneous Computing for Edge Intelligence via Roofline-Derived Pareto-Optimal Energy Modeling and Multi-Objective Orchestration
di: Kumar, Satyam, et al.
Pubblicazione: (2026)
di: Kumar, Satyam, et al.
Pubblicazione: (2026)
AlignedServe: Orchestrating Prefix-aware Batching to Build a High-throughput and Computing-efficient LLM Serving System
di: Bai, Fengyao, et al.
Pubblicazione: (2026)
di: Bai, Fengyao, et al.
Pubblicazione: (2026)
FlexFL: Heterogeneous Federated Learning via APoZ-Guided Flexible Pruning in Uncertain Scenarios
di: Chen, Zekai, et al.
Pubblicazione: (2024)
di: Chen, Zekai, et al.
Pubblicazione: (2024)
GOGH: Correlation-Guided Orchestration of GPUs in Heterogeneous Clusters
di: Raeisi, Ahmad, et al.
Pubblicazione: (2025)
di: Raeisi, Ahmad, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Agent.xpu: Efficient Scheduling of Agentic LLM Workloads on Heterogeneous SoC
di: Wei, Xinming, et al.
Pubblicazione: (2025) -
RAPID: Redundancy-Aware and Compatibility-Optimal Edge-Cloud Partitioned Inference for Diverse VLA Models
di: Zheng, Zihao, et al.
Pubblicazione: (2026) -
RoboECC: Multi-Factor-Aware Edge-Cloud Collaborative Deployment for VLA Models
di: Zheng, Zihao, et al.
Pubblicazione: (2026) -
Characterizing Mobile SoC for Accelerating Heterogeneous LLM Inference
di: Chen, Le, et al.
Pubblicazione: (2025) -
More is Different: Prototyping and Analyzing a New Form of Edge Server with Massive Mobile SoCs
di: Zhang, Li, et al.
Pubblicazione: (2022)