Hermes: Memory-Efficient Pipeline Inference for Large Models on Edge Devices
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Han, Xueyuan, Cai, Zinuo, Zhang, Yichu, Fan, Chongxin, Liu, Junhan, Ma, Ruhui, Buyya, Rajkumar |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
A Joint Time and Energy-Efficient Federated Learning-based Computation Offloading Method for Mobile Edge Computing
par: Mukherjee, Anwesha, et autres
Publié: (2024)
par: Mukherjee, Anwesha, et autres
Publié: (2024)
DOPD: A Dynamic PD-Disaggregation Architecture for Maximizing Goodput in LLM Inference Serving
par: Liao, Junhan, et autres
Publié: (2025)
par: Liao, Junhan, et autres
Publié: (2025)
A Risk-Aware UAV-Edge Service Framework for Wildfire Monitoring and Emergency Response
par: Huang, Yulun, et autres
Publié: (2026)
par: Huang, Yulun, et autres
Publié: (2026)
Efficient Training Approaches for Performance Anomaly Detection Models in Edge Computing Environments
par: Fernando, Duneesha, et autres
Publié: (2024)
par: Fernando, Duneesha, et autres
Publié: (2024)
Proactive and Reactive Autoscaling Techniques for Edge Computing
par: Gupta, Suhrid, et autres
Publié: (2025)
par: Gupta, Suhrid, et autres
Publié: (2025)
Reinforcement Learning based Workflow Scheduling in Cloud and Edge Computing Environments: A Taxonomy, Review and Future Directions
par: Jayanetti, Amanda, et autres
Publié: (2024)
par: Jayanetti, Amanda, et autres
Publié: (2024)
ReinFog: A Deep Reinforcement Learning Empowered Framework for Resource Management in Edge and Cloud Computing Environments
par: Wang, Zhiyu, et autres
Publié: (2024)
par: Wang, Zhiyu, et autres
Publié: (2024)
TF-DDRL: A Transformer-enhanced Distributed DRL Technique for Scheduling IoT Applications in Edge and Cloud Computing Environments
par: Wang, Zhiyu, et autres
Publié: (2024)
par: Wang, Zhiyu, et autres
Publié: (2024)
A Decentralized Root Cause Localization Approach for Edge Computing Environments
par: Fernando, Duneesha, et autres
Publié: (2025)
par: Fernando, Duneesha, et autres
Publié: (2025)
A Hybrid Reactive-Proactive Auto-scaling Algorithm for SLA-Constrained Edge Computing
par: Gupta, Suhrid, et autres
Publié: (2025)
par: Gupta, Suhrid, et autres
Publié: (2025)
iAnomaly: A Toolkit for Generating Performance Anomaly Datasets in Edge-Cloud Integrated Computing Environments
par: Fernando, Duneesha, et autres
Publié: (2024)
par: Fernando, Duneesha, et autres
Publié: (2024)
A Cascaded Graph Neural Network for Joint Root Cause Localization and Analysis in Edge Computing Environments
par: Fernando, Duneesha, et autres
Publié: (2026)
par: Fernando, Duneesha, et autres
Publié: (2026)
EnFed: An Energy-aware Federated Learning in Resource Constrained Environments for Human Activity Recognition
par: Mukherjee, Anwesha, et autres
Publié: (2024)
par: Mukherjee, Anwesha, et autres
Publié: (2024)
Generative Federated Learning for Smart Prediction and Recommendation Applications
par: Mukherjee, Anwesha, et autres
Publié: (2025)
par: Mukherjee, Anwesha, et autres
Publié: (2025)
TrustMesh: A Blockchain-Enabled Trusted Distributed Computing Framework for Open Heterogeneous IoT Environments
par: Rangwala, Murtaza, et autres
Publié: (2024)
par: Rangwala, Murtaza, et autres
Publié: (2024)
REACH: Reinforcement Learning for Adaptive Microservice Rescheduling in the Cloud-Edge Continuum
par: Bai, Xu, et autres
Publié: (2025)
par: Bai, Xu, et autres
Publié: (2025)
Auto-scaling Approaches for Microservice Applications: A Survey and Taxonomy
par: Xu, Minxian, et autres
Publié: (2025)
par: Xu, Minxian, et autres
Publié: (2025)
HGraphScale: Hierarchical Graph Learning for Autoscaling Microservice Applications in Container-based Cloud Computing
par: Fang, Zhengxin, et autres
Publié: (2025)
par: Fang, Zhengxin, et autres
Publié: (2025)
iDynamics: A Configurable Emulation Framework for Evaluating Microservice Scheduling Policies under Controllable Cloud-Edge Dynamics
par: Chen, Ming, et autres
Publié: (2025)
par: Chen, Ming, et autres
Publié: (2025)
Aging-aware CPU Core Management for Embodied Carbon Amortization in Cloud LLM Inference
par: Hewage, Tharindu B., et autres
Publié: (2025)
par: Hewage, Tharindu B., et autres
Publié: (2025)
A Deep Reinforcement Learning Approach for Cost Optimized Workflow Scheduling in Cloud Computing Environments
par: Jayanetti, Amanda, et autres
Publié: (2024)
par: Jayanetti, Amanda, et autres
Publié: (2024)
Placement of Microservices-based IoT Applications in Fog Computing: A Taxonomy and Future Directions
par: Pallewatta, Samodha, et autres
Publié: (2022)
par: Pallewatta, Samodha, et autres
Publié: (2022)
AARC: Automated Affinity-aware Resource Configuration for Serverless Workflows
par: Jin, Lingxiao, et autres
Publié: (2025)
par: Jin, Lingxiao, et autres
Publié: (2025)
AirFed: A Federated Graph-Enhanced Multi-Agent Reinforcement Learning Framework for Multi-UAV Cooperative Mobile Edge Computing
par: Wang, Zhiyu, et autres
Publié: (2025)
par: Wang, Zhiyu, et autres
Publié: (2025)
Sustainable Edge Computing: Challenges and Future Directions
par: Arroba, Patricia, et autres
Publié: (2023)
par: Arroba, Patricia, et autres
Publié: (2023)
Saarthi: An End-to-End Intelligent Platform for Optimising Distributed Serverless Workloads
par: Agarwal, Siddharth, et autres
Publié: (2025)
par: Agarwal, Siddharth, et autres
Publié: (2025)
PipeSD: An Efficient Cloud-Edge Collaborative Pipeline Inference Framework with Speculative Decoding
par: Han, Yunhe, et autres
Publié: (2026)
par: Han, Yunhe, et autres
Publié: (2026)
RingAda: Pipelining Large Model Fine-Tuning on Edge Devices with Scheduled Layer Unfreezing
par: Li, Liang, et autres
Publié: (2025)
par: Li, Liang, et autres
Publié: (2025)
Performance and Security Aware Distributed Service Placement in Fog Computing
par: Goudarzi, Mohammad, et autres
Publié: (2026)
par: Goudarzi, Mohammad, et autres
Publié: (2026)
A Knowledge Distillation-empowered Adaptive Federated Reinforcement Learning Framework for Multi-Domain IoT Applications Scheduling
par: Wang, Zhiyu, et autres
Publié: (2025)
par: Wang, Zhiyu, et autres
Publié: (2025)
LIME:Accelerating Collaborative Lossless LLM Inference on Memory-Constrained Edge Devices
par: Sun, Mingyu, et autres
Publié: (2025)
par: Sun, Mingyu, et autres
Publié: (2025)
Understand and Accelerate Memory Processing Pipeline for Large Language Model Inference
par: He, Zifan, et autres
Publié: (2026)
par: He, Zifan, et autres
Publié: (2026)
Adaptive Configuration Selection for Multi-Model Inference Pipelines in Edge Computing
par: Sheng, Jinhao, et autres
Publié: (2025)
par: Sheng, Jinhao, et autres
Publié: (2025)
A Pipelined Collaborative Speculative Decoding Framework for Efficient Edge-Cloud LLM Inference
par: Zhang, Yida, et autres
Publié: (2026)
par: Zhang, Yida, et autres
Publié: (2026)
ORACL: Optimized Reasoning for Autoscaling via Chain of Thought with LLMs for Microservices
par: Bai, Haoyu, et autres
Publié: (2026)
par: Bai, Haoyu, et autres
Publié: (2026)
Environment-Aware Dynamic Pruning for Pipelined Edge Inference
par: O'Quinn, Austin, et autres
Publié: (2025)
par: O'Quinn, Austin, et autres
Publié: (2025)
Evidential Trust-Aware Model Personalization in Decentralized Federated Learning for Wearable IoT
par: Rangwala, Murtaza, et autres
Publié: (2025)
par: Rangwala, Murtaza, et autres
Publié: (2025)
Deep Reinforcement Learning-based Methods for Resource Scheduling in Cloud Computing: A Review and Future Directions
par: Zhou, Guangyao, et autres
Publié: (2021)
par: Zhou, Guangyao, et autres
Publié: (2021)
Deep Reinforcement Learning (DRL)-based Methods for Serverless Stream Processing Engines: A Vision, Architectural Elements, and Future Directions
par: Read, Maria R., et autres
Publié: (2024)
par: Read, Maria R., et autres
Publié: (2024)
A Framework for Carbon-aware Real-Time Workload Management in Clouds using Renewables-driven Cores
par: Hewage, Tharindu B., et autres
Publié: (2024)
par: Hewage, Tharindu B., et autres
Publié: (2024)
Documents similaires
-
A Joint Time and Energy-Efficient Federated Learning-based Computation Offloading Method for Mobile Edge Computing
par: Mukherjee, Anwesha, et autres
Publié: (2024) -
DOPD: A Dynamic PD-Disaggregation Architecture for Maximizing Goodput in LLM Inference Serving
par: Liao, Junhan, et autres
Publié: (2025) -
A Risk-Aware UAV-Edge Service Framework for Wildfire Monitoring and Emergency Response
par: Huang, Yulun, et autres
Publié: (2026) -
Efficient Training Approaches for Performance Anomaly Detection Models in Edge Computing Environments
par: Fernando, Duneesha, et autres
Publié: (2024) -
Proactive and Reactive Autoscaling Techniques for Edge Computing
par: Gupta, Suhrid, et autres
Publié: (2025)