Inference Offloading for Cost-Sensitive Binary Classification at the Edge
Fuente:
arXiv
Guardado en:
| Autores principales: | Moothedath, Vishnu Narayanan, Agarwal, Umang, N, Umeshraja, Gross, James Richard, Champati, Jaya Prakash, Moharir, Sharayu |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Improved Decision Module Selection for Hierarchical Inference in Resource-Constrained Edge Devices
por: Behera, Adarsh Prasad, et al.
Publicado: (2024)
por: Behera, Adarsh Prasad, et al.
Publicado: (2024)
Cascading Bandits With Feedback
por: Prakash, R Sri, et al.
Publicado: (2025)
por: Prakash, R Sri, et al.
Publicado: (2025)
Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques
por: Behera, Adarsh Prasad, et al.
Publicado: (2025)
por: Behera, Adarsh Prasad, et al.
Publicado: (2025)
Exploring the Boundaries of On-Device Inference: When Tiny Falls Short, Go Hierarchical
por: Behera, Adarsh Prasad, et al.
Publicado: (2024)
por: Behera, Adarsh Prasad, et al.
Publicado: (2024)
To Offload or Not To Offload: Model-driven Comparison of Edge-native and On-device Processing In the Era of Accelerators
por: Ng, Nathan, et al.
Publicado: (2025)
por: Ng, Nathan, et al.
Publicado: (2025)
MSAO: Adaptive Modality Sparsity-Aware Offloading with Edge-Cloud Collaboration for Efficient Multimodal LLM Inference
por: Yang, Zheming, et al.
Publicado: (2026)
por: Yang, Zheming, et al.
Publicado: (2026)
Preemption Aware Task Scheduling for Priority and Deadline Constrained DNN Inference Task Offloading in Homogeneous Mobile-Edge Networks
por: Cotter, Jamie, et al.
Publicado: (2025)
por: Cotter, Jamie, et al.
Publicado: (2025)
MoA-Off: Adaptive Heterogeneous Modality-Aware Offloading with Edge-Cloud Collaboration for Efficient Multimodal LLM Inference
por: Yang, Zheming, et al.
Publicado: (2025)
por: Yang, Zheming, et al.
Publicado: (2025)
Egret: Reinforcement Mechanism for Sequential Computation Offloading in Edge Computing
por: Peng, Haosong, et al.
Publicado: (2024)
por: Peng, Haosong, et al.
Publicado: (2024)
Joint Optimization of Offloading, Batching and DVFS for Multiuser Co-Inference
por: Xu, Yaodan, et al.
Publicado: (2025)
por: Xu, Yaodan, et al.
Publicado: (2025)
Collaborative Inference for Large Models with Task Offloading and Early Exiting
por: Xie, Zuan, et al.
Publicado: (2024)
por: Xie, Zuan, et al.
Publicado: (2024)
FRESCO: Fast and Reliable Edge Offloading with Reputation-based Hybrid Smart Contracts
por: Zilic, Josip, et al.
Publicado: (2024)
por: Zilic, Josip, et al.
Publicado: (2024)
LLM-Enhanced Deep Reinforcement Learning for Task Offloading in Collaborative Edge Computing
por: Guo, Hao, et al.
Publicado: (2026)
por: Guo, Hao, et al.
Publicado: (2026)
Online Algorithms for Hierarchical Inference in Deep Learning applications at the Edge
por: Moothedath, Vishnu Narayanan, et al.
Publicado: (2023)
por: Moothedath, Vishnu Narayanan, et al.
Publicado: (2023)
Memory Offloading for Large Language Model Inference with Latency SLO Guarantees
por: Ma, Chenxiang, et al.
Publicado: (2025)
por: Ma, Chenxiang, et al.
Publicado: (2025)
Accelerating Mixture-of-Experts Inference by Hiding Offloading Latency with Speculative Decoding
por: Wang, Zhibin, et al.
Publicado: (2025)
por: Wang, Zhibin, et al.
Publicado: (2025)
Neuro-Inspired Task Offloading in Edge-IoT Networks Using Spiking Neural Networks
por: Rossi, Fabio Diniz
Publicado: (2025)
por: Rossi, Fabio Diniz
Publicado: (2025)
Orchestrating Joint Offloading and Scheduling for Low-Latency Edge SLAM
por: Zhang, Yao, et al.
Publicado: (2025)
por: Zhang, Yao, et al.
Publicado: (2025)
DAK: Direct-Access-Enabled GPU Memory Offloading with Optimal Efficiency for LLM Inference
por: Lin, Shouxu, et al.
Publicado: (2026)
por: Lin, Shouxu, et al.
Publicado: (2026)
Proposal of Automatic Offloading Method in Mixed Offloading Destination Environment
por: Yamato, Yoji
Publicado: (2020)
por: Yamato, Yoji
Publicado: (2020)
Workload Distribution with Rateless Encoding: A Low-Latency Computation Offloading Method within Edge Networks
por: Guo, Zhongfu, et al.
Publicado: (2023)
por: Guo, Zhongfu, et al.
Publicado: (2023)
Energy-Efficient Joint Offloading and Resource Allocation for Deadline-Constrained Tasks in Multi-Access Edge Computing
por: Gao, Chuanchao, et al.
Publicado: (2025)
por: Gao, Chuanchao, et al.
Publicado: (2025)
A Joint Time and Energy-Efficient Federated Learning-based Computation Offloading Method for Mobile Edge Computing
por: Mukherjee, Anwesha, et al.
Publicado: (2024)
por: Mukherjee, Anwesha, et al.
Publicado: (2024)
Blockchain-Enhanced Offloading in Mobile Edge Computing: A Systematic Review and Survey of Current Trends and Future Directions
por: Moghaddasi, Komeil, et al.
Publicado: (2024)
por: Moghaddasi, Komeil, et al.
Publicado: (2024)
Edge Offloading in Smart Grid
por: Arcas, Gabriel Ioan, et al.
Publicado: (2024)
por: Arcas, Gabriel Ioan, et al.
Publicado: (2024)
EdgeShard: Efficient LLM Inference via Collaborative Edge Computing
por: Zhang, Mingjin, et al.
Publicado: (2024)
por: Zhang, Mingjin, et al.
Publicado: (2024)
Cost-Effective Edge Data Distribution with End-To-End Delay Guarantees in Edge Computing
por: Shankar, Ravi, et al.
Publicado: (2025)
por: Shankar, Ravi, et al.
Publicado: (2025)
Plug & Offload: Transparently Offloading TCP Stack onto Off-path SmartNIC with PnO-TCP
por: Nan, Hailong, et al.
Publicado: (2025)
por: Nan, Hailong, et al.
Publicado: (2025)
DUAL-BLADE: Dual-Path NVMe-Direct KV-Cache Offloading for Edge LLM Inference
por: Jeong, Bodon, et al.
Publicado: (2026)
por: Jeong, Bodon, et al.
Publicado: (2026)
OffloadFS: Leveraging Disaggregated Storage for Computation Offloading
por: Moon, Sungho, et al.
Publicado: (2026)
por: Moon, Sungho, et al.
Publicado: (2026)
Understanding the Performance and Power of LLM Inferencing on Edge Accelerators
por: Arya, Mayank, et al.
Publicado: (2025)
por: Arya, Mayank, et al.
Publicado: (2025)
Toward Sustainability-Aware LLM Inference on Edge Clusters
por: Rajashekar, Kolichala, et al.
Publicado: (2025)
por: Rajashekar, Kolichala, et al.
Publicado: (2025)
Environment-Aware Dynamic Pruning for Pipelined Edge Inference
por: O'Quinn, Austin, et al.
Publicado: (2025)
por: O'Quinn, Austin, et al.
Publicado: (2025)
SYMPHONY: Improving Memory Management for LLM Inference Workloads
por: Agarwal, Saurabh, et al.
Publicado: (2024)
por: Agarwal, Saurabh, et al.
Publicado: (2024)
RIPPLE++: An Incremental Framework for Efficient GNN Inference on Evolving Graphs
por: Naman, Pranjal, et al.
Publicado: (2026)
por: Naman, Pranjal, et al.
Publicado: (2026)
A Survey of Computation Offloading with Task Types
por: Zhang, Siqi, et al.
Publicado: (2023)
por: Zhang, Siqi, et al.
Publicado: (2023)
Performance Characterization of Containerized DNN Training and Inference on Edge Accelerators
por: K., Prashanthi S., et al.
Publicado: (2023)
por: K., Prashanthi S., et al.
Publicado: (2023)
Fulcrum: Optimizing Concurrent DNN Training and Inferencing on Edge Accelerators
por: K., Prashanthi S., et al.
Publicado: (2025)
por: K., Prashanthi S., et al.
Publicado: (2025)
Decentralized LLM Inference over Edge Networks with Energy Harvesting
por: Khoshsirat, Aria, et al.
Publicado: (2024)
por: Khoshsirat, Aria, et al.
Publicado: (2024)
OCTOPINF: Workload-Aware Inference Serving for Edge Video Analytics
por: Nguyen, Thanh-Tung, et al.
Publicado: (2025)
por: Nguyen, Thanh-Tung, et al.
Publicado: (2025)
Ejemplares similares
-
Improved Decision Module Selection for Hierarchical Inference in Resource-Constrained Edge Devices
por: Behera, Adarsh Prasad, et al.
Publicado: (2024) -
Cascading Bandits With Feedback
por: Prakash, R Sri, et al.
Publicado: (2025) -
Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques
por: Behera, Adarsh Prasad, et al.
Publicado: (2025) -
Exploring the Boundaries of On-Device Inference: When Tiny Falls Short, Go Hierarchical
por: Behera, Adarsh Prasad, et al.
Publicado: (2024) -
To Offload or Not To Offload: Model-driven Comparison of Edge-native and On-device Processing In the Era of Accelerators
por: Ng, Nathan, et al.
Publicado: (2025)