On the Impact of White-box Deployment Strategies for Edge AI on Latency and Model Performance
Fuente:
arXiv
Salvato in:
| Autori principali: | Singh, Jaskirat, Adams, Bram, Hassan, Ahmed E. |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
On the Impact of Black-box Deployment Strategies for Edge AI on Latency and Model Performance
di: Singh, Jaskirat, et al.
Pubblicazione: (2024)
di: Singh, Jaskirat, et al.
Pubblicazione: (2024)
Large Language Model Partitioning for Low-Latency Inference at the Edge
di: Kafetzis, Dimitrios, et al.
Pubblicazione: (2025)
di: Kafetzis, Dimitrios, et al.
Pubblicazione: (2025)
Profiling-Driven Adaptive Distributed Transformer Inference on Embedded Edge Deployment
di: Qazi, Muhammad Azlan, et al.
Pubblicazione: (2026)
di: Qazi, Muhammad Azlan, et al.
Pubblicazione: (2026)
Deploying Atmospheric and Oceanic AI Models on Chinese Hardware and Framework: Migration Strategies, Performance Optimization and Analysis
di: Sun, Yuze, et al.
Pubblicazione: (2025)
di: Sun, Yuze, et al.
Pubblicazione: (2025)
T-MAC: CPU Renaissance via Table Lookup for Low-Bit LLM Deployment on Edge
di: Wei, Jianyu, et al.
Pubblicazione: (2024)
di: Wei, Jianyu, et al.
Pubblicazione: (2024)
StreamServe: Adaptive Speculative Flows for Low-Latency Disaggregated LLM Serving
di: Kumar, Satyam, et al.
Pubblicazione: (2026)
di: Kumar, Satyam, et al.
Pubblicazione: (2026)
AI Inference as Relocatable Electricity Demand: A Latency-Constrained Energy-Geography Framework
di: Luo, Xubin, et al.
Pubblicazione: (2026)
di: Luo, Xubin, et al.
Pubblicazione: (2026)
Efficient Edge AI: Deploying Convolutional Neural Networks on FPGA with the Gemmini Accelerator
di: Peccia, Federico Nicolas, et al.
Pubblicazione: (2024)
di: Peccia, Federico Nicolas, et al.
Pubblicazione: (2024)
Percepta: High Performance Stream Processing at the Edge
di: Sousa, Clarisse, et al.
Pubblicazione: (2025)
di: Sousa, Clarisse, et al.
Pubblicazione: (2025)
Accelerating Latency-Critical Applications with AI-Powered Semi-Automatic Fine-Grained Parallelization on SMT Processors
di: Los, Denis, et al.
Pubblicazione: (2025)
di: Los, Denis, et al.
Pubblicazione: (2025)
EdgeReasoning: Characterizing Reasoning LLM Deployment on Edge GPUs
di: Kubwimana, Benjamin, et al.
Pubblicazione: (2025)
di: Kubwimana, Benjamin, et al.
Pubblicazione: (2025)
Deploying Foundation Model Powered Agent Services: A Survey
di: Xu, Wenchao, et al.
Pubblicazione: (2024)
di: Xu, Wenchao, et al.
Pubblicazione: (2024)
EdgeProfiler: A Fast Profiling Framework for Lightweight LLMs on Edge Using Analytical Model
di: Pinnock, Alyssa, et al.
Pubblicazione: (2025)
di: Pinnock, Alyssa, et al.
Pubblicazione: (2025)
ELANA: A Simple Energy and Latency Analyzer for LLMs
di: Chiang, Hung-Yueh, et al.
Pubblicazione: (2025)
di: Chiang, Hung-Yueh, et al.
Pubblicazione: (2025)
Adaptive AI-based Decentralized Resource Management in the Cloud-Edge Continuum
di: Li, Lanpei, et al.
Pubblicazione: (2025)
di: Li, Lanpei, et al.
Pubblicazione: (2025)
Dora: QoE-Aware Hybrid Parallelism for Distributed Edge AI
di: Jin, Jianli, et al.
Pubblicazione: (2025)
di: Jin, Jianli, et al.
Pubblicazione: (2025)
Hardware Utilization and Inference Performance of Edge Object Detection Under Fault Injection
di: Pasandideh, Faezeh, et al.
Pubblicazione: (2026)
di: Pasandideh, Faezeh, et al.
Pubblicazione: (2026)
Compass: A Decentralized Scheduler for Latency-Sensitive ML Workflows
di: Yang, Yuting, et al.
Pubblicazione: (2024)
di: Yang, Yuting, et al.
Pubblicazione: (2024)
Benchmarking Federated Learning in Edge Computing Environments: A Systematic Review and Performance Evaluation
di: Aribe Jr., Sales, et al.
Pubblicazione: (2026)
di: Aribe Jr., Sales, et al.
Pubblicazione: (2026)
CoreGuard: Safeguarding Foundational Capabilities of LLMs Against Model Stealing in Edge Deployment
di: Li, Qinfeng, et al.
Pubblicazione: (2024)
di: Li, Qinfeng, et al.
Pubblicazione: (2024)
Accelerated Digital Twin Learning for Edge AI: A Comparison of FPGA and Mobile GPU
di: Xu, Bin, et al.
Pubblicazione: (2025)
di: Xu, Bin, et al.
Pubblicazione: (2025)
Speculative Decoding in Decentralized LLM Inference: Turning Communication Latency into Computation Throughput
di: Song, Jingwei, et al.
Pubblicazione: (2025)
di: Song, Jingwei, et al.
Pubblicazione: (2025)
Latency-Aware 2-Opt Monotonic Local Search for Distributed Constraint Optimization
di: Rachmut, Ben, et al.
Pubblicazione: (2025)
di: Rachmut, Ben, et al.
Pubblicazione: (2025)
An AI-Driven Framework for Energy-Efficient Environmental Monitoring in Smart Cities Using Edge Intelligence
di: Liu, Yichen, et al.
Pubblicazione: (2026)
di: Liu, Yichen, et al.
Pubblicazione: (2026)
Taming Asynchronous CPU-GPU Coupling for Frequency-aware Latency Estimation on Mobile Edge
di: Chen, Jiesong, et al.
Pubblicazione: (2026)
di: Chen, Jiesong, et al.
Pubblicazione: (2026)
Deploying Graph Neural Networks in Wireless Networks: A Link Stability Viewpoint
di: Li, Jun, et al.
Pubblicazione: (2024)
di: Li, Jun, et al.
Pubblicazione: (2024)
Failure-Resilient Distributed Inference with Model Compression over Heterogeneous Edge Devices
di: Wang, Li, et al.
Pubblicazione: (2024)
di: Wang, Li, et al.
Pubblicazione: (2024)
A Model Aware AIGC Task Offloading Algorithm in IIoT Edge Computing
di: Wang, Xin, et al.
Pubblicazione: (2025)
di: Wang, Xin, et al.
Pubblicazione: (2025)
Quality Scalable Quantization Methodology for Deep Learning on Edge
di: Khaliq, Salman Abdul, et al.
Pubblicazione: (2024)
di: Khaliq, Salman Abdul, et al.
Pubblicazione: (2024)
Scaling Performance of Large Language Model Pretraining
di: Interrante-Grant, Alexander, et al.
Pubblicazione: (2025)
di: Interrante-Grant, Alexander, et al.
Pubblicazione: (2025)
HPCTransCompile: An AI Compiler Generated Dataset for High-Performance CUDA Transpilation and LLM Preliminary Exploration
di: Lv, Jiaqi, et al.
Pubblicazione: (2025)
di: Lv, Jiaqi, et al.
Pubblicazione: (2025)
DeF-DReL: Systematic Deployment of Serverless Functions in Fog and Cloud environments using Deep Reinforcement Learning
di: Dehury, Chinmaya Kumar, et al.
Pubblicazione: (2021)
di: Dehury, Chinmaya Kumar, et al.
Pubblicazione: (2021)
Tiny Deep Ensemble: Uncertainty Estimation in Edge AI Accelerators via Ensembling Normalization Layers with Shared Weights
di: Ahmed, Soyed Tuhin, et al.
Pubblicazione: (2024)
di: Ahmed, Soyed Tuhin, et al.
Pubblicazione: (2024)
Benchmarking of CPU-intensive Stream Data Processing in The Edge Computing Systems
di: Szydlo, Tomasz, et al.
Pubblicazione: (2025)
di: Szydlo, Tomasz, et al.
Pubblicazione: (2025)
Delay-Aware Multi-Stage Edge Server Upgrade with Budget Constraint
di: Wihidayat, Endar Suprih, et al.
Pubblicazione: (2025)
di: Wihidayat, Endar Suprih, et al.
Pubblicazione: (2025)
Reinforcement Learning-driven Data-intensive Workflow Scheduling for Volunteer Edge-Cloud
di: Mounesan, Motahare, et al.
Pubblicazione: (2024)
di: Mounesan, Motahare, et al.
Pubblicazione: (2024)
CoRaiS: Lightweight Real-Time Scheduler for Multi-Edge Cooperative Computing
di: Hu, Yujiao, et al.
Pubblicazione: (2024)
di: Hu, Yujiao, et al.
Pubblicazione: (2024)
DGRAG: Distributed Graph-based Retrieval-Augmented Generation in Edge-Cloud Systems
di: Zhou, Wenqing, et al.
Pubblicazione: (2025)
di: Zhou, Wenqing, et al.
Pubblicazione: (2025)
ECCENTRIC: Edge-Cloud Collaboration Framework for Distributed Inference Using Knowledge Adaptation
di: Kamani, Mohammad Mahdi, et al.
Pubblicazione: (2025)
di: Kamani, Mohammad Mahdi, et al.
Pubblicazione: (2025)
SparOA: Sparse and Operator-aware Hybrid Scheduling for Edge DNN Inference
di: Zhang, Ziyang, et al.
Pubblicazione: (2025)
di: Zhang, Ziyang, et al.
Pubblicazione: (2025)
Documenti analoghi
-
On the Impact of Black-box Deployment Strategies for Edge AI on Latency and Model Performance
di: Singh, Jaskirat, et al.
Pubblicazione: (2024) -
Large Language Model Partitioning for Low-Latency Inference at the Edge
di: Kafetzis, Dimitrios, et al.
Pubblicazione: (2025) -
Profiling-Driven Adaptive Distributed Transformer Inference on Embedded Edge Deployment
di: Qazi, Muhammad Azlan, et al.
Pubblicazione: (2026) -
Deploying Atmospheric and Oceanic AI Models on Chinese Hardware and Framework: Migration Strategies, Performance Optimization and Analysis
di: Sun, Yuze, et al.
Pubblicazione: (2025) -
T-MAC: CPU Renaissance via Table Lookup for Low-Bit LLM Deployment on Edge
di: Wei, Jianyu, et al.
Pubblicazione: (2024)