InstMeter: An Instruction-Level Method to Predict Energy and Latency of DL Model Inference on MCUs
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Liu, Hao, Wang, Qing, Zuniga, Marco |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
lm-Meter: Unveiling Runtime Inference Latency for On-Device Language Models
von: Wang, Haoxin, et al.
Veröffentlicht: (2025)
von: Wang, Haoxin, et al.
Veröffentlicht: (2025)
Low-Energy On-Device Personalization for MCUs
von: Huang, Yushan, et al.
Veröffentlicht: (2024)
von: Huang, Yushan, et al.
Veröffentlicht: (2024)
UnIT: Scalable Unstructured Inference-Time Pruning for MAC-efficient Neural Inference on MCUs
von: Neth, Ashe, et al.
Veröffentlicht: (2025)
von: Neth, Ashe, et al.
Veröffentlicht: (2025)
vMCU: Coordinated Memory Management and Kernel Optimization for DNN Inference on MCUs
von: Zheng, Size, et al.
Veröffentlicht: (2024)
von: Zheng, Size, et al.
Veröffentlicht: (2024)
ML Inference Scheduling with Predictable Latency
von: Zhao, Haidong, et al.
Veröffentlicht: (2025)
von: Zhao, Haidong, et al.
Veröffentlicht: (2025)
MONAS: Efficient Zero-Shot Neural Architecture Search for MCUs
von: Qiao, Ye, et al.
Veröffentlicht: (2024)
von: Qiao, Ye, et al.
Veröffentlicht: (2024)
MicroNAS: Zero-Shot Neural Architecture Search for MCUs
von: Qiao, Ye, et al.
Veröffentlicht: (2024)
von: Qiao, Ye, et al.
Veröffentlicht: (2024)
MambaLite-Micro: Memory-Optimized Mamba Inference on MCUs
von: Xu, Hongjun, et al.
Veröffentlicht: (2025)
von: Xu, Hongjun, et al.
Veröffentlicht: (2025)
Divide-Conquer Transformer Learning for Predicting Electric Vehicle Charging Events Using Smart Meter Data
von: Ke, Fucai, et al.
Veröffentlicht: (2024)
von: Ke, Fucai, et al.
Veröffentlicht: (2024)
Latenrgy: Model Agnostic Latency and Energy Consumption Prediction for Binary Classifiers
von: Pittman, Jason M.
Veröffentlicht: (2024)
von: Pittman, Jason M.
Veröffentlicht: (2024)
GraphPPD: Posterior Predictive Modelling for Graph-Level Inference
von: Pal, Soumyasundar, et al.
Veröffentlicht: (2025)
von: Pal, Soumyasundar, et al.
Veröffentlicht: (2025)
Optimizing the Deployment of Tiny Transformers on Low-Power MCUs
von: Jung, Victor J. B., et al.
Veröffentlicht: (2024)
von: Jung, Victor J. B., et al.
Veröffentlicht: (2024)
ScaleDL: Towards Scalable and Efficient Runtime Prediction for Distributed Deep Learning Workloads
von: Wang, Xiaokai, et al.
Veröffentlicht: (2025)
von: Wang, Xiaokai, et al.
Veröffentlicht: (2025)
SmartMeterFM: Unifying Smart Meter Data Generative Tasks Using Flow Matching Models
von: Lin, Nan, et al.
Veröffentlicht: (2026)
von: Lin, Nan, et al.
Veröffentlicht: (2026)
Benchmarking Energy and Latency in TinyML: A Novel Method for Resource-Constrained AI
von: Bartoli, Pietro, et al.
Veröffentlicht: (2025)
von: Bartoli, Pietro, et al.
Veröffentlicht: (2025)
MESS+: Energy-Optimal Inferencing in Language Model Zoos with Service Level Guarantees
von: Zhang, Ryan, et al.
Veröffentlicht: (2024)
von: Zhang, Ryan, et al.
Veröffentlicht: (2024)
A Study on Inference Latency for Vision Transformers on Mobile Devices
von: Li, Zhuojin, et al.
Veröffentlicht: (2025)
von: Li, Zhuojin, et al.
Veröffentlicht: (2025)
Fast and Compact Tsetlin Machine Inference on CPUs Using Instruction-Level Optimization
von: Zeng, Yefan, et al.
Veröffentlicht: (2025)
von: Zeng, Yefan, et al.
Veröffentlicht: (2025)
ServerlessLoRA: Minimizing Latency and Cost in Serverless Inference for LoRA-Based LLMs
von: Sui, Yifan, et al.
Veröffentlicht: (2025)
von: Sui, Yifan, et al.
Veröffentlicht: (2025)
RepDL: Bit-level Reproducible Deep Learning Training and Inference
von: Xie, Peichen, et al.
Veröffentlicht: (2025)
von: Xie, Peichen, et al.
Veröffentlicht: (2025)
Stateful Inference for Low-Latency Multi-Agent Tool Calling
von: Norgren, Victor
Veröffentlicht: (2026)
von: Norgren, Victor
Veröffentlicht: (2026)
Inference Energy and Latency in AI-Mediated Education: A Learning-per-Watt Analysis of Edge and Cloud Models
von: Khemani, Kushal
Veröffentlicht: (2026)
von: Khemani, Kushal
Veröffentlicht: (2026)
A Survey of Optimization Methods for Training DL Models: Theoretical Perspective on Convergence and Generalization
von: Wang, Jing, et al.
Veröffentlicht: (2025)
von: Wang, Jing, et al.
Veröffentlicht: (2025)
A Data Mining-Based Dynamical Anomaly Detection Method for Integrating with an Advance Metering System
von: Maitra, Sarit
Veröffentlicht: (2024)
von: Maitra, Sarit
Veröffentlicht: (2024)
DVFS-Aware DNN Inference on GPUs: Latency Modeling and Performance Analysis
von: Han, Yunchu, et al.
Veröffentlicht: (2025)
von: Han, Yunchu, et al.
Veröffentlicht: (2025)
Fully Autonomous Z-Score-Based TinyML Anomaly Detection on Resource-Constrained MCUs Using Power Side-Channel Data
von: Albaiz, Abdulrahman, et al.
Veröffentlicht: (2026)
von: Albaiz, Abdulrahman, et al.
Veröffentlicht: (2026)
SparDL: Distributed Deep Learning Training with Efficient Sparse Communication
von: Zhao, Minjun, et al.
Veröffentlicht: (2023)
von: Zhao, Minjun, et al.
Veröffentlicht: (2023)
MCU-MixQ: A HW/SW Co-optimized Mixed-precision Neural Network Design Framework for MCUs
von: Gong, Junfeng, et al.
Veröffentlicht: (2024)
von: Gong, Junfeng, et al.
Veröffentlicht: (2024)
The Spectral Geometry of Thought: Phase Transitions, Instruction Reversal, Token-Level Dynamics, and Perfect Correctness Prediction in How Transformers Reason
von: Liu, Yi
Veröffentlicht: (2026)
von: Liu, Yi
Veröffentlicht: (2026)
Low Latency Transformer Inference on FPGAs for Physics Applications with hls4ml
von: Jiang, Zhixing, et al.
Veröffentlicht: (2024)
von: Jiang, Zhixing, et al.
Veröffentlicht: (2024)
ServerlessLLM: Low-Latency Serverless Inference for Large Language Models
von: Fu, Yao, et al.
Veröffentlicht: (2024)
von: Fu, Yao, et al.
Veröffentlicht: (2024)
Memory- and Latency-Constrained Inference of Large Language Models via Adaptive Split Computing
von: Sung, Mingyu, et al.
Veröffentlicht: (2025)
von: Sung, Mingyu, et al.
Veröffentlicht: (2025)
Sustainable LLM Inference for Edge AI: Evaluating Quantized LLMs for Energy Efficiency, Output Accuracy, and Inference Latency
von: Husom, Erik Johannes, et al.
Veröffentlicht: (2025)
von: Husom, Erik Johannes, et al.
Veröffentlicht: (2025)
Benchmarking of EEG Analysis Techniques for Parkinson's Disease Diagnosis: A Comparison between Traditional ML Methods and Foundation DL Methods
von: Avola, Danilo, et al.
Veröffentlicht: (2025)
von: Avola, Danilo, et al.
Veröffentlicht: (2025)
Video Killed the Energy Budget: Characterizing the Latency and Power Regimes of Open Text-to-Video Models
von: Delavande, Julien, et al.
Veröffentlicht: (2025)
von: Delavande, Julien, et al.
Veröffentlicht: (2025)
Towards Secure and Scalable Energy Theft Detection: A Federated Learning Approach for Resource-Constrained Smart Meters
von: Labate, Diego, et al.
Veröffentlicht: (2026)
von: Labate, Diego, et al.
Veröffentlicht: (2026)
Green AI: A Preliminary Empirical Study on Energy Consumption in DL Models Across Different Runtime Infrastructures
von: Alizadeh, Negar, et al.
Veröffentlicht: (2024)
von: Alizadeh, Negar, et al.
Veröffentlicht: (2024)
EnergyLens: Predictive Energy-Aware Exploration for Multi-GPU LLM Inference Optimization
von: Song, Zhiye, et al.
Veröffentlicht: (2026)
von: Song, Zhiye, et al.
Veröffentlicht: (2026)
Ti-iLSTM: A TinyDL Approach for Logic-Level Anomaly Detection in Industrial Water Treatment Systems
von: Joshi, Mandar, et al.
Veröffentlicht: (2026)
von: Joshi, Mandar, et al.
Veröffentlicht: (2026)
Outcome-Aware Tool Selection for Semantic Routers: Latency-Constrained Learning Without LLM Inference
von: Chen, Huamin, et al.
Veröffentlicht: (2026)
von: Chen, Huamin, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
lm-Meter: Unveiling Runtime Inference Latency for On-Device Language Models
von: Wang, Haoxin, et al.
Veröffentlicht: (2025) -
Low-Energy On-Device Personalization for MCUs
von: Huang, Yushan, et al.
Veröffentlicht: (2024) -
UnIT: Scalable Unstructured Inference-Time Pruning for MAC-efficient Neural Inference on MCUs
von: Neth, Ashe, et al.
Veröffentlicht: (2025) -
vMCU: Coordinated Memory Management and Kernel Optimization for DNN Inference on MCUs
von: Zheng, Size, et al.
Veröffentlicht: (2024) -
ML Inference Scheduling with Predictable Latency
von: Zhao, Haidong, et al.
Veröffentlicht: (2025)