Sustainable LLM Inference for Edge AI: Evaluating Quantized LLMs for Energy Efficiency, Output Accuracy, and Inference Latency
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Husom, Erik Johannes, Goknil, Arda, Astekin, Merve, Shar, Lwin Khin, Kåsen, Andre, Sen, Sagar, Mithassel, Benedikt Andreas, Soylu, Ahmet |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
The Price of Prompting: Profiling Energy Use in Large Language Models Inference
von: Husom, Erik Johannes, et al.
Veröffentlicht: (2024)
von: Husom, Erik Johannes, et al.
Veröffentlicht: (2024)
A Comparative Study on Large Language Models for Log Parsing
von: Astekin, Merve, et al.
Veröffentlicht: (2024)
von: Astekin, Merve, et al.
Veröffentlicht: (2024)
Greening AI Inference with Accuracy and Latency-aware User Incentives
von: Siris, Vasilios A., et al.
Veröffentlicht: (2026)
von: Siris, Vasilios A., et al.
Veröffentlicht: (2026)
Privacy Policy Analysis through Prompt Engineering for LLMs
von: Goknil, Arda, et al.
Veröffentlicht: (2024)
von: Goknil, Arda, et al.
Veröffentlicht: (2024)
Security Modelling for Cyber-Physical Systems: A Systematic Literature Review
von: Huang, Shaofei, et al.
Veröffentlicht: (2024)
von: Huang, Shaofei, et al.
Veröffentlicht: (2024)
Bayesian and Multi-Objective Decision Support for Real-Time Incident Mitigation in Critical Infrastructure
von: Huang, Shaofei, et al.
Veröffentlicht: (2025)
von: Huang, Shaofei, et al.
Veröffentlicht: (2025)
From Incomplete Architecture to Quantified Risk: Multimodal LLM-Driven Security Assessment for Cyber-Physical Systems
von: Huang, Shaofei, et al.
Veröffentlicht: (2026)
von: Huang, Shaofei, et al.
Veröffentlicht: (2026)
ACTISM: Threat-informed Dynamic Security Modelling for Automotive Systems
von: Huang, Shaofei, et al.
Veröffentlicht: (2024)
von: Huang, Shaofei, et al.
Veröffentlicht: (2024)
QPART: Adaptive Model Quantization and Dynamic Workload Balancing for Accuracy-aware Edge Inference
von: Li, Xiangchen, et al.
Veröffentlicht: (2025)
von: Li, Xiangchen, et al.
Veröffentlicht: (2025)
Large Language Model Partitioning for Low-Latency Inference at the Edge
von: Kafetzis, Dimitrios, et al.
Veröffentlicht: (2025)
von: Kafetzis, Dimitrios, et al.
Veröffentlicht: (2025)
HQP: Sensitivity-Aware Hybrid Quantization and Pruning for Ultra-Low-Latency Edge AI Inference
von: Gopalan, Dinesh, et al.
Veröffentlicht: (2026)
von: Gopalan, Dinesh, et al.
Veröffentlicht: (2026)
Accelerating Edge Inference for Distributed MoE Models with Latency-Optimized Expert Placement
von: Wu, Tian, et al.
Veröffentlicht: (2025)
von: Wu, Tian, et al.
Veröffentlicht: (2025)
Towards Energy-Efficiency by Navigating the Trilemma of Energy, Latency, and Accuracy
von: Tian, Boyuan, et al.
Veröffentlicht: (2024)
von: Tian, Boyuan, et al.
Veröffentlicht: (2024)
Agile-Quant: Activation-Guided Quantization for Faster Inference of LLMs on the Edge
von: Shen, Xuan, et al.
Veröffentlicht: (2023)
von: Shen, Xuan, et al.
Veröffentlicht: (2023)
IPA: Inference Pipeline Adaptation to Achieve High Accuracy and Cost-Efficiency
von: Ghafouri, Saeid, et al.
Veröffentlicht: (2023)
von: Ghafouri, Saeid, et al.
Veröffentlicht: (2023)
Trust-Aware Routing for Distributed Generative AI Inference at the Edge
von: Nguyen, Chanh, et al.
Veröffentlicht: (2026)
von: Nguyen, Chanh, et al.
Veröffentlicht: (2026)
VLM-Fuzz: Vision Language Model Assisted Recursive Depth-first Search Exploration for Effective UI Testing of Android Apps
von: Demissie, Biniam Fisseha, et al.
Veröffentlicht: (2025)
von: Demissie, Biniam Fisseha, et al.
Veröffentlicht: (2025)
FFSplit: Split Feed-Forward Network For Optimizing Accuracy-Efficiency Trade-off in Language Model Inference
von: Liu, Zirui, et al.
Veröffentlicht: (2024)
von: Liu, Zirui, et al.
Veröffentlicht: (2024)
SafeMath: Inference-time Safety improves Math Accuracy
von: Basu, Sagnik, et al.
Veröffentlicht: (2026)
von: Basu, Sagnik, et al.
Veröffentlicht: (2026)
Uncertainty Quantification using Variational Inference for Biomedical Image Segmentation
von: Sagar, Abhinav
Veröffentlicht: (2020)
von: Sagar, Abhinav
Veröffentlicht: (2020)
CQIL: Inference Latency Optimization with Concurrent Computation of Quasi-Independent Layers
von: Zou, Longwei, et al.
Veröffentlicht: (2024)
von: Zou, Longwei, et al.
Veröffentlicht: (2024)
Inference Energy and Latency in AI-Mediated Education: A Learning-per-Watt Analysis of Edge and Cloud Models
von: Khemani, Kushal
Veröffentlicht: (2026)
von: Khemani, Kushal
Veröffentlicht: (2026)
Accuracy of Uniform Inference on Fine Grid Points
von: Imai, Shunsuke
Veröffentlicht: (2025)
von: Imai, Shunsuke
Veröffentlicht: (2025)
Prompt Cache: Modular Attention Reuse for Low-Latency Inference
von: Gim, In, et al.
Veröffentlicht: (2023)
von: Gim, In, et al.
Veröffentlicht: (2023)
Adaptive Workload Distribution for Accuracy-aware DNN Inference on Collaborative Edge Platforms
von: Taufique, Zain, et al.
Veröffentlicht: (2023)
von: Taufique, Zain, et al.
Veröffentlicht: (2023)
Lifted Inference beyond First-Order Logic
von: Malhotra, Sagar, et al.
Veröffentlicht: (2023)
von: Malhotra, Sagar, et al.
Veröffentlicht: (2023)
Action Deviation-Aware Inference for Low-Latency Wireless Robots
von: Park, Jeyoung, et al.
Veröffentlicht: (2025)
von: Park, Jeyoung, et al.
Veröffentlicht: (2025)
Token Level Routing Inference System for Edge Devices
von: She, Jianshu, et al.
Veröffentlicht: (2025)
von: She, Jianshu, et al.
Veröffentlicht: (2025)
Runtime Anomaly Detection for Drones: An Integrated Rule-Mining and Unsupervised-Learning Approach
von: Tan, Ivan, et al.
Veröffentlicht: (2025)
von: Tan, Ivan, et al.
Veröffentlicht: (2025)
Enabling Dynamic Sparsity in Quantized LLM Inference
von: Wang, Rongxiang, et al.
Veröffentlicht: (2025)
von: Wang, Rongxiang, et al.
Veröffentlicht: (2025)
EdgePoint2: Compact Descriptors for Superior Efficiency and Accuracy
von: Yao, Haodi, et al.
Veröffentlicht: (2025)
von: Yao, Haodi, et al.
Veröffentlicht: (2025)
LatencyPrism: Online Non-intrusive Latency Sculpting for SLO-Guaranteed LLM Inference
von: Du, Yin, et al.
Veröffentlicht: (2026)
von: Du, Yin, et al.
Veröffentlicht: (2026)
Memory Offloading for Large Language Model Inference with Latency SLO Guarantees
von: Ma, Chenxiang, et al.
Veröffentlicht: (2025)
von: Ma, Chenxiang, et al.
Veröffentlicht: (2025)
Accelerating Mixture-of-Experts Inference by Hiding Offloading Latency with Speculative Decoding
von: Wang, Zhibin, et al.
Veröffentlicht: (2025)
von: Wang, Zhibin, et al.
Veröffentlicht: (2025)
Taming Throughput-Latency Tradeoff in LLM Inference with Sarathi-Serve
von: Agrawal, Amey, et al.
Veröffentlicht: (2024)
von: Agrawal, Amey, et al.
Veröffentlicht: (2024)
EdgeFM: Efficient Edge Inference for Vision-Language Models
von: Deng, Mengling, et al.
Veröffentlicht: (2026)
von: Deng, Mengling, et al.
Veröffentlicht: (2026)
A Study on Inference Latency for Vision Transformers on Mobile Devices
von: Li, Zhuojin, et al.
Veröffentlicht: (2025)
von: Li, Zhuojin, et al.
Veröffentlicht: (2025)
Exact and Approximate Conformal Inference for Multi-Output Regression
von: Johnstone, Chancellor, et al.
Veröffentlicht: (2022)
von: Johnstone, Chancellor, et al.
Veröffentlicht: (2022)
Shift Parallelism: Low-Latency, High-Throughput LLM Inference for Dynamic Workloads
von: Hidayetoglu, Mert, et al.
Veröffentlicht: (2025)
von: Hidayetoglu, Mert, et al.
Veröffentlicht: (2025)
Torpor: GPU-Enabled Serverless Computing for Low-Latency, Resource-Efficient Inference
von: Yu, Minchen, et al.
Veröffentlicht: (2023)
von: Yu, Minchen, et al.
Veröffentlicht: (2023)
Ähnliche Einträge
-
The Price of Prompting: Profiling Energy Use in Large Language Models Inference
von: Husom, Erik Johannes, et al.
Veröffentlicht: (2024) -
A Comparative Study on Large Language Models for Log Parsing
von: Astekin, Merve, et al.
Veröffentlicht: (2024) -
Greening AI Inference with Accuracy and Latency-aware User Incentives
von: Siris, Vasilios A., et al.
Veröffentlicht: (2026) -
Privacy Policy Analysis through Prompt Engineering for LLMs
von: Goknil, Arda, et al.
Veröffentlicht: (2024) -
Security Modelling for Cyber-Physical Systems: A Systematic Literature Review
von: Huang, Shaofei, et al.
Veröffentlicht: (2024)