EnergyLens: Predictive Energy-Aware Exploration for Multi-GPU LLM Inference Optimization
Fuente:
arXiv
Salvato in:
| Autori principali: | Song, Zhiye, Lee, Kyungmi, Lee, Eun Kyung, Zhang, Xin, Eilam, Tamar, Chandrakasan, Anantha P. |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
EnergAIzer: Fast and Accurate GPU Power Estimation Framework for AI Workloads
di: Lee, Kyungmi, et al.
Pubblicazione: (2026)
di: Lee, Kyungmi, et al.
Pubblicazione: (2026)
EnergyLens: Interpretable Closed-Form Energy Models for Multimodal LLM Inference Serving
di: Palladino, Vittorio, et al.
Pubblicazione: (2026)
di: Palladino, Vittorio, et al.
Pubblicazione: (2026)
LEDRO: LLM-Enhanced Design Space Reduction and Optimization for Analog Circuits
di: Kochar, Dimple Vijay, et al.
Pubblicazione: (2024)
di: Kochar, Dimple Vijay, et al.
Pubblicazione: (2024)
A Robust Power Model Training Framework for Cloud Native Runtime Energy Metric Exporter
di: Choochotkaew, Sunyanan, et al.
Pubblicazione: (2024)
di: Choochotkaew, Sunyanan, et al.
Pubblicazione: (2024)
Mind the Memory Gap: Unveiling GPU Bottlenecks in Large-Batch LLM Inference
di: Recasens, Pol G., et al.
Pubblicazione: (2025)
di: Recasens, Pol G., et al.
Pubblicazione: (2025)
FedCore: Straggler-Free Federated Learning with Distributed Coresets
di: Guo, Hongpeng, et al.
Pubblicazione: (2024)
di: Guo, Hongpeng, et al.
Pubblicazione: (2024)
Characterizing LLM Inference Energy-Performance Tradeoffs across Workloads and GPU Scaling
di: Maliakel, Paul Joe, et al.
Pubblicazione: (2025)
di: Maliakel, Paul Joe, et al.
Pubblicazione: (2025)
Online GPU Energy Optimization with Switching-Aware Bandits
di: Xu, Xiongxiao, et al.
Pubblicazione: (2024)
di: Xu, Xiongxiao, et al.
Pubblicazione: (2024)
SLO-aware GPU Frequency Scaling for Energy Efficient LLM Inference Serving
di: Kakolyris, Andreas Kosmas, et al.
Pubblicazione: (2024)
di: Kakolyris, Andreas Kosmas, et al.
Pubblicazione: (2024)
GreenServ: Energy-Efficient Context-Aware Dynamic Routing for Multi-Model LLM Inference
di: Ziller, Thomas, et al.
Pubblicazione: (2026)
di: Ziller, Thomas, et al.
Pubblicazione: (2026)
Multi-LLM Adaptive Conformal Inference for Reliable LLM Responses
di: Noh, Kangjun, et al.
Pubblicazione: (2026)
di: Noh, Kangjun, et al.
Pubblicazione: (2026)
AGFT: An Adaptive GPU Frequency Tuner for Real-Time LLM Inference Optimization
di: Ye, Zicong, et al.
Pubblicazione: (2025)
di: Ye, Zicong, et al.
Pubblicazione: (2025)
Adaptive Block-Scaled Data Types
di: Cook, Jack, et al.
Pubblicazione: (2026)
di: Cook, Jack, et al.
Pubblicazione: (2026)
IRONIC: Coherence-Aware Reasoning Chains for Multi-Modal Sarcasm Detection
di: Ramakrishnan, Aashish Anantha, et al.
Pubblicazione: (2025)
di: Ramakrishnan, Aashish Anantha, et al.
Pubblicazione: (2025)
LLM-Guided Runtime Parameter Optimization for Energy-Efficient Model Inference
di: Crumpacker, Katelyn, et al.
Pubblicazione: (2026)
di: Crumpacker, Katelyn, et al.
Pubblicazione: (2026)
Forecasting GPU Performance for Deep Learning Training and Inference
di: Lee, Seonho, et al.
Pubblicazione: (2024)
di: Lee, Seonho, et al.
Pubblicazione: (2024)
Energy-Efficient Wireless LLM Inference via Uncertainty and Importance-Aware Speculative Decoding
di: Park, Jihoon, et al.
Pubblicazione: (2025)
di: Park, Jihoon, et al.
Pubblicazione: (2025)
Semantic-Aware Gaussian Process Calibration with Structured Layerwise Kernels for Deep Neural Networks
di: Lee, Kyung-hwan, et al.
Pubblicazione: (2025)
di: Lee, Kyung-hwan, et al.
Pubblicazione: (2025)
Energy-Aware Dynamic Neural Inference
di: Bullo, Marcello, et al.
Pubblicazione: (2024)
di: Bullo, Marcello, et al.
Pubblicazione: (2024)
Energy-Aware DNN Graph Optimization
di: Wang, Yu, et al.
Pubblicazione: (2020)
di: Wang, Yu, et al.
Pubblicazione: (2020)
SparseDVFS: Sparse-Aware DVFS for Energy-Efficient Edge Inference
di: Zhang, Ziyang, et al.
Pubblicazione: (2026)
di: Zhang, Ziyang, et al.
Pubblicazione: (2026)
HGCA: Hybrid GPU-CPU Attention for Long Context LLM Inference
di: Deng, Weishu, et al.
Pubblicazione: (2025)
di: Deng, Weishu, et al.
Pubblicazione: (2025)
An Enhanced Projection Pursuit Tree Classifier with Visual Methods for Assessing Algorithmic Improvements
di: da Silva, Natalia, et al.
Pubblicazione: (2026)
di: da Silva, Natalia, et al.
Pubblicazione: (2026)
Interactive Graphics for Visually Diagnosing Forest Classifiers in R
di: da Silva, Natalia, et al.
Pubblicazione: (2017)
di: da Silva, Natalia, et al.
Pubblicazione: (2017)
Watt Counts: Energy-Aware Benchmark for Sustainable LLM Inference on Heterogeneous GPU Architectures
di: Argerich, Mauricio Fadel, et al.
Pubblicazione: (2026)
di: Argerich, Mauricio Fadel, et al.
Pubblicazione: (2026)
Correctness-Optimized Residual Activation Lens (CORAL): Transferrable and Calibration-Aware Inference-Time Steering
di: Miao, Miranda Muqing, et al.
Pubblicazione: (2026)
di: Miao, Miranda Muqing, et al.
Pubblicazione: (2026)
NanoFlux: Adversarial Dual-LLM Evaluation and Distillation For Multi-Domain Reasoning
di: Anantha, Raviteja, et al.
Pubblicazione: (2025)
di: Anantha, Raviteja, et al.
Pubblicazione: (2025)
Learning Short-Term and Long-Term Patterns of High-Order Dynamics in Real-World Networks
di: Ko, Yunyong, et al.
Pubblicazione: (2025)
di: Ko, Yunyong, et al.
Pubblicazione: (2025)
Harvest: Opportunistic Peer-to-Peer GPU Caching for LLM Inference
di: Gopal, Nikhil, et al.
Pubblicazione: (2026)
di: Gopal, Nikhil, et al.
Pubblicazione: (2026)
ModeSwitch-LLM: A Lightweight Phase-Aware Controller for Cross-Mode LLM Inference on a Single GPU
di: Sunesh, Aman, et al.
Pubblicazione: (2026)
di: Sunesh, Aman, et al.
Pubblicazione: (2026)
LIDS: LLM Summary Inference Under the Layered Lens
di: Park, Dylan, et al.
Pubblicazione: (2026)
di: Park, Dylan, et al.
Pubblicazione: (2026)
Transformers as Intrinsic Optimizers: Forward Inference through the Energy Principle
di: Ren, Ruifeng, et al.
Pubblicazione: (2025)
di: Ren, Ruifeng, et al.
Pubblicazione: (2025)
Challenging GPU Dominance: When CPUs Outperform for On-Device LLM Inference
di: Zhang, Haolin, et al.
Pubblicazione: (2025)
di: Zhang, Haolin, et al.
Pubblicazione: (2025)
From Prompts to Power: Measuring the Energy Footprint of LLM Inference
di: Caravaca, Francisco, et al.
Pubblicazione: (2025)
di: Caravaca, Francisco, et al.
Pubblicazione: (2025)
PULSE-ICU: A Pretrained Unified Long-Sequence Encoder for Multi-task Prediction in Intensive Care Units
di: Jang, Sejeong, et al.
Pubblicazione: (2025)
di: Jang, Sejeong, et al.
Pubblicazione: (2025)
Variational Inference Optimized Using the Curved Geometry of Coupled Free Energy
di: Nelson, Kenric, et al.
Pubblicazione: (2025)
di: Nelson, Kenric, et al.
Pubblicazione: (2025)
Scaling On-Device GPU Inference for Large Generative Models
di: Tang, Jiuqiang, et al.
Pubblicazione: (2025)
di: Tang, Jiuqiang, et al.
Pubblicazione: (2025)
New User Event Prediction Through the Lens of Causal Inference
di: Yuchi, Henry Shaowu, et al.
Pubblicazione: (2024)
di: Yuchi, Henry Shaowu, et al.
Pubblicazione: (2024)
Efficient Edge LLMs Deployment via HessianAware Quantization and CPU GPU Collaborative
di: Zhang, Tuo, et al.
Pubblicazione: (2025)
di: Zhang, Tuo, et al.
Pubblicazione: (2025)
Energy Considerations of Large Language Model Inference and Efficiency Optimizations
di: Fernandez, Jared, et al.
Pubblicazione: (2025)
di: Fernandez, Jared, et al.
Pubblicazione: (2025)
Documenti analoghi
-
EnergAIzer: Fast and Accurate GPU Power Estimation Framework for AI Workloads
di: Lee, Kyungmi, et al.
Pubblicazione: (2026) -
EnergyLens: Interpretable Closed-Form Energy Models for Multimodal LLM Inference Serving
di: Palladino, Vittorio, et al.
Pubblicazione: (2026) -
LEDRO: LLM-Enhanced Design Space Reduction and Optimization for Analog Circuits
di: Kochar, Dimple Vijay, et al.
Pubblicazione: (2024) -
A Robust Power Model Training Framework for Cloud Native Runtime Energy Metric Exporter
di: Choochotkaew, Sunyanan, et al.
Pubblicazione: (2024) -
Mind the Memory Gap: Unveiling GPU Bottlenecks in Large-Batch LLM Inference
di: Recasens, Pol G., et al.
Pubblicazione: (2025)