Watt Counts: Energy-Aware Benchmark for Sustainable LLM Inference on Heterogeneous GPU Architectures
Fuente:
arXiv
Salvato in:
| Autori principali: | Argerich, Mauricio Fadel, Fürst, Jonathan, Patiño-Martínez, Marta |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Hybrid Heterogeneous Clusters Can Lower the Energy Consumption of LLM Inference Workloads
di: Wilkins, Grant, et al.
Pubblicazione: (2024)
di: Wilkins, Grant, et al.
Pubblicazione: (2024)
Cost-Efficient Multimodal LLM Inference via Cross-Tier GPU Heterogeneity
di: Yu, Donglin
Pubblicazione: (2026)
di: Yu, Donglin
Pubblicazione: (2026)
Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference
di: Li, Rongzhi, et al.
Pubblicazione: (2025)
di: Li, Rongzhi, et al.
Pubblicazione: (2025)
Characterizing and Optimizing LLM Inference Workloads on CPU-GPU Coupled Architectures
di: Vellaisamy, Prabhu, et al.
Pubblicazione: (2025)
di: Vellaisamy, Prabhu, et al.
Pubblicazione: (2025)
MSCCL++: Rethinking GPU Communication Abstractions for AI Inference
di: Hwang, Changho, et al.
Pubblicazione: (2025)
di: Hwang, Changho, et al.
Pubblicazione: (2025)
FairBatching: Fairness-Aware Batch Formation for LLM Inference
di: Lyu, Hongtao, et al.
Pubblicazione: (2025)
di: Lyu, Hongtao, et al.
Pubblicazione: (2025)
GPU-Virt-Bench: A Comprehensive Benchmarking Framework for Software-Based GPU Virtualization Systems
di: VG, Jithin, et al.
Pubblicazione: (2025)
di: VG, Jithin, et al.
Pubblicazione: (2025)
Identifying and Mitigating Systemic Measurement Bias in Production LLM Inference Benchmarks
di: Chandrasekar, Ashok, et al.
Pubblicazione: (2026)
di: Chandrasekar, Ashok, et al.
Pubblicazione: (2026)
An Efficient Heterogeneous Co-Design for Fine-Tuning on a Single GPU
di: Yang, Ruijia, et al.
Pubblicazione: (2026)
di: Yang, Ruijia, et al.
Pubblicazione: (2026)
Token-Budget-Aware Pool Routing for Cost-Efficient LLM Inference
di: Chen, Huamin, et al.
Pubblicazione: (2026)
di: Chen, Huamin, et al.
Pubblicazione: (2026)
Dooly: Configuration-Agnostic, Redundancy-Aware Profiling for LLM Inference Simulation
di: Kim, Joon Ha, et al.
Pubblicazione: (2026)
di: Kim, Joon Ha, et al.
Pubblicazione: (2026)
TAPAS: Thermal- and Power-Aware Scheduling for LLM Inference in Cloud Platforms
di: Stojkovic, Jovan, et al.
Pubblicazione: (2025)
di: Stojkovic, Jovan, et al.
Pubblicazione: (2025)
SwizzlePerf: Hardware-Aware LLMs for GPU Kernel Performance Optimization
di: Tschand, Arya, et al.
Pubblicazione: (2025)
di: Tschand, Arya, et al.
Pubblicazione: (2025)
LeMix: Unified Scheduling for LLM Training and Inference on Multi-GPU Systems
di: Li, Yufei, et al.
Pubblicazione: (2025)
di: Li, Yufei, et al.
Pubblicazione: (2025)
A Scheduling Framework for Efficient MoE Inference on Edge GPU-NDP Systems
di: Wu, Qi, et al.
Pubblicazione: (2026)
di: Wu, Qi, et al.
Pubblicazione: (2026)
FairKV: Balancing Per-Head KV Cache for Fast Multi-GPU Inference
di: Zhao, Bingzhe, et al.
Pubblicazione: (2025)
di: Zhao, Bingzhe, et al.
Pubblicazione: (2025)
Xe-Forge: Multi-Stage LLM-Powered Kernel Optimization for Intel GPU
di: Spoczynski, Marcin, et al.
Pubblicazione: (2026)
di: Spoczynski, Marcin, et al.
Pubblicazione: (2026)
High-Throughput LLM inference on Heterogeneous Clusters
di: Xiong, Yi, et al.
Pubblicazione: (2025)
di: Xiong, Yi, et al.
Pubblicazione: (2025)
Practical offloading for fine-tuning LLM on commodity GPU via learned sparse projectors
di: Chen, Siyuan, et al.
Pubblicazione: (2024)
di: Chen, Siyuan, et al.
Pubblicazione: (2024)
CoLLM: Continuous Adaptation for SLO-Aware LLM Serving on Shared GPU Clusters
di: Huang, Shaoyuan, et al.
Pubblicazione: (2026)
di: Huang, Shaoyuan, et al.
Pubblicazione: (2026)
NEO: Saving GPU Memory Crisis with CPU Offloading for Online LLM Inference
di: Jiang, Xuanlin, et al.
Pubblicazione: (2024)
di: Jiang, Xuanlin, et al.
Pubblicazione: (2024)
Failure-Resilient Distributed Inference with Model Compression over Heterogeneous Edge Devices
di: Wang, Li, et al.
Pubblicazione: (2024)
di: Wang, Li, et al.
Pubblicazione: (2024)
Accelerating LLM Inference with Precomputed Query Storage
di: Park, Jay H., et al.
Pubblicazione: (2025)
di: Park, Jay H., et al.
Pubblicazione: (2025)
AI Benchmarks and Datasets for LLM Evaluation
di: Ivanov, Todor, et al.
Pubblicazione: (2024)
di: Ivanov, Todor, et al.
Pubblicazione: (2024)
GEM: GPU-Variability-Aware Expert to GPU Mapping for MoE Systems
di: Wawdhane, Sourish, et al.
Pubblicazione: (2026)
di: Wawdhane, Sourish, et al.
Pubblicazione: (2026)
LLM Inference Serving: Survey of Recent Advances and Opportunities
di: Li, Baolin, et al.
Pubblicazione: (2024)
di: Li, Baolin, et al.
Pubblicazione: (2024)
Decentralized AI: Permissionless LLM Inference on POKT Network
di: Olshansky, Daniel, et al.
Pubblicazione: (2024)
di: Olshansky, Daniel, et al.
Pubblicazione: (2024)
Characterizing Mobile SoC for Accelerating Heterogeneous LLM Inference
di: Chen, Le, et al.
Pubblicazione: (2025)
di: Chen, Le, et al.
Pubblicazione: (2025)
SLO-aware GPU Frequency Scaling for Energy Efficient LLM Inference Serving
di: Kakolyris, Andreas Kosmas, et al.
Pubblicazione: (2024)
di: Kakolyris, Andreas Kosmas, et al.
Pubblicazione: (2024)
LLM as HPC Expert: Extending RAG Architecture for HPC Data
di: Miyashita, Yusuke, et al.
Pubblicazione: (2024)
di: Miyashita, Yusuke, et al.
Pubblicazione: (2024)
Llamas on the Web: Memory-Efficient, Performance-Portable, and Multi-Precision LLM Inference with WebGPU
di: Levine, Reese, et al.
Pubblicazione: (2026)
di: Levine, Reese, et al.
Pubblicazione: (2026)
KAIROS: Stateful, Context-Aware Power-Efficient Agentic Inference Serving
di: Yuan, Yichao, et al.
Pubblicazione: (2026)
di: Yuan, Yichao, et al.
Pubblicazione: (2026)
Serving Heterogeneous LoRA Adapters in Distributed LLM Inference Systems
di: Jaiswal, Shashwat, et al.
Pubblicazione: (2025)
di: Jaiswal, Shashwat, et al.
Pubblicazione: (2025)
Seesaw: High-throughput LLM Inference via Model Re-sharding
di: Su, Qidong, et al.
Pubblicazione: (2025)
di: Su, Qidong, et al.
Pubblicazione: (2025)
DeServe: Towards Affordable Offline LLM Inference via Decentralization
di: Wu, Linyu, et al.
Pubblicazione: (2025)
di: Wu, Linyu, et al.
Pubblicazione: (2025)
DynamoLLM: Designing LLM Inference Clusters for Performance and Energy Efficiency
di: Stojkovic, Jovan, et al.
Pubblicazione: (2024)
di: Stojkovic, Jovan, et al.
Pubblicazione: (2024)
LLM-PQ: Serving LLM on Heterogeneous Clusters with Phase-Aware Partition and Adaptive Quantization
di: Zhao, Juntao, et al.
Pubblicazione: (2024)
di: Zhao, Juntao, et al.
Pubblicazione: (2024)
Speculative Decoding in Decentralized LLM Inference: Turning Communication Latency into Computation Throughput
di: Song, Jingwei, et al.
Pubblicazione: (2025)
di: Song, Jingwei, et al.
Pubblicazione: (2025)
FlowSpec: Continuous Pipelined Speculative Decoding for Efficient Distributed LLM Inference
di: Liu, Xing, et al.
Pubblicazione: (2025)
di: Liu, Xing, et al.
Pubblicazione: (2025)
SPECTRE: Hybrid Ordinary-Parallel Speculative Serving for Resource-Efficient LLM Inference
di: Xie, Jincheng, et al.
Pubblicazione: (2026)
di: Xie, Jincheng, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Hybrid Heterogeneous Clusters Can Lower the Energy Consumption of LLM Inference Workloads
di: Wilkins, Grant, et al.
Pubblicazione: (2024) -
Cost-Efficient Multimodal LLM Inference via Cross-Tier GPU Heterogeneity
di: Yu, Donglin
Pubblicazione: (2026) -
Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference
di: Li, Rongzhi, et al.
Pubblicazione: (2025) -
Characterizing and Optimizing LLM Inference Workloads on CPU-GPU Coupled Architectures
di: Vellaisamy, Prabhu, et al.
Pubblicazione: (2025) -
MSCCL++: Rethinking GPU Communication Abstractions for AI Inference
di: Hwang, Changho, et al.
Pubblicazione: (2025)