Magneton: Optimizing Energy Efficiency of ML Systems via Differential Energy Debugging
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Pan, Yi, Qian, Wenbo, Xie, Dedong, Hu, Ruiyan, Hu, Yigong, Kasikci, Baris |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Argos: Agentic Time-Series Anomaly Detection with Autonomous Rule Generation via Large Language Models
par: Gu, Yile, et autres
Publié: (2025)
par: Gu, Yile, et autres
Publié: (2025)
PolyServe: Efficient Multi-SLO Serving at Scale
par: Zhu, Kan, et autres
Publié: (2025)
par: Zhu, Kan, et autres
Publié: (2025)
Fake Runs, Real Fixes -- Analyzing xPU Performance Through Simulation
par: Zarkadas, Ioannis, et autres
Publié: (2025)
par: Zarkadas, Ioannis, et autres
Publié: (2025)
Ilargi: a GPU Compatible Factorized ML Model Training Framework
par: Sun, Wenbo, et autres
Publié: (2025)
par: Sun, Wenbo, et autres
Publié: (2025)
Energy Use of AI Inference: Efficiency Pathways and Test-Time Compute
par: Oviedo, Felipe, et autres
Publié: (2025)
par: Oviedo, Felipe, et autres
Publié: (2025)
Federated Communication-Efficient Multi-Objective Optimization
par: Askin, Baris, et autres
Publié: (2024)
par: Askin, Baris, et autres
Publié: (2024)
Intelligent Task Offloading in VANETs: A Hybrid AI-Driven Approach for Low-Latency and Energy Efficiency
par: Qayyum, Tariq, et autres
Publié: (2025)
par: Qayyum, Tariq, et autres
Publié: (2025)
A Scalable Digital Twin Framework for Energy Optimization in Data Centers
par: Gonçalves, Raphael Hendrigo de Souza, et autres
Publié: (2026)
par: Gonçalves, Raphael Hendrigo de Souza, et autres
Publié: (2026)
Communication and Energy Efficient Federated Learning using Zero-Order Optimization Technique
par: Mhanna, Elissa, et autres
Publié: (2024)
par: Mhanna, Elissa, et autres
Publié: (2024)
ScaleLLM: A Resource-Frugal LLM Serving Framework by Optimizing End-to-End Efficiency
par: Yao, Yuhang, et autres
Publié: (2024)
par: Yao, Yuhang, et autres
Publié: (2024)
Fiddler: CPU-GPU Orchestration for Fast Inference of Mixture-of-Experts Models
par: Kamahori, Keisuke, et autres
Publié: (2024)
par: Kamahori, Keisuke, et autres
Publié: (2024)
TeleRAG: Efficient Retrieval-Augmented Generation Inference with Lookahead Retrieval
par: Lin, Chien-Yu, et autres
Publié: (2025)
par: Lin, Chien-Yu, et autres
Publié: (2025)
BGTplanner: Maximizing Training Accuracy for Differentially Private Federated Recommenders via Strategic Privacy Budget Allocation
par: Zhang, Xianzhi, et autres
Publié: (2024)
par: Zhang, Xianzhi, et autres
Publié: (2024)
Toward Cross-Layer Energy Optimizations in AI Systems
par: Chung, Jae-Won, et autres
Publié: (2024)
par: Chung, Jae-Won, et autres
Publié: (2024)
Apparate: Rethinking Early Exits to Tame Latency-Throughput Tensions in ML Serving
par: Dai, Yinwei, et autres
Publié: (2023)
par: Dai, Yinwei, et autres
Publié: (2023)
MLPerf Power: Benchmarking the Energy Efficiency of Machine Learning Systems from Microwatts to Megawatts for Sustainable AI
par: Tschand, Arya, et autres
Publié: (2024)
par: Tschand, Arya, et autres
Publié: (2024)
VibeServe: Can AI Agents Build Bespoke LLM Serving Systems?
par: Kamahori, Keisuke, et autres
Publié: (2026)
par: Kamahori, Keisuke, et autres
Publié: (2026)
MatchNAS: Optimizing Edge AI in Sparse-Label Data Contexts via Automating Deep Neural Network Porting for Mobile Deployment
par: Huang, Hongtao, et autres
Publié: (2024)
par: Huang, Hongtao, et autres
Publié: (2024)
yProv4ML: Effortless Provenance Tracking for Machine Learning Systems
par: Padovani, Gabriele, et autres
Publié: (2025)
par: Padovani, Gabriele, et autres
Publié: (2025)
SERFLOW: A Cross-Service Cost Optimization Framework for SLO-Aware Dynamic ML Inference
par: Zhang, Zongshun, et autres
Publié: (2025)
par: Zhang, Zongshun, et autres
Publié: (2025)
DiffKV: Differentiated Memory Management for Large Language Models with Parallel KV Compaction
par: Zhang, Yanqi, et autres
Publié: (2024)
par: Zhang, Yanqi, et autres
Publié: (2024)
Deep Reinforcement Learning for Optimizing Energy Consumption in Smart Grid Systems
par: Alsheikhi, Abeer, et autres
Publié: (2026)
par: Alsheikhi, Abeer, et autres
Publié: (2026)
Reducing Energy Bloat in Large Model Training
par: Chung, Jae-Won, et autres
Publié: (2023)
par: Chung, Jae-Won, et autres
Publié: (2023)
DynaFlow: Transparent and Flexible Intra-Device Parallelism via Programmable Operator Scheduling
par: Pan, Yi, et autres
Publié: (2026)
par: Pan, Yi, et autres
Publié: (2026)
AdaptiveFL: Adaptive Heterogeneous Federated Learning for Resource-Constrained AIoT Systems
par: Jia, Chentao, et autres
Publié: (2023)
par: Jia, Chentao, et autres
Publié: (2023)
ConsumerBench: Benchmarking Generative AI Applications on End-User Devices
par: Gu, Yile, et autres
Publié: (2025)
par: Gu, Yile, et autres
Publié: (2025)
Communication Optimization for Distributed Training: Architecture, Advances, and Opportunities
par: Wei, Yunze, et autres
Publié: (2024)
par: Wei, Yunze, et autres
Publié: (2024)
High-Dimensional Sparse Data Low-rank Representation via Accelerated Asynchronous Parallel Stochastic Gradient Descent
par: Hu, Qicong, et autres
Publié: (2024)
par: Hu, Qicong, et autres
Publié: (2024)
Energy-Efficient Federated Learning for Edge Real-Time Vision via Joint Data, Computation, and Communication Design
par: Hou, Xiangwang, et autres
Publié: (2025)
par: Hou, Xiangwang, et autres
Publié: (2025)
Energy-Aware Decentralized Learning with Intermittent Model Training
par: Dhasade, Akash, et autres
Publié: (2024)
par: Dhasade, Akash, et autres
Publié: (2024)
SAIR: Cost-Efficient Multi-Stage ML Pipeline Autoscaling via In-Context Reinforcement Learning
par: Su, Jianchang, et autres
Publié: (2026)
par: Su, Jianchang, et autres
Publié: (2026)
CubicML: Automated ML for Large ML Systems Co-design with ML Prediction of Performance
par: Wen, Wei, et autres
Publié: (2024)
par: Wen, Wei, et autres
Publié: (2024)
Where Do the Joules Go? Diagnosing Inference Energy Consumption
par: Chung, Jae-Won, et autres
Publié: (2026)
par: Chung, Jae-Won, et autres
Publié: (2026)
FedZero: Leveraging Renewable Excess Energy in Federated Learning
par: Wiesner, Philipp, et autres
Publié: (2023)
par: Wiesner, Philipp, et autres
Publié: (2023)
Fed-pilot: Optimizing LoRA Allocation for Efficient Federated Fine-Tuning with Heterogeneous Clients
par: Zhang, Zikai, et autres
Publié: (2024)
par: Zhang, Zikai, et autres
Publié: (2024)
Staggered Batch Scheduling: Co-optimizing Time-to-First-Token and Throughput for High-Efficiency LLM Inference
par: Tian, Jian, et autres
Publié: (2025)
par: Tian, Jian, et autres
Publié: (2025)
CaBaFL: Asynchronous Federated Learning via Hierarchical Cache and Feature Balance
par: Xia, Zeke, et autres
Publié: (2024)
par: Xia, Zeke, et autres
Publié: (2024)
FedAST: Federated Asynchronous Simultaneous Training
par: Askin, Baris, et autres
Publié: (2024)
par: Askin, Baris, et autres
Publié: (2024)
Kareus: Joint Reduction of Dynamic and Static Energy in Large Model Training
par: Wu, Ruofan, et autres
Publié: (2026)
par: Wu, Ruofan, et autres
Publié: (2026)
Energy-Efficient Quantized Federated Learning for Resource-constrained IoT devices
par: Compaoré, Wilfrid Sougrinoma, et autres
Publié: (2025)
par: Compaoré, Wilfrid Sougrinoma, et autres
Publié: (2025)
Documents similaires
-
Argos: Agentic Time-Series Anomaly Detection with Autonomous Rule Generation via Large Language Models
par: Gu, Yile, et autres
Publié: (2025) -
PolyServe: Efficient Multi-SLO Serving at Scale
par: Zhu, Kan, et autres
Publié: (2025) -
Fake Runs, Real Fixes -- Analyzing xPU Performance Through Simulation
par: Zarkadas, Ioannis, et autres
Publié: (2025) -
Ilargi: a GPU Compatible Factorized ML Model Training Framework
par: Sun, Wenbo, et autres
Publié: (2025) -
Energy Use of AI Inference: Efficiency Pathways and Test-Time Compute
par: Oviedo, Felipe, et autres
Publié: (2025)