Cloud abstractions for AI workloads
Fuente:
arXiv
Salvato in:
| Autori principali: | Canini, Marco, Benson, Theophilus A., Bianchini, Ricardo, Goiri, Íñigo, Kostić, Dejan, Pietzuch, Peter, Peter, Simon |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Rearchitecting Datacenter Lifecycle for AI: A TCO-Driven Framework
di: Stojkovic, Jovan, et al.
Pubblicazione: (2025)
di: Stojkovic, Jovan, et al.
Pubblicazione: (2025)
Towards Resource-Efficient Compound AI Systems
di: Chaudhry, Gohar Irfan, et al.
Pubblicazione: (2025)
di: Chaudhry, Gohar Irfan, et al.
Pubblicazione: (2025)
TAPAS: Thermal- and Power-Aware Scheduling for LLM Inference in Cloud Platforms
di: Stojkovic, Jovan, et al.
Pubblicazione: (2025)
di: Stojkovic, Jovan, et al.
Pubblicazione: (2025)
Nanvix: A Multikernel OS Design for High-Density Serverless Deployments
di: Segarra, Carlos, et al.
Pubblicazione: (2026)
di: Segarra, Carlos, et al.
Pubblicazione: (2026)
Towards Cloud Efficiency with Large-scale Workload Characterization
di: Parayil, Anjaly, et al.
Pubblicazione: (2024)
di: Parayil, Anjaly, et al.
Pubblicazione: (2024)
Workload Intelligence: Punching Holes Through the Cloud Abstraction
di: Huang, Lexiang, et al.
Pubblicazione: (2024)
di: Huang, Lexiang, et al.
Pubblicazione: (2024)
StreamWise: Serving Multi-Modal Generation in Real-Time at Scale
di: Qiu, Haoran, et al.
Pubblicazione: (2026)
di: Qiu, Haoran, et al.
Pubblicazione: (2026)
Priority-Aware Preemptive Scheduling for Mixed-Priority Workloads in MoE Inference
di: Siavashi, Mohammad, et al.
Pubblicazione: (2025)
di: Siavashi, Mohammad, et al.
Pubblicazione: (2025)
Lifting to tensors when compiling scientific computing workloads for AI Engines
di: Brown, Nick, et al.
Pubblicazione: (2026)
di: Brown, Nick, et al.
Pubblicazione: (2026)
Integrating and Characterizing HPC Task Runtime Systems for hybrid AI-HPC workloads
di: Merzky, Andre, et al.
Pubblicazione: (2025)
di: Merzky, Andre, et al.
Pubblicazione: (2025)
Junctiond: Extending FaaS Runtimes with Kernel-Bypass
di: Saurez, Enrique, et al.
Pubblicazione: (2024)
di: Saurez, Enrique, et al.
Pubblicazione: (2024)
Combining GPU and CPU for accelerating evolutionary computing workloads
di: Eynaliyev, Rustam, et al.
Pubblicazione: (2025)
di: Eynaliyev, Rustam, et al.
Pubblicazione: (2025)
Simulating LLM training workloads for heterogeneous compute and network infrastructure
di: Kumar, Sumit, et al.
Pubblicazione: (2025)
di: Kumar, Sumit, et al.
Pubblicazione: (2025)
Intelligent resource prediction for SAP HANA continuous integration build workloads
di: Mandel, Torsten, et al.
Pubblicazione: (2026)
di: Mandel, Torsten, et al.
Pubblicazione: (2026)
The workflow motif: a widely-useful performance diagnosis abstraction for distributed applications
di: Abdi, Mania, et al.
Pubblicazione: (2025)
di: Abdi, Mania, et al.
Pubblicazione: (2025)
VerifiableFL: Verifiable Claims for Federated Learning using Exclaves
di: Guo, Jinnan, et al.
Pubblicazione: (2024)
di: Guo, Jinnan, et al.
Pubblicazione: (2024)
Surviving the Edge: Federated Learning under Networking and Resource Constraints
di: Mwanje, Mike, et al.
Pubblicazione: (2026)
di: Mwanje, Mike, et al.
Pubblicazione: (2026)
The AI_INFN Platform: Artificial Intelligence Development in the Cloud
di: Anderlini, Lucio, et al.
Pubblicazione: (2025)
di: Anderlini, Lucio, et al.
Pubblicazione: (2025)
HPCAdvisor: A Tool for Assisting Users in Selecting HPC Resources in the Cloud
di: Netto, Marco A. S.
Pubblicazione: (2024)
di: Netto, Marco A. S.
Pubblicazione: (2024)
DynamoLLM: Designing LLM Inference Clusters for Performance and Energy Efficiency
di: Stojkovic, Jovan, et al.
Pubblicazione: (2024)
di: Stojkovic, Jovan, et al.
Pubblicazione: (2024)
Towards a Flexible and High-Fidelity Approach to Distributed DNN Training Emulation
di: Liu, Banruo, et al.
Pubblicazione: (2024)
di: Liu, Banruo, et al.
Pubblicazione: (2024)
ARCAS: Adaptive Runtime System for Chiplet-Aware Scheduling
di: Fogli, Alessandro, et al.
Pubblicazione: (2025)
di: Fogli, Alessandro, et al.
Pubblicazione: (2025)
Tenplex: Dynamic Parallelism for Deep Learning using Parallelizable Tensor Collections
di: Wagenländer, Marcel, et al.
Pubblicazione: (2023)
di: Wagenländer, Marcel, et al.
Pubblicazione: (2023)
PICO: Performance Insights for Collective Operations
di: Pasqualoni, Saverio, et al.
Pubblicazione: (2025)
di: Pasqualoni, Saverio, et al.
Pubblicazione: (2025)
Quantize Once, Train Fast: Allreduce-Compatible Compression with Provable Guarantees
di: Xin, Jihao, et al.
Pubblicazione: (2023)
di: Xin, Jihao, et al.
Pubblicazione: (2023)
A DataOps Toolbox Enabling Continuous Semantic Integration of Devices for Edge-Cloud AI Applications
di: Scrocca, Mario, et al.
Pubblicazione: (2025)
di: Scrocca, Mario, et al.
Pubblicazione: (2025)
Why Smaller Is Slower? Dimensional Misalignment in Compressed LLMs
di: Xin, Jihao, et al.
Pubblicazione: (2026)
di: Xin, Jihao, et al.
Pubblicazione: (2026)
Tempo: Compiled Dynamic Deep Learning with Symbolic Dependence Graphs
di: Silvestre, Pedro F., et al.
Pubblicazione: (2025)
di: Silvestre, Pedro F., et al.
Pubblicazione: (2025)
No Request Left Behind: Tackling Heterogeneity in Long-Context LLM Inference with Medha
di: Agrawal, Amey, et al.
Pubblicazione: (2024)
di: Agrawal, Amey, et al.
Pubblicazione: (2024)
Designing Datacenter Power Delivery Hierarchies for the AI Era
di: Wilkins, Grant, et al.
Pubblicazione: (2026)
di: Wilkins, Grant, et al.
Pubblicazione: (2026)
Where is the Testbed for my Federated Learning Research?
di: Božič, Janez, et al.
Pubblicazione: (2024)
di: Božič, Janez, et al.
Pubblicazione: (2024)
Scepsy: Serving Agentic Workflows Using Aggregate LLM Pipelines
di: Wagenländer, Marcel, et al.
Pubblicazione: (2026)
di: Wagenländer, Marcel, et al.
Pubblicazione: (2026)
An Empirical Study of Production Incidents in Generative AI Cloud Services
di: Yan, Haoran, et al.
Pubblicazione: (2025)
di: Yan, Haoran, et al.
Pubblicazione: (2025)
SynergAI: Edge-to-Cloud Synergy for Architecture-Driven High-Performance Orchestration for AI Inference
di: Stathopoulou, Foteini, et al.
Pubblicazione: (2025)
di: Stathopoulou, Foteini, et al.
Pubblicazione: (2025)
Orchestrating Mixed-Criticality Cloud Workloads in Reconfigurable Manufacturing Systems
di: Barletta, Marco, et al.
Pubblicazione: (2024)
di: Barletta, Marco, et al.
Pubblicazione: (2024)
SuperBench: Improving Cloud AI Infrastructure Reliability with Proactive Validation
di: Xiong, Yifan, et al.
Pubblicazione: (2024)
di: Xiong, Yifan, et al.
Pubblicazione: (2024)
ARRC: Explainable, Workflow-Integrated Recommender for Sustainable Resource Optimization Across the Edge-Cloud Continuum
di: Jahnke, Brian-Frederik, et al.
Pubblicazione: (2025)
di: Jahnke, Brian-Frederik, et al.
Pubblicazione: (2025)
AI-Driven Multi-Region Provisioning for Cloud Services Using Spot Fleets
di: Fabra, Javier, et al.
Pubblicazione: (2026)
di: Fabra, Javier, et al.
Pubblicazione: (2026)
Evolving HPC services to enable ML workloads on HPE Cray EX
di: Schuppli, Stefano, et al.
Pubblicazione: (2025)
di: Schuppli, Stefano, et al.
Pubblicazione: (2025)
DECICE: AI-Driven Scheduling and Digital Twin Integration for the Cloud-HPC-Edge Compute Continuum
di: Sharma, Aasish Kumar, et al.
Pubblicazione: (2026)
di: Sharma, Aasish Kumar, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Rearchitecting Datacenter Lifecycle for AI: A TCO-Driven Framework
di: Stojkovic, Jovan, et al.
Pubblicazione: (2025) -
Towards Resource-Efficient Compound AI Systems
di: Chaudhry, Gohar Irfan, et al.
Pubblicazione: (2025) -
TAPAS: Thermal- and Power-Aware Scheduling for LLM Inference in Cloud Platforms
di: Stojkovic, Jovan, et al.
Pubblicazione: (2025) -
Nanvix: A Multikernel OS Design for High-Density Serverless Deployments
di: Segarra, Carlos, et al.
Pubblicazione: (2026) -
Towards Cloud Efficiency with Large-scale Workload Characterization
di: Parayil, Anjaly, et al.
Pubblicazione: (2024)