Steering a Fleet: Adaptation for Large-Scale, Workflow-Based Experiments
Fuente:
arXiv
Salvato in:
| Autori principali: | Pruyne, Jim, Hayot-Sasson, Valerie, Zheng, Weijian, Chard, Ryan, Wozniak, Justin M., Bicer, Tekin, Chard, Kyle, Foster, Ian T. |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Employing Artificial Intelligence to Steer Exascale Workflows with Colmena
di: Ward, Logan, et al.
Pubblicazione: (2024)
di: Ward, Logan, et al.
Pubblicazione: (2024)
Accelerating Python Applications with Dask and ProxyStore
di: Pauloski, J. Gregory, et al.
Pubblicazione: (2024)
di: Pauloski, J. Gregory, et al.
Pubblicazione: (2024)
WRATH: Workload Resilience Across Task Hierarchies in Task-based Parallel Programming Frameworks
di: Zhou, Sicheng, et al.
Pubblicazione: (2025)
di: Zhou, Sicheng, et al.
Pubblicazione: (2025)
Flight: A FaaS-Based Framework for Complex and Hierarchical Federated Learning
di: Hudson, Nathaniel, et al.
Pubblicazione: (2024)
di: Hudson, Nathaniel, et al.
Pubblicazione: (2024)
Octopus: Experiences with a Hybrid Event-Driven Architecture for Distributed Scientific Computing
di: Pan, Haochen, et al.
Pubblicazione: (2024)
di: Pan, Haochen, et al.
Pubblicazione: (2024)
Addressing Reproducibility Challenges in HPC with Continuous Integration
di: Hayot-Sasson, Valérie, et al.
Pubblicazione: (2025)
di: Hayot-Sasson, Valérie, et al.
Pubblicazione: (2025)
Object Proxy Patterns for Accelerating Distributed Applications
di: Pauloski, J. Gregory, et al.
Pubblicazione: (2024)
di: Pauloski, J. Gregory, et al.
Pubblicazione: (2024)
TaPS: A Performance Evaluation Suite for Task-based Execution Frameworks
di: Pauloski, J. Gregory, et al.
Pubblicazione: (2024)
di: Pauloski, J. Gregory, et al.
Pubblicazione: (2024)
UniFaaS: Programming across Distributed Cyberinfrastructure with Federated Function Serving
di: Li, Yifei, et al.
Pubblicazione: (2024)
di: Li, Yifei, et al.
Pubblicazione: (2024)
XaaS Containers: Performance-Portable Representation With Source and IR Containers
di: Copik, Marcin, et al.
Pubblicazione: (2025)
di: Copik, Marcin, et al.
Pubblicazione: (2025)
GreenFaaS: Maximizing Energy Efficiency of HPC Workloads with FaaS
di: Kamatar, Alok, et al.
Pubblicazione: (2024)
di: Kamatar, Alok, et al.
Pubblicazione: (2024)
Core Hours and Carbon Credits: Incentivizing Sustainability in HPC
di: Kamatar, Alok, et al.
Pubblicazione: (2025)
di: Kamatar, Alok, et al.
Pubblicazione: (2025)
Icicle: Scalable Metadata Indexing and Real-Time Monitoring for HPC File Systems
di: Pan, Haochen, et al.
Pubblicazione: (2026)
di: Pan, Haochen, et al.
Pubblicazione: (2026)
Empowering Scientific Workflows with Federated Agents
di: Kamatar, Alok, et al.
Pubblicazione: (2025)
di: Kamatar, Alok, et al.
Pubblicazione: (2025)
DynoStore: A wide-area distribution system for the management of data over heterogeneous storage
di: Sanchez-Gallegos, Dante D., et al.
Pubblicazione: (2025)
di: Sanchez-Gallegos, Dante D., et al.
Pubblicazione: (2025)
Hierarchical storage management in user space for neuroimaging applications
di: Hayot-Sasson, Valérie, et al.
Pubblicazione: (2024)
di: Hayot-Sasson, Valérie, et al.
Pubblicazione: (2024)
Parsl+CWL: Towards Combining the Python and CWL Ecosystems
di: Karle, Nishchay, et al.
Pubblicazione: (2024)
di: Karle, Nishchay, et al.
Pubblicazione: (2024)
D-Rex: Heterogeneity-Aware Reliability Framework and Adaptive Algorithms for Distributed Storage
di: Gonthier, Maxime, et al.
Pubblicazione: (2025)
di: Gonthier, Maxime, et al.
Pubblicazione: (2025)
Performance comparison of Dask and Apache Spark on HPC systems for Neuroimaging
di: Dugré, Mathieu, et al.
Pubblicazione: (2024)
di: Dugré, Mathieu, et al.
Pubblicazione: (2024)
Topology-Aware Knowledge Propagation in Decentralized Learning
di: Sakarvadia, Mansi, et al.
Pubblicazione: (2025)
di: Sakarvadia, Mansi, et al.
Pubblicazione: (2025)
Experiences with Model Context Protocol Servers for Science and High Performance Computing
di: Pan, Haochen, et al.
Pubblicazione: (2025)
di: Pan, Haochen, et al.
Pubblicazione: (2025)
Automated, Reliable, and Efficient Continental-Scale Replication of 7.3 Petabytes of Climate Simulation Data: A Case Study
di: Lacinski, Lukasz, et al.
Pubblicazione: (2024)
di: Lacinski, Lukasz, et al.
Pubblicazione: (2024)
PSI/J: A Portable Interface for Submitting, Monitoring, and Managing Jobs
di: Hategan-Marandiuc, Mihael, et al.
Pubblicazione: (2023)
di: Hategan-Marandiuc, Mihael, et al.
Pubblicazione: (2023)
Experiences Building Enterprise-Level Privacy-Preserving Federated Learning to Power AI for Science
di: Li, Zilinghan, et al.
Pubblicazione: (2025)
di: Li, Zilinghan, et al.
Pubblicazione: (2025)
Optimizing Fine-Grained Parallelism Through Dynamic Load Balancing on Multi-Socket Many-Core Systems
di: Wang, Wenyi, et al.
Pubblicazione: (2025)
di: Wang, Wenyi, et al.
Pubblicazione: (2025)
A Terminology for Scientific Workflow Systems
di: Suter, Frédéric, et al.
Pubblicazione: (2025)
di: Suter, Frédéric, et al.
Pubblicazione: (2025)
CoCoDiff: Optimizing Collective Communications for Distributed Diffusion Transformer Inference Under Ulysses Sequence Parallelism
di: Ma, Bin, et al.
Pubblicazione: (2026)
di: Ma, Bin, et al.
Pubblicazione: (2026)
ExaWorks Software Development Kit: A Robust and Scalable Collection of Interoperable Workflow Technologies
di: Turilli, Matteo, et al.
Pubblicazione: (2024)
di: Turilli, Matteo, et al.
Pubblicazione: (2024)
mLR: Scalable Laminography Reconstruction based on Memoization
di: Ma, Bin, et al.
Pubblicazione: (2025)
di: Ma, Bin, et al.
Pubblicazione: (2025)
Exploring Distributed Vector Databases Performance on HPC Platforms: A Study with Qdrant
di: Ockerman, Seth, et al.
Pubblicazione: (2025)
di: Ockerman, Seth, et al.
Pubblicazione: (2025)
Trillion Parameter AI Serving Infrastructure for Scientific Discovery: A Survey and Vision
di: Hudson, Nathaniel, et al.
Pubblicazione: (2024)
di: Hudson, Nathaniel, et al.
Pubblicazione: (2024)
MOFA: Discovering Materials for Carbon Capture with a GenAI- and Simulation-Based Workflow
di: Yan, Xiaoli, et al.
Pubblicazione: (2025)
di: Yan, Xiaoli, et al.
Pubblicazione: (2025)
FleetOpt: Analytical Fleet Provisioning for LLM Inference with Compress-and-Route as Implementation Mechanism
di: Chen, Huamin, et al.
Pubblicazione: (2026)
di: Chen, Huamin, et al.
Pubblicazione: (2026)
Computational Grids
di: Foster, Ian, et al.
Pubblicazione: (2025)
di: Foster, Ian, et al.
Pubblicazione: (2025)
Workflows Community Summit 2024: Future Trends and Challenges in Scientific Workflows
di: da Silva, Rafael Ferreira, et al.
Pubblicazione: (2024)
di: da Silva, Rafael Ferreira, et al.
Pubblicazione: (2024)
Enabling Seamless Transitions from Experimental to Production HPC for Interactive Workflows
di: Etz, Brian D., et al.
Pubblicazione: (2025)
di: Etz, Brian D., et al.
Pubblicazione: (2025)
Towards Experiment Execution in Support of Community Benchmark Workflows for HPC
di: von Laszewski, Gregor, et al.
Pubblicazione: (2025)
di: von Laszewski, Gregor, et al.
Pubblicazione: (2025)
RHAPSODY: Execution of Hybrid AI-HPC Workflows at Scale
di: Alsaadi, Aymen, et al.
Pubblicazione: (2025)
di: Alsaadi, Aymen, et al.
Pubblicazione: (2025)
FIRST: Federated Inference Resource Scheduling Toolkit for Scientific AI Model Access
di: Tanikanti, Aditya, et al.
Pubblicazione: (2025)
di: Tanikanti, Aditya, et al.
Pubblicazione: (2025)
It Takes Two to Tango: Serverless Workflow Serving via Bilaterally Engaged Resource Adaptation
di: Wu, Jing, et al.
Pubblicazione: (2025)
di: Wu, Jing, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Employing Artificial Intelligence to Steer Exascale Workflows with Colmena
di: Ward, Logan, et al.
Pubblicazione: (2024) -
Accelerating Python Applications with Dask and ProxyStore
di: Pauloski, J. Gregory, et al.
Pubblicazione: (2024) -
WRATH: Workload Resilience Across Task Hierarchies in Task-based Parallel Programming Frameworks
di: Zhou, Sicheng, et al.
Pubblicazione: (2025) -
Flight: A FaaS-Based Framework for Complex and Hierarchical Federated Learning
di: Hudson, Nathaniel, et al.
Pubblicazione: (2024) -
Octopus: Experiences with a Hybrid Event-Driven Architecture for Distributed Scientific Computing
di: Pan, Haochen, et al.
Pubblicazione: (2024)