FIRST: Federated Inference Resource Scheduling Toolkit for Scientific AI Model Access
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Tanikanti, Aditya, Côté, Benoit, Guo, Yanfei, Chen, Le, Saint, Nickolaus, Chard, Ryan, Raffenetti, Ken, Thakur, Rajeev, Uram, Thomas, Foster, Ian, Papka, Michael E., Vishwanath, Venkatram |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
LLM-Inference-Bench: Inference Benchmarking of Large Language Models on AI Accelerators
par: Chitty-Venkata, Krishna Teja, et autres
Publié: (2024)
par: Chitty-Venkata, Krishna Teja, et autres
Publié: (2024)
MPI Progress For All
par: Zhou, Hui, et autres
Publié: (2024)
par: Zhou, Hui, et autres
Publié: (2024)
Frustrated with MPI+Threads? Try MPIxThreads!
par: Zhou, Hui, et autres
Publié: (2024)
par: Zhou, Hui, et autres
Publié: (2024)
Designing and Prototyping Extensions to MPI in MPICH
par: Zhou, Hui, et autres
Publié: (2024)
par: Zhou, Hui, et autres
Publié: (2024)
Implementing True MPI Sessions and Evaluating MPI Initialization Scalability
par: Zhou, Hui, et autres
Publié: (2026)
par: Zhou, Hui, et autres
Publié: (2026)
An Incremental Multi-Level, Multi-Scale Approach to Assessment of Multifidelity HPC Systems
par: Shilpika, Shilpika, et autres
Publié: (2025)
par: Shilpika, Shilpika, et autres
Publié: (2025)
Generating Bindings in MPICH
par: Zhou, Hui, et autres
Publié: (2024)
par: Zhou, Hui, et autres
Publié: (2024)
Employing Artificial Intelligence to Steer Exascale Workflows with Colmena
par: Ward, Logan, et autres
Publié: (2024)
par: Ward, Logan, et autres
Publié: (2024)
Empowering Scientific Workflows with Federated Agents
par: Kamatar, Alok, et autres
Publié: (2025)
par: Kamatar, Alok, et autres
Publié: (2025)
Combining Language and Graph Models for Semi-structured Information Extraction on the Web
par: Hong, Zhi, et autres
Publié: (2024)
par: Hong, Zhi, et autres
Publié: (2024)
ChemGraph: An Agentic Framework for Computational Chemistry Workflows
par: Pham, Thang D., et autres
Publié: (2025)
par: Pham, Thang D., et autres
Publié: (2025)
LExI: Layer-Adaptive Active Experts for Efficient MoE Model Inference
par: Chitty-Venkata, Krishna Teja, et autres
Publié: (2025)
par: Chitty-Venkata, Krishna Teja, et autres
Publié: (2025)
Understanding Large-Scale HPC System Behavior Through Cluster-Based Visual Analytics
par: Austin, Allison, et autres
Publié: (2026)
par: Austin, Allison, et autres
Publié: (2026)
Agentic Discovery: Closing the Loop with Cooperative Agents
par: Pauloski, J. Gregory, et autres
Publié: (2025)
par: Pauloski, J. Gregory, et autres
Publié: (2025)
Octopus: Experiences with a Hybrid Event-Driven Architecture for Distributed Scientific Computing
par: Pan, Haochen, et autres
Publié: (2024)
par: Pan, Haochen, et autres
Publié: (2024)
UniFaaS: Programming across Distributed Cyberinfrastructure with Federated Function Serving
par: Li, Yifei, et autres
Publié: (2024)
par: Li, Yifei, et autres
Publié: (2024)
MRSch: Multi-Resource Scheduling for HPC
par: Li, Boyang, et autres
Publié: (2024)
par: Li, Boyang, et autres
Publié: (2024)
Scalable Cross-Facility Federated Learning for Scientific Foundation Models on Multiple Supercomputers
par: Li, Yijiang, et autres
Publié: (2026)
par: Li, Yijiang, et autres
Publié: (2026)
A Deep Probabilistic Framework for Continuous Time Dynamic Graph Generation
par: Hosseini, Ryien, et autres
Publié: (2024)
par: Hosseini, Ryien, et autres
Publié: (2024)
LangVision-LoRA-NAS: Neural Architecture Search for Variable LoRA Rank in Vision Language Models
par: Chitty-Venkata, Krishna Teja, et autres
Publié: (2025)
par: Chitty-Venkata, Krishna Teja, et autres
Publié: (2025)
Extending $μ$P: Spectral Conditions for Feature Learning Across Optimizers
par: Gupta, Akshita, et autres
Publié: (2026)
par: Gupta, Akshita, et autres
Publié: (2026)
BaKlaVa -- Budgeted Allocation of KV cache for Long-context Inference
par: Gulhan, Ahmed Burak, et autres
Publié: (2025)
par: Gulhan, Ahmed Burak, et autres
Publié: (2025)
Towards Energy Efficient Co-Scheduling in HPC
par: Zheng, Zhong, et autres
Publié: (2026)
par: Zheng, Zhong, et autres
Publié: (2026)
AdaParse: An Adaptive Parallel PDF Parsing and Resource Scaling Engine
par: Siebenschuh, Carlo, et autres
Publié: (2025)
par: Siebenschuh, Carlo, et autres
Publié: (2025)
Interpretable Modeling of Deep Reinforcement Learning Driven Scheduling
par: Li, Boyang, et autres
Publié: (2024)
par: Li, Boyang, et autres
Publié: (2024)
An Optimized Error-controlled MPI Collective Framework Integrated with Lossy Compression
par: Huang, Jiajun, et autres
Publié: (2023)
par: Huang, Jiajun, et autres
Publié: (2023)
gZCCL: Compression-Accelerated Collective Communication Framework for GPU Clusters
par: Huang, Jiajun, et autres
Publié: (2023)
par: Huang, Jiajun, et autres
Publié: (2023)
Sketch-Augmented Features Improve Learning Long-Range Dependencies in Graph Neural Networks
par: Hosseini, Ryien, et autres
Publié: (2025)
par: Hosseini, Ryien, et autres
Publié: (2025)
Quality Measures for Dynamic Graph Generative Models
par: Hosseini, Ryien, et autres
Publié: (2025)
par: Hosseini, Ryien, et autres
Publié: (2025)
Topology-Aware Knowledge Propagation in Decentralized Learning
par: Sakarvadia, Mansi, et autres
Publié: (2025)
par: Sakarvadia, Mansi, et autres
Publié: (2025)
ZCCL: Significantly Improving Collective Communication With Error-Bounded Lossy Compression
par: Huang, Jiajun, et autres
Publié: (2025)
par: Huang, Jiajun, et autres
Publié: (2025)
Memory Injections: Correcting Multi-Hop Reasoning Failures during Inference in Transformer-Based Language Models
par: Sakarvadia, Mansi, et autres
Publié: (2023)
par: Sakarvadia, Mansi, et autres
Publié: (2023)
Experiences with Model Context Protocol Servers for Science and High Performance Computing
par: Pan, Haochen, et autres
Publié: (2025)
par: Pan, Haochen, et autres
Publié: (2025)
HiPerRAG: High-Performance Retrieval Augmented Generation for Scientific Insights
par: Gokdemir, Ozan, et autres
Publié: (2025)
par: Gokdemir, Ozan, et autres
Publié: (2025)
Memory-aware Adaptive Scheduling of Scientific Workflows on Heterogeneous Architectures
par: Kulagina, Svetlana, et autres
Publié: (2025)
par: Kulagina, Svetlana, et autres
Publié: (2025)
PagedEviction: Structured Block-wise KV Cache Pruning for Efficient Large Language Model Inference
par: Chitty-Venkata, Krishna Teja, et autres
Publié: (2025)
par: Chitty-Venkata, Krishna Teja, et autres
Publié: (2025)
Flight: A FaaS-Based Framework for Complex and Hierarchical Federated Learning
par: Hudson, Nathaniel, et autres
Publié: (2024)
par: Hudson, Nathaniel, et autres
Publié: (2024)
Steering a Fleet: Adaptation for Large-Scale, Workflow-Based Experiments
par: Pruyne, Jim, et autres
Publié: (2024)
par: Pruyne, Jim, et autres
Publié: (2024)
Trillion Parameter AI Serving Infrastructure for Scientific Discovery: A Survey and Vision
par: Hudson, Nathaniel, et autres
Publié: (2024)
par: Hudson, Nathaniel, et autres
Publié: (2024)
MoE-Inference-Bench: Performance Evaluation of Mixture of Expert Large Language and Vision Models
par: Chitty-Venkata, Krishna Teja, et autres
Publié: (2025)
par: Chitty-Venkata, Krishna Teja, et autres
Publié: (2025)
Documents similaires
-
LLM-Inference-Bench: Inference Benchmarking of Large Language Models on AI Accelerators
par: Chitty-Venkata, Krishna Teja, et autres
Publié: (2024) -
MPI Progress For All
par: Zhou, Hui, et autres
Publié: (2024) -
Frustrated with MPI+Threads? Try MPIxThreads!
par: Zhou, Hui, et autres
Publié: (2024) -
Designing and Prototyping Extensions to MPI in MPICH
par: Zhou, Hui, et autres
Publié: (2024) -
Implementing True MPI Sessions and Evaluating MPI Initialization Scalability
par: Zhou, Hui, et autres
Publié: (2026)