Adaptive Fault Tolerance Mechanisms of Large Language Models in Cloud Computing Environments
Fuente:
arXiv
Salvato in:
| Autori principali: | Jin, Yihong, Yang, Ze, Xu, Xinhe, Zhang, Yihan, Ji, Shuyang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
TierCheck: Tiered Checkpointing for Fault Tolerance in Large Language Model Training
di: Han, Shujie, et al.
Pubblicazione: (2026)
di: Han, Shujie, et al.
Pubblicazione: (2026)
Cloud-Based AI Systems: Leveraging Large Language Models for Intelligent Fault Detection and Autonomous Self-Healing
di: Ji, Cheng, et al.
Pubblicazione: (2025)
di: Ji, Cheng, et al.
Pubblicazione: (2025)
Leveraging Large Language Model for Intelligent Log Processing and Autonomous Debugging in Cloud AI Platforms
di: Ji, Cheng, et al.
Pubblicazione: (2025)
di: Ji, Cheng, et al.
Pubblicazione: (2025)
Scam Detection for Ethereum Smart Contracts: Leveraging Graph Representation Learning for Secure Blockchain
di: Jin, Yihong, et al.
Pubblicazione: (2024)
di: Jin, Yihong, et al.
Pubblicazione: (2024)
Training LLMs with Fault Tolerant HSDP on 100,000 GPUs
di: Salpekar, Omkar, et al.
Pubblicazione: (2026)
di: Salpekar, Omkar, et al.
Pubblicazione: (2026)
Scalability Optimization in Cloud-Based AI Inference Services: Strategies for Real-Time Load Balancing and Automated Scaling
di: Jin, Yihong, et al.
Pubblicazione: (2025)
di: Jin, Yihong, et al.
Pubblicazione: (2025)
Nightjar: Dynamic Adaptive Speculative Decoding for Large Language Models Serving
di: Li, Rui, et al.
Pubblicazione: (2025)
di: Li, Rui, et al.
Pubblicazione: (2025)
Cloud Atlas: Efficient Fault Localization for Cloud Systems using Language Models and Causal Insight
di: Xie, Zhiqiang, et al.
Pubblicazione: (2024)
di: Xie, Zhiqiang, et al.
Pubblicazione: (2024)
ReCoVer: Resilient LLM Pre-Training System via Fault-Tolerant Collective and Versatile Workload
di: Liu, Ziyue, et al.
Pubblicazione: (2026)
di: Liu, Ziyue, et al.
Pubblicazione: (2026)
Data-Juicer 2.0: Cloud-Scale Adaptive Data Processing for and with Foundation Models
di: Chen, Daoyuan, et al.
Pubblicazione: (2024)
di: Chen, Daoyuan, et al.
Pubblicazione: (2024)
Byzantine Fault-Tolerant Multi-Agent System for Healthcare: A Gossip Protocol Approach to Secure Medical Message Propagation
di: Chadderwala, Nihir
Pubblicazione: (2025)
di: Chadderwala, Nihir
Pubblicazione: (2025)
FogROS2-FT: Fault Tolerant Cloud Robotics
di: Chen, Kaiyuan, et al.
Pubblicazione: (2024)
di: Chen, Kaiyuan, et al.
Pubblicazione: (2024)
AI-Driven Cloud Resource Optimization for Multi-Cluster Environments
di: Punniyamoorthy, Vinoth, et al.
Pubblicazione: (2025)
di: Punniyamoorthy, Vinoth, et al.
Pubblicazione: (2025)
Deep Reinforcement Learning for Fault-Adaptive Routing in Eisenstein-Jacobi Interconnection Topologies
di: Charrwi, Mohammad Walid, et al.
Pubblicazione: (2026)
di: Charrwi, Mohammad Walid, et al.
Pubblicazione: (2026)
GhostServe: A Lightweight Checkpointing System in the Shadow for Fault-Tolerant LLM Serving
di: Jayakody, Shakya, et al.
Pubblicazione: (2026)
di: Jayakody, Shakya, et al.
Pubblicazione: (2026)
Combining Cloud and Mobile Computing for Machine Learning
di: Xu, Ruiqi, et al.
Pubblicazione: (2024)
di: Xu, Ruiqi, et al.
Pubblicazione: (2024)
AIBrix: Towards Scalable, Cost-Effective Large Language Model Inference Infrastructure
di: The AIBrix Team, et al.
Pubblicazione: (2025)
di: The AIBrix Team, et al.
Pubblicazione: (2025)
Role-Based Fault Tolerance System for LLM RL Post-Training
di: Chen, Zhenqian, et al.
Pubblicazione: (2025)
di: Chen, Zhenqian, et al.
Pubblicazione: (2025)
A Meta-Heuristic Load Balancer for Cloud Computing Systems
di: Sliwko, Leszek, et al.
Pubblicazione: (2025)
di: Sliwko, Leszek, et al.
Pubblicazione: (2025)
Adaptive AI-based Decentralized Resource Management in the Cloud-Edge Continuum
di: Li, Lanpei, et al.
Pubblicazione: (2025)
di: Li, Lanpei, et al.
Pubblicazione: (2025)
Dynamic Scheduling Strategies for Resource Optimization in Computing Environments
di: Wang, Xiaoye
Pubblicazione: (2024)
di: Wang, Xiaoye
Pubblicazione: (2024)
CloudEval-YAML: A Practical Benchmark for Cloud Configuration Generation
di: Xu, Yifei, et al.
Pubblicazione: (2023)
di: Xu, Yifei, et al.
Pubblicazione: (2023)
Research on Model Parallelism and Data Parallelism Optimization Methods in Large Language Model-Based Recommendation Systems
di: Yang, Haowei, et al.
Pubblicazione: (2025)
di: Yang, Haowei, et al.
Pubblicazione: (2025)
Scaling Large Language Model Training on Frontier with Low-Bandwidth Partitioning
di: Xu, Lang, et al.
Pubblicazione: (2025)
di: Xu, Lang, et al.
Pubblicazione: (2025)
Training Overhead Ratio: A Practical Reliability Metric for Large Language Model Training Systems
di: Lu, Ning, et al.
Pubblicazione: (2024)
di: Lu, Ning, et al.
Pubblicazione: (2024)
Accelerating Large Language Model Training with Hybrid GPU-based Compression
di: Xu, Lang, et al.
Pubblicazione: (2024)
di: Xu, Lang, et al.
Pubblicazione: (2024)
KVCache Cache in the Wild: Characterizing and Optimizing KVCache Cache at a Large Cloud Provider
di: Wang, Jiahao, et al.
Pubblicazione: (2025)
di: Wang, Jiahao, et al.
Pubblicazione: (2025)
SpecEE: Accelerating Large Language Model Inference with Speculative Early Exiting
di: Xu, Jiaming, et al.
Pubblicazione: (2025)
di: Xu, Jiaming, et al.
Pubblicazione: (2025)
Scaling Performance of Large Language Model Pretraining
di: Interrante-Grant, Alexander, et al.
Pubblicazione: (2025)
di: Interrante-Grant, Alexander, et al.
Pubblicazione: (2025)
Equinox: Holistic Fair Scheduling in Serving Large Language Models
di: Wei, Zhixiang, et al.
Pubblicazione: (2025)
di: Wei, Zhixiang, et al.
Pubblicazione: (2025)
A Survey on Large Language Model Acceleration based on KV Cache Management
di: Li, Haoyang, et al.
Pubblicazione: (2024)
di: Li, Haoyang, et al.
Pubblicazione: (2024)
FT-Transformer: Resilient and Reliable Transformer with End-to-End Fault Tolerant Attention
di: Dai, Huangliang, et al.
Pubblicazione: (2025)
di: Dai, Huangliang, et al.
Pubblicazione: (2025)
TimelyFreeze: Adaptive Parameter Freezing Mechanism for Pipeline Parallelism
di: Cho, Seonghye, et al.
Pubblicazione: (2026)
di: Cho, Seonghye, et al.
Pubblicazione: (2026)
Deep Reinforcement Learning for Job Scheduling and Resource Management in Cloud Computing: An Algorithm-Level Review
di: Gu, Yan, et al.
Pubblicazione: (2025)
di: Gu, Yan, et al.
Pubblicazione: (2025)
Can Large Language Models Write Parallel Code?
di: Nichols, Daniel, et al.
Pubblicazione: (2024)
di: Nichols, Daniel, et al.
Pubblicazione: (2024)
Hierarchical Autoscaling for Large Language Model Serving with Chiron
di: Patke, Archit, et al.
Pubblicazione: (2025)
di: Patke, Archit, et al.
Pubblicazione: (2025)
Efficient Multi-Model Orchestration for Self-Hosted Large Language Models
di: Vangala, Bhanu Prakash, et al.
Pubblicazione: (2025)
di: Vangala, Bhanu Prakash, et al.
Pubblicazione: (2025)
HPC-Coder: Modeling Parallel Programs using Large Language Models
di: Nichols, Daniel, et al.
Pubblicazione: (2023)
di: Nichols, Daniel, et al.
Pubblicazione: (2023)
OrchMLLM: Orchestrate Multimodal Data with Batch Post-Balancing to Accelerate Multimodal Large Language Model Training
di: Zheng, Yijie, et al.
Pubblicazione: (2025)
di: Zheng, Yijie, et al.
Pubblicazione: (2025)
Domain-Adaptive Model Merging Across Disconnected Modes
di: Liu, Junming, et al.
Pubblicazione: (2026)
di: Liu, Junming, et al.
Pubblicazione: (2026)
Documenti analoghi
-
TierCheck: Tiered Checkpointing for Fault Tolerance in Large Language Model Training
di: Han, Shujie, et al.
Pubblicazione: (2026) -
Cloud-Based AI Systems: Leveraging Large Language Models for Intelligent Fault Detection and Autonomous Self-Healing
di: Ji, Cheng, et al.
Pubblicazione: (2025) -
Leveraging Large Language Model for Intelligent Log Processing and Autonomous Debugging in Cloud AI Platforms
di: Ji, Cheng, et al.
Pubblicazione: (2025) -
Scam Detection for Ethereum Smart Contracts: Leveraging Graph Representation Learning for Secure Blockchain
di: Jin, Yihong, et al.
Pubblicazione: (2024) -
Training LLMs with Fault Tolerant HSDP on 100,000 GPUs
di: Salpekar, Omkar, et al.
Pubblicazione: (2026)