CrashEventLLM: Predicting System Crashes with Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Mudgal, Priyanka, Arbab, Bijan, Kumar, Swaathi Sampath |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Ensemble Method for System Failure Detection Using Large-Scale Telemetry Data
di: Mudgal, Priyanka, et al.
Pubblicazione: (2024)
di: Mudgal, Priyanka, et al.
Pubblicazione: (2024)
Tight Conditions for Binary-Output Tasks under Crashes
di: Albouy, Timothé, et al.
Pubblicazione: (2025)
di: Albouy, Timothé, et al.
Pubblicazione: (2025)
The Task Completion Problem and its Application to Crash-Resilient Computation
di: Fischer, Orr, et al.
Pubblicazione: (2026)
di: Fischer, Orr, et al.
Pubblicazione: (2026)
On the Decidability of Distributed Tasks with Output Sets under Asynchrony and Any Number of Crashes
di: Albouy, Timothé, et al.
Pubblicazione: (2026)
di: Albouy, Timothé, et al.
Pubblicazione: (2026)
Unix Tools and the FITO Category Mistake: Crash Consistency and the Protocol Nature of Persistence
di: Borrill, Paul
Pubblicazione: (2026)
di: Borrill, Paul
Pubblicazione: (2026)
CFT-Forensics: High-Performance Byzantine Accountability for Crash Fault Tolerant Protocols
di: Tang, Weizhao, et al.
Pubblicazione: (2023)
di: Tang, Weizhao, et al.
Pubblicazione: (2023)
Real-Time Driver Safety Scoring Through Inverse Crash Probability Modeling
di: Roy, Joyjit, et al.
Pubblicazione: (2026)
di: Roy, Joyjit, et al.
Pubblicazione: (2026)
BlockLLM: Multi-tenant Finer-grained Serving for Large Language Models
di: Hu, Bodun, et al.
Pubblicazione: (2024)
di: Hu, Bodun, et al.
Pubblicazione: (2024)
Cascadia: An Efficient Cascade Serving System for Large Language Models
di: Jiang, Youhe, et al.
Pubblicazione: (2025)
di: Jiang, Youhe, et al.
Pubblicazione: (2025)
SplitLLM: Hierarchical Split Learning for Large Language Model over Wireless Network
di: Zhang, Songge, et al.
Pubblicazione: (2025)
di: Zhang, Songge, et al.
Pubblicazione: (2025)
SeaLLM: Service-Aware and Latency-Optimized Resource Sharing for Large Language Model Inference
di: Zhao, Yihao, et al.
Pubblicazione: (2025)
di: Zhao, Yihao, et al.
Pubblicazione: (2025)
TokenSim: Enabling Hardware and Software Exploration for Large Language Model Inference Systems
di: Wu, Feiyang, et al.
Pubblicazione: (2025)
di: Wu, Feiyang, et al.
Pubblicazione: (2025)
Disaggregated Prefill and Decoding Inference System for Large Language Model Serving on Multi-Vendor GPUs
di: Chen, Xing, et al.
Pubblicazione: (2025)
di: Chen, Xing, et al.
Pubblicazione: (2025)
Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda
di: Xu, Minxian, et al.
Pubblicazione: (2026)
di: Xu, Minxian, et al.
Pubblicazione: (2026)
Cooling Matters: Benchmarking Large Language Models and Vision-Language Models on Liquid-Cooled Versus Air-Cooled H100 GPU Systems
di: Latif, Imran, et al.
Pubblicazione: (2025)
di: Latif, Imran, et al.
Pubblicazione: (2025)
AIReSim: A Discrete Event Simulator for Large-scale AI Cluster Reliability Modeling
di: Pattabiraman, Karthik, et al.
Pubblicazione: (2026)
di: Pattabiraman, Karthik, et al.
Pubblicazione: (2026)
Predictable LLM Serving on GPU Clusters
di: Darzi, Erfan, et al.
Pubblicazione: (2025)
di: Darzi, Erfan, et al.
Pubblicazione: (2025)
Offline Energy-Optimal LLM Serving: Workload-Based Energy Models for LLM Inference on Heterogeneous Systems
di: Wilkins, Grant, et al.
Pubblicazione: (2024)
di: Wilkins, Grant, et al.
Pubblicazione: (2024)
Comparative Study of Large Language Model Architectures on Frontier
di: Yin, Junqi, et al.
Pubblicazione: (2024)
di: Yin, Junqi, et al.
Pubblicazione: (2024)
SLO-Aware Scheduling for Large Language Model Inferences
di: Huang, Jinqi, et al.
Pubblicazione: (2025)
di: Huang, Jinqi, et al.
Pubblicazione: (2025)
SPIN: Accelerating Large Language Model Inference with Heterogeneous Speculative Models
di: Chen, Fahao, et al.
Pubblicazione: (2025)
di: Chen, Fahao, et al.
Pubblicazione: (2025)
DeepServe: Serverless Large Language Model Serving at Scale
di: Hu, Junhao, et al.
Pubblicazione: (2025)
di: Hu, Junhao, et al.
Pubblicazione: (2025)
Characterizing Communication Patterns in Distributed Large Language Model Inference
di: Xu, Lang, et al.
Pubblicazione: (2025)
di: Xu, Lang, et al.
Pubblicazione: (2025)
Split Fine-Tuning for Large Language Models in Wireless Networks
di: Zhang, Songge, et al.
Pubblicazione: (2025)
di: Zhang, Songge, et al.
Pubblicazione: (2025)
LLM-assisted Agentic Edge Intelligence Framework
di: Dehury, Chinmaya Kumar, et al.
Pubblicazione: (2026)
di: Dehury, Chinmaya Kumar, et al.
Pubblicazione: (2026)
Benchmarking the Performance of Large Language Models on the Cerebras Wafer Scale Engine
di: Zhang, Zuoning, et al.
Pubblicazione: (2024)
di: Zhang, Zuoning, et al.
Pubblicazione: (2024)
NanoFlow: Towards Optimal Large Language Model Serving Throughput
di: Zhu, Kan, et al.
Pubblicazione: (2024)
di: Zhu, Kan, et al.
Pubblicazione: (2024)
Minions: Accelerating Large Language Model Inference with Aggregated Speculative Execution
di: Wang, Siqi, et al.
Pubblicazione: (2024)
di: Wang, Siqi, et al.
Pubblicazione: (2024)
A Review on Edge Large Language Models: Design, Execution, and Applications
di: Zheng, Yue, et al.
Pubblicazione: (2024)
di: Zheng, Yue, et al.
Pubblicazione: (2024)
Efficient Training of Large Language Models on Distributed Infrastructures: A Survey
di: Duan, Jiangfei, et al.
Pubblicazione: (2024)
di: Duan, Jiangfei, et al.
Pubblicazione: (2024)
Developing an Interactive OpenMP Programming Book with Large Language Models
di: Yi, Xinyao, et al.
Pubblicazione: (2024)
di: Yi, Xinyao, et al.
Pubblicazione: (2024)
Memory Offloading for Large Language Model Inference with Latency SLO Guarantees
di: Ma, Chenxiang, et al.
Pubblicazione: (2025)
di: Ma, Chenxiang, et al.
Pubblicazione: (2025)
FLYING SERVING: On-the-Fly Parallelism Switching for Large Language Model Serving
di: Gao, Shouwei, et al.
Pubblicazione: (2026)
di: Gao, Shouwei, et al.
Pubblicazione: (2026)
Pier: Efficient Large Language Model pretraining with Relaxed Global Communication
di: Fan, Shuyuan, et al.
Pubblicazione: (2025)
di: Fan, Shuyuan, et al.
Pubblicazione: (2025)
Network Edge Inference for Large Language Models: Principles, Techniques, and Opportunities
di: Chen, Zhixiong, et al.
Pubblicazione: (2026)
di: Chen, Zhixiong, et al.
Pubblicazione: (2026)
DistTrain: Addressing Model and Data Heterogeneity with Disaggregated Training for Multimodal Large Language Models
di: Zhang, Zili, et al.
Pubblicazione: (2024)
di: Zhang, Zili, et al.
Pubblicazione: (2024)
Kavier: Exploring Performance, Sustainability, and Efficiency of LLM Ecosystems under Inference through Cache-Aware Discrete-Event Simulation
di: Nicolae, Radu, et al.
Pubblicazione: (2026)
di: Nicolae, Radu, et al.
Pubblicazione: (2026)
Cloud Native System for LLM Inference Serving
di: Xu, Minxian, et al.
Pubblicazione: (2025)
di: Xu, Minxian, et al.
Pubblicazione: (2025)
OCEP: An Ontology-Based Complex Event Processing Framework for Healthcare Decision Support in Big Data Analytics
di: Chandra, Ritesh, et al.
Pubblicazione: (2025)
di: Chandra, Ritesh, et al.
Pubblicazione: (2025)
HexiScale: Facilitating Large Language Model Training over Heterogeneous Hardware
di: Yan, Ran, et al.
Pubblicazione: (2024)
di: Yan, Ran, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Ensemble Method for System Failure Detection Using Large-Scale Telemetry Data
di: Mudgal, Priyanka, et al.
Pubblicazione: (2024) -
Tight Conditions for Binary-Output Tasks under Crashes
di: Albouy, Timothé, et al.
Pubblicazione: (2025) -
The Task Completion Problem and its Application to Crash-Resilient Computation
di: Fischer, Orr, et al.
Pubblicazione: (2026) -
On the Decidability of Distributed Tasks with Output Sets under Asynchrony and Any Number of Crashes
di: Albouy, Timothé, et al.
Pubblicazione: (2026) -
Unix Tools and the FITO Category Mistake: Crash Consistency and the Protocol Nature of Persistence
di: Borrill, Paul
Pubblicazione: (2026)