A Survey of AIOps for Failure Management in the Era of Large Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Zhang, Lingzhe, Jia, Tong, Jia, Mengxi, Wu, Yifan, Liu, Aiwei, Yang, Yong, Wu, Zhonghai, Hu, Xuming, Yu, Philip S., Li, Ying |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
A Survey of AIOps in the Era of Large Language Models
von: Zhang, Lingzhe, et al.
Veröffentlicht: (2025)
von: Zhang, Lingzhe, et al.
Veröffentlicht: (2025)
Multivariate Log-based Anomaly Detection for Distributed Database
von: Zhang, Lingzhe, et al.
Veröffentlicht: (2024)
von: Zhang, Lingzhe, et al.
Veröffentlicht: (2024)
LogDB: Multivariate Log-based Failure Diagnosis for Distributed Databases (Extended from MultiLog)
von: Zhang, Lingzhe, et al.
Veröffentlicht: (2025)
von: Zhang, Lingzhe, et al.
Veröffentlicht: (2025)
Reducing Events to Augment Log-based Anomaly Detection Models: An Empirical Study
von: Zhang, Lingzhe, et al.
Veröffentlicht: (2024)
von: Zhang, Lingzhe, et al.
Veröffentlicht: (2024)
ThinkFL: Self-Refining Failure Localization for Microservice Systems via Reinforcement Fine-Tuning
von: Zhang, Lingzhe, et al.
Veröffentlicht: (2025)
von: Zhang, Lingzhe, et al.
Veröffentlicht: (2025)
AgentFM: Role-Aware Failure Management for Distributed Databases with LLM-Driven Multi-Agents
von: Zhang, Lingzhe, et al.
Veröffentlicht: (2025)
von: Zhang, Lingzhe, et al.
Veröffentlicht: (2025)
Empowering AIOps: Leveraging Large Language Models for IT Operations Management
von: Vitui, Arthur, et al.
Veröffentlicht: (2025)
von: Vitui, Arthur, et al.
Veröffentlicht: (2025)
Towards Robust LLM Post-Training: Automatic Failure Management for Reinforcement Fine-Tuning
von: Zhang, Lingzhe, et al.
Veröffentlicht: (2026)
von: Zhang, Lingzhe, et al.
Veröffentlicht: (2026)
Agentic Memory Enhanced Recursive Reasoning for Root Cause Localization in Microservices
von: Zhang, Lingzhe, et al.
Veröffentlicht: (2026)
von: Zhang, Lingzhe, et al.
Veröffentlicht: (2026)
Walk the Talk: Is Your Log-based Software Reliability Maintenance System Really Reliable?
von: He, Minghua, et al.
Veröffentlicht: (2025)
von: He, Minghua, et al.
Veröffentlicht: (2025)
Efficient Failure Management for Multi-Agent Systems with Reasoning Trace Representation
von: Zhang, Lingzhe, et al.
Veröffentlicht: (2026)
von: Zhang, Lingzhe, et al.
Veröffentlicht: (2026)
A Benchmark for Language Models in Real-World System Building
von: Jin, Weilin, et al.
Veröffentlicht: (2026)
von: Jin, Weilin, et al.
Veröffentlicht: (2026)
RuntimeSlicer: Towards Generalizable Unified Runtime State Representation for Failure Management
von: Zhang, Lingzhe, et al.
Veröffentlicht: (2026)
von: Zhang, Lingzhe, et al.
Veröffentlicht: (2026)
United We Stand: Towards End-to-End Log-based Fault Diagnosis via Interactive Multi-Task Learning
von: He, Minghua, et al.
Veröffentlicht: (2025)
von: He, Minghua, et al.
Veröffentlicht: (2025)
McUDI: Model-Centric Unsupervised Degradation Indicator for Failure Prediction AIOps Solutions
von: Poenaru-Olaru, Lorena, et al.
Veröffentlicht: (2024)
von: Poenaru-Olaru, Lorena, et al.
Veröffentlicht: (2024)
On the Model Update Strategies for Supervised Learning in AIOps Solutions
von: Lyu, Yingzhe, et al.
Veröffentlicht: (2023)
von: Lyu, Yingzhe, et al.
Veröffentlicht: (2023)
A Survey on the Application of Large Language Models in Scenario-Based Testing of Automated Driving Systems
von: Zhao, Yongqi, et al.
Veröffentlicht: (2025)
von: Zhao, Yongqi, et al.
Veröffentlicht: (2025)
Adaptive Root Cause Localization for Microservice Systems with Multi-Agent Recursion-of-Thought
von: Zhang, Lingzhe, et al.
Veröffentlicht: (2025)
von: Zhang, Lingzhe, et al.
Veröffentlicht: (2025)
A Survey on Evaluating Large Language Models in Code Generation Tasks
von: Chen, Liguo, et al.
Veröffentlicht: (2024)
von: Chen, Liguo, et al.
Veröffentlicht: (2024)
The Current Challenges of Software Engineering in the Era of Large Language Models
von: Gao, Cuiyun, et al.
Veröffentlicht: (2024)
von: Gao, Cuiyun, et al.
Veröffentlicht: (2024)
Can We Recycle Our Old Models? An Empirical Evaluation of Model Selection Mechanisms for AIOps Solutions
von: Lyu, Yingzhe, et al.
Veröffentlicht: (2025)
von: Lyu, Yingzhe, et al.
Veröffentlicht: (2025)
Program Slicing in the Era of Large Language Models
von: Shahandashti, Kimya Khakzad, et al.
Veröffentlicht: (2024)
von: Shahandashti, Kimya Khakzad, et al.
Veröffentlicht: (2024)
E2E-REME: Towards End-to-End Microservices Auto-Remediation via Experience-Simulation Reinforcement Fine-Tuning
von: Zhang, Lingzhe, et al.
Veröffentlicht: (2026)
von: Zhang, Lingzhe, et al.
Veröffentlicht: (2026)
Hypothesize-Then-Verify: Speculative Root Cause Analysis for Microservices with Pathwise Parallelism
von: Zhang, Lingzhe, et al.
Veröffentlicht: (2026)
von: Zhang, Lingzhe, et al.
Veröffentlicht: (2026)
A Survey on Large Language Models for Software Engineering
von: Zhang, Quanjun, et al.
Veröffentlicht: (2023)
von: Zhang, Quanjun, et al.
Veröffentlicht: (2023)
Prepared for the Unknown: Adapting AIOps Capacity Forecasting Models to Data Changes
von: Poenaru-Olaru, Lorena, et al.
Veröffentlicht: (2025)
von: Poenaru-Olaru, Lorena, et al.
Veröffentlicht: (2025)
Explaining GitHub Actions Failures with Large Language Models: Challenges, Insights, and Limitations
von: Valenzuela-Toledo, Pablo, et al.
Veröffentlicht: (2025)
von: Valenzuela-Toledo, Pablo, et al.
Veröffentlicht: (2025)
Log Parsing using LLMs with Self-Generated In-Context Learning and Self-Correction
von: Wu, Yifan, et al.
Veröffentlicht: (2024)
von: Wu, Yifan, et al.
Veröffentlicht: (2024)
Revisiting Unnaturalness for Automated Program Repair in the Era of Large Language Models
von: Yang, Aidan Z. H., et al.
Veröffentlicht: (2024)
von: Yang, Aidan Z. H., et al.
Veröffentlicht: (2024)
Can Large Language Models Serve as Evaluators for Code Summarization?
von: Wu, Yang, et al.
Veröffentlicht: (2024)
von: Wu, Yang, et al.
Veröffentlicht: (2024)
AIOps Solutions for Incident Management: Technical Guidelines and A Comprehensive Literature Review
von: Remil, Youcef, et al.
Veröffentlicht: (2024)
von: Remil, Youcef, et al.
Veröffentlicht: (2024)
Leveraging Large Language Models for Predicting Cost and Duration in Software Engineering Projects
von: Carpenter, Justin, et al.
Veröffentlicht: (2024)
von: Carpenter, Justin, et al.
Veröffentlicht: (2024)
Revisiting Sentiment Analysis for Software Engineering in the Era of Large Language Models
von: Zhang, Ting, et al.
Veröffentlicht: (2023)
von: Zhang, Ting, et al.
Veröffentlicht: (2023)
Practical Program Repair in the Era of Large Pre-trained Language Models
von: Xia, Chunqiu Steven, et al.
Veröffentlicht: (2022)
von: Xia, Chunqiu Steven, et al.
Veröffentlicht: (2022)
Computational Thinking Reasoning in Large Language Models
von: Zhang, Kechi, et al.
Veröffentlicht: (2025)
von: Zhang, Kechi, et al.
Veröffentlicht: (2025)
Redefining Crowdsourced Test Report Prioritization: An Innovative Approach with Large Language Model
von: Ling, Yuchen, et al.
Veröffentlicht: (2024)
von: Ling, Yuchen, et al.
Veröffentlicht: (2024)
Unlocking the Power of Numbers: Log Compression via Numeric Token Parsing
von: Yu, Siyu, et al.
Veröffentlicht: (2024)
von: Yu, Siyu, et al.
Veröffentlicht: (2024)
Using Large Language Models to Support Automation of Failure Management in CI/CD Pipelines: A Case Study in SAP HANA
von: Bui, Duong, et al.
Veröffentlicht: (2026)
von: Bui, Duong, et al.
Veröffentlicht: (2026)
A Survey: Collaborative Hardware and Software Design in the Era of Large Language Models
von: Guo, Cong, et al.
Veröffentlicht: (2024)
von: Guo, Cong, et al.
Veröffentlicht: (2024)
VarParser: Unleashing the Neglected Power of Variables for LLM-based Log Parsing
von: Sun, Jinrui, et al.
Veröffentlicht: (2026)
von: Sun, Jinrui, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
A Survey of AIOps in the Era of Large Language Models
von: Zhang, Lingzhe, et al.
Veröffentlicht: (2025) -
Multivariate Log-based Anomaly Detection for Distributed Database
von: Zhang, Lingzhe, et al.
Veröffentlicht: (2024) -
LogDB: Multivariate Log-based Failure Diagnosis for Distributed Databases (Extended from MultiLog)
von: Zhang, Lingzhe, et al.
Veröffentlicht: (2025) -
Reducing Events to Augment Log-based Anomaly Detection Models: An Empirical Study
von: Zhang, Lingzhe, et al.
Veröffentlicht: (2024) -
ThinkFL: Self-Refining Failure Localization for Microservice Systems via Reinforcement Fine-Tuning
von: Zhang, Lingzhe, et al.
Veröffentlicht: (2025)