Towards Robust LLM Post-Training: Automatic Failure Management for Reinforcement Fine-Tuning
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Zhang, Lingzhe, Jia, Tong, Zhai, Yunpeng, Fang, Liancheng, Zheng, Kening, Liu, Hongyi, Huang, Xiaosong, Yu, Philip S., Li, Ying |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
AgentFM: Role-Aware Failure Management for Distributed Databases with LLM-Driven Multi-Agents
von: Zhang, Lingzhe, et al.
Veröffentlicht: (2025)
von: Zhang, Lingzhe, et al.
Veröffentlicht: (2025)
ThinkFL: Self-Refining Failure Localization for Microservice Systems via Reinforcement Fine-Tuning
von: Zhang, Lingzhe, et al.
Veröffentlicht: (2025)
von: Zhang, Lingzhe, et al.
Veröffentlicht: (2025)
E2E-REME: Towards End-to-End Microservices Auto-Remediation via Experience-Simulation Reinforcement Fine-Tuning
von: Zhang, Lingzhe, et al.
Veröffentlicht: (2026)
von: Zhang, Lingzhe, et al.
Veröffentlicht: (2026)
LogDB: Multivariate Log-based Failure Diagnosis for Distributed Databases (Extended from MultiLog)
von: Zhang, Lingzhe, et al.
Veröffentlicht: (2025)
von: Zhang, Lingzhe, et al.
Veröffentlicht: (2025)
A Survey of AIOps for Failure Management in the Era of Large Language Models
von: Zhang, Lingzhe, et al.
Veröffentlicht: (2024)
von: Zhang, Lingzhe, et al.
Veröffentlicht: (2024)
Agentic Memory Enhanced Recursive Reasoning for Root Cause Localization in Microservices
von: Zhang, Lingzhe, et al.
Veröffentlicht: (2026)
von: Zhang, Lingzhe, et al.
Veröffentlicht: (2026)
RuntimeSlicer: Towards Generalizable Unified Runtime State Representation for Failure Management
von: Zhang, Lingzhe, et al.
Veröffentlicht: (2026)
von: Zhang, Lingzhe, et al.
Veröffentlicht: (2026)
Hypothesize-Then-Verify: Speculative Root Cause Analysis for Microservices with Pathwise Parallelism
von: Zhang, Lingzhe, et al.
Veröffentlicht: (2026)
von: Zhang, Lingzhe, et al.
Veröffentlicht: (2026)
From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery
von: Zhang, Lingzhe, et al.
Veröffentlicht: (2026)
von: Zhang, Lingzhe, et al.
Veröffentlicht: (2026)
Efficient Failure Management for Multi-Agent Systems with Reasoning Trace Representation
von: Zhang, Lingzhe, et al.
Veröffentlicht: (2026)
von: Zhang, Lingzhe, et al.
Veröffentlicht: (2026)
Multivariate Log-based Anomaly Detection for Distributed Database
von: Zhang, Lingzhe, et al.
Veröffentlicht: (2024)
von: Zhang, Lingzhe, et al.
Veröffentlicht: (2024)
MicroRemed: Benchmarking LLMs in Microservices Remediation
von: Zhang, Lingzhe, et al.
Veröffentlicht: (2025)
von: Zhang, Lingzhe, et al.
Veröffentlicht: (2025)
Reducing Events to Augment Log-based Anomaly Detection Models: An Empirical Study
von: Zhang, Lingzhe, et al.
Veröffentlicht: (2024)
von: Zhang, Lingzhe, et al.
Veröffentlicht: (2024)
Adaptive Root Cause Localization for Microservice Systems with Multi-Agent Recursion-of-Thought
von: Zhang, Lingzhe, et al.
Veröffentlicht: (2025)
von: Zhang, Lingzhe, et al.
Veröffentlicht: (2025)
United We Stand: Towards End-to-End Log-based Fault Diagnosis via Interactive Multi-Task Learning
von: He, Minghua, et al.
Veröffentlicht: (2025)
von: He, Minghua, et al.
Veröffentlicht: (2025)
A Survey of AIOps in the Era of Large Language Models
von: Zhang, Lingzhe, et al.
Veröffentlicht: (2025)
von: Zhang, Lingzhe, et al.
Veröffentlicht: (2025)
Towards LLM-Based Automatic Playtest
von: Zhao, Yan, et al.
Veröffentlicht: (2025)
von: Zhao, Yan, et al.
Veröffentlicht: (2025)
Towards In-Depth Root Cause Localization for Microservices with Multi-Agent Recursion-of-Thought
von: Zhang, Lingzhe, et al.
Veröffentlicht: (2026)
von: Zhang, Lingzhe, et al.
Veröffentlicht: (2026)
Walk the Talk: Is Your Log-based Software Reliability Maintenance System Really Reliable?
von: He, Minghua, et al.
Veröffentlicht: (2025)
von: He, Minghua, et al.
Veröffentlicht: (2025)
MCTS-Refined CoT: High-Quality Fine-Tuning Data for LLM-Based Repository Issue Resolution
von: Wang, Yibo, et al.
Veröffentlicht: (2025)
von: Wang, Yibo, et al.
Veröffentlicht: (2025)
PostTrainBench: Can LLM Agents Automate LLM Post-Training?
von: Rank, Ben, et al.
Veröffentlicht: (2026)
von: Rank, Ben, et al.
Veröffentlicht: (2026)
VarParser: Unleashing the Neglected Power of Variables for LLM-based Log Parsing
von: Sun, Jinrui, et al.
Veröffentlicht: (2026)
von: Sun, Jinrui, et al.
Veröffentlicht: (2026)
LIA: Supervised Fine-Tuning of Large Language Models for Automatic Issue Assignment
von: Khosravani, Arsham, et al.
Veröffentlicht: (2026)
von: Khosravani, Arsham, et al.
Veröffentlicht: (2026)
Accelerating Automatic Program Repair with Dual Retrieval-Augmented Fine-Tuning and Patch Generation on Large Language Models
von: Guo, Hanyang, et al.
Veröffentlicht: (2025)
von: Guo, Hanyang, et al.
Veröffentlicht: (2025)
Fine Tuning LLM for Enterprise: Practical Guidelines and Recommendations
von: J, Mathav Raj, et al.
Veröffentlicht: (2024)
von: J, Mathav Raj, et al.
Veröffentlicht: (2024)
Assessing, Exploiting, and Mitigating Syntactic Robustness Failures in LLM-Based Code Generation
von: Sarker, Laboni, et al.
Veröffentlicht: (2024)
von: Sarker, Laboni, et al.
Veröffentlicht: (2024)
Adversarial Robustness of Open-source Text Classification Models and Fine-Tuning Chains
von: Qin, Hao, et al.
Veröffentlicht: (2024)
von: Qin, Hao, et al.
Veröffentlicht: (2024)
Improving Deep Assertion Generation via Fine-Tuning Retrieval-Augmented Pre-trained Language Models
von: Zhang, Quanjun, et al.
Veröffentlicht: (2025)
von: Zhang, Quanjun, et al.
Veröffentlicht: (2025)
Sifting the Noise: A Comparative Study of LLM Agents in Vulnerability False Positive Filtering
von: Xiong, Yunpeng, et al.
Veröffentlicht: (2026)
von: Xiong, Yunpeng, et al.
Veröffentlicht: (2026)
Beyond Verifiable Rewards: Rubric-Based GRM for Reinforced Fine-Tuning SWE Agents
von: Huang, Jiawei, et al.
Veröffentlicht: (2026)
von: Huang, Jiawei, et al.
Veröffentlicht: (2026)
Unlock the Correlation between Supervised Fine-Tuning and Reinforcement Learning in Training Code Large Language Models
von: Chen, Jie, et al.
Veröffentlicht: (2024)
von: Chen, Jie, et al.
Veröffentlicht: (2024)
Combining Fine-Tuning and LLM-based Agents for Intuitive Smart Contract Auditing with Justifications
von: Ma, Wei, et al.
Veröffentlicht: (2024)
von: Ma, Wei, et al.
Veröffentlicht: (2024)
Boosting Automatic Java-to-Cangjie Translation with Multi-Stage LLM Training and Error Repair
von: Liang, Xinyue, et al.
Veröffentlicht: (2026)
von: Liang, Xinyue, et al.
Veröffentlicht: (2026)
Delving into Parameter-Efficient Fine-Tuning in Code Change Learning: An Empirical Study
von: Liu, Shuo, et al.
Veröffentlicht: (2024)
von: Liu, Shuo, et al.
Veröffentlicht: (2024)
HarnessLLM: Automatic Testing Harness Generation via Reinforcement Learning
von: Liu, Yujian, et al.
Veröffentlicht: (2025)
von: Liu, Yujian, et al.
Veröffentlicht: (2025)
RepairLLaMA: Efficient Representations and Fine-Tuned Adapters for Program Repair
von: Silva, André, et al.
Veröffentlicht: (2023)
von: Silva, André, et al.
Veröffentlicht: (2023)
Willful Disobedience: Automatically Detecting Failures in Agentic Traces
von: Sharma, Reshabh K, et al.
Veröffentlicht: (2026)
von: Sharma, Reshabh K, et al.
Veröffentlicht: (2026)
Exploring and Lifting the Robustness of LLM-powered Automated Program Repair with Metamorphic Testing
von: Xue, Pengyu, et al.
Veröffentlicht: (2024)
von: Xue, Pengyu, et al.
Veröffentlicht: (2024)
SoRFT: Issue Resolving with Subtask-oriented Reinforced Fine-Tuning
von: Ma, Zexiong, et al.
Veröffentlicht: (2025)
von: Ma, Zexiong, et al.
Veröffentlicht: (2025)
When Fine-Tuning LLMs Meets Data Privacy: An Empirical Study of Federated Learning in LLM-Based Program Repair
von: Luo, Wenqiang, et al.
Veröffentlicht: (2024)
von: Luo, Wenqiang, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
AgentFM: Role-Aware Failure Management for Distributed Databases with LLM-Driven Multi-Agents
von: Zhang, Lingzhe, et al.
Veröffentlicht: (2025) -
ThinkFL: Self-Refining Failure Localization for Microservice Systems via Reinforcement Fine-Tuning
von: Zhang, Lingzhe, et al.
Veröffentlicht: (2025) -
E2E-REME: Towards End-to-End Microservices Auto-Remediation via Experience-Simulation Reinforcement Fine-Tuning
von: Zhang, Lingzhe, et al.
Veröffentlicht: (2026) -
LogDB: Multivariate Log-based Failure Diagnosis for Distributed Databases (Extended from MultiLog)
von: Zhang, Lingzhe, et al.
Veröffentlicht: (2025) -
A Survey of AIOps for Failure Management in the Era of Large Language Models
von: Zhang, Lingzhe, et al.
Veröffentlicht: (2024)