Drift-Bench: Diagnosing Cooperative Breakdowns in LLM Agents under Input Faults via Multi-Turn Interaction
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Bao, Han, Zhang, Zheyuan, Jing, Pengcheng, Yuan, Zhengqing, Shi, Kaiwen, Ye, Yanfang |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
An Empirical Study of Interaction Smells in Multi-Turn Human-LLM Collaborative Code Generation
par: Zhang, Binquan, et autres
Publié: (2026)
par: Zhang, Binquan, et autres
Publié: (2026)
NG-Router: Graph-Supervised Multi-Agent Collaboration for Nutrition Question Answering
par: Shi, Kaiwen, et autres
Publié: (2025)
par: Shi, Kaiwen, et autres
Publié: (2025)
AgentRouter: A Knowledge-Graph-Guided LLM Router for Collaborative Multi-Agent Question Answering
par: Zhang, Zheyuan, et autres
Publié: (2025)
par: Zhang, Zheyuan, et autres
Publié: (2025)
Food4All: A Multi-Agent Framework for Real-time Free Food Discovery with Integrated Nutritional Metadata
par: Yuan, Zhengqing, et autres
Publié: (2025)
par: Yuan, Zhengqing, et autres
Publié: (2025)
BLURR: A Boosted Low-Resource Inference for Vision-Language-Action Models
par: Ma, Xiaoyu, et autres
Publié: (2025)
par: Ma, Xiaoyu, et autres
Publié: (2025)
Finding Missing Input Validation in TEEs via LLM-Assisted Symbolic Execution
par: Ma, Chengyan, et autres
Publié: (2026)
par: Ma, Chengyan, et autres
Publié: (2026)
Skill Drift Is Contract Violation: Proactive Maintenance for LLM Agent Skill Libraries
par: Fan, Linfeng, et autres
Publié: (2026)
par: Fan, Linfeng, et autres
Publié: (2026)
LoCoBench-Agent: An Interactive Benchmark for LLM Agents in Long-Context Software Engineering
par: Qiu, Jielin, et autres
Publié: (2025)
par: Qiu, Jielin, et autres
Publié: (2025)
From UI to Code: Mobile Ads Detection via LLM-Unified Static-Dynamic Analysis
par: Ma, Shang, et autres
Publié: (2026)
par: Ma, Shang, et autres
Publié: (2026)
Taming System Complexity: Demystifying Software Engineering Agents in Diagnosing Linux Kernel Faults
par: Zhou, Zhenhao, et autres
Publié: (2025)
par: Zhou, Zhenhao, et autres
Publié: (2025)
Decoding Human-LLM Collaboration in Coding: An Empirical Study of Multi-Turn Conversations in the Wild
par: Zhang, Binquan, et autres
Publié: (2025)
par: Zhang, Binquan, et autres
Publié: (2025)
EvolveRouter: Co-Evolving Routing and Prompt for Multi-Agent Question Answering
par: Huang, Jiatan, et autres
Publié: (2026)
par: Huang, Jiatan, et autres
Publié: (2026)
STEPWISE-CODEX-Bench: Evaluating Complex Multi-Function Comprehension and Fine-Grained Execution Reasoning
par: Yan, Kaiwen, et autres
Publié: (2025)
par: Yan, Kaiwen, et autres
Publié: (2025)
MAS-FIRE: Fault Injection and Reliability Evaluation for LLM-Based Multi-Agent Systems
par: Jia, Jin, et autres
Publié: (2026)
par: Jia, Jin, et autres
Publié: (2026)
FaultLine: Automated Proof-of-Vulnerability Generation Using LLM Agents
par: Nitin, Vikram, et autres
Publié: (2025)
par: Nitin, Vikram, et autres
Publié: (2025)
A Multi-Agent Approach for REST API Testing with Semantic Graphs and LLM-Driven Inputs
par: Kim, Myeongsoo, et autres
Publié: (2024)
par: Kim, Myeongsoo, et autres
Publié: (2024)
Library Drift: Diagnosing and Fixing a Silent Failure Mode in Self-Evolving LLM Skill Libraries
par: Zhang, Xing, et autres
Publié: (2026)
par: Zhang, Xing, et autres
Publié: (2026)
AgentFL: Scaling LLM-based Fault Localization to Project-Level Context
par: Qin, Yihao, et autres
Publié: (2024)
par: Qin, Yihao, et autres
Publié: (2024)
SGAgent: Suggestion-Guided LLM-Based Multi-Agent Framework for Repository-Level Software Repair
par: Zhang, Quanjun, et autres
Publié: (2026)
par: Zhang, Quanjun, et autres
Publié: (2026)
DataGovBench: Benchmarking LLM Agents for Real-World Data Governance Workflows
par: Liu, Zhou, et autres
Publié: (2025)
par: Liu, Zhou, et autres
Publié: (2025)
Explainable Fault Localization for Programming Assignments via LLM-Guided Annotation
par: Liu, Fang, et autres
Publié: (2025)
par: Liu, Fang, et autres
Publié: (2025)
RIVA: Leveraging LLM Agents for Reliable Configuration Drift Detection
par: Abuzakuk, Sami, et autres
Publié: (2026)
par: Abuzakuk, Sami, et autres
Publié: (2026)
Horizon-LM: A RAM-Centric Architecture for LLM Training
par: Yuan, Zhengqing, et autres
Publié: (2026)
par: Yuan, Zhengqing, et autres
Publié: (2026)
Refining Fuzzed Crashing Inputs for Better Fault Diagnosis
par: Kim, Kieun, et autres
Publié: (2025)
par: Kim, Kieun, et autres
Publié: (2025)
Can LLMs Generate High-Quality Test Cases for Algorithm Problems? TestCase-Eval: A Systematic Evaluation of Fault Coverage and Exposure
par: Yang, Zheyuan, et autres
Publié: (2025)
par: Yang, Zheyuan, et autres
Publié: (2025)
Enhancing LLM-based Fault Localization with a Functionality-Aware Retrieval-Augmented Generation Framework
par: Shi, Xinyu, et autres
Publié: (2025)
par: Shi, Xinyu, et autres
Publié: (2025)
United We Stand: Towards End-to-End Log-based Fault Diagnosis via Interactive Multi-Task Learning
par: He, Minghua, et autres
Publié: (2025)
par: He, Minghua, et autres
Publié: (2025)
Grounding Data Science Code Generation with Input-Output Specifications
par: Wen, Yeming, et autres
Publié: (2024)
par: Wen, Yeming, et autres
Publié: (2024)
A Multi-Agent Approach to Fault Localization via Graph-Based Retrieval and Reflexion
par: Rafi, Md Nakhla, et autres
Publié: (2024)
par: Rafi, Md Nakhla, et autres
Publié: (2024)
The Multi-Agent Fault Localization System Based on Monte Carlo Tree Search Approach
par: Ren, Rui
Publié: (2025)
par: Ren, Rui
Publié: (2025)
Low-Cost and Comprehensive Non-textual Input Fuzzing with LLM-Synthesized Input Generators
par: Zhang, Kunpeng, et autres
Publié: (2025)
par: Zhang, Kunpeng, et autres
Publié: (2025)
Unsafer in Many Turns: Benchmarking and Defending Multi-Turn Safety Risks in Tool-Using Agents
par: Li, Xu, et autres
Publié: (2026)
par: Li, Xu, et autres
Publié: (2026)
ISD-Agent-Bench: A Comprehensive Benchmark for Evaluating LLM-based Instructional Design Agents
par: Jeon, YoungHoon, et autres
Publié: (2026)
par: Jeon, YoungHoon, et autres
Publié: (2026)
SpecMind: Cognitively Inspired, Interactive Multi-Turn Framework for Postcondition Inference
par: Le, Cuong Chi, et autres
Publié: (2026)
par: Le, Cuong Chi, et autres
Publié: (2026)
PBT-Bench: Benchmarking AI Agents on Property-Based Testing
par: Jing, Lucas, et autres
Publié: (2026)
par: Jing, Lucas, et autres
Publié: (2026)
ArtifactsBench: Bridging the Visual-Interactive Gap in LLM Code Generation Evaluation
par: Zhang, Chenchen, et autres
Publié: (2025)
par: Zhang, Chenchen, et autres
Publié: (2025)
From LLMs to Agents: A Comparative Evaluation of LLMs and LLM-based Agents in Security Patch Detection
par: Han, Junxiao, et autres
Publié: (2025)
par: Han, Junxiao, et autres
Publié: (2025)
PostTrainBench: Can LLM Agents Automate LLM Post-Training?
par: Rank, Ben, et autres
Publié: (2026)
par: Rank, Ben, et autres
Publié: (2026)
PyBench: Evaluating LLM Agent on various real-world coding tasks
par: Zhang, Yaolun, et autres
Publié: (2024)
par: Zhang, Yaolun, et autres
Publié: (2024)
Boundary Value Test Input Generation Using Prompt Engineering with LLMs: Fault Detection and Coverage Analysis
par: Guo, Xiujing, et autres
Publié: (2025)
par: Guo, Xiujing, et autres
Publié: (2025)
Documents similaires
-
An Empirical Study of Interaction Smells in Multi-Turn Human-LLM Collaborative Code Generation
par: Zhang, Binquan, et autres
Publié: (2026) -
NG-Router: Graph-Supervised Multi-Agent Collaboration for Nutrition Question Answering
par: Shi, Kaiwen, et autres
Publié: (2025) -
AgentRouter: A Knowledge-Graph-Guided LLM Router for Collaborative Multi-Agent Question Answering
par: Zhang, Zheyuan, et autres
Publié: (2025) -
Food4All: A Multi-Agent Framework for Real-time Free Food Discovery with Integrated Nutritional Metadata
par: Yuan, Zhengqing, et autres
Publié: (2025) -
BLURR: A Boosted Low-Resource Inference for Vision-Language-Action Models
par: Ma, Xiaoyu, et autres
Publié: (2025)