OpenClawBench: Benchmarking Process-side Anomalies in Real-world Agent Execution Trajectories
Fuente:
arXiv
Salvato in:
| Autori principali: | Liu, Yibing, Liu, Yangze, Yin, Xiaolong, Wang, Bin, Zhang, Chong, Yin, Hao, Han, Zhongyi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
TrajAD: Trajectory Anomaly Detection for Trustworthy LLM Agents
di: Liu, Yibing, et al.
Pubblicazione: (2026)
di: Liu, Yibing, et al.
Pubblicazione: (2026)
ClawForge: Generating Executable Interactive Benchmarks for Command-Line Agents
di: Lai, Yuxiang, et al.
Pubblicazione: (2026)
di: Lai, Yuxiang, et al.
Pubblicazione: (2026)
DataClawBench: An Agent Benchmark for Exploratory Real-World Financial Data Analysis
di: Zhang, Qiaohong, et al.
Pubblicazione: (2026)
di: Zhang, Qiaohong, et al.
Pubblicazione: (2026)
Red-Teaming Agent Execution Contexts: Open-World Security Evaluation on OpenClaw
di: Yao, Hongwei, et al.
Pubblicazione: (2026)
di: Yao, Hongwei, et al.
Pubblicazione: (2026)
Benchmarks for Trajectory Safety Evaluation and Diagnosis in OpenClaw and Codex: ATBench-Claw and ATBench-Codex
di: Yang, Zhonghao, et al.
Pubblicazione: (2026)
di: Yang, Zhonghao, et al.
Pubblicazione: (2026)
LiveClawBench: Benchmarking LLM Agents on Complex, Real-World Assistant Tasks
di: Long, Xiang, et al.
Pubblicazione: (2026)
di: Long, Xiang, et al.
Pubblicazione: (2026)
MCPAgentBench: A Real-world Task Benchmark for Evaluating LLM Agent MCP Tool Use
di: Liu, Wenrui, et al.
Pubblicazione: (2025)
di: Liu, Wenrui, et al.
Pubblicazione: (2025)
VitaBench: Benchmarking LLM Agents with Versatile Interactive Tasks in Real-world Applications
di: He, Wei, et al.
Pubblicazione: (2025)
di: He, Wei, et al.
Pubblicazione: (2025)
From Assistant to Double Agent: Formalizing and Benchmarking Attacks on OpenClaw for Personalized Local AI Agent
di: Wang, Yuhang, et al.
Pubblicazione: (2026)
di: Wang, Yuhang, et al.
Pubblicazione: (2026)
A Trajectory-Based Safety Audit of Clawdbot (OpenClaw)
di: Chen, Tianyu, et al.
Pubblicazione: (2026)
di: Chen, Tianyu, et al.
Pubblicazione: (2026)
TimeClaw: A Time-Series AI Agent with Exploratory Execution Learning
di: Liu, Hangchen, et al.
Pubblicazione: (2026)
di: Liu, Hangchen, et al.
Pubblicazione: (2026)
ClawBench: Can AI Agents Complete Everyday Online Tasks?
di: Zhang, Yuxuan, et al.
Pubblicazione: (2026)
di: Zhang, Yuxuan, et al.
Pubblicazione: (2026)
ClawsBench: Evaluating Capability and Safety of LLM Productivity Agents in Simulated Workspaces
di: Li, Xiangyi, et al.
Pubblicazione: (2026)
di: Li, Xiangyi, et al.
Pubblicazione: (2026)
GeoAgentBench: A Dynamic Execution Benchmark for Tool-Augmented Agents in Spatial Analysis
di: Yu, Bo, et al.
Pubblicazione: (2026)
di: Yu, Bo, et al.
Pubblicazione: (2026)
HWE-Bench: Benchmarking LLM Agents on Real-World Hardware Bug Repair Tasks
di: Cui, Fan, et al.
Pubblicazione: (2026)
di: Cui, Fan, et al.
Pubblicazione: (2026)
ClawKeeper: Comprehensive Safety Protection for OpenClaw Agents Through Skills, Plugins, and Watchers
di: Liu, Songyang, et al.
Pubblicazione: (2026)
di: Liu, Songyang, et al.
Pubblicazione: (2026)
Your Agent, Their Asset: A Real-World Safety Analysis of OpenClaw
di: Wang, Zijun, et al.
Pubblicazione: (2026)
di: Wang, Zijun, et al.
Pubblicazione: (2026)
Claw-Eval-Live: A Live Agent Benchmark for Evolving Real-World Workflows
di: Li, Chenxin, et al.
Pubblicazione: (2026)
di: Li, Chenxin, et al.
Pubblicazione: (2026)
OpenClaw-RL: Train Any Agent Simply by Talking
di: Wang, Yinjie, et al.
Pubblicazione: (2026)
di: Wang, Yinjie, et al.
Pubblicazione: (2026)
QuantClaw: Precision Where It Matters for OpenClaw
di: Zhang, Manyi, et al.
Pubblicazione: (2026)
di: Zhang, Manyi, et al.
Pubblicazione: (2026)
DataGovBench: Benchmarking LLM Agents for Real-World Data Governance Workflows
di: Liu, Zhou, et al.
Pubblicazione: (2025)
di: Liu, Zhou, et al.
Pubblicazione: (2025)
MM-Agent: LLM as Agents for Real-world Mathematical Modeling Problem
di: Liu, Fan, et al.
Pubblicazione: (2025)
di: Liu, Fan, et al.
Pubblicazione: (2025)
ShortcutsBench: A Large-Scale Real-world Benchmark for API-based Agents
di: Shen, Haiyang, et al.
Pubblicazione: (2024)
di: Shen, Haiyang, et al.
Pubblicazione: (2024)
ClawArena: Benchmarking AI Agents in Evolving Information Environments
di: Ji, Haonian, et al.
Pubblicazione: (2026)
di: Ji, Haonian, et al.
Pubblicazione: (2026)
BuildBench: Benchmarking LLM Agents on Compiling Real-World Open-Source Software
di: Zhang, Zehua, et al.
Pubblicazione: (2025)
di: Zhang, Zehua, et al.
Pubblicazione: (2025)
Redundant or Necessary? A Benchmark for Detecting Redundant Steps in Agent Trajectories
di: Hu, Minyang, et al.
Pubblicazione: (2026)
di: Hu, Minyang, et al.
Pubblicazione: (2026)
TrafficClaw: A Generalizable LLM Agent in the Unified Physical Environment for Urban Traffic Control
di: Lai, Siqi, et al.
Pubblicazione: (2026)
di: Lai, Siqi, et al.
Pubblicazione: (2026)
VehicleMemBench: An Executable Benchmark for Multi-User Long-Term Memory in In-Vehicle Agents
di: Chen, Yuhao, et al.
Pubblicazione: (2026)
di: Chen, Yuhao, et al.
Pubblicazione: (2026)
AD-Bench: A Real-World, Trajectory-Aware Advertising Analytics Benchmark for LLM Agents
di: Hu, Lingxiang, et al.
Pubblicazione: (2026)
di: Hu, Lingxiang, et al.
Pubblicazione: (2026)
MineAnyBuild: Benchmarking Spatial Planning for Open-world AI Agents
di: Wei, Ziming, et al.
Pubblicazione: (2025)
di: Wei, Ziming, et al.
Pubblicazione: (2025)
ClawTrap: A MITM-Based Red-Teaming Framework for Real-World OpenClaw Security Evaluation
di: Zhao, Haochen, et al.
Pubblicazione: (2026)
di: Zhao, Haochen, et al.
Pubblicazione: (2026)
OpenGo: An OpenClaw-Based Robotic Dog with Real-Time Skill Switching
di: Li, Hanbing, et al.
Pubblicazione: (2026)
di: Li, Hanbing, et al.
Pubblicazione: (2026)
LocalSearchBench: Benchmarking Agentic Search in Real-World Local Life Services
di: He, Hang, et al.
Pubblicazione: (2025)
di: He, Hang, et al.
Pubblicazione: (2025)
A Security Analysis of the OpenClaw AI Agent Framework
di: Suwansathit, Surada, et al.
Pubblicazione: (2026)
di: Suwansathit, Surada, et al.
Pubblicazione: (2026)
Claw-Eval: Towards Trustworthy Evaluation of Autonomous Agents
di: Ye, Bowen, et al.
Pubblicazione: (2026)
di: Ye, Bowen, et al.
Pubblicazione: (2026)
SGR-Bench: Benchmarking Search Agents on State-Gated Retrieval
di: Li, Ningyuan, et al.
Pubblicazione: (2026)
di: Li, Ningyuan, et al.
Pubblicazione: (2026)
ResearchEnvBench: Benchmarking Agents on Environment Synthesis for Research Code Execution
di: Wang, Yubang, et al.
Pubblicazione: (2026)
di: Wang, Yubang, et al.
Pubblicazione: (2026)
ProBench: Benchmarking GUI Agents with Accurate Process Information
di: Yang, Leyang, et al.
Pubblicazione: (2025)
di: Yang, Leyang, et al.
Pubblicazione: (2025)
LiveAgentBench: Comprehensive Benchmarking of Agentic Systems Across 104 Real-World Challenges
di: Li, Hao, et al.
Pubblicazione: (2026)
di: Li, Hao, et al.
Pubblicazione: (2026)
TOBench: A Task-Oriented Omni-Modal Benchmark for Real-World Tool-Using Agents
di: Liu, Zhiqiang, et al.
Pubblicazione: (2026)
di: Liu, Zhiqiang, et al.
Pubblicazione: (2026)
Documenti analoghi
-
TrajAD: Trajectory Anomaly Detection for Trustworthy LLM Agents
di: Liu, Yibing, et al.
Pubblicazione: (2026) -
ClawForge: Generating Executable Interactive Benchmarks for Command-Line Agents
di: Lai, Yuxiang, et al.
Pubblicazione: (2026) -
DataClawBench: An Agent Benchmark for Exploratory Real-World Financial Data Analysis
di: Zhang, Qiaohong, et al.
Pubblicazione: (2026) -
Red-Teaming Agent Execution Contexts: Open-World Security Evaluation on OpenClaw
di: Yao, Hongwei, et al.
Pubblicazione: (2026) -
Benchmarks for Trajectory Safety Evaluation and Diagnosis in OpenClaw and Codex: ATBench-Claw and ATBench-Codex
di: Yang, Zhonghao, et al.
Pubblicazione: (2026)