Claw-Eval: Towards Trustworthy Evaluation of Autonomous Agents
Fuente:
arXiv
Saved in:
| Main Authors: | Ye, Bowen, Li, Rang, Yang, Qibin, Liu, Yuanxin, Yao, Linli, Lv, Hanglong, Xie, Zhihui, An, Chenxin, Li, Lei, Kong, Lingpeng, Liu, Qi, Sui, Zhifang, Yang, Tong |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Claw-Eval-Live: A Live Agent Benchmark for Evolving Real-World Workflows
by: Li, Chenxin, et al.
Published: (2026)
by: Li, Chenxin, et al.
Published: (2026)
Temporal Reasoning Transfer from Text to Video
by: Li, Lei, et al.
Published: (2024)
by: Li, Lei, et al.
Published: (2024)
Towards Better RL Training Data Utilization via Second-Order Rollout
by: Yang, Zhe, et al.
Published: (2026)
by: Yang, Zhe, et al.
Published: (2026)
RICo: Refined In-Context Contribution for Automatic Instruction-Tuning Data Selection
by: Yang, Yixin, et al.
Published: (2025)
by: Yang, Yixin, et al.
Published: (2025)
Uncovering Security Threats and Architecting Defenses in Autonomous Agents: A Case Study of OpenClaw
by: Ying, Zonghao, et al.
Published: (2026)
by: Ying, Zonghao, et al.
Published: (2026)
Defensible Design for OpenClaw: Securing Autonomous Tool-Invoking Agents
by: Li, Zongwei, et al.
Published: (2026)
by: Li, Zongwei, et al.
Published: (2026)
TimeChat-Online: 80% Visual Tokens are Naturally Redundant in Streaming Videos
by: Yao, Linli, et al.
Published: (2025)
by: Yao, Linli, et al.
Published: (2025)
Jailbreaking as a Reward Misspecification Problem
by: Xie, Zhihui, et al.
Published: (2024)
by: Xie, Zhihui, et al.
Published: (2024)
DataClaw: An Autonomous Data Agent with Instant Messaging Integration
by: Li, Huahang, et al.
Published: (2026)
by: Li, Huahang, et al.
Published: (2026)
Claw AI Lab: An Autonomous Multi-Agent Research Team
by: Wu, Fan, et al.
Published: (2026)
by: Wu, Fan, et al.
Published: (2026)
VL-RewardBench: A Challenging Benchmark for Vision-Language Generative Reward Models
by: Li, Lei, et al.
Published: (2024)
by: Li, Lei, et al.
Published: (2024)
ClawKeeper: Comprehensive Safety Protection for OpenClaw Agents Through Skills, Plugins, and Watchers
by: Liu, Songyang, et al.
Published: (2026)
by: Liu, Songyang, et al.
Published: (2026)
MolClaw: An Autonomous Agent with Hierarchical Skills for Drug Molecule Evaluation, Screening, and Optimization
by: Zhang, Lisheng, et al.
Published: (2026)
by: Zhang, Lisheng, et al.
Published: (2026)
Red-Teaming Agent Execution Contexts: Open-World Security Evaluation on OpenClaw
by: Yao, Hongwei, et al.
Published: (2026)
by: Yao, Hongwei, et al.
Published: (2026)
ClawGym: A Scalable Framework for Building Effective Claw Agents
by: Bai, Fei, et al.
Published: (2026)
by: Bai, Fei, et al.
Published: (2026)
DeCo: Decoupling Token Compression from Semantic Abstraction in Multimodal Large Language Models
by: Yao, Linli, et al.
Published: (2024)
by: Yao, Linli, et al.
Published: (2024)
OS-Copilot: Towards Generalist Computer Agents with Self-Improvement
by: Wu, Zhiyong, et al.
Published: (2024)
by: Wu, Zhiyong, et al.
Published: (2024)
Towards Trustworthy GUI Agents: A Survey
by: Shi, Yucheng, et al.
Published: (2025)
by: Shi, Yucheng, et al.
Published: (2025)
SeClaw: Spec-Driven Security Task Synthesis for Evaluating Autonomous Agents
by: Cheng, Hao, et al.
Published: (2026)
by: Cheng, Hao, et al.
Published: (2026)
ClawEnvKit: Automatic Environment Generation for Claw-Like Agents
by: Li, Xirui, et al.
Published: (2026)
by: Li, Xirui, et al.
Published: (2026)
Why Does the Effective Context Length of LLMs Fall Short?
by: An, Chenxin, et al.
Published: (2024)
by: An, Chenxin, et al.
Published: (2024)
ClawNet: Human-Symbiotic Agent Network for Cross-User Autonomous Cooperation
by: Yang, Zhiqin, et al.
Published: (2026)
by: Yang, Zhiqin, et al.
Published: (2026)
Taming OpenClaw: Security Analysis and Mitigation of Autonomous LLM Agent Threats
by: Deng, Xinhao, et al.
Published: (2026)
by: Deng, Xinhao, et al.
Published: (2026)
TrustAgent: Towards Safe and Trustworthy LLM-based Agents
by: Hua, Wenyue, et al.
Published: (2024)
by: Hua, Wenyue, et al.
Published: (2024)
TimeClaw: A Time-Series AI Agent with Exploratory Execution Learning
by: Liu, Hangchen, et al.
Published: (2026)
by: Liu, Hangchen, et al.
Published: (2026)
TimeChat-Captioner: Scripting Multi-Scene Videos with Time-Aware and Structural Audio-Visual Captions
by: Yao, Linli, et al.
Published: (2026)
by: Yao, Linli, et al.
Published: (2026)
OS-Sentinel: Towards Safety-Enhanced Mobile GUI Agents via Hybrid Validation in Realistic Workflows
by: Sun, Qiushi, et al.
Published: (2025)
by: Sun, Qiushi, et al.
Published: (2025)
R&D-Agent: An LLM-Agent Framework Towards Autonomous Data Science
by: Yang, Xu, et al.
Published: (2025)
by: Yang, Xu, et al.
Published: (2025)
ClawArena: Benchmarking AI Agents in Evolving Information Environments
by: Ji, Haonian, et al.
Published: (2026)
by: Ji, Haonian, et al.
Published: (2026)
Decoding in Geometry: Alleviating Embedding-Space Crowding for Complex Reasoning
by: Yang, Yixin, et al.
Published: (2026)
by: Yang, Yixin, et al.
Published: (2026)
Trustworthy Evaluation of Robotic Manipulation: A New Benchmark and AutoEval Methods
by: Liu, Mengyuan, et al.
Published: (2026)
by: Liu, Mengyuan, et al.
Published: (2026)
RS-Claw: Progressive Active Tool Exploration via Hierarchical Skill Trees for Remote Sensing Agents
by: Liu, Liangtian, et al.
Published: (2026)
by: Liu, Liangtian, et al.
Published: (2026)
XrayClaw: Cooperative-Competitive Multi-Agent Alignment for Trustworthy Chest X-ray Diagnosis
by: Young, Shawn, et al.
Published: (2026)
by: Young, Shawn, et al.
Published: (2026)
ClawSafety: "Safe" LLMs, Unsafe Agents
by: Wei, Bowen, et al.
Published: (2026)
by: Wei, Bowen, et al.
Published: (2026)
TEMPLE: Incentivizing Temporal Understanding of Video Large Language Models via Progressive Pre-SFT Alignment
by: Li, Shicheng, et al.
Published: (2025)
by: Li, Shicheng, et al.
Published: (2025)
AutoResearchClaw: Self-Reinforcing Autonomous Research with Human-AI Collaboration
by: Liu, Jiaqi, et al.
Published: (2026)
by: Liu, Jiaqi, et al.
Published: (2026)
Towards AI-$45^{\circ}$ Law: A Roadmap to Trustworthy AGI
by: Yang, Chao, et al.
Published: (2024)
by: Yang, Chao, et al.
Published: (2024)
Target Detection in OFDM-ISAC Systems: A Multipath Exploitation Approach
by: Lv, Xiaohan, et al.
Published: (2025)
by: Lv, Xiaohan, et al.
Published: (2025)
DataClawBench: An Agent Benchmark for Exploratory Real-World Financial Data Analysis
by: Zhang, Qiaohong, et al.
Published: (2026)
by: Zhang, Qiaohong, et al.
Published: (2026)
FT-Dojo: Towards Autonomous LLM Fine-Tuning with Language Agents
by: Li, Qizheng, et al.
Published: (2026)
by: Li, Qizheng, et al.
Published: (2026)
Similar Items
-
Claw-Eval-Live: A Live Agent Benchmark for Evolving Real-World Workflows
by: Li, Chenxin, et al.
Published: (2026) -
Temporal Reasoning Transfer from Text to Video
by: Li, Lei, et al.
Published: (2024) -
Towards Better RL Training Data Utilization via Second-Order Rollout
by: Yang, Zhe, et al.
Published: (2026) -
RICo: Refined In-Context Contribution for Automatic Instruction-Tuning Data Selection
by: Yang, Yixin, et al.
Published: (2025) -
Uncovering Security Threats and Architecting Defenses in Autonomous Agents: A Case Study of OpenClaw
by: Ying, Zonghao, et al.
Published: (2026)