LiveClawBench: Benchmarking LLM Agents on Complex, Real-World Assistant Tasks
Fuente:
arXiv
Guardado en:
| Autores principales: | Long, Xiang, Du, Li, Xu, Yilong, Liu, Fangcheng, Wang, Haoqing, Ding, Ning, Li, Ziheng, Guo, Jianyuan, Tang, Yehui |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
To Mix or To Merge: Toward Multi-Domain Reinforcement Learning for Large Language Models
por: Wang, Haoqing, et al.
Publicado: (2026)
por: Wang, Haoqing, et al.
Publicado: (2026)
Claw-Eval-Live: A Live Agent Benchmark for Evolving Real-World Workflows
por: Li, Chenxin, et al.
Publicado: (2026)
por: Li, Chenxin, et al.
Publicado: (2026)
WildClawBench: A Benchmark for Real-World, Long-Horizon Agent Evaluation
por: Ding, Shuangrui, et al.
Publicado: (2026)
por: Ding, Shuangrui, et al.
Publicado: (2026)
DataClawBench: An Agent Benchmark for Exploratory Real-World Financial Data Analysis
por: Zhang, Qiaohong, et al.
Publicado: (2026)
por: Zhang, Qiaohong, et al.
Publicado: (2026)
Trust Region On-Policy Distillation
por: Xing, Xingrun, et al.
Publicado: (2026)
por: Xing, Xingrun, et al.
Publicado: (2026)
MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers
por: Wang, Zhenting, et al.
Publicado: (2025)
por: Wang, Zhenting, et al.
Publicado: (2025)
HWE-Bench: Benchmarking LLM Agents on Real-World Hardware Bug Repair Tasks
por: Cui, Fan, et al.
Publicado: (2026)
por: Cui, Fan, et al.
Publicado: (2026)
ProAgentBench: Evaluating LLM Agents for Proactive Assistance with Real-World Data
por: Tang, Yuanbo, et al.
Publicado: (2026)
por: Tang, Yuanbo, et al.
Publicado: (2026)
GitTaskBench: A Benchmark for Code Agents Solving Real-World Tasks Through Code Repository Leveraging
por: Ni, Ziyi, et al.
Publicado: (2025)
por: Ni, Ziyi, et al.
Publicado: (2025)
LiveAgentBench: Comprehensive Benchmarking of Agentic Systems Across 104 Real-World Challenges
por: Li, Hao, et al.
Publicado: (2026)
por: Li, Hao, et al.
Publicado: (2026)
ClawBench: Can AI Agents Complete Everyday Online Tasks?
por: Zhang, Yuxuan, et al.
Publicado: (2026)
por: Zhang, Yuxuan, et al.
Publicado: (2026)
MeKi: Memory-based Expert Knowledge Injection for Efficient LLM Scaling
por: Ding, Ning, et al.
Publicado: (2026)
por: Ding, Ning, et al.
Publicado: (2026)
OpenClawBench: Benchmarking Process-side Anomalies in Real-world Agent Execution Trajectories
por: Liu, Yibing, et al.
Publicado: (2026)
por: Liu, Yibing, et al.
Publicado: (2026)
TheAgentCompany: Benchmarking LLM Agents on Consequential Real World Tasks
por: Xu, Frank F., et al.
Publicado: (2024)
por: Xu, Frank F., et al.
Publicado: (2024)
ClawMark: A Living-World Benchmark for Multi-Turn, Multi-Day, Multimodal Coworker Agents
por: Meng, Fanqing, et al.
Publicado: (2026)
por: Meng, Fanqing, et al.
Publicado: (2026)
SafeAgentBench: A Benchmark for Safe Task Planning of Embodied LLM Agents
por: Yin, Sheng, et al.
Publicado: (2024)
por: Yin, Sheng, et al.
Publicado: (2024)
ClawsBench: Evaluating Capability and Safety of LLM Productivity Agents in Simulated Workspaces
por: Li, Xiangyi, et al.
Publicado: (2026)
por: Li, Xiangyi, et al.
Publicado: (2026)
VoiceBench: Benchmarking LLM-Based Voice Assistants
por: Chen, Yiming, et al.
Publicado: (2024)
por: Chen, Yiming, et al.
Publicado: (2024)
Claw-Anything: Benchmarking Always-On Personal Assistants with Broader Access to User's Digital World
por: Lin, Yusong, et al.
Publicado: (2026)
por: Lin, Yusong, et al.
Publicado: (2026)
SkillLearnBench: Benchmarking Continual Learning Methods for Agent Skill Generation on Real-World Tasks
por: Zhong, Shanshan, et al.
Publicado: (2026)
por: Zhong, Shanshan, et al.
Publicado: (2026)
AD-Bench: A Real-World, Trajectory-Aware Advertising Analytics Benchmark for LLM Agents
por: Hu, Lingxiang, et al.
Publicado: (2026)
por: Hu, Lingxiang, et al.
Publicado: (2026)
From Assistant to Double Agent: Formalizing and Benchmarking Attacks on OpenClaw for Personalized Local AI Agent
por: Wang, Yuhang, et al.
Publicado: (2026)
por: Wang, Yuhang, et al.
Publicado: (2026)
VitaBench: Benchmarking LLM Agents with Versatile Interactive Tasks in Real-world Applications
por: He, Wei, et al.
Publicado: (2025)
por: He, Wei, et al.
Publicado: (2025)
TerminalWorld: Benchmarking Agents on Real-World Terminal Tasks
por: Chu, Zhaoyang, et al.
Publicado: (2026)
por: Chu, Zhaoyang, et al.
Publicado: (2026)
DataGovBench: Benchmarking LLM Agents for Real-World Data Governance Workflows
por: Liu, Zhou, et al.
Publicado: (2025)
por: Liu, Zhou, et al.
Publicado: (2025)
BuildBench: Benchmarking LLM Agents on Compiling Real-World Open-Source Software
por: Zhang, Zehua, et al.
Publicado: (2025)
por: Zhang, Zehua, et al.
Publicado: (2025)
When Do LLMs Reason? A Dynamical Systems View via Entropy Phase Transitions
por: Xia, Wei, et al.
Publicado: (2026)
por: Xia, Wei, et al.
Publicado: (2026)
EnergyAgentBench: Benchmarking LLM Agents on Live Energy Infrastructure Data
por: Curcio, Eliseo
Publicado: (2026)
por: Curcio, Eliseo
Publicado: (2026)
FinToolBench: Evaluating LLM Agents for Real-World Financial Tool Use
por: Lu, Jiaxuan, et al.
Publicado: (2026)
por: Lu, Jiaxuan, et al.
Publicado: (2026)
FinMCP-Bench: Benchmarking LLM Agents for Real-World Financial Tool Use under the Model Context Protocol
por: Zhu, Jie, et al.
Publicado: (2026)
por: Zhu, Jie, et al.
Publicado: (2026)
ShoppingBench: A Real-World Intent-Grounded Shopping Benchmark for LLM-based Agents
por: Wang, Jiangyuan, et al.
Publicado: (2025)
por: Wang, Jiangyuan, et al.
Publicado: (2025)
LiveStar: Live Streaming Assistant for Real-World Online Video Understanding
por: Yang, Zhenyu, et al.
Publicado: (2025)
por: Yang, Zhenyu, et al.
Publicado: (2025)
MCPAgentBench: A Real-world Task Benchmark for Evaluating LLM Agent MCP Tool Use
por: Liu, Wenrui, et al.
Publicado: (2025)
por: Liu, Wenrui, et al.
Publicado: (2025)
SecRepoBench: Benchmarking Code Agents for Secure Code Completion in Real-World Repositories
por: Shen, Chihao, et al.
Publicado: (2025)
por: Shen, Chihao, et al.
Publicado: (2025)
Free Video-LLM: Prompt-guided Visual Perception for Efficient Training-free Video LLMs
por: Han, Kai, et al.
Publicado: (2024)
por: Han, Kai, et al.
Publicado: (2024)
SEC-bench: Automated Benchmarking of LLM Agents on Real-World Software Security Tasks
por: Lee, Hwiwon, et al.
Publicado: (2025)
por: Lee, Hwiwon, et al.
Publicado: (2025)
TRIP-Bench: A Benchmark for Long-Horizon Interactive Agents in Real-World Scenarios
por: Shen, Yuanzhe, et al.
Publicado: (2026)
por: Shen, Yuanzhe, et al.
Publicado: (2026)
Your Agent, Their Asset: A Real-World Safety Analysis of OpenClaw
por: Wang, Zijun, et al.
Publicado: (2026)
por: Wang, Zijun, et al.
Publicado: (2026)
$C^3$-Bench: The Things Real Disturbing LLM based Agent in Multi-Tasking
por: Yu, Peijie, et al.
Publicado: (2025)
por: Yu, Peijie, et al.
Publicado: (2025)
RealBench: Benchmarking Verilog Generation Models with Real-World IP Designs
por: Jin, Pengwei, et al.
Publicado: (2025)
por: Jin, Pengwei, et al.
Publicado: (2025)
Ejemplares similares
-
To Mix or To Merge: Toward Multi-Domain Reinforcement Learning for Large Language Models
por: Wang, Haoqing, et al.
Publicado: (2026) -
Claw-Eval-Live: A Live Agent Benchmark for Evolving Real-World Workflows
por: Li, Chenxin, et al.
Publicado: (2026) -
WildClawBench: A Benchmark for Real-World, Long-Horizon Agent Evaluation
por: Ding, Shuangrui, et al.
Publicado: (2026) -
DataClawBench: An Agent Benchmark for Exploratory Real-World Financial Data Analysis
por: Zhang, Qiaohong, et al.
Publicado: (2026) -
Trust Region On-Policy Distillation
por: Xing, Xingrun, et al.
Publicado: (2026)