OccuBench: Evaluating AI Agents on Real-World Professional Tasks via Language Environment Simulation
Fuente:
arXiv
Salvato in:
| Autori principali: | Hu, Xiaomeng, Zhang, Yinger, Huang, Fei, Tu, Jianhong, Su, Yang, Deng, Lianghao, Liu, Yuxuan, Liu, Yantao, Liu, Dayiheng, Ho, Tsung-Yi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Are Agents Ready to Teach? A Multi-Stage Benchmark for Real-World Teaching Workflows
di: Chen, Zixin, et al.
Pubblicazione: (2026)
di: Chen, Zixin, et al.
Pubblicazione: (2026)
DeepPlanning: Benchmarking Long-Horizon Agentic Planning with Verifiable Constraints
di: Zhang, Yinger, et al.
Pubblicazione: (2026)
di: Zhang, Yinger, et al.
Pubblicazione: (2026)
HumanStudy-Bench: Towards AI Agent Design for Participant Simulation
di: Liu, Xuan, et al.
Pubblicazione: (2026)
di: Liu, Xuan, et al.
Pubblicazione: (2026)
PhysicianBench: Evaluating LLM Agents in Real-World EHR Environments
di: Liu, Ruoqi, et al.
Pubblicazione: (2026)
di: Liu, Ruoqi, et al.
Pubblicazione: (2026)
Comparing AI Agents to Cybersecurity Professionals in Real-World Penetration Testing
di: Lin, Justin W., et al.
Pubblicazione: (2025)
di: Lin, Justin W., et al.
Pubblicazione: (2025)
LongWeave: A Long-Form Generation Benchmark Bridging Real-World Relevance and Verifiability
di: Xiao, Zikai, et al.
Pubblicazione: (2025)
di: Xiao, Zikai, et al.
Pubblicazione: (2025)
LiveClawBench: Benchmarking LLM Agents on Complex, Real-World Assistant Tasks
di: Long, Xiang, et al.
Pubblicazione: (2026)
di: Long, Xiang, et al.
Pubblicazione: (2026)
CirrusBench: Evaluating LLM-based Agents Beyond Correctness in Real-World Cloud Service Environments
di: Yu, Yi, et al.
Pubblicazione: (2026)
di: Yu, Yi, et al.
Pubblicazione: (2026)
TPS-Bench: Evaluating AI Agents' Tool Planning \& Scheduling Abilities in Compounding Tasks
di: Xu, Hanwen, et al.
Pubblicazione: (2025)
di: Xu, Hanwen, et al.
Pubblicazione: (2025)
BountyBench: Dollar Impact of AI Agent Attackers and Defenders on Real-World Cybersecurity Systems
di: Zhang, Andy K., et al.
Pubblicazione: (2025)
di: Zhang, Andy K., et al.
Pubblicazione: (2025)
StockBench: Can LLM Agents Trade Stocks Profitably In Real-world Markets?
di: Chen, Yanxu, et al.
Pubblicazione: (2025)
di: Chen, Yanxu, et al.
Pubblicazione: (2025)
MobileBench-OL: A Comprehensive Chinese Benchmark for Evaluating Mobile GUI Agents in Real-World Environment
di: Wu, Qinzhuo, et al.
Pubblicazione: (2026)
di: Wu, Qinzhuo, et al.
Pubblicazione: (2026)
IndoorWorld: Integrating Physical Task Solving and Social Simulation in A Heterogeneous Multi-Agent Environment
di: Wu, Dekun, et al.
Pubblicazione: (2025)
di: Wu, Dekun, et al.
Pubblicazione: (2025)
WebWorld: A Large-Scale World Model for Web Agent Training
di: Xiao, Zikai, et al.
Pubblicazione: (2026)
di: Xiao, Zikai, et al.
Pubblicazione: (2026)
BeSafe-Bench: Unveiling Behavioral Safety Risks of Situated Agents in Functional Environments
di: Li, Yuxuan, et al.
Pubblicazione: (2026)
di: Li, Yuxuan, et al.
Pubblicazione: (2026)
GitTaskBench: A Benchmark for Code Agents Solving Real-World Tasks Through Code Repository Leveraging
di: Ni, Ziyi, et al.
Pubblicazione: (2025)
di: Ni, Ziyi, et al.
Pubblicazione: (2025)
MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers
di: Wang, Zhenting, et al.
Pubblicazione: (2025)
di: Wang, Zhenting, et al.
Pubblicazione: (2025)
ToolRM: Towards Agentic Tool-Use Reward Modeling
di: Li, Renhao, et al.
Pubblicazione: (2025)
di: Li, Renhao, et al.
Pubblicazione: (2025)
CUA-Gym: Scaling Verifiable Training Environments and Tasks for Computer-Use Agents
di: Wang, Bowen, et al.
Pubblicazione: (2026)
di: Wang, Bowen, et al.
Pubblicazione: (2026)
HWE-Bench: Benchmarking LLM Agents on Real-World Hardware Bug Repair Tasks
di: Cui, Fan, et al.
Pubblicazione: (2026)
di: Cui, Fan, et al.
Pubblicazione: (2026)
CVE-Bench: A Benchmark for AI Agents' Ability to Exploit Real-World Web Application Vulnerabilities
di: Zhu, Yuxuan, et al.
Pubblicazione: (2025)
di: Zhu, Yuxuan, et al.
Pubblicazione: (2025)
ProAgentBench: Evaluating LLM Agents for Proactive Assistance with Real-World Data
di: Tang, Yuanbo, et al.
Pubblicazione: (2026)
di: Tang, Yuanbo, et al.
Pubblicazione: (2026)
Is Machine Learning Unsafe and Irresponsible in Social Sciences? Paradoxes and Reconsidering from Recidivism Prediction Tasks
di: Liu, Jianhong, et al.
Pubblicazione: (2023)
di: Liu, Jianhong, et al.
Pubblicazione: (2023)
EnvSimBench: A Benchmark for Evaluating and Improving LLM-Based Environment Simulation
di: Liu, Yi, et al.
Pubblicazione: (2026)
di: Liu, Yi, et al.
Pubblicazione: (2026)
CR-Bench: Evaluating the Real-World Utility of AI Code Review Agents
di: Pereira, Kristen, et al.
Pubblicazione: (2026)
di: Pereira, Kristen, et al.
Pubblicazione: (2026)
MCPAgentBench: A Real-world Task Benchmark for Evaluating LLM Agent MCP Tool Use
di: Liu, Wenrui, et al.
Pubblicazione: (2025)
di: Liu, Wenrui, et al.
Pubblicazione: (2025)
MEGA-Bench: Scaling Multimodal Evaluation to over 500 Real-World Tasks
di: Chen, Jiacheng, et al.
Pubblicazione: (2024)
di: Chen, Jiacheng, et al.
Pubblicazione: (2024)
TheAgentCompany: Benchmarking LLM Agents on Consequential Real World Tasks
di: Xu, Frank F., et al.
Pubblicazione: (2024)
di: Xu, Frank F., et al.
Pubblicazione: (2024)
TRIP-Bench: A Benchmark for Long-Horizon Interactive Agents in Real-World Scenarios
di: Shen, Yuanzhe, et al.
Pubblicazione: (2026)
di: Shen, Yuanzhe, et al.
Pubblicazione: (2026)
BuildBench: Benchmarking LLM Agents on Compiling Real-World Open-Source Software
di: Zhang, Zehua, et al.
Pubblicazione: (2025)
di: Zhang, Zehua, et al.
Pubblicazione: (2025)
DataGovBench: Benchmarking LLM Agents for Real-World Data Governance Workflows
di: Liu, Zhou, et al.
Pubblicazione: (2025)
di: Liu, Zhou, et al.
Pubblicazione: (2025)
SWE-Universe: Scale Real-World Verifiable Environments to Millions
di: Chen, Mouxiang, et al.
Pubblicazione: (2026)
di: Chen, Mouxiang, et al.
Pubblicazione: (2026)
SWE-Next: Scalable Real-World Software Engineering Tasks for Agents
di: Liang, Jiarong, et al.
Pubblicazione: (2026)
di: Liang, Jiarong, et al.
Pubblicazione: (2026)
ITBench: Evaluating AI Agents across Diverse Real-World IT Automation Tasks
di: Jha, Saurabh, et al.
Pubblicazione: (2025)
di: Jha, Saurabh, et al.
Pubblicazione: (2025)
ClawBench: Can AI Agents Complete Everyday Online Tasks?
di: Zhang, Yuxuan, et al.
Pubblicazione: (2026)
di: Zhang, Yuxuan, et al.
Pubblicazione: (2026)
SimuWoB: Simulating Real-World Mobile Apps for Fast and Faithful GUI Agent Benchmarking
di: Liu, Guohong, et al.
Pubblicazione: (2026)
di: Liu, Guohong, et al.
Pubblicazione: (2026)
Accurate Gauge-Invariant Tensor Network Simulations for Abelian Lattice Gauge Theory in (2+1)D: ground state and real-time dynamics
di: Wu, Yantao, et al.
Pubblicazione: (2025)
di: Wu, Yantao, et al.
Pubblicazione: (2025)
VitaBench: Benchmarking LLM Agents with Versatile Interactive Tasks in Real-world Applications
di: He, Wei, et al.
Pubblicazione: (2025)
di: He, Wei, et al.
Pubblicazione: (2025)
Agent-World: Scaling Real-World Environment Synthesis for Evolving General Agent Intelligence
di: Dong, Guanting, et al.
Pubblicazione: (2026)
di: Dong, Guanting, et al.
Pubblicazione: (2026)
SkillLearnBench: Benchmarking Continual Learning Methods for Agent Skill Generation on Real-World Tasks
di: Zhong, Shanshan, et al.
Pubblicazione: (2026)
di: Zhong, Shanshan, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Are Agents Ready to Teach? A Multi-Stage Benchmark for Real-World Teaching Workflows
di: Chen, Zixin, et al.
Pubblicazione: (2026) -
DeepPlanning: Benchmarking Long-Horizon Agentic Planning with Verifiable Constraints
di: Zhang, Yinger, et al.
Pubblicazione: (2026) -
HumanStudy-Bench: Towards AI Agent Design for Participant Simulation
di: Liu, Xuan, et al.
Pubblicazione: (2026) -
PhysicianBench: Evaluating LLM Agents in Real-World EHR Environments
di: Liu, Ruoqi, et al.
Pubblicazione: (2026) -
Comparing AI Agents to Cybersecurity Professionals in Real-World Penetration Testing
di: Lin, Justin W., et al.
Pubblicazione: (2025)