OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Xie, Tianbao, Zhang, Danyang, Chen, Jixuan, Li, Xiaochuan, Zhao, Siheng, Cao, Ruisheng, Hua, Toh Jing, Cheng, Zhoujun, Shin, Dongchan, Lei, Fangyu, Liu, Yitao, Xu, Yiheng, Zhou, Shuyan, Savarese, Silvio, Xiong, Caiming, Zhong, Victor, Yu, Tao |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Enabling High Data Throughput Reinforcement Learning on GPUs: A Domain Agnostic Framework for Data-Driven Scientific Research
par: Lan, Tian, et autres
Publié: (2024)
par: Lan, Tian, et autres
Publié: (2024)
Shared Imagination: LLMs Hallucinate Alike
par: Zhou, Yilun, et autres
Publié: (2024)
par: Zhou, Yilun, et autres
Publié: (2024)
Spider 2.0: Evaluating Language Models on Real-World Enterprise Text-to-SQL Workflows
par: Lei, Fangyu, et autres
Publié: (2024)
par: Lei, Fangyu, et autres
Publié: (2024)
Lemur: Harmonizing Natural Language and Code for Language Agents
par: Xu, Yiheng, et autres
Publié: (2023)
par: Xu, Yiheng, et autres
Publié: (2023)
Reasoning Curriculum: Bootstrapping Broad LLM Reasoning from Math
par: Pang, Bo, et autres
Publié: (2025)
par: Pang, Bo, et autres
Publié: (2025)
INDICT: Code Generation with Internal Dialogues of Critiques for Both Security and Helpfulness
par: Le, Hung, et autres
Publié: (2024)
par: Le, Hung, et autres
Publié: (2024)
CRMArena: Understanding the Capacity of LLM Agents to Perform Professional CRM Tasks in Realistic Environments
par: Huang, Kung-Hsiang, et autres
Publié: (2024)
par: Huang, Kung-Hsiang, et autres
Publié: (2024)
OSWorld-MCP: Benchmarking MCP Tool Invocation In Computer-Use Agents
par: Jia, Hongrui, et autres
Publié: (2025)
par: Jia, Hongrui, et autres
Publié: (2025)
Spider2-V: How Far Are Multimodal Agents From Automating Data Science and Engineering Workflows?
par: Cao, Ruisheng, et autres
Publié: (2024)
par: Cao, Ruisheng, et autres
Publié: (2024)
RiOSWorld: Benchmarking the Risk of Multimodal Computer-Use Agents
par: Yang, Jingyi, et autres
Publié: (2025)
par: Yang, Jingyi, et autres
Publié: (2025)
DyMU: Dynamic Merging and Virtual Unmerging for Efficient VLMs
par: Wang, Zhenhailong, et autres
Publié: (2025)
par: Wang, Zhenhailong, et autres
Publié: (2025)
BOLT: Bootstrap Long Chain-of-Thought in Language Models without Distillation
par: Pang, Bo, et autres
Publié: (2025)
par: Pang, Bo, et autres
Publié: (2025)
Unified Training of Universal Time Series Forecasting Transformers
par: Woo, Gerald, et autres
Publié: (2024)
par: Woo, Gerald, et autres
Publié: (2024)
CodeTree: Agent-guided Tree Search for Code Generation with Large Language Models
par: Li, Jierui, et autres
Publié: (2024)
par: Li, Jierui, et autres
Publié: (2024)
Test-Time Adaptation for LLM Agents via Environment Interaction
par: Chen, Arthur, et autres
Publié: (2025)
par: Chen, Arthur, et autres
Publié: (2025)
OpenCUA: Open Foundations for Computer-Use Agents
par: Wang, Xinyuan, et autres
Publié: (2025)
par: Wang, Xinyuan, et autres
Publié: (2025)
Scaling Computer-Use Grounding via User Interface Decomposition and Synthesis
par: Xie, Tianbao, et autres
Publié: (2025)
par: Xie, Tianbao, et autres
Publié: (2025)
Hard2Verify: A Step-Level Verification Benchmark for Open-Ended Frontier Math
par: Pandit, Shrey, et autres
Publié: (2025)
par: Pandit, Shrey, et autres
Publié: (2025)
The Hyperfitting Phenomenon: Sharpening and Stabilizing LLMs for Open-Ended Text Generation
par: Carlsson, Fredrik, et autres
Publié: (2024)
par: Carlsson, Fredrik, et autres
Publié: (2024)
PerfCodeGen: Improving Performance of LLM Generated Code with Execution Feedback
par: Peng, Yun, et autres
Publié: (2024)
par: Peng, Yun, et autres
Publié: (2024)
Asynchronous Tool Usage for Real-Time Agents
par: Ginart, Antonio A., et autres
Publié: (2024)
par: Ginart, Antonio A., et autres
Publié: (2024)
MCU: An Evaluation Framework for Open-Ended Game Agents
par: Zheng, Xinyue, et autres
Publié: (2023)
par: Zheng, Xinyue, et autres
Publié: (2023)
Embodied World Models Emerge from Navigational Task in Open-Ended Environments
par: Jin, Li, et autres
Publié: (2025)
par: Jin, Li, et autres
Publié: (2025)
BLIP3-o: A Family of Fully Open Unified Multimodal Models-Architecture, Training and Dataset
par: Chen, Jiuhai, et autres
Publié: (2025)
par: Chen, Jiuhai, et autres
Publié: (2025)
LZ Penalty: An information-theoretic repetition penalty for autoregressive language models
par: Ginart, Antonio A., et autres
Publié: (2025)
par: Ginart, Antonio A., et autres
Publié: (2025)
CodeXEmbed: A Generalist Embedding Model Family for Multiligual and Multi-task Code Retrieval
par: Liu, Ye, et autres
Publié: (2024)
par: Liu, Ye, et autres
Publié: (2024)
MINT-1T: Scaling Open-Source Multimodal Data by 10x: A Multimodal Dataset with One Trillion Tokens
par: Awadalla, Anas, et autres
Publié: (2024)
par: Awadalla, Anas, et autres
Publié: (2024)
Extending RLVR to Open-Ended Tasks via Verifiable Multiple-Choice Reformulation
par: Zhang, Mengyu, et autres
Publié: (2025)
par: Zhang, Mengyu, et autres
Publié: (2025)
Ultrahigh‐temperature tensile behaviors of ZrB 2 –SiC ceramics
par: Tianbao Cheng, et autres
Publié: (2024)
par: Tianbao Cheng, et autres
Publié: (2024)
OSWorld-Human: Benchmarking the Efficiency of Computer-Use Agents
par: Abhyankar, Reyna, et autres
Publié: (2025)
par: Abhyankar, Reyna, et autres
Publié: (2025)
Strefer: Empowering Video LLMs with Space-Time Referring and Reasoning via Synthetic Instruction Data
par: Zhou, Honglu, et autres
Publié: (2025)
par: Zhou, Honglu, et autres
Publié: (2025)
AEL: Agent Evolving Learning for Open-Ended Environments
par: Xu, Wujiang, et autres
Publié: (2026)
par: Xu, Wujiang, et autres
Publié: (2026)
UserBench: An Interactive Gym Environment for User-Centric Agents
par: Qian, Cheng, et autres
Publié: (2025)
par: Qian, Cheng, et autres
Publié: (2025)
xGen-small Technical Report
par: Nijkamp, Erik, et autres
Publié: (2025)
par: Nijkamp, Erik, et autres
Publié: (2025)
SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents
par: Nguyen, Xuan-Phi, et autres
Publié: (2025)
par: Nguyen, Xuan-Phi, et autres
Publié: (2025)
GIFT-Eval: A Benchmark For General Time Series Forecasting Model Evaluation
par: Aksu, Taha, et autres
Publié: (2024)
par: Aksu, Taha, et autres
Publié: (2024)
Reward-Guided Speculative Decoding for Efficient LLM Reasoning
par: Liao, Baohao, et autres
Publié: (2025)
par: Liao, Baohao, et autres
Publié: (2025)
ViUniT: Visual Unit Tests for More Robust Visual Programming
par: Panagopoulou, Artemis, et autres
Publié: (2024)
par: Panagopoulou, Artemis, et autres
Publié: (2024)
Entropy-Based Block Pruning for Efficient Large Language Models
par: Yang, Liangwei, et autres
Publié: (2025)
par: Yang, Liangwei, et autres
Publié: (2025)
Enterprise Deep Research: Steerable Multi-Agent Deep Research for Enterprise Analytics
par: Prabhakar, Akshara, et autres
Publié: (2025)
par: Prabhakar, Akshara, et autres
Publié: (2025)
Documents similaires
-
Enabling High Data Throughput Reinforcement Learning on GPUs: A Domain Agnostic Framework for Data-Driven Scientific Research
par: Lan, Tian, et autres
Publié: (2024) -
Shared Imagination: LLMs Hallucinate Alike
par: Zhou, Yilun, et autres
Publié: (2024) -
Spider 2.0: Evaluating Language Models on Real-World Enterprise Text-to-SQL Workflows
par: Lei, Fangyu, et autres
Publié: (2024) -
Lemur: Harmonizing Natural Language and Code for Language Agents
par: Xu, Yiheng, et autres
Publié: (2023) -
Reasoning Curriculum: Bootstrapping Broad LLM Reasoning from Math
par: Pang, Bo, et autres
Publié: (2025)