On the Reliability of Computer Use Agents
Fuente:
arXiv
Salvato in:
| Autori principali: | Gonzalez-Pumariega, Gonzalo, Agashe, Saaket, Yang, Jiachen, Li, Ang, Wang, Xin Eric |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Agent S2: A Compositional Generalist-Specialist Framework for Computer Use Agents
di: Agashe, Saaket, et al.
Pubblicazione: (2025)
di: Agashe, Saaket, et al.
Pubblicazione: (2025)
Agent S: An Open Agentic Framework that Uses Computers Like a Human
di: Agashe, Saaket, et al.
Pubblicazione: (2024)
di: Agashe, Saaket, et al.
Pubblicazione: (2024)
Scaling Agents for Computer Use
di: Gonzalez-Pumariega, Gonzalo, et al.
Pubblicazione: (2025)
di: Gonzalez-Pumariega, Gonzalo, et al.
Pubblicazione: (2025)
Self-Resource Allocation in Multi-Agent LLM Systems
di: Amayuelas, Alfonso, et al.
Pubblicazione: (2025)
di: Amayuelas, Alfonso, et al.
Pubblicazione: (2025)
EnactToM: An Evolving Benchmark for Functional Theory of Mind in Embodied Agents
di: Juneja, Gurusha, et al.
Pubblicazione: (2026)
di: Juneja, Gurusha, et al.
Pubblicazione: (2026)
Robotouille: An Asynchronous Planning Benchmark for LLM Agents
di: Gonzalez-Pumariega, Gonzalo, et al.
Pubblicazione: (2025)
di: Gonzalez-Pumariega, Gonzalo, et al.
Pubblicazione: (2025)
Stateful Reasoning via Insight Replay
di: Lei, Bin, et al.
Pubblicazione: (2026)
di: Lei, Bin, et al.
Pubblicazione: (2026)
Query-Efficient Planning with Language Models
di: Gonzalez-Pumariega, Gonzalo, et al.
Pubblicazione: (2024)
di: Gonzalez-Pumariega, Gonzalo, et al.
Pubblicazione: (2024)
LLM-Coordination: Evaluating and Analyzing Multi-agent Coordination Abilities in Large Language Models
di: Agashe, Saaket, et al.
Pubblicazione: (2023)
di: Agashe, Saaket, et al.
Pubblicazione: (2023)
Skill-Aligned Fairness in Multi-Agent Learning for Collaboration in Healthcare
di: Ekpo, Promise Osaine, et al.
Pubblicazione: (2025)
di: Ekpo, Promise Osaine, et al.
Pubblicazione: (2025)
MCPWorld: A Unified Benchmarking Testbed for API, GUI, and Hybrid Computer Use Agents
di: Yan, Yunhe, et al.
Pubblicazione: (2025)
di: Yan, Yunhe, et al.
Pubblicazione: (2025)
RiOSWorld: Benchmarking the Risk of Multimodal Computer-Use Agents
di: Yang, Jingyi, et al.
Pubblicazione: (2025)
di: Yang, Jingyi, et al.
Pubblicazione: (2025)
OSExpert: Computer-Use Agents Learning Professional Skills via Exploration
di: Liu, Jiateng, et al.
Pubblicazione: (2026)
di: Liu, Jiateng, et al.
Pubblicazione: (2026)
Learning to Rewrite Tool Descriptions for Reliable LLM-Agent Tool Use
di: Guo, Ruocheng, et al.
Pubblicazione: (2026)
di: Guo, Ruocheng, et al.
Pubblicazione: (2026)
Human-Guided Harm Recovery for Computer Use Agents
di: Li, Christy, et al.
Pubblicazione: (2026)
di: Li, Christy, et al.
Pubblicazione: (2026)
PRO-CUA: Process-Reward Optimization for Computer Use Agents
di: He, Yifei, et al.
Pubblicazione: (2026)
di: He, Yifei, et al.
Pubblicazione: (2026)
Multi-Turn Code Generation Through Single-Step Rewards
di: Jain, Arnav Kumar, et al.
Pubblicazione: (2025)
di: Jain, Arnav Kumar, et al.
Pubblicazione: (2025)
AgentHijack: Benchmarking Computer Use Agent Robustness to Common Environment Corruptions
di: Sun, Jingwei, et al.
Pubblicazione: (2026)
di: Sun, Jingwei, et al.
Pubblicazione: (2026)
A Large Language Model-Empowered Agent for Reliable and Robust Structural Analysis
di: Liu, Jiachen, et al.
Pubblicazione: (2025)
di: Liu, Jiachen, et al.
Pubblicazione: (2025)
Context Bootstrapped Reinforcement Learning
di: Agashe, Saaket, et al.
Pubblicazione: (2026)
di: Agashe, Saaket, et al.
Pubblicazione: (2026)
AgentHazard: A Benchmark for Evaluating Harmful Behavior in Computer-Use Agents
di: Feng, Yunhao, et al.
Pubblicazione: (2026)
di: Feng, Yunhao, et al.
Pubblicazione: (2026)
Identification of Probabilities of Causation: from Recursive to Closed-Form Bounds
di: Shu, Xin, et al.
Pubblicazione: (2025)
di: Shu, Xin, et al.
Pubblicazione: (2025)
CaMeLs Can Use Computers Too: System-level Security for Computer Use Agents
di: Foerster, Hanna, et al.
Pubblicazione: (2026)
di: Foerster, Hanna, et al.
Pubblicazione: (2026)
OpenCUA: Open Foundations for Computer-Use Agents
di: Wang, Xinyuan, et al.
Pubblicazione: (2025)
di: Wang, Xinyuan, et al.
Pubblicazione: (2025)
The Art of Building Verifiers for Computer Use Agents
di: Rosset, Corby, et al.
Pubblicazione: (2026)
di: Rosset, Corby, et al.
Pubblicazione: (2026)
IntentScore: Intent-Conditioned Action Evaluation for Computer-Use Agents
di: Chen, Rongqian, et al.
Pubblicazione: (2026)
di: Chen, Rongqian, et al.
Pubblicazione: (2026)
The Agent Use of Agent Beings: Agent Cybernetics Is the Missing Science of Foundation Agents
di: Wang, Xinrun, et al.
Pubblicazione: (2026)
di: Wang, Xinrun, et al.
Pubblicazione: (2026)
Grounding Computer Use Agents on Human Demonstrations
di: Feizi, Aarash, et al.
Pubblicazione: (2025)
di: Feizi, Aarash, et al.
Pubblicazione: (2025)
Reducing Cognitive Overhead in Tool Use via Multi-Small-Agent Reinforcement Learning
di: Wang, Dayu, et al.
Pubblicazione: (2025)
di: Wang, Dayu, et al.
Pubblicazione: (2025)
C-World: A Computer Use Agent Environment Creator
di: Xi, Ziqiao, et al.
Pubblicazione: (2026)
di: Xi, Ziqiao, et al.
Pubblicazione: (2026)
ComputerRL: Scaling End-to-End Online Reinforcement Learning for Computer Use Agents
di: Lai, Hanyu, et al.
Pubblicazione: (2025)
di: Lai, Hanyu, et al.
Pubblicazione: (2025)
OpenComputer: Verifiable Software Worlds for Computer-Use Agents
di: Wei, Jinbiao, et al.
Pubblicazione: (2026)
di: Wei, Jinbiao, et al.
Pubblicazione: (2026)
Agent Alpha: Tree Search Unifying Generation, Exploration and Evaluation for Computer-Use Agents
di: Tang, Sizhe, et al.
Pubblicazione: (2026)
di: Tang, Sizhe, et al.
Pubblicazione: (2026)
S-Agents: Self-organizing Agents in Open-ended Environments
di: Chen, Jiaqi, et al.
Pubblicazione: (2024)
di: Chen, Jiaqi, et al.
Pubblicazione: (2024)
ToolCUA: Towards Optimal GUI-Tool Path Orchestration for Computer Use Agents
di: Hu, Xuhao, et al.
Pubblicazione: (2026)
di: Hu, Xuhao, et al.
Pubblicazione: (2026)
P-Guide: Parameter-Efficient Prior Steering for Single-Pass CFG Inference
di: Peng, Xin, et al.
Pubblicazione: (2026)
di: Peng, Xin, et al.
Pubblicazione: (2026)
DPO Learning with LLMs-Judge Signal for Computer Use Agents
di: Luo, Man, et al.
Pubblicazione: (2025)
di: Luo, Man, et al.
Pubblicazione: (2025)
SlideBot: A Multi-Agent Framework for Generating Informative, Reliable, Multi-Modal Presentations
di: Xie, Eric, et al.
Pubblicazione: (2025)
di: Xie, Eric, et al.
Pubblicazione: (2025)
DORAEMON: Decentralized Ontology-aware Reliable Agent with Enhanced Memory Oriented Navigation
di: Gu, Tianjun, et al.
Pubblicazione: (2025)
di: Gu, Tianjun, et al.
Pubblicazione: (2025)
Evolving in Tasks: Empowering the Multi-modality Large Language Model as the Computer Use Agent
di: Cheng, Yuhao, et al.
Pubblicazione: (2025)
di: Cheng, Yuhao, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Agent S2: A Compositional Generalist-Specialist Framework for Computer Use Agents
di: Agashe, Saaket, et al.
Pubblicazione: (2025) -
Agent S: An Open Agentic Framework that Uses Computers Like a Human
di: Agashe, Saaket, et al.
Pubblicazione: (2024) -
Scaling Agents for Computer Use
di: Gonzalez-Pumariega, Gonzalo, et al.
Pubblicazione: (2025) -
Self-Resource Allocation in Multi-Agent LLM Systems
di: Amayuelas, Alfonso, et al.
Pubblicazione: (2025) -
EnactToM: An Evolving Benchmark for Functional Theory of Mind in Embodied Agents
di: Juneja, Gurusha, et al.
Pubblicazione: (2026)