Scaling Agents for Computer Use
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Gonzalez-Pumariega, Gonzalo, Tu, Vincent, Lee, Chih-Lun, Yang, Jiachen, Li, Ang, Wang, Xin Eric |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Agent S2: A Compositional Generalist-Specialist Framework for Computer Use Agents
par: Agashe, Saaket, et autres
Publié: (2025)
par: Agashe, Saaket, et autres
Publié: (2025)
Agent S: An Open Agentic Framework that Uses Computers Like a Human
par: Agashe, Saaket, et autres
Publié: (2024)
par: Agashe, Saaket, et autres
Publié: (2024)
OS Agents: A Survey on MLLM-based Agents for General Computing Devices Use
par: Hu, Xueyu, et autres
Publié: (2025)
par: Hu, Xueyu, et autres
Publié: (2025)
See, Point, Fly: A Learning-Free VLM Framework for Universal Unmanned Aerial Navigation
par: Hu, Chih Yao, et autres
Publié: (2025)
par: Hu, Chih Yao, et autres
Publié: (2025)
Tracing Representation Progression: Analyzing and Enhancing Layer-Wise Similarity
par: Jiang, Jiachen, et autres
Publié: (2024)
par: Jiang, Jiachen, et autres
Publié: (2024)
Teaching Embodied Reinforcement Learning Agents: Informativeness and Diversity of Language Use
par: Xi, Jiajun, et autres
Publié: (2024)
par: Xi, Jiajun, et autres
Publié: (2024)
The Dawn of GUI Agent: A Preliminary Case Study with Claude 3.5 Computer Use
par: Hu, Siyuan, et autres
Publié: (2024)
par: Hu, Siyuan, et autres
Publié: (2024)
AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
par: Ahn, Michael, et autres
Publié: (2024)
par: Ahn, Michael, et autres
Publié: (2024)
Video2GUI: Synthesizing Large-Scale Interaction Trajectories for Generalized GUI Agent Pretraining
par: Xiong, Weimin, et autres
Publié: (2026)
par: Xiong, Weimin, et autres
Publié: (2026)
SEAgent: Self-Evolving Computer Use Agent with Autonomous Learning from Experience
par: Sun, Zeyi, et autres
Publié: (2025)
par: Sun, Zeyi, et autres
Publié: (2025)
Stronger Normalization-Free Transformers
par: Chen, Mingzhi, et autres
Publié: (2025)
par: Chen, Mingzhi, et autres
Publié: (2025)
Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models
par: Jiang, Jiachen, et autres
Publié: (2025)
par: Jiang, Jiachen, et autres
Publié: (2025)
From EduVisBench to EduVisAgent: A Benchmark and Multi-Agent Framework for Reasoning-Driven Pedagogical Visualization
par: Ji, Haonian, et autres
Publié: (2025)
par: Ji, Haonian, et autres
Publié: (2025)
Transformers without Normalization
par: Zhu, Jiachen, et autres
Publié: (2025)
par: Zhu, Jiachen, et autres
Publié: (2025)
Scaling Computer-Use Grounding via User Interface Decomposition and Synthesis
par: Xie, Tianbao, et autres
Publié: (2025)
par: Xie, Tianbao, et autres
Publié: (2025)
LEGENT: Open Platform for Embodied Agents
par: Cheng, Zhili, et autres
Publié: (2024)
par: Cheng, Zhili, et autres
Publié: (2024)
VisualWebInstruct: Scaling up Multimodal Instruction Data through Web Search
par: Jia, Yiming, et autres
Publié: (2025)
par: Jia, Yiming, et autres
Publié: (2025)
OmniParser for Pure Vision Based GUI Agent
par: Lu, Yadong, et autres
Publié: (2024)
par: Lu, Yadong, et autres
Publié: (2024)
Delve into Visual Contrastive Decoding for Hallucination Mitigation of Large Vision-Language Models
par: Lee, Yi-Lun, et autres
Publié: (2024)
par: Lee, Yi-Lun, et autres
Publié: (2024)
Scalable Video-to-Dataset Generation for Cross-Platform Mobile Agents
par: Jang, Yunseok, et autres
Publié: (2025)
par: Jang, Yunseok, et autres
Publié: (2025)
Real Deep Research for AI, Robotics and Beyond
par: Zou, Xueyan, et autres
Publié: (2025)
par: Zou, Xueyan, et autres
Publié: (2025)
Fara-7B: An Efficient Agentic Model for Computer Use
par: Awadallah, Ahmed, et autres
Publié: (2025)
par: Awadallah, Ahmed, et autres
Publié: (2025)
MATRIX: Multimodal Agent Tuning for Robust Tool-Use Reasoning
par: Ashraf, Tajamul, et autres
Publié: (2025)
par: Ashraf, Tajamul, et autres
Publié: (2025)
OpenClaw-RL: Train Any Agent Simply by Talking
par: Wang, Yinjie, et autres
Publié: (2026)
par: Wang, Yinjie, et autres
Publié: (2026)
ViCor: Bridging Visual Understanding and Commonsense Reasoning with Large Language Models
par: Zhou, Kaiwen, et autres
Publié: (2023)
par: Zhou, Kaiwen, et autres
Publié: (2023)
On the Reliability of Computer Use Agents
par: Gonzalez-Pumariega, Gonzalo, et autres
Publié: (2026)
par: Gonzalez-Pumariega, Gonzalo, et autres
Publié: (2026)
GUI-Bee: Align GUI Action Grounding to Novel Environments via Autonomous Exploration
par: Fan, Yue, et autres
Publié: (2025)
par: Fan, Yue, et autres
Publié: (2025)
MMedAgent-RL: Optimizing Multi-Agent Collaboration for Multimodal Medical Reasoning
par: Xia, Peng, et autres
Publié: (2025)
par: Xia, Peng, et autres
Publié: (2025)
Transformers are Stateless Differentiable Neural Computers
par: Tang, Bo, et autres
Publié: (2026)
par: Tang, Bo, et autres
Publié: (2026)
DART: Leveraging Multi-Agent Disagreement for Tool Recruitment in Multimodal Reasoning
par: Sivakumaran, Nithin, et autres
Publié: (2025)
par: Sivakumaran, Nithin, et autres
Publié: (2025)
MMWorld: Towards Multi-discipline Multi-faceted World Model Evaluation in Videos
par: He, Xuehai, et autres
Publié: (2024)
par: He, Xuehai, et autres
Publié: (2024)
OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents
par: Yang, Rui, et autres
Publié: (2026)
par: Yang, Rui, et autres
Publié: (2026)
SpatialThinker: Reinforcing 3D Reasoning in Multimodal LLMs via Spatial Rewards
par: Batra, Hunar, et autres
Publié: (2025)
par: Batra, Hunar, et autres
Publié: (2025)
An Embodied Generalist Agent in 3D World
par: Huang, Jiangyong, et autres
Publié: (2023)
par: Huang, Jiangyong, et autres
Publié: (2023)
Scaling Agentic Reinforcement Learning for Tool-Integrated Reasoning in VLMs
par: Lu, Meng, et autres
Publié: (2025)
par: Lu, Meng, et autres
Publié: (2025)
CapsFusion: Rethinking Image-Text Data at Scale
par: Yu, Qiying, et autres
Publié: (2023)
par: Yu, Qiying, et autres
Publié: (2023)
Rethinking Training Dynamics in Scale-wise Autoregressive Generation
par: Zhou, Gengze, et autres
Publié: (2025)
par: Zhou, Gengze, et autres
Publié: (2025)
Towards Privacy-Aware Sign Language Translation at Scale
par: Rust, Phillip, et autres
Publié: (2024)
par: Rust, Phillip, et autres
Publié: (2024)
METAL: A Multi-Agent Framework for Chart Generation with Test-Time Scaling
par: Li, Bingxuan, et autres
Publié: (2025)
par: Li, Bingxuan, et autres
Publié: (2025)
MCU: An Evaluation Framework for Open-Ended Game Agents
par: Zheng, Xinyue, et autres
Publié: (2023)
par: Zheng, Xinyue, et autres
Publié: (2023)
Documents similaires
-
Agent S2: A Compositional Generalist-Specialist Framework for Computer Use Agents
par: Agashe, Saaket, et autres
Publié: (2025) -
Agent S: An Open Agentic Framework that Uses Computers Like a Human
par: Agashe, Saaket, et autres
Publié: (2024) -
OS Agents: A Survey on MLLM-based Agents for General Computing Devices Use
par: Hu, Xueyu, et autres
Publié: (2025) -
See, Point, Fly: A Learning-Free VLM Framework for Universal Unmanned Aerial Navigation
par: Hu, Chih Yao, et autres
Publié: (2025) -
Tracing Representation Progression: Analyzing and Enhancing Layer-Wise Similarity
par: Jiang, Jiachen, et autres
Publié: (2024)