Agent S: An Open Agentic Framework that Uses Computers Like a Human
Fuente:
arXiv
Guardado en:
| Autores principales: | Agashe, Saaket, Han, Jiuzhou, Gan, Shuyu, Yang, Jiachen, Li, Ang, Wang, Xin Eric |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Agent S2: A Compositional Generalist-Specialist Framework for Computer Use Agents
por: Agashe, Saaket, et al.
Publicado: (2025)
por: Agashe, Saaket, et al.
Publicado: (2025)
Scaling Agents for Computer Use
por: Gonzalez-Pumariega, Gonzalo, et al.
Publicado: (2025)
por: Gonzalez-Pumariega, Gonzalo, et al.
Publicado: (2025)
Fara-7B: An Efficient Agentic Model for Computer Use
por: Awadallah, Ahmed, et al.
Publicado: (2025)
por: Awadallah, Ahmed, et al.
Publicado: (2025)
EndoCogniAgent: Closed-Loop Agentic Reasoning with Self-Consistency Validation for Endoscopic Diagnosis
por: Tang, Yi, et al.
Publicado: (2025)
por: Tang, Yi, et al.
Publicado: (2025)
JARVIS: A Neuro-Symbolic Commonsense Reasoning Framework for Conversational Embodied Agents
por: Zheng, Kaizhi, et al.
Publicado: (2022)
por: Zheng, Kaizhi, et al.
Publicado: (2022)
MCU: An Evaluation Framework for Open-Ended Game Agents
por: Zheng, Xinyue, et al.
Publicado: (2023)
por: Zheng, Xinyue, et al.
Publicado: (2023)
ADAM: An Embodied Causal Agent in Open-World Environments
por: Yu, Shu, et al.
Publicado: (2024)
por: Yu, Shu, et al.
Publicado: (2024)
GUI-G1: Understanding R1-Zero-Like Training for Visual Grounding in GUI Agents
por: Zhou, Yuqi, et al.
Publicado: (2025)
por: Zhou, Yuqi, et al.
Publicado: (2025)
Towards Human-Level Understanding of Complex Process Engineering Schematics: A Pedagogical, Introspective Multi-Agent Framework for Open-Domain Question Answering
por: Sakhinana, Sagar Srinivas, et al.
Publicado: (2024)
por: Sakhinana, Sagar Srinivas, et al.
Publicado: (2024)
Scaling Agentic Reinforcement Learning for Tool-Integrated Reasoning in VLMs
por: Lu, Meng, et al.
Publicado: (2025)
por: Lu, Meng, et al.
Publicado: (2025)
SOK-Bench: A Situated Video Reasoning Benchmark with Aligned Open-World Knowledge
por: Wang, Andong, et al.
Publicado: (2024)
por: Wang, Andong, et al.
Publicado: (2024)
From EduVisBench to EduVisAgent: A Benchmark and Multi-Agent Framework for Reasoning-Driven Pedagogical Visualization
por: Ji, Haonian, et al.
Publicado: (2025)
por: Ji, Haonian, et al.
Publicado: (2025)
MMWorld: Towards Multi-discipline Multi-faceted World Model Evaluation in Videos
por: He, Xuehai, et al.
Publicado: (2024)
por: He, Xuehai, et al.
Publicado: (2024)
Navigating the Digital World as Humans Do: Universal Visual Grounding for GUI Agents
por: Gou, Boyu, et al.
Publicado: (2024)
por: Gou, Boyu, et al.
Publicado: (2024)
UltraCUA: A Foundation Model for Computer Use Agents with Hybrid Action
por: Yang, Yuhao, et al.
Publicado: (2025)
por: Yang, Yuhao, et al.
Publicado: (2025)
OpenClaw-RL: Train Any Agent Simply by Talking
por: Wang, Yinjie, et al.
Publicado: (2026)
por: Wang, Yinjie, et al.
Publicado: (2026)
PyVision: Agentic Vision with Dynamic Tooling
por: Zhao, Shitian, et al.
Publicado: (2025)
por: Zhao, Shitian, et al.
Publicado: (2025)
Fast-Slow Thinking GRPO for Large Vision-Language Model Reasoning
por: Xiao, Wenyi, et al.
Publicado: (2025)
por: Xiao, Wenyi, et al.
Publicado: (2025)
Evaluation Agent: Efficient and Promptable Evaluation Framework for Visual Generative Models
por: Zhang, Fan, et al.
Publicado: (2024)
por: Zhang, Fan, et al.
Publicado: (2024)
MM-WebAgent: A Hierarchical Multimodal Web Agent for Webpage Generation
por: Li, Yan, et al.
Publicado: (2026)
por: Li, Yan, et al.
Publicado: (2026)
On the Reliability of Computer Use Agents
por: Gonzalez-Pumariega, Gonzalo, et al.
Publicado: (2026)
por: Gonzalez-Pumariega, Gonzalo, et al.
Publicado: (2026)
A Survey on Agentic Multimodal Large Language Models
por: Yao, Huanjin, et al.
Publicado: (2025)
por: Yao, Huanjin, et al.
Publicado: (2025)
OpenMobile: Building Open Mobile Agents with Task and Trajectory Synthesis
por: Cheng, Kanzhi, et al.
Publicado: (2026)
por: Cheng, Kanzhi, et al.
Publicado: (2026)
The Dawn of GUI Agent: A Preliminary Case Study with Claude 3.5 Computer Use
por: Hu, Siyuan, et al.
Publicado: (2024)
por: Hu, Siyuan, et al.
Publicado: (2024)
TC-Bench: Benchmarking Temporal Compositionality in Text-to-Video and Image-to-Video Generation
por: Feng, Weixi, et al.
Publicado: (2024)
por: Feng, Weixi, et al.
Publicado: (2024)
METAL: A Multi-Agent Framework for Chart Generation with Test-Time Scaling
por: Li, Bingxuan, et al.
Publicado: (2025)
por: Li, Bingxuan, et al.
Publicado: (2025)
Failure Makes the Agent Stronger: Enhancing Accuracy through Structured Reflection for Reliable Tool Interactions
por: Su, Junhao, et al.
Publicado: (2025)
por: Su, Junhao, et al.
Publicado: (2025)
VideoExplorer: Think With Videos For Agentic Long-Video Understanding
por: Yuan, Huaying, et al.
Publicado: (2025)
por: Yuan, Huaying, et al.
Publicado: (2025)
A Unified Agentic Framework for Evaluating Conditional Image Generation
por: Wang, Jifang, et al.
Publicado: (2025)
por: Wang, Jifang, et al.
Publicado: (2025)
VerlTool: Towards Holistic Agentic Reinforcement Learning with Tool Use
por: Jiang, Dongfu, et al.
Publicado: (2025)
por: Jiang, Dongfu, et al.
Publicado: (2025)
End-to-End Agentic RAG System Training for Traceable Diagnostic Reasoning
por: Zheng, Qiaoyu, et al.
Publicado: (2025)
por: Zheng, Qiaoyu, et al.
Publicado: (2025)
TeleMem: Building Long-Term and Multimodal Memory for Agentic AI
por: Chen, Chunliang, et al.
Publicado: (2025)
por: Chen, Chunliang, et al.
Publicado: (2025)
ATLAS: Agentic or Latent Visual Reasoning? One Word is Enough for Both
por: Guo, Ziyu, et al.
Publicado: (2026)
por: Guo, Ziyu, et al.
Publicado: (2026)
OpenCUA: Open Foundations for Computer-Use Agents
por: Wang, Xinyuan, et al.
Publicado: (2025)
por: Wang, Xinyuan, et al.
Publicado: (2025)
ViCor: Bridging Visual Understanding and Commonsense Reasoning with Large Language Models
por: Zhou, Kaiwen, et al.
Publicado: (2023)
por: Zhou, Kaiwen, et al.
Publicado: (2023)
ComCLIP: Training-Free Compositional Image and Text Matching
por: Jiang, Kenan, et al.
Publicado: (2022)
por: Jiang, Kenan, et al.
Publicado: (2022)
OpenVLThinkerV2: A Generalist Multimodal Reasoning Model for Multi-domain Visual Tasks
por: Hu, Wenbo, et al.
Publicado: (2026)
por: Hu, Wenbo, et al.
Publicado: (2026)
Enhancing Human-Computer Interaction in Chest X-ray Analysis using Vision and Language Model with Eye Gaze Patterns
por: Kim, Yunsoo, et al.
Publicado: (2024)
por: Kim, Yunsoo, et al.
Publicado: (2024)
VL-Calibration: Decoupled Confidence Calibration for Large Vision-Language Models Reasoning
por: Xiao, Wenyi, et al.
Publicado: (2026)
por: Xiao, Wenyi, et al.
Publicado: (2026)
Navigation as Attackers Wish? Towards Building Robust Embodied Agents under Federated Learning
por: Zhang, Yunchao, et al.
Publicado: (2022)
por: Zhang, Yunchao, et al.
Publicado: (2022)
Ejemplares similares
-
Agent S2: A Compositional Generalist-Specialist Framework for Computer Use Agents
por: Agashe, Saaket, et al.
Publicado: (2025) -
Scaling Agents for Computer Use
por: Gonzalez-Pumariega, Gonzalo, et al.
Publicado: (2025) -
Fara-7B: An Efficient Agentic Model for Computer Use
por: Awadallah, Ahmed, et al.
Publicado: (2025) -
EndoCogniAgent: Closed-Loop Agentic Reasoning with Self-Consistency Validation for Endoscopic Diagnosis
por: Tang, Yi, et al.
Publicado: (2025) -
JARVIS: A Neuro-Symbolic Commonsense Reasoning Framework for Conversational Embodied Agents
por: Zheng, Kaizhi, et al.
Publicado: (2022)