GUI Agents with Foundation Models: A Comprehensive Survey
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Shuai, Liu, Weiwen, Chen, Jingxuan, Zhou, Yuqi, Gan, Weinan, Zeng, Xingshan, Che, Yuhan, Yu, Shuai, Hao, Xinlong, Shao, Kun, Wang, Bin, Wu, Chuhan, Wang, Yasheng, Tang, Ruiming, Hao, Jianye |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
ToolACE-DEV: Self-Improving Tool Learning via Decomposition and EVolution
di: Huang, Xu, et al.
Pubblicazione: (2025)
di: Huang, Xu, et al.
Pubblicazione: (2025)
SPA-Bench: A Comprehensive Benchmark for SmartPhone Agent Evaluation
di: Chen, Jingxuan, et al.
Pubblicazione: (2024)
di: Chen, Jingxuan, et al.
Pubblicazione: (2024)
ACEBench: Who Wins the Match Point in Tool Usage?
di: Chen, Chen, et al.
Pubblicazione: (2025)
di: Chen, Chen, et al.
Pubblicazione: (2025)
Position: The Real Barrier to LLM Agent Usability is Agentic ROI
di: Liu, Weiwen, et al.
Pubblicazione: (2025)
di: Liu, Weiwen, et al.
Pubblicazione: (2025)
Advancing and Benchmarking Personalized Tool Invocation for LLMs
di: Huang, Xu, et al.
Pubblicazione: (2025)
di: Huang, Xu, et al.
Pubblicazione: (2025)
ToolACE: Winning the Points of LLM Function Calling
di: Liu, Weiwen, et al.
Pubblicazione: (2024)
di: Liu, Weiwen, et al.
Pubblicazione: (2024)
Fast, Slow, and Tool-augmented Thinking for LLMs: A Review
di: Jia, Xinda, et al.
Pubblicazione: (2025)
di: Jia, Xinda, et al.
Pubblicazione: (2025)
Uncertainty-Aware GUI Agent: Adaptive Perception through Component Recommendation and Human-in-the-Loop Refinement
di: Hao, Chao, et al.
Pubblicazione: (2025)
di: Hao, Chao, et al.
Pubblicazione: (2025)
ToolACE-R: Model-aware Iterative Training and Adaptive Refinement for Tool Learning
di: Zeng, Xingshan, et al.
Pubblicazione: (2025)
di: Zeng, Xingshan, et al.
Pubblicazione: (2025)
GUI-G1: Understanding R1-Zero-Like Training for Visual Grounding in GUI Agents
di: Zhou, Yuqi, et al.
Pubblicazione: (2025)
di: Zhou, Yuqi, et al.
Pubblicazione: (2025)
ViMo: A Generative Visual GUI World Model for App Agents
di: Luo, Dezhao, et al.
Pubblicazione: (2025)
di: Luo, Dezhao, et al.
Pubblicazione: (2025)
ARTIS: Agentic Risk-Aware Test-Time Scaling via Iterative Simulation
di: Zeng, Xingshan, et al.
Pubblicazione: (2026)
di: Zeng, Xingshan, et al.
Pubblicazione: (2026)
Instruction-Tuning Data Synthesis from Scratch via Web Reconstruction
di: Jiang, Yuxin, et al.
Pubblicazione: (2025)
di: Jiang, Yuxin, et al.
Pubblicazione: (2025)
ATGen: Adversarial Reinforcement Learning for Test Case Generation
di: Li, Qingyao, et al.
Pubblicazione: (2025)
di: Li, Qingyao, et al.
Pubblicazione: (2025)
WESE: Weak Exploration to Strong Exploitation for LLM Agents
di: Huang, Xu, et al.
Pubblicazione: (2024)
di: Huang, Xu, et al.
Pubblicazione: (2024)
Beyond Syntax: Action Semantics Learning for App Agents
di: Tang, Bohan, et al.
Pubblicazione: (2025)
di: Tang, Bohan, et al.
Pubblicazione: (2025)
HATS: Hardness-Aware Trajectory Synthesis for GUI Agents
di: Shao, Rui, et al.
Pubblicazione: (2026)
di: Shao, Rui, et al.
Pubblicazione: (2026)
Advancing Autonomous VLM Agents via Variational Subgoal-Conditioned Reinforcement Learning
di: Wu, Qingyuan, et al.
Pubblicazione: (2025)
di: Wu, Qingyuan, et al.
Pubblicazione: (2025)
LLM-Powered GUI Agents in Phone Automation: Surveying Progress and Prospects
di: Liu, Guangyi, et al.
Pubblicazione: (2025)
di: Liu, Guangyi, et al.
Pubblicazione: (2025)
ToolACE-MT: Non-Autoregressive Generation for Agentic Multi-Turn Interaction
di: Zeng, Xingshan, et al.
Pubblicazione: (2025)
di: Zeng, Xingshan, et al.
Pubblicazione: (2025)
Understanding the planning of LLM agents: A survey
di: Huang, Xu, et al.
Pubblicazione: (2024)
di: Huang, Xu, et al.
Pubblicazione: (2024)
Adaptive Milestone Reward for GUI Agents
di: Zheng, Congmin, et al.
Pubblicazione: (2026)
di: Zheng, Congmin, et al.
Pubblicazione: (2026)
LogitsCoder: Towards Efficient Chain-of-Thought Path Search via Logits Preference Decoding for Code Generation
di: Chen, Jizheng, et al.
Pubblicazione: (2026)
di: Chen, Jizheng, et al.
Pubblicazione: (2026)
DistRL: An Asynchronous Distributed Reinforcement Learning Framework for On-Device Control Agents
di: Wang, Taiyi, et al.
Pubblicazione: (2024)
di: Wang, Taiyi, et al.
Pubblicazione: (2024)
Evolutionary Perspectives on the Evaluation of LLM-Based AI Agents: A Comprehensive Survey
di: Zhu, Jiachen, et al.
Pubblicazione: (2025)
di: Zhu, Jiachen, et al.
Pubblicazione: (2025)
ToolFlow: Boosting LLM Tool-Calling Through Natural and Coherent Dialogue Synthesis
di: Wang, Zezhong, et al.
Pubblicazione: (2024)
di: Wang, Zezhong, et al.
Pubblicazione: (2024)
Bridging and Modeling Correlations in Pairwise Data for Direct Preference Optimization
di: Jiang, Yuxin, et al.
Pubblicazione: (2024)
di: Jiang, Yuxin, et al.
Pubblicazione: (2024)
EE-MCP: Self-Evolving MCP-GUI Agents via Automated Environment Generation and Experience Learning
di: He, Tiantian, et al.
Pubblicazione: (2026)
di: He, Tiantian, et al.
Pubblicazione: (2026)
VeriOS: Query-Driven Proactive Human-Agent-GUI Interaction for Trustworthy OS Agents
di: Wu, Zheng, et al.
Pubblicazione: (2025)
di: Wu, Zheng, et al.
Pubblicazione: (2025)
Entropy Law: The Story Behind Data Compression and LLM Performance
di: Yin, Mingjia, et al.
Pubblicazione: (2024)
di: Yin, Mingjia, et al.
Pubblicazione: (2024)
Stepwise Reasoning Checkpoint Analysis: A Test Time Scaling Method to Enhance LLMs' Reasoning
di: Wang, Zezhong, et al.
Pubblicazione: (2025)
di: Wang, Zezhong, et al.
Pubblicazione: (2025)
Chain-of-Probe: Examining the Necessity and Accuracy of CoT Step-by-Step
di: Wang, Zezhong, et al.
Pubblicazione: (2024)
di: Wang, Zezhong, et al.
Pubblicazione: (2024)
Play to Your Strengths: Collaborative Intelligence of Conventional Recommender Models and Large Language Models
di: Xi, Yunjia, et al.
Pubblicazione: (2024)
di: Xi, Yunjia, et al.
Pubblicazione: (2024)
ACE-Router: Generalizing History-Aware Routing from MCP Tools to the Agent Web
di: Yao, Zhiyuan, et al.
Pubblicazione: (2026)
di: Yao, Zhiyuan, et al.
Pubblicazione: (2026)
Crowd Comparative Reasoning: Unlocking Comprehensive Evaluations for LLM-as-a-Judge
di: Zhang, Qiyuan, et al.
Pubblicazione: (2025)
di: Zhang, Qiyuan, et al.
Pubblicazione: (2025)
NL-Debugging: Exploiting Natural Language as an Intermediate Representation for Code Debugging
di: Zhang, Weiming, et al.
Pubblicazione: (2025)
di: Zhang, Weiming, et al.
Pubblicazione: (2025)
MonoScale: Scaling Multi-Agent System with Monotonic Improvement
di: Shao, Shuai, et al.
Pubblicazione: (2026)
di: Shao, Shuai, et al.
Pubblicazione: (2026)
Adaptive Tool Use in Large Language Models with Meta-Cognition Trigger
di: Li, Wenjun, et al.
Pubblicazione: (2025)
di: Li, Wenjun, et al.
Pubblicazione: (2025)
HiconAgent: History Context-aware Policy Optimization for GUI Agents
di: Zhou, Xurui, et al.
Pubblicazione: (2025)
di: Zhou, Xurui, et al.
Pubblicazione: (2025)
Planning, Creation, Usage: Benchmarking LLMs for Comprehensive Tool Utilization in Real-World Complex Scenarios
di: Huang, Shijue, et al.
Pubblicazione: (2024)
di: Huang, Shijue, et al.
Pubblicazione: (2024)
Documenti analoghi
-
ToolACE-DEV: Self-Improving Tool Learning via Decomposition and EVolution
di: Huang, Xu, et al.
Pubblicazione: (2025) -
SPA-Bench: A Comprehensive Benchmark for SmartPhone Agent Evaluation
di: Chen, Jingxuan, et al.
Pubblicazione: (2024) -
ACEBench: Who Wins the Match Point in Tool Usage?
di: Chen, Chen, et al.
Pubblicazione: (2025) -
Position: The Real Barrier to LLM Agent Usability is Agentic ROI
di: Liu, Weiwen, et al.
Pubblicazione: (2025) -
Advancing and Benchmarking Personalized Tool Invocation for LLMs
di: Huang, Xu, et al.
Pubblicazione: (2025)