Building Autonomous GUI Navigation via Agentic-Q Estimation and Step-Wise Policy Optimization
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Yibo, Huzhang, Guangda, Hu, Yuwei, Xia, Yu, Lu, Shiyin, Chen, Qing-Guo, Xu, Zhao, Luo, Weihua, Zhang, Kaifu, Zhang, Lijun |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Walk the Talk: Bridging the Reasoning-Action Gap for Thinking with Images via Multimodal Agentic Policy Optimization
par: Yang, Wenhao, et autres
Publié: (2026)
par: Yang, Wenhao, et autres
Publié: (2026)
GraphPilot: GUI Task Automation with One-Step LLM Reasoning Powered by Knowledge Graph
par: Yu, Mingxian, et autres
Publié: (2026)
par: Yu, Mingxian, et autres
Publié: (2026)
PixelWeb: The First Web GUI Dataset with Pixel-Wise Labels
par: Yang, Qi, et autres
Publié: (2025)
par: Yang, Qi, et autres
Publié: (2025)
GUI-R1 : A Generalist R1-Style Vision-Language Action Model For GUI Agents
par: Luo, Run, et autres
Publié: (2025)
par: Luo, Run, et autres
Publié: (2025)
UIPro: Unleashing Superior Interaction Capability For GUI Agents
par: Li, Hongxin, et autres
Publié: (2025)
par: Li, Hongxin, et autres
Publié: (2025)
Navi-plus: Managing Ambiguous GUI Navigation Tasks with Follow-up Questions
par: Cheng, Ziming, et autres
Publié: (2025)
par: Cheng, Ziming, et autres
Publié: (2025)
Optimal Transport-Based Token Weighting scheme for Enhanced Preference Optimization
par: Li, Meng, et autres
Publié: (2025)
par: Li, Meng, et autres
Publié: (2025)
OmniGUI: Benchmarking GUI Agents in Omni-Modal Smartphone Environments
par: Henry, Felix, et autres
Publié: (2026)
par: Henry, Felix, et autres
Publié: (2026)
Building AI Literacy at Home: How Families Navigate Children's Self-Directed Learning with AI
par: Xie, Jingyi, et autres
Publié: (2025)
par: Xie, Jingyi, et autres
Publié: (2025)
SeeClick: Harnessing GUI Grounding for Advanced Visual GUI Agents
par: Cheng, Kanzhi, et autres
Publié: (2024)
par: Cheng, Kanzhi, et autres
Publié: (2024)
Beyond Clicking:A Step Towards Generalist GUI Grounding via Text Dragging
par: Liao, Zeyi, et autres
Publié: (2025)
par: Liao, Zeyi, et autres
Publié: (2025)
Large Language Model-Brained GUI Agents: A Survey
par: Zhang, Chaoyun, et autres
Publié: (2024)
par: Zhang, Chaoyun, et autres
Publié: (2024)
Characterizing Unintended Consequences in Human-GUI Agent Collaboration for Web Browsing
par: Zhang, Shuning, et autres
Publié: (2025)
par: Zhang, Shuning, et autres
Publié: (2025)
UI-E2I-Synth: Advancing GUI Grounding with Large-Scale Instruction Synthesis
par: Liu, Xinyi, et autres
Publié: (2025)
par: Liu, Xinyi, et autres
Publié: (2025)
Building an Open-Source Community to Enhance Autonomic Nervous System Signal Analysis: DBDP-Autonomic
par: Dunn, Jessilyn, et autres
Publié: (2024)
par: Dunn, Jessilyn, et autres
Publié: (2024)
MobileViews: A Million-scale and Diverse Mobile GUI Dataset
par: Gao, Longxi, et autres
Publié: (2024)
par: Gao, Longxi, et autres
Publié: (2024)
Triplets Better Than Pairs: Towards Stable and Effective Self-Play Fine-Tuning for LLMs
par: Wang, Yibo, et autres
Publié: (2026)
par: Wang, Yibo, et autres
Publié: (2026)
WinClick: GUI Grounding with Multimodal Large Language Models
par: Hui, Zheng, et autres
Publié: (2025)
par: Hui, Zheng, et autres
Publié: (2025)
GUI-G$^2$: Gaussian Reward Modeling for GUI Grounding
par: Tang, Fei, et autres
Publié: (2025)
par: Tang, Fei, et autres
Publié: (2025)
When Should Users Check? Modeling Confirmation Frequency inMulti-Step Agentic AI Tasks
par: Zhou, Jieyu, et autres
Publié: (2025)
par: Zhou, Jieyu, et autres
Publié: (2025)
M$^2$: Dual-Memory Augmentation for Long-Horizon Web Agents via Trajectory Summarization and Insight Retrieval
par: Yan, Dawei, et autres
Publié: (2026)
par: Yan, Dawei, et autres
Publié: (2026)
From Novice to Expert: LLM Agent Policy Optimization via Step-wise Reinforcement Learning
par: Deng, Zhirui, et autres
Publié: (2024)
par: Deng, Zhirui, et autres
Publié: (2024)
GUI Agents: A Survey
par: Nguyen, Dang, et autres
Publié: (2024)
par: Nguyen, Dang, et autres
Publié: (2024)
TaskSense: Cognitive Chain Modeling and Difficulty Estimation for GUI Tasks
par: Yin, Yiwen, et autres
Publié: (2025)
par: Yin, Yiwen, et autres
Publié: (2025)
CRAFT-GUI: Curriculum-Reinforced Agent For GUI Tasks
par: Nong, Songqin, et autres
Publié: (2025)
par: Nong, Songqin, et autres
Publié: (2025)
Deep But Reliable: Advancing Multi-turn Reasoning for Thinking with Images
par: Yang, Wenhao, et autres
Publié: (2025)
par: Yang, Wenhao, et autres
Publié: (2025)
MP-GUI: Modality Perception with MLLMs for GUI Understanding
par: Wang, Ziwei, et autres
Publié: (2025)
par: Wang, Ziwei, et autres
Publié: (2025)
A-MEM: Agentic Memory for LLM Agents
par: Xu, Wujiang, et autres
Publié: (2025)
par: Xu, Wujiang, et autres
Publié: (2025)
E-ANT: A Large-Scale Dataset for Efficient Automatic GUI NavigaTion
par: Wang, Ke, et autres
Publié: (2024)
par: Wang, Ke, et autres
Publié: (2024)
Automating UI Optimization through Multi-Agentic Reasoning
par: Li, Zhipeng, et autres
Publié: (2026)
par: Li, Zhipeng, et autres
Publié: (2026)
API Agents vs. GUI Agents: Divergence and Convergence
par: Zhang, Chaoyun, et autres
Publié: (2025)
par: Zhang, Chaoyun, et autres
Publié: (2025)
Navigating Algorithmic Opacity: Folk Theories and User Agency in Semi-Autonomous Vehicles
par: Perry, Yehuda, et autres
Publié: (2026)
par: Perry, Yehuda, et autres
Publié: (2026)
GUI-AIMA: Aligning Intrinsic Multimodal Attention with a Context Anchor for GUI Grounding
par: Zhou, Shijie, et autres
Publié: (2025)
par: Zhou, Shijie, et autres
Publié: (2025)
OS-Kairos: Adaptive Interaction for MLLM-Powered GUI Agents
par: Cheng, Pengzhou, et autres
Publié: (2025)
par: Cheng, Pengzhou, et autres
Publié: (2025)
Aria-UI: Visual Grounding for GUI Instructions
par: Yang, Yuhao, et autres
Publié: (2024)
par: Yang, Yuhao, et autres
Publié: (2024)
MagicGUI: A Foundational Mobile GUI Agent with Scalable Data Pipeline and Reinforcement Fine-tuning
par: Tang, Liujian, et autres
Publié: (2025)
par: Tang, Liujian, et autres
Publié: (2025)
Beyond Binary: Reframing GUI Critique as Continuous Semantic Alignment
par: Sun, Yuchen, et autres
Publié: (2026)
par: Sun, Yuchen, et autres
Publié: (2026)
ACE-TA: An Agentic Teaching Assistant for Grounded Q&A, Quiz Generation, and Code Tutoring
par: Tripathi, Himanshu, et autres
Publié: (2026)
par: Tripathi, Himanshu, et autres
Publié: (2026)
LLM Agent Meets Agentic AI: Can LLM Agents Simulate Customers to Evaluate Agentic-AI-based Shopping Assistants?
par: Sun, Lu, et autres
Publié: (2025)
par: Sun, Lu, et autres
Publié: (2025)
A Survey on (M)LLM-Based GUI Agents
par: Tang, Fei, et autres
Publié: (2025)
par: Tang, Fei, et autres
Publié: (2025)
Documents similaires
-
Walk the Talk: Bridging the Reasoning-Action Gap for Thinking with Images via Multimodal Agentic Policy Optimization
par: Yang, Wenhao, et autres
Publié: (2026) -
GraphPilot: GUI Task Automation with One-Step LLM Reasoning Powered by Knowledge Graph
par: Yu, Mingxian, et autres
Publié: (2026) -
PixelWeb: The First Web GUI Dataset with Pixel-Wise Labels
par: Yang, Qi, et autres
Publié: (2025) -
GUI-R1 : A Generalist R1-Style Vision-Language Action Model For GUI Agents
par: Luo, Run, et autres
Publié: (2025) -
UIPro: Unleashing Superior Interaction Capability For GUI Agents
par: Li, Hongxin, et autres
Publié: (2025)