GUI Exploration Lab: Enhancing Screen Navigation in Agents via Multi-Turn Reinforcement Learning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yan, Haolong, Shen, Yeqing, Huang, Xin, Wang, Jia, Tan, Kaijun, Liang, Zhixuan, Li, Hongxin, Ge, Zheng, Yoshie, Osamu, Li, Si, Zhang, Xiangyu, Jiang, Daxin |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
M-DocSum: Do LVLMs Genuinely Comprehend Interleaved Image-Text in Document Summarization?
par: Yan, Haolong, et autres
Publié: (2025)
par: Yan, Haolong, et autres
Publié: (2025)
UI-TARS-2 Technical Report: Advancing GUI Agent with Multi-Turn Reinforcement Learning
par: Wang, Haoming, et autres
Publié: (2025)
par: Wang, Haoming, et autres
Publié: (2025)
GUI Agents for Continual Game Generation
par: Huang, Yixu, et autres
Publié: (2026)
par: Huang, Yixu, et autres
Publié: (2026)
GUI-Xplore: Empowering Generalizable GUI Agents with One Exploration
par: Sun, Yuchen, et autres
Publié: (2025)
par: Sun, Yuchen, et autres
Publié: (2025)
EchoTrail-GUI: Building Actionable Memory for GUI Agents via Critic-Guided Self-Exploration
par: Li, Runze, et autres
Publié: (2025)
par: Li, Runze, et autres
Publié: (2025)
UIPro: Unleashing Superior Interaction Capability For GUI Agents
par: Li, Hongxin, et autres
Publié: (2025)
par: Li, Hongxin, et autres
Publié: (2025)
GUI-explorer: Autonomous Exploration and Mining of Transition-aware Knowledge for GUI Agent
par: Xie, Bin, et autres
Publié: (2025)
par: Xie, Bin, et autres
Publié: (2025)
GEBench: Benchmarking Image Generation Models as GUI Environments
par: Li, Haodong, et autres
Publié: (2026)
par: Li, Haodong, et autres
Publié: (2026)
AutoGUI: Scaling GUI Grounding with Automatic Functionality Annotations from LLMs
par: Li, Hongxin, et autres
Publié: (2025)
par: Li, Hongxin, et autres
Publié: (2025)
CLIP-driven rain perception: Adaptive deraining with pattern-aware network routing and mask-guided cross-attention
par: Guan, Cong, et autres
Publié: (2025)
par: Guan, Cong, et autres
Publié: (2025)
GoClick: Lightweight Element Grounding Model for Autonomous GUI Interaction
par: Li, Hongxin, et autres
Publié: (2026)
par: Li, Hongxin, et autres
Publié: (2026)
GUI-Bee: Align GUI Action Grounding to Novel Environments via Autonomous Exploration
par: Fan, Yue, et autres
Publié: (2025)
par: Fan, Yue, et autres
Publié: (2025)
Step-GUI Technical Report
par: Yan, Haolong, et autres
Publié: (2025)
par: Yan, Haolong, et autres
Publié: (2025)
Chain-of-Memory: Enhancing GUI Agents for Cross-Application Navigation
par: Gao, Xinzge, et autres
Publié: (2025)
par: Gao, Xinzge, et autres
Publié: (2025)
CRAFT-GUI: Curriculum-Reinforced Agent For GUI Tasks
par: Nong, Songqin, et autres
Publié: (2025)
par: Nong, Songqin, et autres
Publié: (2025)
TinyClick: Single-Turn Agent for Empowering GUI Automation
par: Pawlowski, Pawel, et autres
Publié: (2024)
par: Pawlowski, Pawel, et autres
Publié: (2024)
AutoGUI-v2: A Comprehensive Multi-Modal GUI Functionality Understanding Benchmark
par: Li, Hongxin, et autres
Publié: (2026)
par: Li, Hongxin, et autres
Publié: (2026)
MMBench-GUI: Hierarchical Multi-Platform Evaluation Framework for GUI Agents
par: Wang, Xuehui, et autres
Publié: (2025)
par: Wang, Xuehui, et autres
Publié: (2025)
LiteGUI: Distilling Compact GUI Agents with Reinforcement Learning
par: Wu, Yubin, et autres
Publié: (2026)
par: Wu, Yubin, et autres
Publié: (2026)
GUI-Shift: Enhancing VLM-Based GUI Agents through Self-supervised Reinforcement Learning
par: Gao, Longxi, et autres
Publié: (2025)
par: Gao, Longxi, et autres
Publié: (2025)
GUI-Rise: Structured Reasoning and History Summarization for GUI Navigation
par: Liu, Tao, et autres
Publié: (2025)
par: Liu, Tao, et autres
Publié: (2025)
API Agents vs. GUI Agents: Divergence and Convergence
par: Zhang, Chaoyun, et autres
Publié: (2025)
par: Zhang, Chaoyun, et autres
Publié: (2025)
GUI-ReWalk: Massive Data Generation for GUI Agent via Stochastic Exploration and Intent-Aware Reasoning
par: Lin, Musen, et autres
Publié: (2025)
par: Lin, Musen, et autres
Publié: (2025)
A Survey on GUI Agents with Foundation Models Enhanced by Reinforcement Learning
par: Li, Jiahao, et autres
Publié: (2025)
par: Li, Jiahao, et autres
Publié: (2025)
MobileGUI-RL: Advancing Mobile GUI Agent through Reinforcement Learning in Online Environment
par: Shi, Yucheng, et autres
Publié: (2025)
par: Shi, Yucheng, et autres
Publié: (2025)
GUI Agents with Reinforcement Learning: Toward Digital Inhabitants
par: Hu, Junan, et autres
Publié: (2026)
par: Hu, Junan, et autres
Publié: (2026)
AgentCPM-GUI: Building Mobile-Use Agents with Reinforcement Fine-Tuning
par: Zhang, Zhong, et autres
Publié: (2025)
par: Zhang, Zhong, et autres
Publié: (2025)
FluencyVE: Marrying Temporal-Aware Mamba with Bypass Attention for Video Editing
par: Cai, Mingshu, et autres
Publié: (2025)
par: Cai, Mingshu, et autres
Publié: (2025)
GUI-Actor: Coordinate-Free Visual Grounding for GUI Agents
par: Wu, Qianhui, et autres
Publié: (2025)
par: Wu, Qianhui, et autres
Publié: (2025)
ReInAgent: A Context-Aware GUI Agent Enabling Human-in-the-Loop Mobile Task Navigation
par: Jia, Haitao, et autres
Publié: (2025)
par: Jia, Haitao, et autres
Publié: (2025)
Alpha-R1: Alpha Screening with LLM Reasoning via Reinforcement Learning
par: Jiang, Zuoyou, et autres
Publié: (2025)
par: Jiang, Zuoyou, et autres
Publié: (2025)
Multi-Attribute guided Thermal Face Image Translation based on Latent Diffusion Model
par: Cai, Mingshu, et autres
Publié: (2025)
par: Cai, Mingshu, et autres
Publié: (2025)
Environmental Injection Attacks against GUI Agents in Realistic Dynamic Environments
par: Zhang, Yitong, et autres
Publié: (2025)
par: Zhang, Yitong, et autres
Publié: (2025)
UI-KOBE: Knowledge-Oriented Behavior Exploration for Lightweight Graph-Guided GUI Agents
par: Chai, Yuxiang, et autres
Publié: (2026)
par: Chai, Yuxiang, et autres
Publié: (2026)
Turning the Ratchet: Dynamic Screening with Multiple Agents
par: Ekmekci, Mehmet, et autres
Publié: (2024)
par: Ekmekci, Mehmet, et autres
Publié: (2024)
Restoring Real-World Degraded Events Improves Deblurring Quality
par: Shen, Yeqing, et autres
Publié: (2024)
par: Shen, Yeqing, et autres
Publié: (2024)
GUI Testing Arena: A Unified Benchmark for Advancing Autonomous GUI Testing Agent
par: Zhao, Kangjia, et autres
Publié: (2024)
par: Zhao, Kangjia, et autres
Publié: (2024)
Where, What, Why: Toward Explainable 3D-GS Watermarking
par: Cai, Mingshu, et autres
Publié: (2026)
par: Cai, Mingshu, et autres
Publié: (2026)
UI-R1: Enhancing Efficient Action Prediction of GUI Agents by Reinforcement Learning
par: Lu, Zhengxi, et autres
Publié: (2025)
par: Lu, Zhengxi, et autres
Publié: (2025)
UI-AGILE: Advancing GUI Agents with Effective Reinforcement Learning and Precise Inference-Time Grounding
par: Lian, Shuquan, et autres
Publié: (2025)
par: Lian, Shuquan, et autres
Publié: (2025)
Documents similaires
-
M-DocSum: Do LVLMs Genuinely Comprehend Interleaved Image-Text in Document Summarization?
par: Yan, Haolong, et autres
Publié: (2025) -
UI-TARS-2 Technical Report: Advancing GUI Agent with Multi-Turn Reinforcement Learning
par: Wang, Haoming, et autres
Publié: (2025) -
GUI Agents for Continual Game Generation
par: Huang, Yixu, et autres
Publié: (2026) -
GUI-Xplore: Empowering Generalizable GUI Agents with One Exploration
par: Sun, Yuchen, et autres
Publié: (2025) -
EchoTrail-GUI: Building Actionable Memory for GUI Agents via Critic-Guided Self-Exploration
par: Li, Runze, et autres
Publié: (2025)