GUI-Xplore: Empowering Generalizable GUI Agents with One Exploration
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Sun, Yuchen, Zhao, Shanhui, Yu, Tao, Wen, Hao, Va, Samith, Xu, Mengwei, Li, Yuanchun, Zhang, Chongyang |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
GUI-Reflection: Empowering Multimodal GUI Models with Self-Reflection Behavior
par: Wu, Penghao, et autres
Publié: (2025)
par: Wu, Penghao, et autres
Publié: (2025)
GUI-ARP: Enhancing Grounding with Adaptive Region Perception for GUI Agents
par: Ye, Xianhang, et autres
Publié: (2025)
par: Ye, Xianhang, et autres
Publié: (2025)
GUI-Rise: Structured Reasoning and History Summarization for GUI Navigation
par: Liu, Tao, et autres
Publié: (2025)
par: Liu, Tao, et autres
Publié: (2025)
Towards GUI Agents: Vision-Language Diffusion Models for GUI Grounding
par: Kumbhar, Shrinidhi, et autres
Publié: (2026)
par: Kumbhar, Shrinidhi, et autres
Publié: (2026)
GUI-Bee: Align GUI Action Grounding to Novel Environments via Autonomous Exploration
par: Fan, Yue, et autres
Publié: (2025)
par: Fan, Yue, et autres
Publié: (2025)
GUI-Actor: Coordinate-Free Visual Grounding for GUI Agents
par: Wu, Qianhui, et autres
Publié: (2025)
par: Wu, Qianhui, et autres
Publié: (2025)
ToolTok: Tool Tokenization for Efficient and Generalizable GUI Agents
par: Wang, Xiaoce, et autres
Publié: (2026)
par: Wang, Xiaoce, et autres
Publié: (2026)
\textsc{GUI-Spotlight}: Adaptive Iterative Focus Refinement for Enhanced GUI Visual Grounding
par: Lei, Bin, et autres
Publié: (2025)
par: Lei, Bin, et autres
Publié: (2025)
GUI-CEval: A Hierarchical and Comprehensive Chinese Benchmark for Mobile GUI Agents
par: Li, Yang, et autres
Publié: (2026)
par: Li, Yang, et autres
Publié: (2026)
ControlGUI: Guiding Generative GUI Exploration through Perceptual Visual Flow
par: Garg, Aryan, et autres
Publié: (2025)
par: Garg, Aryan, et autres
Publié: (2025)
ZeroGUI: Automating Online GUI Learning at Zero Human Cost
par: Yang, Chenyu, et autres
Publié: (2025)
par: Yang, Chenyu, et autres
Publié: (2025)
Less is More: Empowering GUI Agent with Context-Aware Simplification
par: Chen, Gongwei, et autres
Publié: (2025)
par: Chen, Gongwei, et autres
Publié: (2025)
Continual GUI Agents
par: Liu, Ziwei, et autres
Publié: (2026)
par: Liu, Ziwei, et autres
Publié: (2026)
GUI-G1: Understanding R1-Zero-Like Training for Visual Grounding in GUI Agents
par: Zhou, Yuqi, et autres
Publié: (2025)
par: Zhou, Yuqi, et autres
Publié: (2025)
VideoGUI: A Benchmark for GUI Automation from Instructional Videos
par: Lin, Kevin Qinghong, et autres
Publié: (2024)
par: Lin, Kevin Qinghong, et autres
Publié: (2024)
MP-GUI: Modality Perception with MLLMs for GUI Understanding
par: Wang, Ziwei, et autres
Publié: (2025)
par: Wang, Ziwei, et autres
Publié: (2025)
GUI Agents with Reinforcement Learning: Toward Digital Inhabitants
par: Hu, Junan, et autres
Publié: (2026)
par: Hu, Junan, et autres
Publié: (2026)
AdaZoom-GUI: Adaptive Zoom-based GUI Grounding with Instruction Refinement
par: Pei, Siqi, et autres
Publié: (2026)
par: Pei, Siqi, et autres
Publié: (2026)
Video2GUI: Synthesizing Large-Scale Interaction Trajectories for Generalized GUI Agent Pretraining
par: Xiong, Weimin, et autres
Publié: (2026)
par: Xiong, Weimin, et autres
Publié: (2026)
Spatio-Temporal Token Pruning for Efficient High-Resolution GUI Agents
par: Xu, Zhou, et autres
Publié: (2026)
par: Xu, Zhou, et autres
Publié: (2026)
POINTS-GUI-G: GUI-Grounding Journey
par: Zhao, Zhongyin, et autres
Publié: (2026)
par: Zhao, Zhongyin, et autres
Publié: (2026)
ClawGUI: A Unified Framework for Training, Evaluating, and Deploying GUI Agents
par: Tang, Fei, et autres
Publié: (2026)
par: Tang, Fei, et autres
Publié: (2026)
GUI-World: A Video Benchmark and Dataset for Multimodal GUI-oriented Understanding
par: Chen, Dongping, et autres
Publié: (2024)
par: Chen, Dongping, et autres
Publié: (2024)
Chain-of-Memory: Enhancing GUI Agents for Cross-Application Navigation
par: Gao, Xinzge, et autres
Publié: (2025)
par: Gao, Xinzge, et autres
Publié: (2025)
A Survey on (M)LLM-Based GUI Agents
par: Tang, Fei, et autres
Publié: (2025)
par: Tang, Fei, et autres
Publié: (2025)
LPO: Towards Accurate GUI Agent Interaction via Location Preference Optimization
par: Tang, Jiaqi, et autres
Publié: (2025)
par: Tang, Jiaqi, et autres
Publié: (2025)
BTL-UI: Blink-Think-Link Reasoning Model for GUI Agent
par: Zhang, Shaojie, et autres
Publié: (2025)
par: Zhang, Shaojie, et autres
Publié: (2025)
M$^2$-Miner: Multi-Agent Enhanced MCTS for Mobile GUI Agent Data Mining
par: Lv, Rui, et autres
Publié: (2026)
par: Lv, Rui, et autres
Publié: (2026)
Navigating the Digital World as Humans Do: Universal Visual Grounding for GUI Agents
par: Gou, Boyu, et autres
Publié: (2024)
par: Gou, Boyu, et autres
Publié: (2024)
Visual Test-time Scaling for GUI Agent Grounding
par: Luo, Tiange, et autres
Publié: (2025)
par: Luo, Tiange, et autres
Publié: (2025)
Breaking the Data Barrier -- Building GUI Agents Through Task Generalization
par: Zhang, Junlei, et autres
Publié: (2025)
par: Zhang, Junlei, et autres
Publié: (2025)
AgentProg: Empowering Long-Horizon GUI Agents with Program-Guided Context Management
par: Tian, Shizuo, et autres
Publié: (2025)
par: Tian, Shizuo, et autres
Publié: (2025)
AQuaUI: Visual Token Reduction for GUI Agents with Adaptive Quadtrees
par: Li, Yuankai, et autres
Publié: (2026)
par: Li, Yuankai, et autres
Publié: (2026)
MMBench-GUI: Hierarchical Multi-Platform Evaluation Framework for GUI Agents
par: Wang, Xuehui, et autres
Publié: (2025)
par: Wang, Xuehui, et autres
Publié: (2025)
History-Aware Reasoning for GUI Agents
par: Wang, Ziwei, et autres
Publié: (2025)
par: Wang, Ziwei, et autres
Publié: (2025)
GUI Agents for Continual Game Generation
par: Huang, Yixu, et autres
Publié: (2026)
par: Huang, Yixu, et autres
Publié: (2026)
Trifuse: Enhancing Attention-Based GUI Grounding via Multimodal Fusion
par: Ma, Longhui, et autres
Publié: (2026)
par: Ma, Longhui, et autres
Publié: (2026)
GPA: Learning GUI Process Automation from Demonstrations
par: Zhao, Zirui, et autres
Publié: (2026)
par: Zhao, Zirui, et autres
Publié: (2026)
GEBench: Benchmarking Image Generation Models as GUI Environments
par: Li, Haodong, et autres
Publié: (2026)
par: Li, Haodong, et autres
Publié: (2026)
ShowUI: One Vision-Language-Action Model for GUI Visual Agent
par: Lin, Kevin Qinghong, et autres
Publié: (2024)
par: Lin, Kevin Qinghong, et autres
Publié: (2024)
Documents similaires
-
GUI-Reflection: Empowering Multimodal GUI Models with Self-Reflection Behavior
par: Wu, Penghao, et autres
Publié: (2025) -
GUI-ARP: Enhancing Grounding with Adaptive Region Perception for GUI Agents
par: Ye, Xianhang, et autres
Publié: (2025) -
GUI-Rise: Structured Reasoning and History Summarization for GUI Navigation
par: Liu, Tao, et autres
Publié: (2025) -
Towards GUI Agents: Vision-Language Diffusion Models for GUI Grounding
par: Kumbhar, Shrinidhi, et autres
Publié: (2026) -
GUI-Bee: Align GUI Action Grounding to Novel Environments via Autonomous Exploration
par: Fan, Yue, et autres
Publié: (2025)