Enhancing Visual Grounding for GUI Agents via Self-Evolutionary Reinforcement Learning
Fuente:
arXiv
Guardado en:
| Autores principales: | Yuan, Xinbin, Zhang, Jian, Li, Kaixin, Cai, Zhuoxuan, Yao, Lujian, Chen, Jie, Wang, Enguang, Hou, Qibin, Chen, Jinwei, Jiang, Peng-Tao, Li, Bo |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Photography Perspective Composition: Towards Aesthetic Perspective Recommendation
por: Yao, Lujian, et al.
Publicado: (2025)
por: Yao, Lujian, et al.
Publicado: (2025)
Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment
por: Cai, Zhuoxuan, et al.
Publicado: (2025)
por: Cai, Zhuoxuan, et al.
Publicado: (2025)
GUI-Eyes: Tool-Augmented Perception for Visual Grounding in GUI Agents
por: Chen, Chen, et al.
Publicado: (2026)
por: Chen, Chen, et al.
Publicado: (2026)
GUI-Actor: Coordinate-Free Visual Grounding for GUI Agents
por: Wu, Qianhui, et al.
Publicado: (2025)
por: Wu, Qianhui, et al.
Publicado: (2025)
GUI-Shift: Enhancing VLM-Based GUI Agents through Self-supervised Reinforcement Learning
por: Gao, Longxi, et al.
Publicado: (2025)
por: Gao, Longxi, et al.
Publicado: (2025)
Multi-Task Dense Prediction via Mixture of Low-Rank Experts
por: Yang, Yuqi, et al.
Publicado: (2024)
por: Yang, Yuqi, et al.
Publicado: (2024)
GUI-ARP: Enhancing Grounding with Adaptive Region Perception for GUI Agents
por: Ye, Xianhang, et al.
Publicado: (2025)
por: Ye, Xianhang, et al.
Publicado: (2025)
Enhancing Trustworthy GUI Grounding via Self-Critiqued Reinforcement Learning
por: Zhang, Shaojie, et al.
Publicado: (2025)
por: Zhang, Shaojie, et al.
Publicado: (2025)
SeeClick: Harnessing GUI Grounding for Advanced Visual GUI Agents
por: Cheng, Kanzhi, et al.
Publicado: (2024)
por: Cheng, Kanzhi, et al.
Publicado: (2024)
Revisiting Lightweight Low-Light Image Enhancement: From a YUV Color Space Perspective
por: Yan, Hailong, et al.
Publicado: (2026)
por: Yan, Hailong, et al.
Publicado: (2026)
LiteGUI: Distilling Compact GUI Agents with Reinforcement Learning
por: Wu, Yubin, et al.
Publicado: (2026)
por: Wu, Yubin, et al.
Publicado: (2026)
CRAFT-GUI: Curriculum-Reinforced Agent For GUI Tasks
por: Nong, Songqin, et al.
Publicado: (2025)
por: Nong, Songqin, et al.
Publicado: (2025)
Aria-UI: Visual Grounding for GUI Instructions
por: Yang, Yuhao, et al.
Publicado: (2024)
por: Yang, Yuhao, et al.
Publicado: (2024)
ControlSR: Taming Diffusion Models for Consistent Real-World Image Super Resolution
por: Wan, Yuhao, et al.
Publicado: (2024)
por: Wan, Yuhao, et al.
Publicado: (2024)
GUI Agents with Reinforcement Learning: Toward Digital Inhabitants
por: Hu, Junan, et al.
Publicado: (2026)
por: Hu, Junan, et al.
Publicado: (2026)
MEGA-GUI: Multi-stage Enhanced Grounding Agents for GUI Elements
por: Kwak, SeokJoo, et al.
Publicado: (2025)
por: Kwak, SeokJoo, et al.
Publicado: (2025)
Visual Test-time Scaling for GUI Agent Grounding
por: Luo, Tiange, et al.
Publicado: (2025)
por: Luo, Tiange, et al.
Publicado: (2025)
Real-Time Loop Closure Detection in Visual SLAM via NetVLAD and Faiss
por: Fan, Enguang
Publicado: (2026)
por: Fan, Enguang
Publicado: (2026)
AutoGUI: Scaling GUI Grounding with Automatic Functionality Annotations from LLMs
por: Li, Hongxin, et al.
Publicado: (2025)
por: Li, Hongxin, et al.
Publicado: (2025)
UI-AGILE: Advancing GUI Agents with Effective Reinforcement Learning and Precise Inference-Time Grounding
por: Lian, Shuquan, et al.
Publicado: (2025)
por: Lian, Shuquan, et al.
Publicado: (2025)
A Survey on GUI Agents with Foundation Models Enhanced by Reinforcement Learning
por: Li, Jiahao, et al.
Publicado: (2025)
por: Li, Jiahao, et al.
Publicado: (2025)
DiMo-GUI: Advancing Test-time Scaling in GUI Grounding via Modality-Aware Visual Reasoning
por: Wu, Hang, et al.
Publicado: (2025)
por: Wu, Hang, et al.
Publicado: (2025)
\textsc{GUI-Spotlight}: Adaptive Iterative Focus Refinement for Enhanced GUI Visual Grounding
por: Lei, Bin, et al.
Publicado: (2025)
por: Lei, Bin, et al.
Publicado: (2025)
GUI-PRA: Process Reward Agent for GUI Tasks
por: Xiong, Tao, et al.
Publicado: (2025)
por: Xiong, Tao, et al.
Publicado: (2025)
MPR-GUI: Benchmarking and Enhancing Multilingual Perception and Reasoning in GUI Agents
por: Chen, Ruihan, et al.
Publicado: (2025)
por: Chen, Ruihan, et al.
Publicado: (2025)
YOLO-MS: Rethinking Multi-Scale Representation Learning for Real-time Object Detection
por: Chen, Yuming, et al.
Publicado: (2023)
por: Chen, Yuming, et al.
Publicado: (2023)
Communication-Aware Multi-Agent Reinforcement Learning for Decentralized Cooperative UAV Deployment
por: Fan, Enguang, et al.
Publicado: (2026)
por: Fan, Enguang, et al.
Publicado: (2026)
GUI-G1: Understanding R1-Zero-Like Training for Visual Grounding in GUI Agents
por: Zhou, Yuqi, et al.
Publicado: (2025)
por: Zhou, Yuqi, et al.
Publicado: (2025)
EchoTrail-GUI: Building Actionable Memory for GUI Agents via Critic-Guided Self-Exploration
por: Li, Runze, et al.
Publicado: (2025)
por: Li, Runze, et al.
Publicado: (2025)
GUI-C$^2$: Coarse-to-Fine GUI Grounding via Difficulty-Aware Reinforcement Learning
por: Li, Junlong, et al.
Publicado: (2026)
por: Li, Junlong, et al.
Publicado: (2026)
Chain-of-Memory: Enhancing GUI Agents for Cross-Application Navigation
por: Gao, Xinzge, et al.
Publicado: (2025)
por: Gao, Xinzge, et al.
Publicado: (2025)
EDGE: Enhanced Grounded GUI Understanding with Enriched Multi-Granularity Synthetic Data
por: Chen, Xuetian, et al.
Publicado: (2024)
por: Chen, Xuetian, et al.
Publicado: (2024)
AdaZoom-GUI: Adaptive Zoom-based GUI Grounding with Instruction Refinement
por: Pei, Siqi, et al.
Publicado: (2026)
por: Pei, Siqi, et al.
Publicado: (2026)
UI-Ins: Enhancing GUI Grounding with Multi-Perspective Instruction-as-Reasoning
por: Chen, Liangyu, et al.
Publicado: (2025)
por: Chen, Liangyu, et al.
Publicado: (2025)
UI-Mem: Self-Evolving Experience Memory for Online Reinforcement Learning in Mobile GUI Agents
por: Xiao, Han, et al.
Publicado: (2026)
por: Xiao, Han, et al.
Publicado: (2026)
Scalable Visual State Space Model with Fractal Scanning
por: Tang, Lv, et al.
Publicado: (2024)
por: Tang, Lv, et al.
Publicado: (2024)
GUI-explorer: Autonomous Exploration and Mining of Transition-aware Knowledge for GUI Agent
por: Xie, Bin, et al.
Publicado: (2025)
por: Xie, Bin, et al.
Publicado: (2025)
Chain of Visual Perception: Harnessing Multimodal Large Language Models for Zero-shot Camouflaged Object Detection
por: Tang, Lv, et al.
Publicado: (2023)
por: Tang, Lv, et al.
Publicado: (2023)
CogAgent: A Visual Language Model for GUI Agents
por: Hong, Wenyi, et al.
Publicado: (2023)
por: Hong, Wenyi, et al.
Publicado: (2023)
ScreenSpot-Pro: GUI Grounding for Professional High-Resolution Computer Use
por: Li, Kaixin, et al.
Publicado: (2025)
por: Li, Kaixin, et al.
Publicado: (2025)
Ejemplares similares
-
Photography Perspective Composition: Towards Aesthetic Perspective Recommendation
por: Yao, Lujian, et al.
Publicado: (2025) -
Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment
por: Cai, Zhuoxuan, et al.
Publicado: (2025) -
GUI-Eyes: Tool-Augmented Perception for Visual Grounding in GUI Agents
por: Chen, Chen, et al.
Publicado: (2026) -
GUI-Actor: Coordinate-Free Visual Grounding for GUI Agents
por: Wu, Qianhui, et al.
Publicado: (2025) -
GUI-Shift: Enhancing VLM-Based GUI Agents through Self-supervised Reinforcement Learning
por: Gao, Longxi, et al.
Publicado: (2025)