Enhancing Trustworthy GUI Grounding via Self-Critiqued Reinforcement Learning
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhang, Shaojie, Fu, Pei, Zhang, Ruoceng, Yang, Jiahui, Du, Anan, Xi, Xiuwen, Wang, Shaokang, Huang, Ying, Qin, Bin, Luo, Zhenbo, Luan, Jian |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Beyond Binary: Reframing GUI Critique as Continuous Semantic Alignment
por: Sun, Yuchen, et al.
Publicado: (2026)
por: Sun, Yuchen, et al.
Publicado: (2026)
GAIA: A Data Flywheel System for Training GUI Test-Time Scaling Critic Models
por: Wang, Shaokang, et al.
Publicado: (2026)
por: Wang, Shaokang, et al.
Publicado: (2026)
BTL-UI: Blink-Think-Link Reasoning Model for GUI Agent
por: Zhang, Shaojie, et al.
Publicado: (2025)
por: Zhang, Shaojie, et al.
Publicado: (2025)
Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs
por: Zhang, Shaojie, et al.
Publicado: (2025)
por: Zhang, Shaojie, et al.
Publicado: (2025)
Q-Mask: Query-driven Causal Masks for Text Anchoring in OCR-Oriented Vision-Language Models
por: Xu, Longwei, et al.
Publicado: (2026)
por: Xu, Longwei, et al.
Publicado: (2026)
GUI-Shift: Enhancing VLM-Based GUI Agents through Self-supervised Reinforcement Learning
por: Gao, Longxi, et al.
Publicado: (2025)
por: Gao, Longxi, et al.
Publicado: (2025)
PatchCue: Enhancing Vision-Language Model Reasoning with Patch-Based Visual Cues
por: Qi, Yukun, et al.
Publicado: (2026)
por: Qi, Yukun, et al.
Publicado: (2026)
IMTBench: A Multi-Scenario Cross-Modal Collaborative Evaluation Benchmark for In-Image Machine Translation
por: Lyu, Jiahao, et al.
Publicado: (2026)
por: Lyu, Jiahao, et al.
Publicado: (2026)
Enhancing Visual Grounding for GUI Agents via Self-Evolutionary Reinforcement Learning
por: Yuan, Xinbin, et al.
Publicado: (2025)
por: Yuan, Xinbin, et al.
Publicado: (2025)
EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models
por: Fang, Yiyang, et al.
Publicado: (2026)
por: Fang, Yiyang, et al.
Publicado: (2026)
GUI-Actor: Coordinate-Free Visual Grounding for GUI Agents
por: Wu, Qianhui, et al.
Publicado: (2025)
por: Wu, Qianhui, et al.
Publicado: (2025)
MagicGUI: A Foundational Mobile GUI Agent with Scalable Data Pipeline and Reinforcement Fine-tuning
por: Tang, Liujian, et al.
Publicado: (2025)
por: Tang, Liujian, et al.
Publicado: (2025)
Thinking in cocktail party: Chain-of-Thought and reinforcement learning for target speaker automatic speech recognition
por: Zhang, Yiru, et al.
Publicado: (2025)
por: Zhang, Yiru, et al.
Publicado: (2025)
GUI-ARP: Enhancing Grounding with Adaptive Region Perception for GUI Agents
por: Ye, Xianhang, et al.
Publicado: (2025)
por: Ye, Xianhang, et al.
Publicado: (2025)
\textsc{GUI-Spotlight}: Adaptive Iterative Focus Refinement for Enhanced GUI Visual Grounding
por: Lei, Bin, et al.
Publicado: (2025)
por: Lei, Bin, et al.
Publicado: (2025)
BacktrackAgent: Enhancing GUI Agent with Error Detection and Backtracking Mechanism
por: Wu, Qinzhuo, et al.
Publicado: (2025)
por: Wu, Qinzhuo, et al.
Publicado: (2025)
AdaZoom-GUI: Adaptive Zoom-based GUI Grounding with Instruction Refinement
por: Pei, Siqi, et al.
Publicado: (2026)
por: Pei, Siqi, et al.
Publicado: (2026)
UI-Ins: Enhancing GUI Grounding with Multi-Perspective Instruction-as-Reasoning
por: Chen, Liangyu, et al.
Publicado: (2025)
por: Chen, Liangyu, et al.
Publicado: (2025)
GUI-PRA: Process Reward Agent for GUI Tasks
por: Xiong, Tao, et al.
Publicado: (2025)
por: Xiong, Tao, et al.
Publicado: (2025)
Test-Time Reinforcement Learning for GUI Grounding via Region Consistency
por: Du, Yong, et al.
Publicado: (2025)
por: Du, Yong, et al.
Publicado: (2025)
ICRL: Learning to Internalize Self-Critique with Reinforcement Learning
por: Lin, Jianbo, et al.
Publicado: (2026)
por: Lin, Jianbo, et al.
Publicado: (2026)
MEGA-GUI: Multi-stage Enhanced Grounding Agents for GUI Elements
por: Kwak, SeokJoo, et al.
Publicado: (2025)
por: Kwak, SeokJoo, et al.
Publicado: (2025)
Critique-Coder: Enhancing Coder Models by Critique Reinforcement Learning
por: Ruan, Chi, et al.
Publicado: (2025)
por: Ruan, Chi, et al.
Publicado: (2025)
GuirlVG: Incentivize GUI Visual Grounding via Empirical Exploration on Reinforcement Learning
por: Kang, Weitai, et al.
Publicado: (2025)
por: Kang, Weitai, et al.
Publicado: (2025)
Dancing with Critiques: Enhancing LLM Reasoning with Stepwise Natural Language Self-Critique
por: Li, Yansi, et al.
Publicado: (2025)
por: Li, Yansi, et al.
Publicado: (2025)
Phi-Ground Tech Report: Advancing Perception in GUI Grounding
por: Zhang, Miaosen, et al.
Publicado: (2025)
por: Zhang, Miaosen, et al.
Publicado: (2025)
GUI Agents with Reinforcement Learning: Toward Digital Inhabitants
por: Hu, Junan, et al.
Publicado: (2026)
por: Hu, Junan, et al.
Publicado: (2026)
Critique-RL: Training Language Models for Critiquing through Two-Stage Reinforcement Learning
por: Xi, Zhiheng, et al.
Publicado: (2025)
por: Xi, Zhiheng, et al.
Publicado: (2025)
Towards Trustworthy GUI Agents: A Survey
por: Shi, Yucheng, et al.
Publicado: (2025)
por: Shi, Yucheng, et al.
Publicado: (2025)
TimeViper: A Hybrid Mamba-Transformer Vision-Language Model for Efficient Long Video Understanding
por: Xu, Boshen, et al.
Publicado: (2025)
por: Xu, Boshen, et al.
Publicado: (2025)
GUI-C$^2$: Coarse-to-Fine GUI Grounding via Difficulty-Aware Reinforcement Learning
por: Li, Junlong, et al.
Publicado: (2026)
por: Li, Junlong, et al.
Publicado: (2026)
Learn where to Click from Yourself: On-Policy Self-Distillation for GUI Grounding
por: Zhang, Yan, et al.
Publicado: (2026)
por: Zhang, Yan, et al.
Publicado: (2026)
Multiple q-zeta values and traces
por: Qin, Zhenbo
Publicado: (2025)
por: Qin, Zhenbo
Publicado: (2025)
MLA-Trust: Benchmarking Trustworthiness of Multimodal LLM Agents in GUI Environments
por: Yang, Xiao, et al.
Publicado: (2025)
por: Yang, Xiao, et al.
Publicado: (2025)
VG3S: Visual Geometry Grounded Gaussian Splatting for Semantic Occupancy Prediction
por: Yan, Xiaoyang, et al.
Publicado: (2026)
por: Yan, Xiaoyang, et al.
Publicado: (2026)
SeeClick: Harnessing GUI Grounding for Advanced Visual GUI Agents
por: Cheng, Kanzhi, et al.
Publicado: (2024)
por: Cheng, Kanzhi, et al.
Publicado: (2024)
GUI-G$^2$: Gaussian Reward Modeling for GUI Grounding
por: Tang, Fei, et al.
Publicado: (2025)
por: Tang, Fei, et al.
Publicado: (2025)
Think Twice, Click Once: Enhancing GUI Grounding via Fast and Slow Systems
por: Tang, Fei, et al.
Publicado: (2025)
por: Tang, Fei, et al.
Publicado: (2025)
POINTS-GUI-G: GUI-Grounding Journey
por: Zhao, Zhongyin, et al.
Publicado: (2026)
por: Zhao, Zhongyin, et al.
Publicado: (2026)
Shuffle-R1: Efficient RL framework for Multimodal Large Language Models via Data-centric Dynamic Shuffle
por: Zhu, Linghao, et al.
Publicado: (2025)
por: Zhu, Linghao, et al.
Publicado: (2025)
Ejemplares similares
-
Beyond Binary: Reframing GUI Critique as Continuous Semantic Alignment
por: Sun, Yuchen, et al.
Publicado: (2026) -
GAIA: A Data Flywheel System for Training GUI Test-Time Scaling Critic Models
por: Wang, Shaokang, et al.
Publicado: (2026) -
BTL-UI: Blink-Think-Link Reasoning Model for GUI Agent
por: Zhang, Shaojie, et al.
Publicado: (2025) -
Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs
por: Zhang, Shaojie, et al.
Publicado: (2025) -
Q-Mask: Query-driven Causal Masks for Text Anchoring in OCR-Oriented Vision-Language Models
por: Xu, Longwei, et al.
Publicado: (2026)