Learning Active Perception via Self-Evolving Preference Optimization for GUI Grounding
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Wanfu, Huang, Qipeng, Xue, Guangquan, Liang, Xiaobo, Li, Juntao |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
GUI-ARP: Enhancing Grounding with Adaptive Region Perception for GUI Agents
di: Ye, Xianhang, et al.
Pubblicazione: (2025)
di: Ye, Xianhang, et al.
Pubblicazione: (2025)
Phi-Ground Tech Report: Advancing Perception in GUI Grounding
di: Zhang, Miaosen, et al.
Pubblicazione: (2025)
di: Zhang, Miaosen, et al.
Pubblicazione: (2025)
UI-Voyager: A Self-Evolving GUI Agent Learning via Failed Experience
di: Lin, Zichuan, et al.
Pubblicazione: (2026)
di: Lin, Zichuan, et al.
Pubblicazione: (2026)
AdaZoom-GUI: Adaptive Zoom-based GUI Grounding with Instruction Refinement
di: Pei, Siqi, et al.
Pubblicazione: (2026)
di: Pei, Siqi, et al.
Pubblicazione: (2026)
Learn where to Click from Yourself: On-Policy Self-Distillation for GUI Grounding
di: Zhang, Yan, et al.
Pubblicazione: (2026)
di: Zhang, Yan, et al.
Pubblicazione: (2026)
Trifuse: Enhancing Attention-Based GUI Grounding via Multimodal Fusion
di: Ma, Longhui, et al.
Pubblicazione: (2026)
di: Ma, Longhui, et al.
Pubblicazione: (2026)
BAMI: Training-Free Bias Mitigation in GUI Grounding
di: Zhang, Borui, et al.
Pubblicazione: (2026)
di: Zhang, Borui, et al.
Pubblicazione: (2026)
Towards GUI Agents: Vision-Language Diffusion Models for GUI Grounding
di: Kumbhar, Shrinidhi, et al.
Pubblicazione: (2026)
di: Kumbhar, Shrinidhi, et al.
Pubblicazione: (2026)
LPO: Towards Accurate GUI Agent Interaction via Location Preference Optimization
di: Tang, Jiaqi, et al.
Pubblicazione: (2025)
di: Tang, Jiaqi, et al.
Pubblicazione: (2025)
GUI-Reflection: Empowering Multimodal GUI Models with Self-Reflection Behavior
di: Wu, Penghao, et al.
Pubblicazione: (2025)
di: Wu, Penghao, et al.
Pubblicazione: (2025)
Improving GUI Grounding with Explicit Position-to-Coordinate Mapping
di: Wang, Suyuchen, et al.
Pubblicazione: (2025)
di: Wang, Suyuchen, et al.
Pubblicazione: (2025)
\textsc{GUI-Spotlight}: Adaptive Iterative Focus Refinement for Enhanced GUI Visual Grounding
di: Lei, Bin, et al.
Pubblicazione: (2025)
di: Lei, Bin, et al.
Pubblicazione: (2025)
Chain-of-Ground: Improving GUI Grounding via Iterative Reasoning and Reference Feedback
di: Li, Aiden Yiliu, et al.
Pubblicazione: (2025)
di: Li, Aiden Yiliu, et al.
Pubblicazione: (2025)
Improved GUI Grounding via Iterative Narrowing
di: Nguyen, Anthony
Pubblicazione: (2024)
di: Nguyen, Anthony
Pubblicazione: (2024)
Test-Time Reinforcement Learning for GUI Grounding via Region Consistency
di: Du, Yong, et al.
Pubblicazione: (2025)
di: Du, Yong, et al.
Pubblicazione: (2025)
MP-GUI: Modality Perception with MLLMs for GUI Understanding
di: Wang, Ziwei, et al.
Pubblicazione: (2025)
di: Wang, Ziwei, et al.
Pubblicazione: (2025)
UI-Ins: Enhancing GUI Grounding with Multi-Perspective Instruction-as-Reasoning
di: Chen, Liangyu, et al.
Pubblicazione: (2025)
di: Chen, Liangyu, et al.
Pubblicazione: (2025)
GUI-Actor: Coordinate-Free Visual Grounding for GUI Agents
di: Wu, Qianhui, et al.
Pubblicazione: (2025)
di: Wu, Qianhui, et al.
Pubblicazione: (2025)
EvoDriveVLA: Evolving Driving VLA Models via Collaborative Perception-Planning Distillation
di: Cao, Jiajun, et al.
Pubblicazione: (2026)
di: Cao, Jiajun, et al.
Pubblicazione: (2026)
Towards Self-Improvement of Diffusion Models via Group Preference Optimization
di: Chen, Renjie, et al.
Pubblicazione: (2025)
di: Chen, Renjie, et al.
Pubblicazione: (2025)
Zoom in, Click out: Unlocking and Evaluating the Potential of Zooming for GUI Grounding
di: Jiang, Zhiyuan, et al.
Pubblicazione: (2025)
di: Jiang, Zhiyuan, et al.
Pubblicazione: (2025)
Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding
di: Wang, Wenkai, et al.
Pubblicazione: (2026)
di: Wang, Wenkai, et al.
Pubblicazione: (2026)
Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining
di: Ge, Zhiqi, et al.
Pubblicazione: (2024)
di: Ge, Zhiqi, et al.
Pubblicazione: (2024)
GUI-Bee: Align GUI Action Grounding to Novel Environments via Autonomous Exploration
di: Fan, Yue, et al.
Pubblicazione: (2025)
di: Fan, Yue, et al.
Pubblicazione: (2025)
GUI-Rise: Structured Reasoning and History Summarization for GUI Navigation
di: Liu, Tao, et al.
Pubblicazione: (2025)
di: Liu, Tao, et al.
Pubblicazione: (2025)
OpenGround: Active Cognition-based Reasoning for Open-World 3D Visual Grounding
di: Huang, Wenyuan, et al.
Pubblicazione: (2025)
di: Huang, Wenyuan, et al.
Pubblicazione: (2025)
Self-Evolving Spatial Reasoning in Vision Language Models via Geometric Logic Consistency
di: Liu, Junming, et al.
Pubblicazione: (2026)
di: Liu, Junming, et al.
Pubblicazione: (2026)
DiMo-GUI: Advancing Test-time Scaling in GUI Grounding via Modality-Aware Visual Reasoning
di: Wu, Hang, et al.
Pubblicazione: (2025)
di: Wu, Hang, et al.
Pubblicazione: (2025)
GUI-G1: Understanding R1-Zero-Like Training for Visual Grounding in GUI Agents
di: Zhou, Yuqi, et al.
Pubblicazione: (2025)
di: Zhou, Yuqi, et al.
Pubblicazione: (2025)
Active-O3: Empowering Multimodal Large Language Models with Active Perception via GRPO
di: Zhu, Muzhi, et al.
Pubblicazione: (2025)
di: Zhu, Muzhi, et al.
Pubblicazione: (2025)
VideoGUI: A Benchmark for GUI Automation from Instructional Videos
di: Lin, Kevin Qinghong, et al.
Pubblicazione: (2024)
di: Lin, Kevin Qinghong, et al.
Pubblicazione: (2024)
Learning from Noisy Preferences: A Semi-Supervised Learning Approach to Direct Preference Optimization
di: Liu, Xinxin, et al.
Pubblicazione: (2026)
di: Liu, Xinxin, et al.
Pubblicazione: (2026)
SparkUI-Parser: Enhancing GUI Perception with Robust Grounding and Parsing
di: Jing, Hongyi, et al.
Pubblicazione: (2025)
di: Jing, Hongyi, et al.
Pubblicazione: (2025)
GUI-Xplore: Empowering Generalizable GUI Agents with One Exploration
di: Sun, Yuchen, et al.
Pubblicazione: (2025)
di: Sun, Yuchen, et al.
Pubblicazione: (2025)
V-Zen: Efficient GUI Understanding and Precise Grounding With A Novel Multimodal LLM
di: Rahman, Abdur, et al.
Pubblicazione: (2024)
di: Rahman, Abdur, et al.
Pubblicazione: (2024)
ZeroGUI: Automating Online GUI Learning at Zero Human Cost
di: Yang, Chenyu, et al.
Pubblicazione: (2025)
di: Yang, Chenyu, et al.
Pubblicazione: (2025)
Visual Test-time Scaling for GUI Agent Grounding
di: Luo, Tiange, et al.
Pubblicazione: (2025)
di: Luo, Tiange, et al.
Pubblicazione: (2025)
GUI Agents with Reinforcement Learning: Toward Digital Inhabitants
di: Hu, Junan, et al.
Pubblicazione: (2026)
di: Hu, Junan, et al.
Pubblicazione: (2026)
UI-AGILE: Advancing GUI Agents with Effective Reinforcement Learning and Precise Inference-Time Grounding
di: Lian, Shuquan, et al.
Pubblicazione: (2025)
di: Lian, Shuquan, et al.
Pubblicazione: (2025)
Think Twice, Click Once: Enhancing GUI Grounding via Fast and Slow Systems
di: Tang, Fei, et al.
Pubblicazione: (2025)
di: Tang, Fei, et al.
Pubblicazione: (2025)
Documenti analoghi
-
GUI-ARP: Enhancing Grounding with Adaptive Region Perception for GUI Agents
di: Ye, Xianhang, et al.
Pubblicazione: (2025) -
Phi-Ground Tech Report: Advancing Perception in GUI Grounding
di: Zhang, Miaosen, et al.
Pubblicazione: (2025) -
UI-Voyager: A Self-Evolving GUI Agent Learning via Failed Experience
di: Lin, Zichuan, et al.
Pubblicazione: (2026) -
AdaZoom-GUI: Adaptive Zoom-based GUI Grounding with Instruction Refinement
di: Pei, Siqi, et al.
Pubblicazione: (2026) -
Learn where to Click from Yourself: On-Policy Self-Distillation for GUI Grounding
di: Zhang, Yan, et al.
Pubblicazione: (2026)