UI-AGILE: Advancing GUI Agents with Effective Reinforcement Learning and Precise Inference-Time Grounding
Fuente:
arXiv
Salvato in:
| Autori principali: | Lian, Shuquan, Wu, Yuhang, Ma, Jia, Ding, Yifan, Song, Zihan, Chen, Bingqi, Zheng, Xiawu, Li, Hui, Ji, Rongrong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SWE-AGILE: A Software Agent Framework for Efficiently Managing Dynamic Reasoning Context
di: Lian, Shuquan, et al.
Pubblicazione: (2026)
di: Lian, Shuquan, et al.
Pubblicazione: (2026)
UI-TARS-2 Technical Report: Advancing GUI Agent with Multi-Turn Reinforcement Learning
di: Wang, Haoming, et al.
Pubblicazione: (2025)
di: Wang, Haoming, et al.
Pubblicazione: (2025)
Benchmarking Abstract and Reasoning Abilities Through A Theoretical Perspective
di: Ma, Qingchuan, et al.
Pubblicazione: (2025)
di: Ma, Qingchuan, et al.
Pubblicazione: (2025)
UI-E2I-Synth: Advancing GUI Grounding with Large-Scale Instruction Synthesis
di: Liu, Xinyi, et al.
Pubblicazione: (2025)
di: Liu, Xinyi, et al.
Pubblicazione: (2025)
Aria-UI: Visual Grounding for GUI Instructions
di: Yang, Yuhao, et al.
Pubblicazione: (2024)
di: Yang, Yuhao, et al.
Pubblicazione: (2024)
UI-Zoomer: Uncertainty-Driven Adaptive Zoom-In for GUI Grounding
di: Tang, Fei, et al.
Pubblicazione: (2026)
di: Tang, Fei, et al.
Pubblicazione: (2026)
CodeRAG: Finding Relevant and Necessary Knowledge for Retrieval-Augmented Repository-Level Code Completion
di: Zhang, Sheng, et al.
Pubblicazione: (2025)
di: Zhang, Sheng, et al.
Pubblicazione: (2025)
SparkUI-Parser: Enhancing GUI Perception with Robust Grounding and Parsing
di: Jing, Hongyi, et al.
Pubblicazione: (2025)
di: Jing, Hongyi, et al.
Pubblicazione: (2025)
UI-TARS: Pioneering Automated GUI Interaction with Native Agents
di: Qin, Yujia, et al.
Pubblicazione: (2025)
di: Qin, Yujia, et al.
Pubblicazione: (2025)
ShowUI-Aloha: Human-Taught GUI Agent
di: Zhang, Yichun, et al.
Pubblicazione: (2026)
di: Zhang, Yichun, et al.
Pubblicazione: (2026)
Ferret-UI Lite: Lessons from Building Small On-Device GUI Agents
di: Yang, Zhen, et al.
Pubblicazione: (2025)
di: Yang, Zhen, et al.
Pubblicazione: (2025)
SeeClick: Harnessing GUI Grounding for Advanced Visual GUI Agents
di: Cheng, Kanzhi, et al.
Pubblicazione: (2024)
di: Cheng, Kanzhi, et al.
Pubblicazione: (2024)
PAL-UI: Planning with Active Look-back for Vision-Based GUI Agents
di: Liu, Zikang, et al.
Pubblicazione: (2025)
di: Liu, Zikang, et al.
Pubblicazione: (2025)
Guiding VLM Agents with Process Rewards at Inference Time for GUI Navigation
di: Hu, Zhiyuan, et al.
Pubblicazione: (2025)
di: Hu, Zhiyuan, et al.
Pubblicazione: (2025)
UI-Mem: Self-Evolving Experience Memory for Online Reinforcement Learning in Mobile GUI Agents
di: Xiao, Han, et al.
Pubblicazione: (2026)
di: Xiao, Han, et al.
Pubblicazione: (2026)
ShowUI: One Vision-Language-Action Model for GUI Visual Agent
di: Lin, Kevin Qinghong, et al.
Pubblicazione: (2024)
di: Lin, Kevin Qinghong, et al.
Pubblicazione: (2024)
UI-Ins: Enhancing GUI Grounding with Multi-Perspective Instruction-as-Reasoning
di: Chen, Liangyu, et al.
Pubblicazione: (2025)
di: Chen, Liangyu, et al.
Pubblicazione: (2025)
Multi-branch Collaborative Learning Network for 3D Visual Grounding
di: Qian, Zhipeng, et al.
Pubblicazione: (2024)
di: Qian, Zhipeng, et al.
Pubblicazione: (2024)
Falcon-UI: Understanding GUI Before Following User Instructions
di: Shen, Huawen, et al.
Pubblicazione: (2024)
di: Shen, Huawen, et al.
Pubblicazione: (2024)
InfiGUI-G1: Advancing GUI Grounding with Adaptive Exploration Policy Optimization
di: Liu, Yuhang, et al.
Pubblicazione: (2025)
di: Liu, Yuhang, et al.
Pubblicazione: (2025)
GUI-Actor: Coordinate-Free Visual Grounding for GUI Agents
di: Wu, Qianhui, et al.
Pubblicazione: (2025)
di: Wu, Qianhui, et al.
Pubblicazione: (2025)
Test-Time Reinforcement Learning for GUI Grounding via Region Consistency
di: Du, Yong, et al.
Pubblicazione: (2025)
di: Du, Yong, et al.
Pubblicazione: (2025)
Phi-Ground Tech Report: Advancing Perception in GUI Grounding
di: Zhang, Miaosen, et al.
Pubblicazione: (2025)
di: Zhang, Miaosen, et al.
Pubblicazione: (2025)
BTL-UI: Blink-Think-Link Reasoning Model for GUI Agent
di: Zhang, Shaojie, et al.
Pubblicazione: (2025)
di: Zhang, Shaojie, et al.
Pubblicazione: (2025)
GUI-G1: Understanding R1-Zero-Like Training for Visual Grounding in GUI Agents
di: Zhou, Yuqi, et al.
Pubblicazione: (2025)
di: Zhou, Yuqi, et al.
Pubblicazione: (2025)
TongUI: Internet-Scale Trajectories from Multimodal Web Tutorials for Generalized GUI Agents
di: Zhang, Bofei, et al.
Pubblicazione: (2025)
di: Zhang, Bofei, et al.
Pubblicazione: (2025)
MAI-UI Technical Report: Real-World Centric Foundation GUI Agents
di: Zhou, Hanzhang, et al.
Pubblicazione: (2025)
di: Zhou, Hanzhang, et al.
Pubblicazione: (2025)
Ferret-UI: Grounded Mobile UI Understanding with Multimodal LLMs
di: You, Keen, et al.
Pubblicazione: (2024)
di: You, Keen, et al.
Pubblicazione: (2024)
Are GUI Agents Focused Enough? Automated Distraction via Semantic-level UI Element Injection
di: Yang, Wenkui, et al.
Pubblicazione: (2026)
di: Yang, Wenkui, et al.
Pubblicazione: (2026)
InfiGUI-R1: Advancing Multimodal GUI Agents from Reactive Actors to Deliberative Reasoners
di: Liu, Yuhang, et al.
Pubblicazione: (2025)
di: Liu, Yuhang, et al.
Pubblicazione: (2025)
MobileGUI-RL: Advancing Mobile GUI Agent through Reinforcement Learning in Online Environment
di: Shi, Yucheng, et al.
Pubblicazione: (2025)
di: Shi, Yucheng, et al.
Pubblicazione: (2025)
EBFT: Effective and Block-Wise Fine-Tuning for Sparse LLMs
di: Guo, Song, et al.
Pubblicazione: (2024)
di: Guo, Song, et al.
Pubblicazione: (2024)
AQuaUI: Visual Token Reduction for GUI Agents with Adaptive Quadtrees
di: Li, Yuankai, et al.
Pubblicazione: (2026)
di: Li, Yuankai, et al.
Pubblicazione: (2026)
Training-Free Multimodal Large Language Model Orchestration
di: Xie, Tianyu, et al.
Pubblicazione: (2025)
di: Xie, Tianyu, et al.
Pubblicazione: (2025)
Generative UI: LLMs are Effective UI Generators
di: Leviathan, Yaniv, et al.
Pubblicazione: (2026)
di: Leviathan, Yaniv, et al.
Pubblicazione: (2026)
UI-Genie: A Self-Improving Approach for Iteratively Boosting MLLM-based Mobile GUI Agents
di: Xiao, Han, et al.
Pubblicazione: (2025)
di: Xiao, Han, et al.
Pubblicazione: (2025)
CRAFT-GUI: Curriculum-Reinforced Agent For GUI Tasks
di: Nong, Songqin, et al.
Pubblicazione: (2025)
di: Nong, Songqin, et al.
Pubblicazione: (2025)
Event-Anchored Frame Selection for Effective Long-Video Understanding
di: Chen, Wang, et al.
Pubblicazione: (2026)
di: Chen, Wang, et al.
Pubblicazione: (2026)
ZonUI-3B: A Lightweight Vision-Language Model for Cross-Resolution GUI Grounding
di: Hsieh, ZongHan, et al.
Pubblicazione: (2025)
di: Hsieh, ZongHan, et al.
Pubblicazione: (2025)
SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning
di: Huang, Haoyu, et al.
Pubblicazione: (2026)
di: Huang, Haoyu, et al.
Pubblicazione: (2026)
Documenti analoghi
-
SWE-AGILE: A Software Agent Framework for Efficiently Managing Dynamic Reasoning Context
di: Lian, Shuquan, et al.
Pubblicazione: (2026) -
UI-TARS-2 Technical Report: Advancing GUI Agent with Multi-Turn Reinforcement Learning
di: Wang, Haoming, et al.
Pubblicazione: (2025) -
Benchmarking Abstract and Reasoning Abilities Through A Theoretical Perspective
di: Ma, Qingchuan, et al.
Pubblicazione: (2025) -
UI-E2I-Synth: Advancing GUI Grounding with Large-Scale Instruction Synthesis
di: Liu, Xinyi, et al.
Pubblicazione: (2025) -
Aria-UI: Visual Grounding for GUI Instructions
di: Yang, Yuhao, et al.
Pubblicazione: (2024)