MagicGUI: A Foundational Mobile GUI Agent with Scalable Data Pipeline and Reinforcement Fine-tuning
Fuente:
arXiv
Salvato in:
| Autori principali: | Tang, Liujian, Dong, Shaokang, Huang, Yijia, Xiang, Minqi, Ruan, Hongtao, Wang, Bin, Li, Shuo, Xi, Zhiheng, Cao, Zhihui, Pang, Hailiang, Kong, Heng, Yang, He, Chai, Mingxu, Gao, Zhilin, Liu, Xingyu, Fu, Yingnan, Liu, Jiaming, Huang, Xuanjing, Jiang, Yu-Gang, Gui, Tao, Zhang, Qi, Wang, Kang, Zhang, Yunke, Wang, Yuran |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MagicGUI-RMS: A Multi-Agent Reward Model System for Self-Evolving GUI Agents via Automated Feedback Reflux
di: Li, Zecheng, et al.
Pubblicazione: (2026)
di: Li, Zecheng, et al.
Pubblicazione: (2026)
GUI-CEval: A Hierarchical and Comprehensive Chinese Benchmark for Mobile GUI Agents
di: Li, Yang, et al.
Pubblicazione: (2026)
di: Li, Yang, et al.
Pubblicazione: (2026)
Coding with Eyes: Visual Feedback Unlocks Reliable GUI Code Generating and Debugging
di: Liu, Zhilin, et al.
Pubblicazione: (2026)
di: Liu, Zhilin, et al.
Pubblicazione: (2026)
Enhancing Trustworthy GUI Grounding via Self-Critiqued Reinforcement Learning
di: Zhang, Shaojie, et al.
Pubblicazione: (2025)
di: Zhang, Shaojie, et al.
Pubblicazione: (2025)
BTL-UI: Blink-Think-Link Reasoning Model for GUI Agent
di: Zhang, Shaojie, et al.
Pubblicazione: (2025)
di: Zhang, Shaojie, et al.
Pubblicazione: (2025)
POINTS-GUI-G: GUI-Grounding Journey
di: Zhao, Zhongyin, et al.
Pubblicazione: (2026)
di: Zhao, Zhongyin, et al.
Pubblicazione: (2026)
Adaptive Milestone Reward for GUI Agents
di: Zheng, Congmin, et al.
Pubblicazione: (2026)
di: Zheng, Congmin, et al.
Pubblicazione: (2026)
GAIA: A Data Flywheel System for Training GUI Test-Time Scaling Critic Models
di: Wang, Shaokang, et al.
Pubblicazione: (2026)
di: Wang, Shaokang, et al.
Pubblicazione: (2026)
MMBench-GUI: Hierarchical Multi-Platform Evaluation Framework for GUI Agents
di: Wang, Xuehui, et al.
Pubblicazione: (2025)
di: Wang, Xuehui, et al.
Pubblicazione: (2025)
GUI-Rise: Structured Reasoning and History Summarization for GUI Navigation
di: Liu, Tao, et al.
Pubblicazione: (2025)
di: Liu, Tao, et al.
Pubblicazione: (2025)
GUI-PRA: Process Reward Agent for GUI Tasks
di: Xiong, Tao, et al.
Pubblicazione: (2025)
di: Xiong, Tao, et al.
Pubblicazione: (2025)
GUI-G$^2$: Gaussian Reward Modeling for GUI Grounding
di: Tang, Fei, et al.
Pubblicazione: (2025)
di: Tang, Fei, et al.
Pubblicazione: (2025)
InfiGUI-G1: Advancing GUI Grounding with Adaptive Exploration Policy Optimization
di: Liu, Yuhang, et al.
Pubblicazione: (2025)
di: Liu, Yuhang, et al.
Pubblicazione: (2025)
GUI-R1 : A Generalist R1-Style Vision-Language Action Model For GUI Agents
di: Luo, Run, et al.
Pubblicazione: (2025)
di: Luo, Run, et al.
Pubblicazione: (2025)
OmniGUI: Benchmarking GUI Agents in Omni-Modal Smartphone Environments
di: Henry, Felix, et al.
Pubblicazione: (2026)
di: Henry, Felix, et al.
Pubblicazione: (2026)
GUI-Reflection: Empowering Multimodal GUI Models with Self-Reflection Behavior
di: Wu, Penghao, et al.
Pubblicazione: (2025)
di: Wu, Penghao, et al.
Pubblicazione: (2025)
ZeroGUI: Automating Online GUI Learning at Zero Human Cost
di: Yang, Chenyu, et al.
Pubblicazione: (2025)
di: Yang, Chenyu, et al.
Pubblicazione: (2025)
VeriOS: Query-Driven Proactive Human-Agent-GUI Interaction for Trustworthy OS Agents
di: Wu, Zheng, et al.
Pubblicazione: (2025)
di: Wu, Zheng, et al.
Pubblicazione: (2025)
META-GUI: Towards Multi-modal Conversational Agents on Mobile GUI
di: Sun, Liangtai, et al.
Pubblicazione: (2022)
di: Sun, Liangtai, et al.
Pubblicazione: (2022)
MagicAgent: Towards Generalized Agent Planning
di: Ren, Xuhui, et al.
Pubblicazione: (2026)
di: Ren, Xuhui, et al.
Pubblicazione: (2026)
ShowUI-Aloha: Human-Taught GUI Agent
di: Zhang, Yichun, et al.
Pubblicazione: (2026)
di: Zhang, Yichun, et al.
Pubblicazione: (2026)
MemGUI-Bench: Benchmarking Memory of Mobile GUI Agents in Dynamic Environments
di: Liu, Guangyi, et al.
Pubblicazione: (2026)
di: Liu, Guangyi, et al.
Pubblicazione: (2026)
MobileGUI-RL: Advancing Mobile GUI Agent through Reinforcement Learning in Online Environment
di: Shi, Yucheng, et al.
Pubblicazione: (2025)
di: Shi, Yucheng, et al.
Pubblicazione: (2025)
DRS-GUI: Dynamic Region Search for Training-Free GUI Grounding
di: Liu, Yichao, et al.
Pubblicazione: (2026)
di: Liu, Yichao, et al.
Pubblicazione: (2026)
See, Plan, Snap: Evaluating Multimodal GUI Agents in Scratch
di: Zhang, Xingyi, et al.
Pubblicazione: (2026)
di: Zhang, Xingyi, et al.
Pubblicazione: (2026)
AdaZoom-GUI: Adaptive Zoom-based GUI Grounding with Instruction Refinement
di: Pei, Siqi, et al.
Pubblicazione: (2026)
di: Pei, Siqi, et al.
Pubblicazione: (2026)
GUI-Actor: Coordinate-Free Visual Grounding for GUI Agents
di: Wu, Qianhui, et al.
Pubblicazione: (2025)
di: Wu, Qianhui, et al.
Pubblicazione: (2025)
GUI-Bee: Align GUI Action Grounding to Novel Environments via Autonomous Exploration
di: Fan, Yue, et al.
Pubblicazione: (2025)
di: Fan, Yue, et al.
Pubblicazione: (2025)
Step-GUI Technical Report
di: Yan, Haolong, et al.
Pubblicazione: (2025)
di: Yan, Haolong, et al.
Pubblicazione: (2025)
MP-GUI: Modality Perception with MLLMs for GUI Understanding
di: Wang, Ziwei, et al.
Pubblicazione: (2025)
di: Wang, Ziwei, et al.
Pubblicazione: (2025)
FedGUI: Benchmarking Federated GUI Agents across Heterogeneous Platforms, Devices, and Operating Systems
di: Wang, Wenhao, et al.
Pubblicazione: (2026)
di: Wang, Wenhao, et al.
Pubblicazione: (2026)
LiteGUI: Distilling Compact GUI Agents with Reinforcement Learning
di: Wu, Yubin, et al.
Pubblicazione: (2026)
di: Wu, Yubin, et al.
Pubblicazione: (2026)
Look Before You Leap: A GUI-Critic-R1 Model for Pre-Operative Error Diagnosis in GUI Automation
di: Wanyan, Yuyang, et al.
Pubblicazione: (2025)
di: Wanyan, Yuyang, et al.
Pubblicazione: (2025)
GUI-Eyes: Tool-Augmented Perception for Visual Grounding in GUI Agents
di: Chen, Chen, et al.
Pubblicazione: (2026)
di: Chen, Chen, et al.
Pubblicazione: (2026)
GUI-World: A Video Benchmark and Dataset for Multimodal GUI-oriented Understanding
di: Chen, Dongping, et al.
Pubblicazione: (2024)
di: Chen, Dongping, et al.
Pubblicazione: (2024)
GUI-Shepherd: Reliable Process Reward and Verification for Long-Sequence GUI Tasks
di: Chen, Cong, et al.
Pubblicazione: (2025)
di: Chen, Cong, et al.
Pubblicazione: (2025)
GUI-explorer: Autonomous Exploration and Mining of Transition-aware Knowledge for GUI Agent
di: Xie, Bin, et al.
Pubblicazione: (2025)
di: Xie, Bin, et al.
Pubblicazione: (2025)
DocOS: Towards Proactive Document-Guided Actions in GUI Agents
di: Liu, Jingjing, et al.
Pubblicazione: (2026)
di: Liu, Jingjing, et al.
Pubblicazione: (2026)
GUI-ARP: Enhancing Grounding with Adaptive Region Perception for GUI Agents
di: Ye, Xianhang, et al.
Pubblicazione: (2025)
di: Ye, Xianhang, et al.
Pubblicazione: (2025)
ToolCUA: Towards Optimal GUI-Tool Path Orchestration for Computer Use Agents
di: Hu, Xuhao, et al.
Pubblicazione: (2026)
di: Hu, Xuhao, et al.
Pubblicazione: (2026)
Documenti analoghi
-
MagicGUI-RMS: A Multi-Agent Reward Model System for Self-Evolving GUI Agents via Automated Feedback Reflux
di: Li, Zecheng, et al.
Pubblicazione: (2026) -
GUI-CEval: A Hierarchical and Comprehensive Chinese Benchmark for Mobile GUI Agents
di: Li, Yang, et al.
Pubblicazione: (2026) -
Coding with Eyes: Visual Feedback Unlocks Reliable GUI Code Generating and Debugging
di: Liu, Zhilin, et al.
Pubblicazione: (2026) -
Enhancing Trustworthy GUI Grounding via Self-Critiqued Reinforcement Learning
di: Zhang, Shaojie, et al.
Pubblicazione: (2025) -
BTL-UI: Blink-Think-Link Reasoning Model for GUI Agent
di: Zhang, Shaojie, et al.
Pubblicazione: (2025)