InfiGUI-R1: Advancing Multimodal GUI Agents from Reactive Actors to Deliberative Reasoners
Fuente:
arXiv
Salvato in:
| Autori principali: | Liu, Yuhang, Li, Pengxiang, Xie, Congkai, Hu, Xavier, Han, Xiaotian, Zhang, Shengyu, Yang, Hongxia, Wu, Fei |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
InfiGUI-G1: Advancing GUI Grounding with Adaptive Exploration Policy Optimization
di: Liu, Yuhang, et al.
Pubblicazione: (2025)
di: Liu, Yuhang, et al.
Pubblicazione: (2025)
InfiGUIAgent: A Multimodal Generalist GUI Agent with Native Reasoning and Reflection
di: Liu, Yuhang, et al.
Pubblicazione: (2025)
di: Liu, Yuhang, et al.
Pubblicazione: (2025)
InfiR : Crafting Effective Small Language Models and Multimodal Small Language Models in Reasoning
di: Xie, Congkai, et al.
Pubblicazione: (2025)
di: Xie, Congkai, et al.
Pubblicazione: (2025)
InfiMed: Low-Resource Medical MLLMs with Advancing Understanding and Reasoning
di: Liu, Zeyu, et al.
Pubblicazione: (2025)
di: Liu, Zeyu, et al.
Pubblicazione: (2025)
Infi-MMR: Curriculum-based Unlocking Multimodal Reasoning via Phased Reinforcement Learning in Multimodal Small Language Models
di: Liu, Zeyu, et al.
Pubblicazione: (2025)
di: Liu, Zeyu, et al.
Pubblicazione: (2025)
InfiMed-Foundation: Pioneering Advanced Multimodal Medical Models with Compute-Efficient Pre-Training and Multi-Stage Fine-Tuning
di: Zhu, Guanghao, et al.
Pubblicazione: (2025)
di: Zhu, Guanghao, et al.
Pubblicazione: (2025)
GUI-Actor: Coordinate-Free Visual Grounding for GUI Agents
di: Wu, Qianhui, et al.
Pubblicazione: (2025)
di: Wu, Qianhui, et al.
Pubblicazione: (2025)
InfiR2: A Comprehensive FP8 Training Recipe for Reasoning-Enhanced Language Models
di: Wang, Wenjun, et al.
Pubblicazione: (2025)
di: Wang, Wenjun, et al.
Pubblicazione: (2025)
InfiMed-ORBIT: Aligning LLMs on Open-Ended Complex Tasks via Rubric-Based Incremental Training
di: Wang, Pengkai, et al.
Pubblicazione: (2025)
di: Wang, Pengkai, et al.
Pubblicazione: (2025)
GUI-PRA: Process Reward Agent for GUI Tasks
di: Xiong, Tao, et al.
Pubblicazione: (2025)
di: Xiong, Tao, et al.
Pubblicazione: (2025)
InfiFusion: A Unified Framework for Enhanced Cross-Model Reasoning via LLM Fusion
di: Yan, Zhaoyi, et al.
Pubblicazione: (2025)
di: Yan, Zhaoyi, et al.
Pubblicazione: (2025)
MMBench-GUI: Hierarchical Multi-Platform Evaluation Framework for GUI Agents
di: Wang, Xuehui, et al.
Pubblicazione: (2025)
di: Wang, Xuehui, et al.
Pubblicazione: (2025)
InfiAgent-DABench: Evaluating Agents on Data Analysis Tasks
di: Hu, Xueyu, et al.
Pubblicazione: (2024)
di: Hu, Xueyu, et al.
Pubblicazione: (2024)
History-Aware Reasoning for GUI Agents
di: Wang, Ziwei, et al.
Pubblicazione: (2025)
di: Wang, Ziwei, et al.
Pubblicazione: (2025)
GUI-Libra: Training Native GUI Agents to Reason and Act with Action-aware Supervision and Partially Verifiable RL
di: Yang, Rui, et al.
Pubblicazione: (2026)
di: Yang, Rui, et al.
Pubblicazione: (2026)
MobileGUI-RL: Advancing Mobile GUI Agent through Reinforcement Learning in Online Environment
di: Shi, Yucheng, et al.
Pubblicazione: (2025)
di: Shi, Yucheng, et al.
Pubblicazione: (2025)
GAIR: GUI Automation via Information-Joint Reasoning and Group Reflection
di: Wei, Zishu, et al.
Pubblicazione: (2025)
di: Wei, Zishu, et al.
Pubblicazione: (2025)
GUI-CIDER: Mid-training GUI Agents via Causal Internalization and Density-aware Exemplar Reselection
di: Wu, Zheng, et al.
Pubblicazione: (2026)
di: Wu, Zheng, et al.
Pubblicazione: (2026)
GUI-KV: Efficient GUI Agents via KV Cache with Spatio-Temporal Awareness
di: Huang, Kung-Hsiang, et al.
Pubblicazione: (2025)
di: Huang, Kung-Hsiang, et al.
Pubblicazione: (2025)
InfiAlign: A Scalable and Sample-Efficient Framework for Aligning LLMs to Enhance Reasoning Capabilities
di: Cai, Shuo, et al.
Pubblicazione: (2025)
di: Cai, Shuo, et al.
Pubblicazione: (2025)
ClawGUI: A Unified Framework for Training, Evaluating, and Deploying GUI Agents
di: Tang, Fei, et al.
Pubblicazione: (2026)
di: Tang, Fei, et al.
Pubblicazione: (2026)
META-GUI: Towards Multi-modal Conversational Agents on Mobile GUI
di: Sun, Liangtai, et al.
Pubblicazione: (2022)
di: Sun, Liangtai, et al.
Pubblicazione: (2022)
DELTA: Deliberative Multi-Agent Reasoning with Reinforcement Learning for Multimodal Psychological Counseling
di: Yang, Jiangnan, et al.
Pubblicazione: (2026)
di: Yang, Jiangnan, et al.
Pubblicazione: (2026)
InfiGFusion: Graph-on-Logits Distillation via Efficient Gromov-Wasserstein for Model Fusion
di: Wang, Yuanyi, et al.
Pubblicazione: (2025)
di: Wang, Yuanyi, et al.
Pubblicazione: (2025)
GUI-R1 : A Generalist R1-Style Vision-Language Action Model For GUI Agents
di: Luo, Run, et al.
Pubblicazione: (2025)
di: Luo, Run, et al.
Pubblicazione: (2025)
DeskVision: Large Scale Desktop Region Captioning for Advanced GUI Agents
di: Xu, Yibin, et al.
Pubblicazione: (2025)
di: Xu, Yibin, et al.
Pubblicazione: (2025)
UI-AGILE: Advancing GUI Agents with Effective Reinforcement Learning and Precise Inference-Time Grounding
di: Lian, Shuquan, et al.
Pubblicazione: (2025)
di: Lian, Shuquan, et al.
Pubblicazione: (2025)
GUI-World: A Video Benchmark and Dataset for Multimodal GUI-oriented Understanding
di: Chen, Dongping, et al.
Pubblicazione: (2024)
di: Chen, Dongping, et al.
Pubblicazione: (2024)
GUI-G1: Understanding R1-Zero-Like Training for Visual Grounding in GUI Agents
di: Zhou, Yuqi, et al.
Pubblicazione: (2025)
di: Zhou, Yuqi, et al.
Pubblicazione: (2025)
InfiFPO: Implicit Model Fusion via Preference Optimization in Large Language Models
di: Gu, Yanggan, et al.
Pubblicazione: (2025)
di: Gu, Yanggan, et al.
Pubblicazione: (2025)
Auto-scaling Continuous Memory for GUI Agent
di: Wu, Wenyi, et al.
Pubblicazione: (2025)
di: Wu, Wenyi, et al.
Pubblicazione: (2025)
Aguvis: Unified Pure Vision Agents for Autonomous GUI Interaction
di: Xu, Yiheng, et al.
Pubblicazione: (2024)
di: Xu, Yiheng, et al.
Pubblicazione: (2024)
Quantization Meets Reasoning: Exploring LLM Low-Bit Quantization Degradation for Mathematical Reasoning
di: Li, Zhen, et al.
Pubblicazione: (2025)
di: Li, Zhen, et al.
Pubblicazione: (2025)
Retrieval-augmented GUI Agents with Generative Guidelines
di: Xu, Ran, et al.
Pubblicazione: (2025)
di: Xu, Ran, et al.
Pubblicazione: (2025)
Adaptive Milestone Reward for GUI Agents
di: Zheng, Congmin, et al.
Pubblicazione: (2026)
di: Zheng, Congmin, et al.
Pubblicazione: (2026)
Hidden Ghost Hand: Unveiling Backdoor Vulnerabilities in MLLM-Powered Mobile GUI Agents
di: Cheng, Pengzhou, et al.
Pubblicazione: (2025)
di: Cheng, Pengzhou, et al.
Pubblicazione: (2025)
Understanding GUI Agent Localization Biases through Logit Sharpness
di: Tao, Xingjian, et al.
Pubblicazione: (2025)
di: Tao, Xingjian, et al.
Pubblicazione: (2025)
BacktrackAgent: Enhancing GUI Agent with Error Detection and Backtracking Mechanism
di: Wu, Qinzhuo, et al.
Pubblicazione: (2025)
di: Wu, Qinzhuo, et al.
Pubblicazione: (2025)
See, Think, Act: Teaching Multimodal Agents to Effectively Interact with GUI by Identifying Toggles
di: Wu, Zongru, et al.
Pubblicazione: (2025)
di: Wu, Zongru, et al.
Pubblicazione: (2025)
VLAA-GUI: Knowing When to Stop, Recover, and Search, A Modular Framework for GUI Automation
di: Han, Qijun, et al.
Pubblicazione: (2026)
di: Han, Qijun, et al.
Pubblicazione: (2026)
Documenti analoghi
-
InfiGUI-G1: Advancing GUI Grounding with Adaptive Exploration Policy Optimization
di: Liu, Yuhang, et al.
Pubblicazione: (2025) -
InfiGUIAgent: A Multimodal Generalist GUI Agent with Native Reasoning and Reflection
di: Liu, Yuhang, et al.
Pubblicazione: (2025) -
InfiR : Crafting Effective Small Language Models and Multimodal Small Language Models in Reasoning
di: Xie, Congkai, et al.
Pubblicazione: (2025) -
InfiMed: Low-Resource Medical MLLMs with Advancing Understanding and Reasoning
di: Liu, Zeyu, et al.
Pubblicazione: (2025) -
Infi-MMR: Curriculum-based Unlocking Multimodal Reasoning via Phased Reinforcement Learning in Multimodal Small Language Models
di: Liu, Zeyu, et al.
Pubblicazione: (2025)