Efficient Multi-turn RL for GUI Agents via Decoupled Training and Adaptive Data Curation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Pengxiang, Hu, Zechen, Shang, Zirui, Wu, Jingrong, Liu, Yang, Liu, Hui, Gao, Zhi, Shi, Chenrui, Zhang, Bofei, Zhang, Zihao, Shi, Xiaochuan, YU, Zedong, Wu, Yuwei, Wu, Xinxiao, Jia, Yunde, Xiang, Liuyu, He, Zhaofeng, Li, Qing |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
GUI Knowledge Bench: Revealing the Knowledge Gap of VLMs in GUI Tasks
par: Shi, Chenrui, et autres
Publié: (2025)
par: Shi, Chenrui, et autres
Publié: (2025)
Iterative Tool Usage Exploration for Multimodal Agents via Step-wise Preference Tuning
par: Li, Pengxiang, et autres
Publié: (2025)
par: Li, Pengxiang, et autres
Publié: (2025)
Benchmarking and Improving GUI Agents in High-Dynamic Environments
par: Liu, Enqi, et autres
Publié: (2026)
par: Liu, Enqi, et autres
Publié: (2026)
TongUI: Internet-Scale Trajectories from Multimodal Web Tutorials for Generalized GUI Agents
par: Zhang, Bofei, et autres
Publié: (2025)
par: Zhang, Bofei, et autres
Publié: (2025)
Game-Theoretic Modeling of Heterogeneous Investor Interactions for Stock Price Forecasting
par: Zhang, Yong, et autres
Publié: (2026)
par: Zhang, Yong, et autres
Publié: (2026)
FIRE: A Dataset for Feedback Integration and Refinement Evaluation of Multimodal Models
par: Li, Pengxiang, et autres
Publié: (2024)
par: Li, Pengxiang, et autres
Publié: (2024)
Adaptive Chain-of-Focus Reasoning via Dynamic Visual Search and Zooming for Efficient VLMs
par: Zhang, Xintong, et autres
Publié: (2025)
par: Zhang, Xintong, et autres
Publié: (2025)
Multi-modal Agent Tuning: Building a VLM-Driven Agent for Efficient Tool Usage
par: Gao, Zhi, et autres
Publié: (2024)
par: Gao, Zhi, et autres
Publié: (2024)
Long-Horizon Visual Imitation Learning via Plan and Code Reflection
par: Chen, Quan, et autres
Publié: (2025)
par: Chen, Quan, et autres
Publié: (2025)
Modality Alignment across Trees on Heterogeneous Hyperbolic Manifolds
par: Wu, Wei, et autres
Publié: (2025)
par: Wu, Wei, et autres
Publié: (2025)
LLM-powered Query Expansion for Enhancing Boundary Prediction in Language-driven Action Localization
par: Shang, Zirui, et autres
Publié: (2025)
par: Shang, Zirui, et autres
Publié: (2025)
GUIDE: Resolving Domain Bias in GUI Agents through Real-Time Web Video Retrieval and Plug-and-Play Annotation
par: Xie, Rui, et autres
Publié: (2026)
par: Xie, Rui, et autres
Publié: (2026)
Geometry-aware Distance Measure for Diverse Hierarchical Structures in Hyperbolic Spaces
par: Li, Pengxiang, et autres
Publié: (2025)
par: Li, Pengxiang, et autres
Publié: (2025)
AdaptMMBench: Benchmarking Adaptive Multimodal Reasoning for Mode Selection and Reasoning Process
par: Zhang, Xintong, et autres
Publié: (2026)
par: Zhang, Xintong, et autres
Publié: (2026)
InfiGUI-R1: Advancing Multimodal GUI Agents from Reactive Actors to Deliberative Reasoners
par: Liu, Yuhang, et autres
Publié: (2025)
par: Liu, Yuhang, et autres
Publié: (2025)
MIRROR: Multimodal Iterative Reasoning via Reflection on Visual Regions
par: Zhang, Haoyu, et autres
Publié: (2026)
par: Zhang, Haoyu, et autres
Publié: (2026)
MobileGUI-RL: Advancing Mobile GUI Agent through Reinforcement Learning in Online Environment
par: Shi, Yucheng, et autres
Publié: (2025)
par: Shi, Yucheng, et autres
Publié: (2025)
Video Summarization using Denoising Diffusion Probabilistic Model
par: Shang, Zirui, et autres
Publié: (2024)
par: Shang, Zirui, et autres
Publié: (2024)
Multi-Sourced Compositional Generalization in Visual Question Answering
par: Li, Chuanhao, et autres
Publié: (2025)
par: Li, Chuanhao, et autres
Publié: (2025)
A Set-to-Set Distance Measure in Hyperbolic Space
par: Li, Pengxiang, et autres
Publié: (2025)
par: Li, Pengxiang, et autres
Publié: (2025)
Cognition Transferring and Decoupling for Text-supervised Egocentric Semantic Segmentation
par: Shi, Zhaofeng, et autres
Publié: (2024)
par: Shi, Zhaofeng, et autres
Publié: (2024)
Multi-Label Stereo Matching for Transparent Scene Depth Estimation
par: Liu, Zhidan, et autres
Publié: (2025)
par: Liu, Zhidan, et autres
Publié: (2025)
Temporally Consistent Stereo Matching
par: Zeng, Jiaxi, et autres
Publié: (2024)
par: Zeng, Jiaxi, et autres
Publié: (2024)
Memory-Centric Embodied Question Answering
par: Zhai, Mingliang, et autres
Publié: (2025)
par: Zhai, Mingliang, et autres
Publié: (2025)
Rethinking Class-Incremental Learning from a Dynamic Imbalanced Learning Perspective
par: Wang, Leyuan, et autres
Publié: (2024)
par: Wang, Leyuan, et autres
Publié: (2024)
Select-Then-Decompose: From Empirical Analysis to Adaptive Selection Strategy for Task Decomposition in Large Language Models
par: Liu, Shuodi, et autres
Publié: (2025)
par: Liu, Shuodi, et autres
Publié: (2025)
A Unifying View of Linear Function Approximation in Off-Policy RL Through Matrix Splitting and Preconditioning
par: Wu, Zechen, et autres
Publié: (2025)
par: Wu, Zechen, et autres
Publié: (2025)
Composition-Incremental Learning for Compositional Generalization
par: Li, Zhen, et autres
Publié: (2025)
par: Li, Zhen, et autres
Publié: (2025)
InfiGUI-G1: Advancing GUI Grounding with Adaptive Exploration Policy Optimization
par: Liu, Yuhang, et autres
Publié: (2025)
par: Liu, Yuhang, et autres
Publié: (2025)
Diving into the Fusion of Monocular Priors for Generalized Stereo Matching
par: Yao, Chengtang, et autres
Publié: (2025)
par: Yao, Chengtang, et autres
Publié: (2025)
3D Visual Illusion Depth Estimation
par: Yao, Chengtang, et autres
Publié: (2025)
par: Yao, Chengtang, et autres
Publié: (2025)
Simulation-Free PSRO: Removing Game Simulation from Policy Space Response Oracles
par: Liu, Yingzhuo, et autres
Publié: (2025)
par: Liu, Yingzhuo, et autres
Publié: (2025)
Fine-Grained 3D Facial Reconstruction for Micro-Expressions
par: Sun, Che, et autres
Publié: (2026)
par: Sun, Che, et autres
Publié: (2026)
Large-Scale Riemannian Meta-Optimization via Subspace Adaptation
par: Yu, Peilin, et autres
Publié: (2025)
par: Yu, Peilin, et autres
Publié: (2025)
Residual Hyperbolic Graph Convolution Networks
par: Xue, Yangkai, et autres
Publié: (2024)
par: Xue, Yangkai, et autres
Publié: (2024)
Curvature Learning for Generalization of Hyperbolic Neural Networks
par: Fan, Xiaomeng, et autres
Publié: (2025)
par: Fan, Xiaomeng, et autres
Publié: (2025)
Dynamic Generation of Personalities with Large Language Models
par: Liu, Jianzhi, et autres
Publié: (2024)
par: Liu, Jianzhi, et autres
Publié: (2024)
Do MLLMs Really Understand the Charts?
par: Zhang, Xiao, et autres
Publié: (2025)
par: Zhang, Xiao, et autres
Publié: (2025)
EchoTrail-GUI: Building Actionable Memory for GUI Agents via Critic-Guided Self-Exploration
par: Li, Runze, et autres
Publié: (2025)
par: Li, Runze, et autres
Publié: (2025)
Adaptive Articulated Object Manipulation On The Fly with Foundation Model Reasoning and Part Grounding
par: Zhang, Xiaojie, et autres
Publié: (2025)
par: Zhang, Xiaojie, et autres
Publié: (2025)
Documents similaires
-
GUI Knowledge Bench: Revealing the Knowledge Gap of VLMs in GUI Tasks
par: Shi, Chenrui, et autres
Publié: (2025) -
Iterative Tool Usage Exploration for Multimodal Agents via Step-wise Preference Tuning
par: Li, Pengxiang, et autres
Publié: (2025) -
Benchmarking and Improving GUI Agents in High-Dynamic Environments
par: Liu, Enqi, et autres
Publié: (2026) -
TongUI: Internet-Scale Trajectories from Multimodal Web Tutorials for Generalized GUI Agents
par: Zhang, Bofei, et autres
Publié: (2025) -
Game-Theoretic Modeling of Heterogeneous Investor Interactions for Stock Price Forecasting
par: Zhang, Yong, et autres
Publié: (2026)