Video2GUI: Synthesizing Large-Scale Interaction Trajectories for Generalized GUI Agent Pretraining
Fuente:
arXiv
Guardado en:
| Autores principales: | Xiong, Weimin, Gu, Shuhao, Ye, Bowen, Yue, Zihao, Li, Lei, Song, Feifan, Li, Sujian, Tian, Hao |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
AndroTMem: From Interaction Trajectories to Anchored Memory in Long-Horizon GUI Agents
por: Shi, Yibo, et al.
Publicado: (2026)
por: Shi, Yibo, et al.
Publicado: (2026)
MPO: Boosting LLM Agents with Meta Plan Optimization
por: Xiong, Weimin, et al.
Publicado: (2025)
por: Xiong, Weimin, et al.
Publicado: (2025)
MMBench-GUI: Hierarchical Multi-Platform Evaluation Framework for GUI Agents
por: Wang, Xuehui, et al.
Publicado: (2025)
por: Wang, Xuehui, et al.
Publicado: (2025)
AgentBank: Towards Generalized LLM Agents via Fine-Tuning on 50000+ Interaction Trajectories
por: Song, Yifan, et al.
Publicado: (2024)
por: Song, Yifan, et al.
Publicado: (2024)
UI-TARS: Pioneering Automated GUI Interaction with Native Agents
por: Qin, Yujia, et al.
Publicado: (2025)
por: Qin, Yujia, et al.
Publicado: (2025)
GUI-World: A Video Benchmark and Dataset for Multimodal GUI-oriented Understanding
por: Chen, Dongping, et al.
Publicado: (2024)
por: Chen, Dongping, et al.
Publicado: (2024)
UIPro: Unleashing Superior Interaction Capability For GUI Agents
por: Li, Hongxin, et al.
Publicado: (2025)
por: Li, Hongxin, et al.
Publicado: (2025)
Large Language Model-Brained GUI Agents: A Survey
por: Zhang, Chaoyun, et al.
Publicado: (2024)
por: Zhang, Chaoyun, et al.
Publicado: (2024)
GUI-Xplore: Empowering Generalizable GUI Agents with One Exploration
por: Sun, Yuchen, et al.
Publicado: (2025)
por: Sun, Yuchen, et al.
Publicado: (2025)
HATS: Hardness-Aware Trajectory Synthesis for GUI Agents
por: Shao, Rui, et al.
Publicado: (2026)
por: Shao, Rui, et al.
Publicado: (2026)
Recovering Policy-Induced Errors: Benchmarking and Trajectory Synthesis for Robust GUI Agents
por: Bu, Tianpeng, et al.
Publicado: (2026)
por: Bu, Tianpeng, et al.
Publicado: (2026)
TongUI: Internet-Scale Trajectories from Multimodal Web Tutorials for Generalized GUI Agents
por: Zhang, Bofei, et al.
Publicado: (2025)
por: Zhang, Bofei, et al.
Publicado: (2025)
GUI-KV: Efficient GUI Agents via KV Cache with Spatio-Temporal Awareness
por: Huang, Kung-Hsiang, et al.
Publicado: (2025)
por: Huang, Kung-Hsiang, et al.
Publicado: (2025)
DeskVision: Large Scale Desktop Region Captioning for Advanced GUI Agents
por: Xu, Yibin, et al.
Publicado: (2025)
por: Xu, Yibin, et al.
Publicado: (2025)
GUI-ARP: Enhancing Grounding with Adaptive Region Perception for GUI Agents
por: Ye, Xianhang, et al.
Publicado: (2025)
por: Ye, Xianhang, et al.
Publicado: (2025)
VideoGUI: A Benchmark for GUI Automation from Instructional Videos
por: Lin, Kevin Qinghong, et al.
Publicado: (2024)
por: Lin, Kevin Qinghong, et al.
Publicado: (2024)
AutoGUI: Scaling GUI Grounding with Automatic Functionality Annotations from LLMs
por: Li, Hongxin, et al.
Publicado: (2025)
por: Li, Hongxin, et al.
Publicado: (2025)
Aguvis: Unified Pure Vision Agents for Autonomous GUI Interaction
por: Xu, Yiheng, et al.
Publicado: (2024)
por: Xu, Yiheng, et al.
Publicado: (2024)
GUI-Actor: Coordinate-Free Visual Grounding for GUI Agents
por: Wu, Qianhui, et al.
Publicado: (2025)
por: Wu, Qianhui, et al.
Publicado: (2025)
History-Aware Reasoning for GUI Agents
por: Wang, Ziwei, et al.
Publicado: (2025)
por: Wang, Ziwei, et al.
Publicado: (2025)
Continual GUI Agents
por: Liu, Ziwei, et al.
Publicado: (2026)
por: Liu, Ziwei, et al.
Publicado: (2026)
ZeroGUI: Automating Online GUI Learning at Zero Human Cost
por: Yang, Chenyu, et al.
Publicado: (2025)
por: Yang, Chenyu, et al.
Publicado: (2025)
SeeClick: Harnessing GUI Grounding for Advanced Visual GUI Agents
por: Cheng, Kanzhi, et al.
Publicado: (2024)
por: Cheng, Kanzhi, et al.
Publicado: (2024)
MemGUI-Bench: Benchmarking Memory of Mobile GUI Agents in Dynamic Environments
por: Liu, Guangyi, et al.
Publicado: (2026)
por: Liu, Guangyi, et al.
Publicado: (2026)
CRAFT-GUI: Curriculum-Reinforced Agent For GUI Tasks
por: Nong, Songqin, et al.
Publicado: (2025)
por: Nong, Songqin, et al.
Publicado: (2025)
GUI-R1 : A Generalist R1-Style Vision-Language Action Model For GUI Agents
por: Luo, Run, et al.
Publicado: (2025)
por: Luo, Run, et al.
Publicado: (2025)
GUI Agents for Continual Game Generation
por: Huang, Yixu, et al.
Publicado: (2026)
por: Huang, Yixu, et al.
Publicado: (2026)
GUI-CEval: A Hierarchical and Comprehensive Chinese Benchmark for Mobile GUI Agents
por: Li, Yang, et al.
Publicado: (2026)
por: Li, Yang, et al.
Publicado: (2026)
GUI-CIDER: Mid-training GUI Agents via Causal Internalization and Density-aware Exemplar Reselection
por: Wu, Zheng, et al.
Publicado: (2026)
por: Wu, Zheng, et al.
Publicado: (2026)
LLM-Powered GUI Agents in Phone Automation: Surveying Progress and Prospects
por: Liu, Guangyi, et al.
Publicado: (2025)
por: Liu, Guangyi, et al.
Publicado: (2025)
GUI-Rise: Structured Reasoning and History Summarization for GUI Navigation
por: Liu, Tao, et al.
Publicado: (2025)
por: Liu, Tao, et al.
Publicado: (2025)
OS-Genesis: Automating GUI Agent Trajectory Construction via Reverse Task Synthesis
por: Sun, Qiushi, et al.
Publicado: (2024)
por: Sun, Qiushi, et al.
Publicado: (2024)
GUI-G$^2$: Gaussian Reward Modeling for GUI Grounding
por: Tang, Fei, et al.
Publicado: (2025)
por: Tang, Fei, et al.
Publicado: (2025)
POINTS-GUI-G: GUI-Grounding Journey
por: Zhao, Zhongyin, et al.
Publicado: (2026)
por: Zhao, Zhongyin, et al.
Publicado: (2026)
MP-GUI: Modality Perception with MLLMs for GUI Understanding
por: Wang, Ziwei, et al.
Publicado: (2025)
por: Wang, Ziwei, et al.
Publicado: (2025)
ControlGUI: Guiding Generative GUI Exploration through Perceptual Visual Flow
por: Garg, Aryan, et al.
Publicado: (2025)
por: Garg, Aryan, et al.
Publicado: (2025)
META-GUI: Towards Multi-modal Conversational Agents on Mobile GUI
por: Sun, Liangtai, et al.
Publicado: (2022)
por: Sun, Liangtai, et al.
Publicado: (2022)
ClawGUI: A Unified Framework for Training, Evaluating, and Deploying GUI Agents
por: Tang, Fei, et al.
Publicado: (2026)
por: Tang, Fei, et al.
Publicado: (2026)
DiMo-GUI: Advancing Test-time Scaling in GUI Grounding via Modality-Aware Visual Reasoning
por: Wu, Hang, et al.
Publicado: (2025)
por: Wu, Hang, et al.
Publicado: (2025)
OmniGUI: Benchmarking GUI Agents in Omni-Modal Smartphone Environments
por: Henry, Felix, et al.
Publicado: (2026)
por: Henry, Felix, et al.
Publicado: (2026)
Ejemplares similares
-
AndroTMem: From Interaction Trajectories to Anchored Memory in Long-Horizon GUI Agents
por: Shi, Yibo, et al.
Publicado: (2026) -
MPO: Boosting LLM Agents with Meta Plan Optimization
por: Xiong, Weimin, et al.
Publicado: (2025) -
MMBench-GUI: Hierarchical Multi-Platform Evaluation Framework for GUI Agents
por: Wang, Xuehui, et al.
Publicado: (2025) -
AgentBank: Towards Generalized LLM Agents via Fine-Tuning on 50000+ Interaction Trajectories
por: Song, Yifan, et al.
Publicado: (2024) -
UI-TARS: Pioneering Automated GUI Interaction with Native Agents
por: Qin, Yujia, et al.
Publicado: (2025)