VideoGUI: A Benchmark for GUI Automation from Instructional Videos
Fuente:
arXiv
Guardado en:
| Autores principales: | Lin, Kevin Qinghong, Li, Linjie, Gao, Difei, WU, Qinchen, Yan, Mingyi, Yang, Zhengyuan, Wang, Lijuan, Shou, Mike Zheng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
ShowUI: One Vision-Language-Action Model for GUI Visual Agent
por: Lin, Kevin Qinghong, et al.
Publicado: (2024)
por: Lin, Kevin Qinghong, et al.
Publicado: (2024)
GUI Action Narrator: Where and When Did That Action Take Place?
por: Wu, Qinchen, et al.
Publicado: (2024)
por: Wu, Qinchen, et al.
Publicado: (2024)
ShowUI-$π$: Flow-based Generative Models as GUI Dexterous Hands
por: Hu, Siyuan, et al.
Publicado: (2025)
por: Hu, Siyuan, et al.
Publicado: (2025)
VLog: Video-Language Models by Generative Retrieval of Narration Vocabulary
por: Lin, Kevin Qinghong, et al.
Publicado: (2025)
por: Lin, Kevin Qinghong, et al.
Publicado: (2025)
The Dawn of GUI Agent: A Preliminary Case Study with Claude 3.5 Computer Use
por: Hu, Siyuan, et al.
Publicado: (2024)
por: Hu, Siyuan, et al.
Publicado: (2024)
ShowUI-Aloha: Human-Taught GUI Agent
por: Zhang, Yichun, et al.
Publicado: (2026)
por: Zhang, Yichun, et al.
Publicado: (2026)
COSMO: COntrastive Streamlined MultimOdal Model with Interleaved Pre-Training
por: Wang, Alex Jinpeng, et al.
Publicado: (2024)
por: Wang, Alex Jinpeng, et al.
Publicado: (2024)
VideoLLM-online: Online Video Large Language Model for Streaming Video
por: Chen, Joya, et al.
Publicado: (2024)
por: Chen, Joya, et al.
Publicado: (2024)
Learning Video Context as Interleaved Multimodal Sequences
por: Lin, Kevin Qinghong, et al.
Publicado: (2024)
por: Lin, Kevin Qinghong, et al.
Publicado: (2024)
Computer-Use Agents as Judges for Generative User Interface
por: Lin, Kevin Qinghong, et al.
Publicado: (2025)
por: Lin, Kevin Qinghong, et al.
Publicado: (2025)
Paper2Video: Automatic Video Generation from Scientific Papers
por: Zhu, Zeyu, et al.
Publicado: (2025)
por: Zhu, Zeyu, et al.
Publicado: (2025)
Code2Video: A Code-centric Paradigm for Educational Video Generation
por: Chen, Yanzhe, et al.
Publicado: (2025)
por: Chen, Yanzhe, et al.
Publicado: (2025)
VideoMind: A Chain-of-LoRA Agent for Temporal-Grounded Video Reasoning
por: Liu, Ye, et al.
Publicado: (2025)
por: Liu, Ye, et al.
Publicado: (2025)
GUI-World: A Video Benchmark and Dataset for Multimodal GUI-oriented Understanding
por: Chen, Dongping, et al.
Publicado: (2024)
por: Chen, Dongping, et al.
Publicado: (2024)
Soap2Soap: Long Cinematic Video Remaking via Multi-Agent Collaboration
por: Song, Yiren, et al.
Publicado: (2026)
por: Song, Yiren, et al.
Publicado: (2026)
LiVOS: Light Video Object Segmentation with Gated Linear Matching
por: Liu, Qin, et al.
Publicado: (2024)
por: Liu, Qin, et al.
Publicado: (2024)
Factorized Learning for Temporally Grounded Video-Language Models
por: Zeng, Wenzheng, et al.
Publicado: (2025)
por: Zeng, Wenzheng, et al.
Publicado: (2025)
VideoLLM-MoD: Efficient Video-Language Streaming with Mixture-of-Depths Vision Computation
por: Wu, Shiwei, et al.
Publicado: (2024)
por: Wu, Shiwei, et al.
Publicado: (2024)
Exploring a Unified Vision-Centric Contrastive Alternatives on Multi-Modal Web Documents
por: Lin, Yiqi, et al.
Publicado: (2025)
por: Lin, Yiqi, et al.
Publicado: (2025)
Benchmarking and Improving GUI Agents in High-Dynamic Environments
por: Liu, Enqi, et al.
Publicado: (2026)
por: Liu, Enqi, et al.
Publicado: (2026)
GUI-CEval: A Hierarchical and Comprehensive Chinese Benchmark for Mobile GUI Agents
por: Li, Yang, et al.
Publicado: (2026)
por: Li, Yang, et al.
Publicado: (2026)
GUIDE: A Benchmark for Understanding and Assisting Users in Open-Ended GUI Tasks
por: Yang, Saelyne, et al.
Publicado: (2026)
por: Yang, Saelyne, et al.
Publicado: (2026)
Motion Consistency Model: Accelerating Video Diffusion with Disentangled Motion-Appearance Distillation
por: Zhai, Yuanhao, et al.
Publicado: (2024)
por: Zhai, Yuanhao, et al.
Publicado: (2024)
Delocate: Detection and Localization for Deepfake Videos with Randomly-Located Tampered Traces
por: Hu, Juan, et al.
Publicado: (2024)
por: Hu, Juan, et al.
Publicado: (2024)
AUTO-Explorer: Automated Data Collection for GUI Agent
por: Guo, Xiangwu, et al.
Publicado: (2025)
por: Guo, Xiangwu, et al.
Publicado: (2025)
AdaZoom-GUI: Adaptive Zoom-based GUI Grounding with Instruction Refinement
por: Pei, Siqi, et al.
Publicado: (2026)
por: Pei, Siqi, et al.
Publicado: (2026)
PANDA: Towards Generalist Video Anomaly Detection via Agentic AI Engineer
por: Yang, Zhiwei, et al.
Publicado: (2025)
por: Yang, Zhiwei, et al.
Publicado: (2025)
AutoGUI-v2: A Comprehensive Multi-Modal GUI Functionality Understanding Benchmark
por: Li, Hongxin, et al.
Publicado: (2026)
por: Li, Hongxin, et al.
Publicado: (2026)
\textsc{GUI-Spotlight}: Adaptive Iterative Focus Refinement for Enhanced GUI Visual Grounding
por: Lei, Bin, et al.
Publicado: (2025)
por: Lei, Bin, et al.
Publicado: (2025)
Bootstrapping SparseFormers from Vision Foundation Models
por: Gao, Ziteng, et al.
Publicado: (2023)
por: Gao, Ziteng, et al.
Publicado: (2023)
POINTS-GUI-G: GUI-Grounding Journey
por: Zhao, Zhongyin, et al.
Publicado: (2026)
por: Zhao, Zhongyin, et al.
Publicado: (2026)
TPDiff: Temporal Pyramid Video Diffusion Model
por: Ran, Lingmin, et al.
Publicado: (2025)
por: Ran, Lingmin, et al.
Publicado: (2025)
Sparkle: Realizing Lively Instruction-Guided Video Background Replacement via Decoupled Guidance
por: Zeng, Ziyun, et al.
Publicado: (2026)
por: Zeng, Ziyun, et al.
Publicado: (2026)
Impossible Videos
por: Bai, Zechen, et al.
Publicado: (2025)
por: Bai, Zechen, et al.
Publicado: (2025)
IDOL: Unified Dual-Modal Latent Diffusion for Human-Centric Joint Video-Depth Generation
por: Zhai, Yuanhao, et al.
Publicado: (2024)
por: Zhai, Yuanhao, et al.
Publicado: (2024)
ASSISTGUI: Task-Oriented Desktop Graphical User Interface Automation
por: Gao, Difei, et al.
Publicado: (2023)
por: Gao, Difei, et al.
Publicado: (2023)
CutVerse: A Compositional GUI Agents Benchmark for Media Post-Production Editing
por: Hu, Haobo, et al.
Publicado: (2026)
por: Hu, Haobo, et al.
Publicado: (2026)
GEB+: A Benchmark for Generic Event Boundary Captioning, Grounding and Retrieval
por: Wang, Yuxuan, et al.
Publicado: (2022)
por: Wang, Yuxuan, et al.
Publicado: (2022)
MovieBench: A Hierarchical Movie Level Dataset for Long Video Generation
por: Wu, Weijia, et al.
Publicado: (2024)
por: Wu, Weijia, et al.
Publicado: (2024)
X-Humanoid: Robotize Human Videos to Generate Humanoid Videos at Scale
por: Yang, Pei, et al.
Publicado: (2025)
por: Yang, Pei, et al.
Publicado: (2025)
Ejemplares similares
-
ShowUI: One Vision-Language-Action Model for GUI Visual Agent
por: Lin, Kevin Qinghong, et al.
Publicado: (2024) -
GUI Action Narrator: Where and When Did That Action Take Place?
por: Wu, Qinchen, et al.
Publicado: (2024) -
ShowUI-$π$: Flow-based Generative Models as GUI Dexterous Hands
por: Hu, Siyuan, et al.
Publicado: (2025) -
VLog: Video-Language Models by Generative Retrieval of Narration Vocabulary
por: Lin, Kevin Qinghong, et al.
Publicado: (2025) -
The Dawn of GUI Agent: A Preliminary Case Study with Claude 3.5 Computer Use
por: Hu, Siyuan, et al.
Publicado: (2024)