Explorer: Robust Collection of Interactable GUI Elements
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chaimalas, Iason, Vyšniauskas, Arnas, Brostow, Gabriel |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MP-GUI: Modality Perception with MLLMs for GUI Understanding
par: Wang, Ziwei, et autres
Publié: (2025)
par: Wang, Ziwei, et autres
Publié: (2025)
DiMo-GUI: Advancing Test-time Scaling in GUI Grounding via Modality-Aware Visual Reasoning
par: Wu, Hang, et autres
Publié: (2025)
par: Wu, Hang, et autres
Publié: (2025)
UI-TARS: Pioneering Automated GUI Interaction with Native Agents
par: Qin, Yujia, et autres
Publié: (2025)
par: Qin, Yujia, et autres
Publié: (2025)
SparkUI-Parser: Enhancing GUI Perception with Robust Grounding and Parsing
par: Jing, Hongyi, et autres
Publié: (2025)
par: Jing, Hongyi, et autres
Publié: (2025)
ControlGUI: Guiding Generative GUI Exploration through Perceptual Visual Flow
par: Garg, Aryan, et autres
Publié: (2025)
par: Garg, Aryan, et autres
Publié: (2025)
PixelWeb: The First Web GUI Dataset with Pixel-Wise Labels
par: Yang, Qi, et autres
Publié: (2025)
par: Yang, Qi, et autres
Publié: (2025)
ShowUI-$π$: Flow-based Generative Models as GUI Dexterous Hands
par: Hu, Siyuan, et autres
Publié: (2025)
par: Hu, Siyuan, et autres
Publié: (2025)
GUIDE: A Benchmark for Understanding and Assisting Users in Open-Ended GUI Tasks
par: Yang, Saelyne, et autres
Publié: (2026)
par: Yang, Saelyne, et autres
Publié: (2026)
How Smart Is Your GUI Agent? A Framework for the Future of Software Interaction
par: Feng, Sidong, et autres
Publié: (2026)
par: Feng, Sidong, et autres
Publié: (2026)
History-Aware Reasoning for GUI Agents
par: Wang, Ziwei, et autres
Publié: (2025)
par: Wang, Ziwei, et autres
Publié: (2025)
GroundUp: Rapid Sketch-Based 3D City Massing
par: Unlu, Gizem Esra, et autres
Publié: (2024)
par: Unlu, Gizem Esra, et autres
Publié: (2024)
A Survey on (M)LLM-Based GUI Agents
par: Tang, Fei, et autres
Publié: (2025)
par: Tang, Fei, et autres
Publié: (2025)
GUI Agents for Continual Game Generation
par: Huang, Yixu, et autres
Publié: (2026)
par: Huang, Yixu, et autres
Publié: (2026)
CutVerse: A Compositional GUI Agents Benchmark for Media Post-Production Editing
par: Hu, Haobo, et autres
Publié: (2026)
par: Hu, Haobo, et autres
Publié: (2026)
GUICourse: From General Vision Language Models to Versatile GUI Agents
par: Chen, Wentong, et autres
Publié: (2024)
par: Chen, Wentong, et autres
Publié: (2024)
ShowUI: One Vision-Language-Action Model for GUI Visual Agent
par: Lin, Kevin Qinghong, et autres
Publié: (2024)
par: Lin, Kevin Qinghong, et autres
Publié: (2024)
GUI-G$^2$: Gaussian Reward Modeling for GUI Grounding
par: Tang, Fei, et autres
Publié: (2025)
par: Tang, Fei, et autres
Publié: (2025)
Smoothing Grounding and Reasoning for MLLM-Powered GUI Agents with Query-Oriented Pivot Tasks
par: Wu, Zongru, et autres
Publié: (2025)
par: Wu, Zongru, et autres
Publié: (2025)
OS-Genesis: Automating GUI Agent Trajectory Construction via Reverse Task Synthesis
par: Sun, Qiushi, et autres
Publié: (2024)
par: Sun, Qiushi, et autres
Publié: (2024)
Code2World: A GUI World Model via Renderable Code Generation
par: Zheng, Yuhao, et autres
Publié: (2026)
par: Zheng, Yuhao, et autres
Publié: (2026)
UI-TARS-2 Technical Report: Advancing GUI Agent with Multi-Turn Reinforcement Learning
par: Wang, Haoming, et autres
Publié: (2025)
par: Wang, Haoming, et autres
Publié: (2025)
Building Autonomous GUI Navigation via Agentic-Q Estimation and Step-Wise Policy Optimization
par: Wang, Yibo, et autres
Publié: (2026)
par: Wang, Yibo, et autres
Publié: (2026)
Less is More: Empowering GUI Agent with Context-Aware Simplification
par: Chen, Gongwei, et autres
Publié: (2025)
par: Chen, Gongwei, et autres
Publié: (2025)
OS-Sentinel: Towards Safety-Enhanced Mobile GUI Agents via Hybrid Validation in Realistic Workflows
par: Sun, Qiushi, et autres
Publié: (2025)
par: Sun, Qiushi, et autres
Publié: (2025)
GUI-AIMA: Aligning Intrinsic Multimodal Attention with a Context Anchor for GUI Grounding
par: Zhou, Shijie, et autres
Publié: (2025)
par: Zhou, Shijie, et autres
Publié: (2025)
Yume: An Interactive World Generation Model
par: Mao, Xiaofeng, et autres
Publié: (2025)
par: Mao, Xiaofeng, et autres
Publié: (2025)
Graph4GUI: Graph Neural Networks for Representing Graphical User Interfaces
par: Jiang, Yue, et autres
Publié: (2024)
par: Jiang, Yue, et autres
Publié: (2024)
RITA: A Real-time Interactive Talking Avatars Framework
par: Cheng, Wuxinlin, et autres
Publié: (2024)
par: Cheng, Wuxinlin, et autres
Publié: (2024)
UIPro: Unleashing Superior Interaction Capability For GUI Agents
par: Li, Hongxin, et autres
Publié: (2025)
par: Li, Hongxin, et autres
Publié: (2025)
OmniResponse: Online Multimodal Conversational Response Generation in Dyadic Interactions
par: Luo, Cheng, et autres
Publié: (2025)
par: Luo, Cheng, et autres
Publié: (2025)
Pose-Robust Calibration Strategy for Point-of-Gaze Estimation on Mobile Phones
par: Zhao, Yujie, et autres
Publié: (2025)
par: Zhao, Yujie, et autres
Publié: (2025)
Posture-Informed Muscular Force Learning for Robust Hand Pressure Estimation
par: Seo, Kyungjin, et autres
Publié: (2024)
par: Seo, Kyungjin, et autres
Publié: (2024)
StreamAvatar: Streaming Diffusion Models for Real-Time Interactive Human Avatars
par: Sun, Zhiyao, et autres
Publié: (2025)
par: Sun, Zhiyao, et autres
Publié: (2025)
See-Control: A Multimodal Agent Framework for Smartphone Interaction with a Robotic Arm
par: Zhao, Haoyu, et autres
Publié: (2025)
par: Zhao, Haoyu, et autres
Publié: (2025)
Achieving Effective Virtual Reality Interactions via Acoustic Gesture Recognition based on Large Language Models
par: Zhang, Xijie, et autres
Publié: (2025)
par: Zhang, Xijie, et autres
Publié: (2025)
PersonalAlign: Hierarchical Implicit Intent Alignment for Personalized GUI Agent with Long-Term User-Centric Records
par: Lyu, Yibo, et autres
Publié: (2026)
par: Lyu, Yibo, et autres
Publié: (2026)
Multi-Masked Querying Network for Robust Emotion Recognition from Incomplete Multi-Modal Physiological Signals
par: Xu, Geng-Xin, et autres
Publié: (2025)
par: Xu, Geng-Xin, et autres
Publié: (2025)
T2I-Copilot: A Training-Free Multi-Agent Text-to-Image System for Enhanced Prompt Interpretation and Interactive Generation
par: Chen, Chieh-Yun, et autres
Publié: (2025)
par: Chen, Chieh-Yun, et autres
Publié: (2025)
Efficient Retail Video Annotation: A Robust Key Frame Generation Approach for Product and Customer Interaction Analysis
par: Mannam, Varun, et autres
Publié: (2025)
par: Mannam, Varun, et autres
Publié: (2025)
Multi-face emotion detection for effective Human-Robot Interaction
par: Yahyaoui, Mohamed Ala, et autres
Publié: (2025)
par: Yahyaoui, Mohamed Ala, et autres
Publié: (2025)
Documents similaires
-
MP-GUI: Modality Perception with MLLMs for GUI Understanding
par: Wang, Ziwei, et autres
Publié: (2025) -
DiMo-GUI: Advancing Test-time Scaling in GUI Grounding via Modality-Aware Visual Reasoning
par: Wu, Hang, et autres
Publié: (2025) -
UI-TARS: Pioneering Automated GUI Interaction with Native Agents
par: Qin, Yujia, et autres
Publié: (2025) -
SparkUI-Parser: Enhancing GUI Perception with Robust Grounding and Parsing
par: Jing, Hongyi, et autres
Publié: (2025) -
ControlGUI: Guiding Generative GUI Exploration through Perceptual Visual Flow
par: Garg, Aryan, et autres
Publié: (2025)