ControlGUI: Guiding Generative GUI Exploration through Perceptual Visual Flow
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Garg, Aryan, Jiang, Yue, Oulasvirta, Antti |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Graph4GUI: Graph Neural Networks for Representing Graphical User Interfaces
par: Jiang, Yue, et autres
Publié: (2024)
par: Jiang, Yue, et autres
Publié: (2024)
CutVerse: A Compositional GUI Agents Benchmark for Media Post-Production Editing
par: Hu, Haobo, et autres
Publié: (2026)
par: Hu, Haobo, et autres
Publié: (2026)
MP-GUI: Modality Perception with MLLMs for GUI Understanding
par: Wang, Ziwei, et autres
Publié: (2025)
par: Wang, Ziwei, et autres
Publié: (2025)
DiMo-GUI: Advancing Test-time Scaling in GUI Grounding via Modality-Aware Visual Reasoning
par: Wu, Hang, et autres
Publié: (2025)
par: Wu, Hang, et autres
Publié: (2025)
SurroFlow: A Flow-Based Surrogate Model for Parameter Space Exploration and Uncertainty Quantification
par: Shen, Jingyi, et autres
Publié: (2024)
par: Shen, Jingyi, et autres
Publié: (2024)
ShowUI-$π$: Flow-based Generative Models as GUI Dexterous Hands
par: Hu, Siyuan, et autres
Publié: (2025)
par: Hu, Siyuan, et autres
Publié: (2025)
ScriptViz: A Visualization Tool to Aid Scriptwriting based on a Large Movie Database
par: Rao, Anyi, et autres
Publié: (2024)
par: Rao, Anyi, et autres
Publié: (2024)
Generative AI Framework for 3D Object Generation in Augmented Reality
par: Behravan, Majid
Publié: (2025)
par: Behravan, Majid
Publié: (2025)
Training program on sign language: social inclusion through Virtual Reality in ISENSE project
par: Bisio, Alessia, et autres
Publié: (2024)
par: Bisio, Alessia, et autres
Publié: (2024)
EyeFormer: Predicting Personalized Scanpaths with Transformer-Guided Reinforcement Learning
par: Jiang, Yue, et autres
Publié: (2024)
par: Jiang, Yue, et autres
Publié: (2024)
TextureMeDefect: LLM-based Defect Texture Generation for Railway Components on Mobile Devices
par: Ferdousi, Rahatara, et autres
Publié: (2024)
par: Ferdousi, Rahatara, et autres
Publié: (2024)
ObjectGS: Object-aware Scene Reconstruction and Scene Understanding via Gaussian Splatting
par: Zhu, Ruijie, et autres
Publié: (2025)
par: Zhu, Ruijie, et autres
Publié: (2025)
Sketch2Colab: Sketch-Conditioned Multi-Human Animation via Controllable Flow Distillation
par: Daiya, Divyanshu, et autres
Publié: (2026)
par: Daiya, Divyanshu, et autres
Publié: (2026)
Explorer: Robust Collection of Interactable GUI Elements
par: Chaimalas, Iason, et autres
Publié: (2025)
par: Chaimalas, Iason, et autres
Publié: (2025)
History-Aware Reasoning for GUI Agents
par: Wang, Ziwei, et autres
Publié: (2025)
par: Wang, Ziwei, et autres
Publié: (2025)
GUI Agents for Continual Game Generation
par: Huang, Yixu, et autres
Publié: (2026)
par: Huang, Yixu, et autres
Publié: (2026)
Pattern Analogies: Learning to Perform Programmatic Image Edits by Analogy
par: Ganeshan, Aditya, et autres
Publié: (2024)
par: Ganeshan, Aditya, et autres
Publié: (2024)
EditRoom: LLM-parameterized Graph Diffusion for Composable 3D Room Layout Editing
par: Zheng, Kaizhi, et autres
Publié: (2024)
par: Zheng, Kaizhi, et autres
Publié: (2024)
From Far and Near: Perceptual Evaluation of Crowd Representations Across Levels of Detail
par: Sun, Xiaohan, et autres
Publié: (2025)
par: Sun, Xiaohan, et autres
Publié: (2025)
Coral Model Generation from Single Images for Virtual Reality Applications
par: Fu, Jie, et autres
Publié: (2024)
par: Fu, Jie, et autres
Publié: (2024)
GUICourse: From General Vision Language Models to Versatile GUI Agents
par: Chen, Wentong, et autres
Publié: (2024)
par: Chen, Wentong, et autres
Publié: (2024)
Advancing Talking Head Generation: A Comprehensive Survey of Multi-Modal Methodologies, Datasets, Evaluation Metrics, and Loss Functions
par: Rakesh, Vineet Kumar, et autres
Publié: (2025)
par: Rakesh, Vineet Kumar, et autres
Publié: (2025)
ShowUI: One Vision-Language-Action Model for GUI Visual Agent
par: Lin, Kevin Qinghong, et autres
Publié: (2024)
par: Lin, Kevin Qinghong, et autres
Publié: (2024)
GUI-G$^2$: Gaussian Reward Modeling for GUI Grounding
par: Tang, Fei, et autres
Publié: (2025)
par: Tang, Fei, et autres
Publié: (2025)
PixelWeb: The First Web GUI Dataset with Pixel-Wise Labels
par: Yang, Qi, et autres
Publié: (2025)
par: Yang, Qi, et autres
Publié: (2025)
MRUCT: Mixed Reality Assistance for Acupuncture Guided by Ultrasonic Computed Tomography
par: Wang, Xinkai, et autres
Publié: (2025)
par: Wang, Xinkai, et autres
Publié: (2025)
GUIDE: A Benchmark for Understanding and Assisting Users in Open-Ended GUI Tasks
par: Yang, Saelyne, et autres
Publié: (2026)
par: Yang, Saelyne, et autres
Publié: (2026)
CleAR: Robust Context-Guided Generative Lighting Estimation for Mobile Augmented Reality
par: Zhao, Yiqin, et autres
Publié: (2024)
par: Zhao, Yiqin, et autres
Publié: (2024)
Photoreal Scene Reconstruction from an Egocentric Device
par: Lv, Zhaoyang, et autres
Publié: (2025)
par: Lv, Zhaoyang, et autres
Publié: (2025)
A Survey on (M)LLM-Based GUI Agents
par: Tang, Fei, et autres
Publié: (2025)
par: Tang, Fei, et autres
Publié: (2025)
UI-TARS: Pioneering Automated GUI Interaction with Native Agents
par: Qin, Yujia, et autres
Publié: (2025)
par: Qin, Yujia, et autres
Publié: (2025)
Impact of Target and Tool Visualization on Depth Perception and Usability in Optical See-Through AR
par: Yang, Yue, et autres
Publié: (2025)
par: Yang, Yue, et autres
Publié: (2025)
DebiasPI: Inference-time Debiasing by Prompt Iteration of a Text-to-Image Generative Model
par: Bonna, Sarah, et autres
Publié: (2025)
par: Bonna, Sarah, et autres
Publié: (2025)
BlenderRAG: High-Fidelity 3D Object Generation via Retrieval-Augmented Code Synthesis
par: Rondelli, Massimo, et autres
Publié: (2026)
par: Rondelli, Massimo, et autres
Publié: (2026)
GUI-AIMA: Aligning Intrinsic Multimodal Attention with a Context Anchor for GUI Grounding
par: Zhou, Shijie, et autres
Publié: (2025)
par: Zhou, Shijie, et autres
Publié: (2025)
Code2World: A GUI World Model via Renderable Code Generation
par: Zheng, Yuhao, et autres
Publié: (2026)
par: Zheng, Yuhao, et autres
Publié: (2026)
MAPWise: Evaluating Vision-Language Models for Advanced Map Queries
par: Mukhopadhyay, Srija, et autres
Publié: (2024)
par: Mukhopadhyay, Srija, et autres
Publié: (2024)
Determining the Difficulties of Students With Dyslexia via Virtual Reality and Artificial Intelligence: An Exploratory Analysis
par: Yeguas-Bolívar, Enrique, et autres
Publié: (2024)
par: Yeguas-Bolívar, Enrique, et autres
Publié: (2024)
ParSEL: Parameterized Shape Editing with Language
par: Ganeshan, Aditya, et autres
Publié: (2024)
par: Ganeshan, Aditya, et autres
Publié: (2024)
SparkUI-Parser: Enhancing GUI Perception with Robust Grounding and Parsing
par: Jing, Hongyi, et autres
Publié: (2025)
par: Jing, Hongyi, et autres
Publié: (2025)
Documents similaires
-
Graph4GUI: Graph Neural Networks for Representing Graphical User Interfaces
par: Jiang, Yue, et autres
Publié: (2024) -
CutVerse: A Compositional GUI Agents Benchmark for Media Post-Production Editing
par: Hu, Haobo, et autres
Publié: (2026) -
MP-GUI: Modality Perception with MLLMs for GUI Understanding
par: Wang, Ziwei, et autres
Publié: (2025) -
DiMo-GUI: Advancing Test-time Scaling in GUI Grounding via Modality-Aware Visual Reasoning
par: Wu, Hang, et autres
Publié: (2025) -
SurroFlow: A Flow-Based Surrogate Model for Parameter Space Exploration and Uncertainty Quantification
par: Shen, Jingyi, et autres
Publié: (2024)