Predicting and Explaining Mobile UI Tappability with Vision Modeling and Saliency Analysis
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Schoop, Eldon, Zhou, Xin, Li, Gang, Chen, Zhourong, Hartmann, Björn, Li, Yang |
|---|---|
| Format: | Preprint |
| Publié: |
2022
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Ferret-UI: Grounded Mobile UI Understanding with Multimodal LLMs
par: You, Keen, et autres
Publié: (2024)
par: You, Keen, et autres
Publié: (2024)
From Interaction to Impact: Towards Safer AI Agents Through Understanding and Evaluating Mobile UI Operation Impacts
par: Zhang, Zhuohao Jerry, et autres
Publié: (2024)
par: Zhang, Zhuohao Jerry, et autres
Publié: (2024)
RWKV-UI: UI Understanding with Enhanced Perception and Reasoning
par: Yang, Jiaxi, et autres
Publié: (2025)
par: Yang, Jiaxi, et autres
Publié: (2025)
Enhancing Saliency Prediction in Monitoring Tasks: The Role of Visual Highlights
par: Wu, Zekun, et autres
Publié: (2024)
par: Wu, Zekun, et autres
Publié: (2024)
UI-UG: A Unified MLLM for UI Understanding and Generation
par: Yang, Hao, et autres
Publié: (2025)
par: Yang, Hao, et autres
Publié: (2025)
ShowUI: One Vision-Language-Action Model for GUI Visual Agent
par: Lin, Kevin Qinghong, et autres
Publié: (2024)
par: Lin, Kevin Qinghong, et autres
Publié: (2024)
Morae: Proactively Pausing UI Agents for User Choices
par: Peng, Yi-Hao, et autres
Publié: (2025)
par: Peng, Yi-Hao, et autres
Publié: (2025)
Mapping the Design Space of User Experience for Computer Use Agents
par: Cheng, Ruijia, et autres
Publié: (2026)
par: Cheng, Ruijia, et autres
Publié: (2026)
Athena: Intermediate Representations for Iterative Scaffolded App Generation with an LLM
par: Beason, Jazbo, et autres
Publié: (2025)
par: Beason, Jazbo, et autres
Publié: (2025)
Visual Affect Analysis: Predicting Emotions of Image Viewers with Vision-Language Models
par: Nowicki, Filip, et autres
Publié: (2026)
par: Nowicki, Filip, et autres
Publié: (2026)
UI-TARS: Pioneering Automated GUI Interaction with Native Agents
par: Qin, Yujia, et autres
Publié: (2025)
par: Qin, Yujia, et autres
Publié: (2025)
Towards Consumer-Grade Cybersickness Prediction: Multi-Model Alignment for Real-Time Vision-Only Inference
par: Zhu, Yitong, et autres
Publié: (2025)
par: Zhu, Yitong, et autres
Publié: (2025)
Learning User Embeddings from Human Gaze for Personalised Saliency Prediction
par: Strohm, Florian, et autres
Publié: (2024)
par: Strohm, Florian, et autres
Publié: (2024)
Generating Automatic Feedback on UI Mockups with Large Language Models
par: Duan, Peitong, et autres
Publié: (2024)
par: Duan, Peitong, et autres
Publié: (2024)
VFA: Vision Frequency Analysis of Foundation Models and Human
par: Darvishi-Bayazi, Mohammad-Javad, et autres
Publié: (2024)
par: Darvishi-Bayazi, Mohammad-Javad, et autres
Publié: (2024)
Not all Blends are Equal: The BLEMORE Dataset of Blended Emotion Expressions with Relative Salience Annotations
par: Lachmann, Tim, et autres
Publié: (2026)
par: Lachmann, Tim, et autres
Publié: (2026)
egoEMOTION: Egocentric Vision and Physiological Signals for Emotion and Personality Recognition in Real-World Tasks
par: Jammot, Matthias, et autres
Publié: (2025)
par: Jammot, Matthias, et autres
Publié: (2025)
ShowUI-$π$: Flow-based Generative Models as GUI Dexterous Hands
par: Hu, Siyuan, et autres
Publié: (2025)
par: Hu, Siyuan, et autres
Publié: (2025)
FocusUI: Efficient UI Grounding via Position-Preserving Visual Token Selection
par: Ouyang, Mingyu, et autres
Publié: (2026)
par: Ouyang, Mingyu, et autres
Publié: (2026)
UISim: An Interactive Image-Based UI Simulator for Dynamic Mobile Environments
par: Xiang, Jiannan, et autres
Publié: (2025)
par: Xiang, Jiannan, et autres
Publié: (2025)
Development of a Mobile Application for at-Home Analysis of Retinal Fundus Images
par: Reid, Mattea, et autres
Publié: (2025)
par: Reid, Mattea, et autres
Publié: (2025)
Do MLLMs Understand Pointing? Benchmarking and Enhancing Referential Reasoning in Egocentric Vision
par: Li, Chentao, et autres
Publié: (2026)
par: Li, Chentao, et autres
Publié: (2026)
UI-TARS-2 Technical Report: Advancing GUI Agent with Multi-Turn Reinforcement Learning
par: Wang, Haoming, et autres
Publié: (2025)
par: Wang, Haoming, et autres
Publié: (2025)
MedFoundationHub: A Lightweight and Secure Toolkit for Deploying Medical Vision Language Foundation Models
par: Li, Xiao, et autres
Publié: (2025)
par: Li, Xiao, et autres
Publié: (2025)
UI-E2I-Synth: Advancing GUI Grounding with Large-Scale Instruction Synthesis
par: Liu, Xinyi, et autres
Publié: (2025)
par: Liu, Xinyi, et autres
Publié: (2025)
An Egocentric Vision-Language Model based Portable Real-time Smart Assistant
par: Huang, Yifei, et autres
Publié: (2025)
par: Huang, Yifei, et autres
Publié: (2025)
Vision Language Models as Values Detectors
par: Abbo, Giulio Antonio, et autres
Publié: (2025)
par: Abbo, Giulio Antonio, et autres
Publié: (2025)
Probabilistic Human Intent Prediction for Mobile Manipulation: An Evaluation with Human-Inspired Constraints
par: Contreras, Cesar Alan, et autres
Publié: (2025)
par: Contreras, Cesar Alan, et autres
Publié: (2025)
Adaptive 3D UI Placement in Mixed Reality Using Deep Reinforcement Learning
par: Lu, Feiyu, et autres
Publié: (2025)
par: Lu, Feiyu, et autres
Publié: (2025)
Explain and Monitor Deep Learning Models for Computer Vision using Obz AI
par: Chung, Neo Christopher, et autres
Publié: (2025)
par: Chung, Neo Christopher, et autres
Publié: (2025)
Motion Sickness Modeling with Visual Vertical Estimation and Its Application to Autonomous Personal Mobility Vehicles
par: Liu, Hailong, et autres
Publié: (2022)
par: Liu, Hailong, et autres
Publié: (2022)
Weak-Annotation of HAR Datasets using Vision Foundation Models
par: Bock, Marius, et autres
Publié: (2024)
par: Bock, Marius, et autres
Publié: (2024)
VisionCAD: An Integration-Free Radiology Copilot Framework
par: Li, Jiaming, et autres
Publié: (2025)
par: Li, Jiaming, et autres
Publié: (2025)
Toward Scalable Co-located Practical Learning: Assisting with Computer Vision and Multimodal Analytics
par: Li, Xinyu, et autres
Publié: (2026)
par: Li, Xinyu, et autres
Publié: (2026)
FlowEval: Reference-based Evaluation of Generated User Interfaces
par: Wu, Jason, et autres
Publié: (2026)
par: Wu, Jason, et autres
Publié: (2026)
AgentBuilder: Exploring Scaffolds for Prototyping User Experiences of Interface Agents
par: Liang, Jenny T., et autres
Publié: (2025)
par: Liang, Jenny T., et autres
Publié: (2025)
Towards Context-aware Support for Color Vision Deficiency: An Approach Integrating LLM and AR
par: Morita, Shogo, et autres
Publié: (2024)
par: Morita, Shogo, et autres
Publié: (2024)
MambaTalk: Efficient Holistic Gesture Synthesis with Selective State Space Models
par: Xu, Zunnan, et autres
Publié: (2024)
par: Xu, Zunnan, et autres
Publié: (2024)
MobilePoser: Real-Time Full-Body Pose Estimation and 3D Human Translation from IMUs in Mobile Consumer Devices
par: Xu, Vasco, et autres
Publié: (2025)
par: Xu, Vasco, et autres
Publié: (2025)
Design and Evaluation of Camera-Centric Mobile Crowdsourcing Applications
par: Stylianou, Abby, et autres
Publié: (2024)
par: Stylianou, Abby, et autres
Publié: (2024)
Documents similaires
-
Ferret-UI: Grounded Mobile UI Understanding with Multimodal LLMs
par: You, Keen, et autres
Publié: (2024) -
From Interaction to Impact: Towards Safer AI Agents Through Understanding and Evaluating Mobile UI Operation Impacts
par: Zhang, Zhuohao Jerry, et autres
Publié: (2024) -
RWKV-UI: UI Understanding with Enhanced Perception and Reasoning
par: Yang, Jiaxi, et autres
Publié: (2025) -
Enhancing Saliency Prediction in Monitoring Tasks: The Role of Visual Highlights
par: Wu, Zekun, et autres
Publié: (2024) -
UI-UG: A Unified MLLM for UI Understanding and Generation
par: Yang, Hao, et autres
Publié: (2025)