GUIOdyssey: A Comprehensive Dataset for Cross-App GUI Navigation on Mobile Devices
Fuente:
arXiv
Salvato in:
| Autori principali: | Lu, Quanfeng, Shao, Wenqi, Liu, Zitao, Du, Lingxiao, Meng, Fanqing, Li, Boxuan, Chen, Botong, Huang, Siyuan, Zhang, Kaipeng, Luo, Ping |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
ChartAssisstant: A Universal Chart Multimodal Language Model via Chart-to-Table Pre-training and Multitask Instruction Tuning
di: Meng, Fanqing, et al.
Pubblicazione: (2024)
di: Meng, Fanqing, et al.
Pubblicazione: (2024)
Towards World Simulator: Crafting Physical Commonsense-Based Benchmark for Video Generation
di: Meng, Fanqing, et al.
Pubblicazione: (2024)
di: Meng, Fanqing, et al.
Pubblicazione: (2024)
TinyLVLM-eHub: Towards Comprehensive and Efficient Evaluation for Large Vision-Language Models
di: Shao, Wenqi, et al.
Pubblicazione: (2023)
di: Shao, Wenqi, et al.
Pubblicazione: (2023)
MM-PRM: Enhancing Multimodal Mathematical Reasoning with Scalable Step-Level Supervision
di: Du, Lingxiao, et al.
Pubblicazione: (2025)
di: Du, Lingxiao, et al.
Pubblicazione: (2025)
PhyBench: A Physical Commonsense Benchmark for Evaluating Text-to-Image Models
di: Meng, Fanqing, et al.
Pubblicazione: (2024)
di: Meng, Fanqing, et al.
Pubblicazione: (2024)
MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning
di: Meng, Fanqing, et al.
Pubblicazione: (2025)
di: Meng, Fanqing, et al.
Pubblicazione: (2025)
MMIU: Multimodal Multi-image Understanding for Evaluating Large Vision-Language Models
di: Meng, Fanqing, et al.
Pubblicazione: (2024)
di: Meng, Fanqing, et al.
Pubblicazione: (2024)
CPGD: Toward Stable Rule-based Reinforcement Learning for Language Models
di: Liu, Zongkai, et al.
Pubblicazione: (2025)
di: Liu, Zongkai, et al.
Pubblicazione: (2025)
SWIRL: A Staged Workflow for Interleaved Reinforcement Learning in Mobile GUI Control
di: Lu, Quanfeng, et al.
Pubblicazione: (2025)
di: Lu, Quanfeng, et al.
Pubblicazione: (2025)
OmniMedVQA: A New Large-Scale Comprehensive Evaluation Benchmark for Medical LVLM
di: Hu, Yutao, et al.
Pubblicazione: (2024)
di: Hu, Yutao, et al.
Pubblicazione: (2024)
FuncDroid: Towards Inter-Functional Flows for Comprehensive Mobile App GUI Testing
di: He, Jinlong, et al.
Pubblicazione: (2026)
di: He, Jinlong, et al.
Pubblicazione: (2026)
AMEX: Android Multi-annotation Expo Dataset for Mobile GUI Agents
di: Chai, Yuxiang, et al.
Pubblicazione: (2024)
di: Chai, Yuxiang, et al.
Pubblicazione: (2024)
MMT-Bench: A Comprehensive Multimodal Benchmark for Evaluating Large Vision-Language Models Towards Multitask AGI
di: Ying, Kaining, et al.
Pubblicazione: (2024)
di: Ying, Kaining, et al.
Pubblicazione: (2024)
GUI-CEval: A Hierarchical and Comprehensive Chinese Benchmark for Mobile GUI Agents
di: Li, Yang, et al.
Pubblicazione: (2026)
di: Li, Yang, et al.
Pubblicazione: (2026)
Vision-Based Mobile App GUI Testing: A Survey
di: Yu, Shengcheng, et al.
Pubblicazione: (2023)
di: Yu, Shengcheng, et al.
Pubblicazione: (2023)
Scenario-Guided LLM-based Mobile App GUI Testing
di: Yu, Shengcheng, et al.
Pubblicazione: (2025)
di: Yu, Shengcheng, et al.
Pubblicazione: (2025)
OWMM-Agent: Open World Mobile Manipulation With Multi-modal Agentic Data Synthesis
di: Chen, Junting, et al.
Pubblicazione: (2025)
di: Chen, Junting, et al.
Pubblicazione: (2025)
Efficient High-Resolution Visual Representation Learning with State Space Model for Human Pose Estimation
di: Zhang, Hao, et al.
Pubblicazione: (2024)
di: Zhang, Hao, et al.
Pubblicazione: (2024)
ClawGUI: A Unified Framework for Training, Evaluating, and Deploying GUI Agents
di: Tang, Fei, et al.
Pubblicazione: (2026)
di: Tang, Fei, et al.
Pubblicazione: (2026)
MobileExplorer: Accelerating On-Device Inference for Mobile GUI Agents via Online Exploration
di: Huang, Runxi, et al.
Pubblicazione: (2026)
di: Huang, Runxi, et al.
Pubblicazione: (2026)
ViMo: A Generative Visual GUI World Model for App Agents
di: Luo, Dezhao, et al.
Pubblicazione: (2025)
di: Luo, Dezhao, et al.
Pubblicazione: (2025)
Rapid Mobile App Development for Generative AI Agents on MIT App Inventor
di: Gao, Jaida, et al.
Pubblicazione: (2024)
di: Gao, Jaida, et al.
Pubblicazione: (2024)
EfficientQAT: Efficient Quantization-Aware Training for Large Language Models
di: Chen, Mengzhao, et al.
Pubblicazione: (2024)
di: Chen, Mengzhao, et al.
Pubblicazione: (2024)
Dynamic Multimodal Evaluation with Flexible Complexity by Vision-Language Bootstrapping
di: Yang, Yue, et al.
Pubblicazione: (2024)
di: Yang, Yue, et al.
Pubblicazione: (2024)
MobileSteward: Integrating Multiple App-Oriented Agents with Self-Evolution to Automate Cross-App Instructions
di: Liu, Yuxuan, et al.
Pubblicazione: (2025)
di: Liu, Yuxuan, et al.
Pubblicazione: (2025)
TP-Eval: Tap Multimodal LLMs' Potential in Evaluation by Customizing Prompts
di: Xie, Yuxuan, et al.
Pubblicazione: (2024)
di: Xie, Yuxuan, et al.
Pubblicazione: (2024)
MobileViews: A Million-scale and Diverse Mobile GUI Dataset
di: Gao, Longxi, et al.
Pubblicazione: (2024)
di: Gao, Longxi, et al.
Pubblicazione: (2024)
AppGen: Mobility-aware App Usage Behavior Generation for Mobile Users
di: Huang, Zihan, et al.
Pubblicazione: (2024)
di: Huang, Zihan, et al.
Pubblicazione: (2024)
GUI-G$^2$: Gaussian Reward Modeling for GUI Grounding
di: Tang, Fei, et al.
Pubblicazione: (2025)
di: Tang, Fei, et al.
Pubblicazione: (2025)
Don't Confuse! Redrawing GUI Navigation Flow in Mobile Apps for Visually Impaired Users
di: Zhang, Mengxi, et al.
Pubblicazione: (2025)
di: Zhang, Mengxi, et al.
Pubblicazione: (2025)
Scaling, Benchmarking, and Reasoning of Vision-Language Agents for Mobile GUI Navigation
di: Qu, Heng, et al.
Pubblicazione: (2026)
di: Qu, Heng, et al.
Pubblicazione: (2026)
GUI-Robust: A Comprehensive Dataset for Testing GUI Agent Robustness in Real-World Anomalies
di: Yang, Jingqi, et al.
Pubblicazione: (2025)
di: Yang, Jingqi, et al.
Pubblicazione: (2025)
DiffAgent: Fast and Accurate Text-to-Image API Selection with Large Language Model
di: Zhao, Lirui, et al.
Pubblicazione: (2024)
di: Zhao, Lirui, et al.
Pubblicazione: (2024)
B-AVIBench: Towards Evaluating the Robustness of Large Vision-Language Model on Black-box Adversarial Visual-Instructions
di: Zhang, Hao, et al.
Pubblicazione: (2024)
di: Zhang, Hao, et al.
Pubblicazione: (2024)
SAMRefiner: Taming Segment Anything Model for Universal Mask Refinement
di: Lin, Yuqi, et al.
Pubblicazione: (2025)
di: Lin, Yuqi, et al.
Pubblicazione: (2025)
Diffree: Text-Guided Shape Free Object Inpainting with Diffusion Model
di: Zhao, Lirui, et al.
Pubblicazione: (2024)
di: Zhao, Lirui, et al.
Pubblicazione: (2024)
Open-Vocabulary Animal Keypoint Detection with Semantic-feature Matching
di: Zhang, Hao, et al.
Pubblicazione: (2023)
di: Zhang, Hao, et al.
Pubblicazione: (2023)
META-GUI: Towards Multi-modal Conversational Agents on Mobile GUI
di: Sun, Liangtai, et al.
Pubblicazione: (2022)
di: Sun, Liangtai, et al.
Pubblicazione: (2022)
MemGUI-Bench: Benchmarking Memory of Mobile GUI Agents in Dynamic Environments
di: Liu, Guangyi, et al.
Pubblicazione: (2026)
di: Liu, Guangyi, et al.
Pubblicazione: (2026)
Information Use and Barriers on a Mobile App in Distance Learning
di: Du, Yunfei
Pubblicazione: (2015)
di: Du, Yunfei
Pubblicazione: (2015)
Documenti analoghi
-
ChartAssisstant: A Universal Chart Multimodal Language Model via Chart-to-Table Pre-training and Multitask Instruction Tuning
di: Meng, Fanqing, et al.
Pubblicazione: (2024) -
Towards World Simulator: Crafting Physical Commonsense-Based Benchmark for Video Generation
di: Meng, Fanqing, et al.
Pubblicazione: (2024) -
TinyLVLM-eHub: Towards Comprehensive and Efficient Evaluation for Large Vision-Language Models
di: Shao, Wenqi, et al.
Pubblicazione: (2023) -
MM-PRM: Enhancing Multimodal Mathematical Reasoning with Scalable Step-Level Supervision
di: Du, Lingxiao, et al.
Pubblicazione: (2025) -
PhyBench: A Physical Commonsense Benchmark for Evaluating Text-to-Image Models
di: Meng, Fanqing, et al.
Pubblicazione: (2024)