Mobile-Env: Building Qualified Evaluation Benchmarks for LLM-GUI Interaction
Fuente:
arXiv
Saved in:
| Main Authors: | Zhang, Danyang, Shen, Zhennan, Xie, Rui, Zhang, Situo, Xie, Tianbao, Zhao, Zihan, Chen, Siyuan, Chen, Lu, Xu, Hongshen, Cao, Ruisheng, Yu, Kai |
|---|---|
| Format: | Preprint |
| Published: |
2023
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
ProgRM: Build Better GUI Agents with Progress Rewards
by: Zhang, Danyang, et al.
Published: (2025)
by: Zhang, Danyang, et al.
Published: (2025)
CoE-SQL: In-Context Learning for Multi-Turn Text-to-SQL with Chain-of-Editions
by: Zhang, Hanchong, et al.
Published: (2024)
by: Zhang, Hanchong, et al.
Published: (2024)
Hierarchical Multimodal Pre-training for Visually Rich Webpage Understanding
by: Xu, Hongshen, et al.
Published: (2024)
by: Xu, Hongshen, et al.
Published: (2024)
Rejection Improves Reliability: Training LLMs to Refuse Unknown Questions Using RL from Knowledge Feedback
by: Xu, Hongshen, et al.
Published: (2024)
by: Xu, Hongshen, et al.
Published: (2024)
A BiRGAT Model for Multi-intent Spoken Language Understanding with Hierarchical Semantic Frames
by: Xu, Hongshen, et al.
Published: (2024)
by: Xu, Hongshen, et al.
Published: (2024)
CharTool: Tool-Integrated Visual Reasoning for Chart Understanding
by: Zhang, Situo, et al.
Published: (2026)
by: Zhang, Situo, et al.
Published: (2026)
SciEval: A Multi-Level Large Language Model Evaluation Benchmark for Scientific Research
by: Sun, Liangtai, et al.
Published: (2023)
by: Sun, Liangtai, et al.
Published: (2023)
Reducing Tool Hallucination via Reliability Alignment
by: Xu, Hongshen, et al.
Published: (2024)
by: Xu, Hongshen, et al.
Published: (2024)
Compressing KV Cache for Long-Context LLM Inference with Inter-Layer Attention Similarity
by: Ma, Da, et al.
Published: (2024)
by: Ma, Da, et al.
Published: (2024)
MobA: Multifaceted Memory-Enhanced Adaptive Planning for Efficient Mobile Task Automation
by: Zhu, Zichen, et al.
Published: (2024)
by: Zhu, Zichen, et al.
Published: (2024)
PACER: Blockwise Pre-verification for Speculative Decoding with Adaptive Length
by: Zhang, Situo, et al.
Published: (2026)
by: Zhang, Situo, et al.
Published: (2026)
META-GUI: Towards Multi-modal Conversational Agents on Mobile GUI
by: Sun, Liangtai, et al.
Published: (2022)
by: Sun, Liangtai, et al.
Published: (2022)
Aguvis: Unified Pure Vision Agents for Autonomous GUI Interaction
by: Xu, Yiheng, et al.
Published: (2024)
by: Xu, Yiheng, et al.
Published: (2024)
EnvSimBench: A Benchmark for Evaluating and Improving LLM-Based Environment Simulation
by: Liu, Yi, et al.
Published: (2026)
by: Liu, Yi, et al.
Published: (2026)
EnvGS: Modeling View-Dependent Appearance with Environment Gaussian
by: Xie, Tao, et al.
Published: (2024)
by: Xie, Tao, et al.
Published: (2024)
MMBench-GUI: Hierarchical Multi-Platform Evaluation Framework for GUI Agents
by: Wang, Xuehui, et al.
Published: (2025)
by: Wang, Xuehui, et al.
Published: (2025)
AgentCPM-GUI: Building Mobile-Use Agents with Reinforcement Fine-Tuning
by: Zhang, Zhong, et al.
Published: (2025)
by: Zhang, Zhong, et al.
Published: (2025)
ChemDFM-R: A Chemical Reasoning LLM Enhanced with Atomized Chemical Knowledge
by: Zhao, Zihan, et al.
Published: (2025)
by: Zhao, Zihan, et al.
Published: (2025)
MemGUI-Bench: Benchmarking Memory of Mobile GUI Agents in Dynamic Environments
by: Liu, Guangyi, et al.
Published: (2026)
by: Liu, Guangyi, et al.
Published: (2026)
MobileFlow: A Multimodal LLM For Mobile GUI Agent
by: Nong, Songqin, et al.
Published: (2024)
by: Nong, Songqin, et al.
Published: (2024)
From Model Choice to Model Belief: Establishing a New Measure for LLM-Based Research
by: Sun, Hongshen, et al.
Published: (2025)
by: Sun, Hongshen, et al.
Published: (2025)
Reasoning-Driven Retrosynthesis Prediction with Large Language Models via Reinforcement Learning
by: Zhang, Situo, et al.
Published: (2025)
by: Zhang, Situo, et al.
Published: (2025)
GUI-CEval: A Hierarchical and Comprehensive Chinese Benchmark for Mobile GUI Agents
by: Li, Yang, et al.
Published: (2026)
by: Li, Yang, et al.
Published: (2026)
A Multi-LLM-Agent-Based Framework for Economic and Public Policy Analysis
by: Hao, Yuzhi, et al.
Published: (2025)
by: Hao, Yuzhi, et al.
Published: (2025)
GUI-explorer: Autonomous Exploration and Mining of Transition-aware Knowledge for GUI Agent
by: Xie, Bin, et al.
Published: (2025)
by: Xie, Bin, et al.
Published: (2025)
OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments
by: Xie, Tianbao, et al.
Published: (2024)
by: Xie, Tianbao, et al.
Published: (2024)
GUIOdyssey: A Comprehensive Dataset for Cross-App GUI Navigation on Mobile Devices
by: Lu, Quanfeng, et al.
Published: (2024)
by: Lu, Quanfeng, et al.
Published: (2024)
ResearchEnvBench: Benchmarking Agents on Environment Synthesis for Research Code Execution
by: Wang, Yubang, et al.
Published: (2026)
by: Wang, Yubang, et al.
Published: (2026)
Spider2-V: How Far Are Multimodal Agents From Automating Data Science and Engineering Workflows?
by: Cao, Ruisheng, et al.
Published: (2024)
by: Cao, Ruisheng, et al.
Published: (2024)
Scenario-Guided LLM-based Mobile App GUI Testing
by: Yu, Shengcheng, et al.
Published: (2025)
by: Yu, Shengcheng, et al.
Published: (2025)
ClawGUI: A Unified Framework for Training, Evaluating, and Deploying GUI Agents
by: Tang, Fei, et al.
Published: (2026)
by: Tang, Fei, et al.
Published: (2026)
DiSRouter: Distributed Self-Routing for LLM Selections
by: Zheng, Hang, et al.
Published: (2025)
by: Zheng, Hang, et al.
Published: (2025)
Alignment for Efficient Tool Calling of Large Language Models
by: Xu, Hongshen, et al.
Published: (2025)
by: Xu, Hongshen, et al.
Published: (2025)
ScaleEnv: Scaling Environment Synthesis from Scratch for Generalist Interactive Tool-Use Agent Training
by: Tu, Dunwei, et al.
Published: (2026)
by: Tu, Dunwei, et al.
Published: (2026)
GUI Test Migration via Abstraction and Concretization
by: Zhang, Yakun, et al.
Published: (2024)
by: Zhang, Yakun, et al.
Published: (2024)
ClarifySTL: An Interactive LLM Agent Framework for STL Transformation through Requirements Clarification
by: Fang, Yue, et al.
Published: (2026)
by: Fang, Yue, et al.
Published: (2026)
Enhancing LLM Reliability via Explicit Knowledge Boundary Modeling
by: Zheng, Hang, et al.
Published: (2025)
by: Zheng, Hang, et al.
Published: (2025)
Multilingual Brain Surgeon: Large Language Models Can be Compressed Leaving No Language Behind
by: Zeng, Hongchuan, et al.
Published: (2024)
by: Zeng, Hongchuan, et al.
Published: (2024)
PandaLM: An Automatic Evaluation Benchmark for LLM Instruction Tuning Optimization
by: Wang, Yidong, et al.
Published: (2023)
by: Wang, Yidong, et al.
Published: (2023)
ShuttleEnv: An Interactive Data-Driven RL Environment for Badminton Strategy Modeling
by: Li, Ang, et al.
Published: (2026)
by: Li, Ang, et al.
Published: (2026)
Similar Items
-
ProgRM: Build Better GUI Agents with Progress Rewards
by: Zhang, Danyang, et al.
Published: (2025) -
CoE-SQL: In-Context Learning for Multi-Turn Text-to-SQL with Chain-of-Editions
by: Zhang, Hanchong, et al.
Published: (2024) -
Hierarchical Multimodal Pre-training for Visually Rich Webpage Understanding
by: Xu, Hongshen, et al.
Published: (2024) -
Rejection Improves Reliability: Training LLMs to Refuse Unknown Questions Using RL from Knowledge Feedback
by: Xu, Hongshen, et al.
Published: (2024) -
A BiRGAT Model for Multi-intent Spoken Language Understanding with Hierarchical Semantic Frames
by: Xu, Hongshen, et al.
Published: (2024)