Turing Test on Screen: A Benchmark for Mobile GUI Agent Humanization
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhu, Jiachen, Yang, Lingyu, Shan, Rong, Zheng, Congmin, Zheng, Zeyu, Liu, Weiwen, Yu, Yong, Zhang, Weinan, Lin, Jianghao |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Evolutionary Perspectives on the Evaluation of LLM-Based AI Agents: A Comprehensive Survey
di: Zhu, Jiachen, et al.
Pubblicazione: (2025)
di: Zhu, Jiachen, et al.
Pubblicazione: (2025)
CoLD: Counterfactually-Guided Length Debiasing for Process Reward Models in Mathematical Reasoning
di: Zheng, Congmin, et al.
Pubblicazione: (2025)
di: Zheng, Congmin, et al.
Pubblicazione: (2025)
Adaptive Milestone Reward for GUI Agents
di: Zheng, Congmin, et al.
Pubblicazione: (2026)
di: Zheng, Congmin, et al.
Pubblicazione: (2026)
A Survey of Process Reward Models: From Outcome Signals to Process Supervisions for Large Language Models
di: Zheng, Congmin, et al.
Pubblicazione: (2025)
di: Zheng, Congmin, et al.
Pubblicazione: (2025)
Position: Academic Conferences are Potentially Facing Denominator Gaming Caused by Fully Automated Scientific Agents
di: Shan, Rong, et al.
Pubblicazione: (2026)
di: Shan, Rong, et al.
Pubblicazione: (2026)
Contexting as Recommendation: Evolutionary Collaborative Filtering for Context Engineering
di: Zhu, Jiachen, et al.
Pubblicazione: (2026)
di: Zhu, Jiachen, et al.
Pubblicazione: (2026)
Superplatforms Have to Attack AI Agents
di: Lin, Jianghao, et al.
Pubblicazione: (2025)
di: Lin, Jianghao, et al.
Pubblicazione: (2025)
Retrieval-Augmented Process Reward Model for Generalizable Mathematical Reasoning
di: Zhu, Jiachen, et al.
Pubblicazione: (2025)
di: Zhu, Jiachen, et al.
Pubblicazione: (2025)
A Survey of LLM-based Deep Search Agents: Paradigm, Optimization, Evaluation, and Challenges
di: Xi, Yunjia, et al.
Pubblicazione: (2025)
di: Xi, Yunjia, et al.
Pubblicazione: (2025)
Stop DDoS Attacking the Research Community with AI-Generated Survey Papers
di: Lin, Jianghao, et al.
Pubblicazione: (2025)
di: Lin, Jianghao, et al.
Pubblicazione: (2025)
Full-Stack Optimized Large Language Models for Lifelong Sequential Behavior Comprehension in Recommendation
di: Shan, Rong, et al.
Pubblicazione: (2025)
di: Shan, Rong, et al.
Pubblicazione: (2025)
Skills on the Fly: Test-Time Adaptive Skill Synthesis for LLM Agents
di: Wang, Jingxing, et al.
Pubblicazione: (2026)
di: Wang, Jingxing, et al.
Pubblicazione: (2026)
Lifelong Personalized Low-Rank Adaptation of Large Language Models for Recommendation
di: Zhu, Jiachen, et al.
Pubblicazione: (2024)
di: Zhu, Jiachen, et al.
Pubblicazione: (2024)
DynaTree: Dynamic Agentic Retrieval Tree for Time-Sensitive News Retrieval
di: Qi, Siyuan, et al.
Pubblicazione: (2026)
di: Qi, Siyuan, et al.
Pubblicazione: (2026)
Mobile-Agent-v3: Fundamental Agents for GUI Automation
di: Ye, Jiabo, et al.
Pubblicazione: (2025)
di: Ye, Jiabo, et al.
Pubblicazione: (2025)
A Survey on Diffusion Models for Recommender Systems
di: Lin, Jianghao, et al.
Pubblicazione: (2024)
di: Lin, Jianghao, et al.
Pubblicazione: (2024)
Faithful Mobile GUI Agents with Guided Advantage Estimator
di: Hu, Haowen, et al.
Pubblicazione: (2026)
di: Hu, Haowen, et al.
Pubblicazione: (2026)
macOSWorld: A Multilingual Interactive Benchmark for GUI Agents
di: Yang, Pei, et al.
Pubblicazione: (2025)
di: Yang, Pei, et al.
Pubblicazione: (2025)
MMSkills: Towards Multimodal Skills for General Visual Agents
di: Zhang, Kangning, et al.
Pubblicazione: (2026)
di: Zhang, Kangning, et al.
Pubblicazione: (2026)
MuonRec: Shifting the Optimizer Paradigm Beyond Adam in Scalable Generative Recommendation
di: Shan, Rong, et al.
Pubblicazione: (2026)
di: Shan, Rong, et al.
Pubblicazione: (2026)
ColorBench: Benchmarking Mobile Agents with Graph-Structured Framework for Complex Long-Horizon Tasks
di: Song, Yuanyi, et al.
Pubblicazione: (2025)
di: Song, Yuanyi, et al.
Pubblicazione: (2025)
AmbiBench: Benchmarking Mobile GUI Agents Beyond One-Shot Instructions in the Wild
di: Sun, Jiazheng, et al.
Pubblicazione: (2026)
di: Sun, Jiazheng, et al.
Pubblicazione: (2026)
GUI Testing Arena: A Unified Benchmark for Advancing Autonomous GUI Testing Agent
di: Zhao, Kangjia, et al.
Pubblicazione: (2024)
di: Zhao, Kangjia, et al.
Pubblicazione: (2024)
META-GUI: Towards Multi-modal Conversational Agents on Mobile GUI
di: Sun, Liangtai, et al.
Pubblicazione: (2022)
di: Sun, Liangtai, et al.
Pubblicazione: (2022)
Scaling, Benchmarking, and Reasoning of Vision-Language Agents for Mobile GUI Navigation
di: Qu, Heng, et al.
Pubblicazione: (2026)
di: Qu, Heng, et al.
Pubblicazione: (2026)
MAS-Bench: A Unified Benchmark for Shortcut-Augmented Hybrid Mobile GUI Agents
di: Zhao, Pengxiang, et al.
Pubblicazione: (2025)
di: Zhao, Pengxiang, et al.
Pubblicazione: (2025)
ReLLa: Retrieval-enhanced Large Language Models for Lifelong Sequential Behavior Comprehension in Recommendation
di: Lin, Jianghao, et al.
Pubblicazione: (2023)
di: Lin, Jianghao, et al.
Pubblicazione: (2023)
Plan-MCTS: Plan Exploration for Action Exploitation in Web Navigation
di: Zhang, Weiming, et al.
Pubblicazione: (2026)
di: Zhang, Weiming, et al.
Pubblicazione: (2026)
An Automatic Graph Construction Framework based on Large Language Models for Recommendation
di: Shan, Rong, et al.
Pubblicazione: (2024)
di: Shan, Rong, et al.
Pubblicazione: (2024)
OmniGUI: Benchmarking GUI Agents in Omni-Modal Smartphone Environments
di: Henry, Felix, et al.
Pubblicazione: (2026)
di: Henry, Felix, et al.
Pubblicazione: (2026)
A Survey of AI Agent Protocols
di: Yang, Yingxuan, et al.
Pubblicazione: (2025)
di: Yang, Yingxuan, et al.
Pubblicazione: (2025)
GUI Agents with Foundation Models: A Comprehensive Survey
di: Wang, Shuai, et al.
Pubblicazione: (2024)
di: Wang, Shuai, et al.
Pubblicazione: (2024)
MobileBench-OL: A Comprehensive Chinese Benchmark for Evaluating Mobile GUI Agents in Real-World Environment
di: Wu, Qinzhuo, et al.
Pubblicazione: (2026)
di: Wu, Qinzhuo, et al.
Pubblicazione: (2026)
Mobile-Agent-v3.5: Multi-platform Fundamental GUI Agents
di: Xu, Haiyang, et al.
Pubblicazione: (2026)
di: Xu, Haiyang, et al.
Pubblicazione: (2026)
MobiBench: Multi-Branch, Modular Benchmark for Mobile GUI Agents
di: Im, Youngmin, et al.
Pubblicazione: (2025)
di: Im, Youngmin, et al.
Pubblicazione: (2025)
Holder Policy Optimisation
di: Chen, Yuxiang, et al.
Pubblicazione: (2026)
di: Chen, Yuxiang, et al.
Pubblicazione: (2026)
MobileDreamer: Generative Sketch World Model for GUI Agent
di: Cao, Yilin, et al.
Pubblicazione: (2026)
di: Cao, Yilin, et al.
Pubblicazione: (2026)
Audio Turing Test: Benchmarking the Human-likeness of Large Language Model-based Text-to-Speech Systems in Chinese
di: Wang, Xihuai, et al.
Pubblicazione: (2025)
di: Wang, Xihuai, et al.
Pubblicazione: (2025)
ProBench: Benchmarking GUI Agents with Accurate Process Information
di: Yang, Leyang, et al.
Pubblicazione: (2025)
di: Yang, Leyang, et al.
Pubblicazione: (2025)
DRS-GUI: Dynamic Region Search for Training-Free GUI Grounding
di: Liu, Yichao, et al.
Pubblicazione: (2026)
di: Liu, Yichao, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Evolutionary Perspectives on the Evaluation of LLM-Based AI Agents: A Comprehensive Survey
di: Zhu, Jiachen, et al.
Pubblicazione: (2025) -
CoLD: Counterfactually-Guided Length Debiasing for Process Reward Models in Mathematical Reasoning
di: Zheng, Congmin, et al.
Pubblicazione: (2025) -
Adaptive Milestone Reward for GUI Agents
di: Zheng, Congmin, et al.
Pubblicazione: (2026) -
A Survey of Process Reward Models: From Outcome Signals to Process Supervisions for Large Language Models
di: Zheng, Congmin, et al.
Pubblicazione: (2025) -
Position: Academic Conferences are Potentially Facing Denominator Gaming Caused by Fully Automated Scientific Agents
di: Shan, Rong, et al.
Pubblicazione: (2026)