KnowU-Bench: Towards Interactive, Proactive, and Personalized Mobile Agent Evaluation
Fuente:
arXiv
Guardado en:
| Autores principales: | Chen, Tongbo, Lu, Zhengxi, Xu, Zhan, Shao, Guocheng, Zhao, Shaohan, Tang, Fei, Du, Yong, Song, Kaitao, Liu, Yizhou, Yan, Yuchen, Zhang, Wenqi, Tan, Xu, Lu, Weiming, Xiao, Jun, Zhuang, Yueting, Shen, Yongliang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
TaskBench: Benchmarking Large Language Models for Task Automation
por: Shen, Yongliang, et al.
Publicado: (2023)
por: Shen, Yongliang, et al.
Publicado: (2023)
UI-Copilot: Advancing Long-Horizon GUI Automation via Tool-Integrated Policy Optimization
por: Lu, Zhengxi, et al.
Publicado: (2026)
por: Lu, Zhengxi, et al.
Publicado: (2026)
UI-Zoomer: Uncertainty-Driven Adaptive Zoom-In for GUI Grounding
por: Tang, Fei, et al.
Publicado: (2026)
por: Tang, Fei, et al.
Publicado: (2026)
Let LRMs Break Free from Overthinking via Self-Braking Tuning
por: Zhao, Haoran, et al.
Publicado: (2025)
por: Zhao, Haoran, et al.
Publicado: (2025)
Code-A1: Adversarial Evolving of Code LLM and Test LLM via Reinforcement Learning
por: Wang, Aozhe, et al.
Publicado: (2026)
por: Wang, Aozhe, et al.
Publicado: (2026)
GaVaMoE: Gaussian-Variational Gated Mixture of Experts for Explainable Recommendation
por: Tang, Fei, et al.
Publicado: (2024)
por: Tang, Fei, et al.
Publicado: (2024)
Mind the Gap: Bridging Thought Leap for Improved Chain-of-Thought Tuning
por: Xu, Haolei, et al.
Publicado: (2025)
por: Xu, Haolei, et al.
Publicado: (2025)
Data-Copilot: Bridging Billions of Data and Humans with Autonomous Workflow
por: Zhang, Wenqi, et al.
Publicado: (2023)
por: Zhang, Wenqi, et al.
Publicado: (2023)
EasySteer: A Unified Framework for High-Performance and Extensible LLM Steering
por: Xu, Haolei, et al.
Publicado: (2025)
por: Xu, Haolei, et al.
Publicado: (2025)
UI-S1: Advancing GUI Automation via Semi-online Reinforcement Learning
por: Lu, Zhengxi, et al.
Publicado: (2025)
por: Lu, Zhengxi, et al.
Publicado: (2025)
Think Twice, Click Once: Enhancing GUI Grounding via Fast and Slow Systems
por: Tang, Fei, et al.
Publicado: (2025)
por: Tang, Fei, et al.
Publicado: (2025)
A Survey on (M)LLM-Based GUI Agents
por: Tang, Fei, et al.
Publicado: (2025)
por: Tang, Fei, et al.
Publicado: (2025)
GUI-G$^2$: Gaussian Reward Modeling for GUI Grounding
por: Tang, Fei, et al.
Publicado: (2025)
por: Tang, Fei, et al.
Publicado: (2025)
Self-Contrast: Better Reflection Through Inconsistent Solving Perspectives
por: Zhang, Wenqi, et al.
Publicado: (2024)
por: Zhang, Wenqi, et al.
Publicado: (2024)
Test-Time Reinforcement Learning for GUI Grounding via Region Consistency
por: Du, Yong, et al.
Publicado: (2025)
por: Du, Yong, et al.
Publicado: (2025)
ClawGUI: A Unified Framework for Training, Evaluating, and Deploying GUI Agents
por: Tang, Fei, et al.
Publicado: (2026)
por: Tang, Fei, et al.
Publicado: (2026)
ViewSpatial-Bench: Evaluating Multi-perspective Spatial Localization in Vision-Language Models
por: Li, Dingming, et al.
Publicado: (2025)
por: Li, Dingming, et al.
Publicado: (2025)
SKILL0: In-Context Agentic Reinforcement Learning for Skill Internalization
por: Lu, Zhengxi, et al.
Publicado: (2026)
por: Lu, Zhengxi, et al.
Publicado: (2026)
Structural-Temporal Coupling Anomaly Detection with Dynamic Graph Transformer
por: Zong, Chang, et al.
Publicado: (2025)
por: Zong, Chang, et al.
Publicado: (2025)
SpatialLadder: Progressive Training for Spatial Reasoning in Vision-Language Models
por: Li, Hongxing, et al.
Publicado: (2025)
por: Li, Hongxing, et al.
Publicado: (2025)
Self-Distilled Agentic Reinforcement Learning
por: Lu, Zhengxi, et al.
Publicado: (2026)
por: Lu, Zhengxi, et al.
Publicado: (2026)
Advancing Process Verification for Large Language Models via Tree-Based Preference Learning
por: He, Mingqian, et al.
Publicado: (2024)
por: He, Mingqian, et al.
Publicado: (2024)
SVGenius: Benchmarking LLMs in SVG Understanding, Editing and Generation
por: Chen, Siqi, et al.
Publicado: (2025)
por: Chen, Siqi, et al.
Publicado: (2025)
Agent-Pro: Learning to Evolve via Policy-Level Reflection and Optimization
por: Zhang, Wenqi, et al.
Publicado: (2024)
por: Zhang, Wenqi, et al.
Publicado: (2024)
2.5 Years in Class: A Multimodal Textbook for Vision-Language Pretraining
por: Zhang, Wenqi, et al.
Publicado: (2025)
por: Zhang, Wenqi, et al.
Publicado: (2025)
ProGuard: Towards Proactive Multimodal Safeguard
por: Yu, Shaohan, et al.
Publicado: (2025)
por: Yu, Shaohan, et al.
Publicado: (2025)
Triad: A Framework Leveraging a Multi-Role LLM-based Agent to Solve Knowledge Base Question Answering
por: Zong, Chang, et al.
Publicado: (2024)
por: Zong, Chang, et al.
Publicado: (2024)
LAPO: Internalizing Reasoning Efficiency via Length-Adaptive Policy Optimization
por: Wu, Xingyu, et al.
Publicado: (2025)
por: Wu, Xingyu, et al.
Publicado: (2025)
GroundAct: Can LLM Agents Ground Actions in Environmental States?
por: Wang, Zixuan, et al.
Publicado: (2025)
por: Wang, Zixuan, et al.
Publicado: (2025)
Embodied-Reasoner: Synergizing Visual Search, Reasoning, and Action for Embodied Interactive Tasks
por: Zhang, Wenqi, et al.
Publicado: (2025)
por: Zhang, Wenqi, et al.
Publicado: (2025)
EgoPro-Bench: Benchmarking Personalized Proactive Interaction in Egocentric Video Streams
por: Ran, Dongchuan, et al.
Publicado: (2026)
por: Ran, Dongchuan, et al.
Publicado: (2026)
Multimodal Self-Instruct: Synthetic Abstract Image and Visual Reasoning Instruction Using Language Model
por: Zhang, Wenqi, et al.
Publicado: (2024)
por: Zhang, Wenqi, et al.
Publicado: (2024)
EgoSocialArena: Benchmarking the Social Intelligence of Large Language Models from a First-person Perspective
por: Hou, Guiyang, et al.
Publicado: (2024)
por: Hou, Guiyang, et al.
Publicado: (2024)
Pause or Fabricate? Training Language Models for Grounded Reasoning
por: Qiu, Yiwen, et al.
Publicado: (2026)
por: Qiu, Yiwen, et al.
Publicado: (2026)
GSM8K-V: Can Vision Language Models Solve Grade School Math Word Problems in Visual Contexts
por: Yuan, Fan, et al.
Publicado: (2025)
por: Yuan, Fan, et al.
Publicado: (2025)
VerifyBench: Benchmarking Reference-based Reward Systems for Large Language Models
por: Yan, Yuchen, et al.
Publicado: (2025)
por: Yan, Yuchen, et al.
Publicado: (2025)
MathFimer: Enhancing Mathematical Reasoning by Expanding Reasoning Steps through Fill-in-the-Middle Task
por: Yan, Yuchen, et al.
Publicado: (2025)
por: Yan, Yuchen, et al.
Publicado: (2025)
TimeToM: Temporal Space is the Key to Unlocking the Door of Large Language Models' Theory-of-Mind
por: Hou, Guiyang, et al.
Publicado: (2024)
por: Hou, Guiyang, et al.
Publicado: (2024)
Hierarchical Budget Policy Optimization for Adaptive Reasoning
por: Lyu, Shangke, et al.
Publicado: (2025)
por: Lyu, Shangke, et al.
Publicado: (2025)
Milestone-Guided Policy Learning for Long-Horizon Language Agents
por: Wang, Zixuan, et al.
Publicado: (2026)
por: Wang, Zixuan, et al.
Publicado: (2026)
Ejemplares similares
-
TaskBench: Benchmarking Large Language Models for Task Automation
por: Shen, Yongliang, et al.
Publicado: (2023) -
UI-Copilot: Advancing Long-Horizon GUI Automation via Tool-Integrated Policy Optimization
por: Lu, Zhengxi, et al.
Publicado: (2026) -
UI-Zoomer: Uncertainty-Driven Adaptive Zoom-In for GUI Grounding
por: Tang, Fei, et al.
Publicado: (2026) -
Let LRMs Break Free from Overthinking via Self-Braking Tuning
por: Zhao, Haoran, et al.
Publicado: (2025) -
Code-A1: Adversarial Evolving of Code LLM and Test LLM via Reinforcement Learning
por: Wang, Aozhe, et al.
Publicado: (2026)