MobileDreamer: Generative Sketch World Model for GUI Agent
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Cao, Yilin, Zhong, Yufeng, Zeng, Zhixiong, Zheng, Liming, Huang, Jing, Qiu, Haibo, Shi, Peng, Mao, Wenji, Guanglu, Wan |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
OmniActor: A Generalist GUI and Embodied Agent for 2D&3D Worlds
von: Yang, Longrong, et al.
Veröffentlicht: (2025)
von: Yang, Longrong, et al.
Veröffentlicht: (2025)
ScaleTrack: Scaling and back-tracking Automated GUI Agents
von: Huang, Jing, et al.
Veröffentlicht: (2025)
von: Huang, Jing, et al.
Veröffentlicht: (2025)
VinciCoder: Unifying Multimodal Code Generation via Coarse-to-fine Visual Reinforcement Learning
von: Zhao, Xuanle, et al.
Veröffentlicht: (2025)
von: Zhao, Xuanle, et al.
Veröffentlicht: (2025)
TreeCUA: Efficiently Scaling GUI Automation with Tree-Structured Verifiable Evolution
von: Jiang, Deyang, et al.
Veröffentlicht: (2026)
von: Jiang, Deyang, et al.
Veröffentlicht: (2026)
UItron: Foundational GUI Agent with Advanced Perception and Planning
von: Zeng, Zhixiong, et al.
Veröffentlicht: (2025)
von: Zeng, Zhixiong, et al.
Veröffentlicht: (2025)
UITron-Speech: Towards Automated GUI Agents Based on Speech Instructions
von: Han, Wenkang, et al.
Veröffentlicht: (2025)
von: Han, Wenkang, et al.
Veröffentlicht: (2025)
Agentic Reward Modeling: Verifying GUI Agent via Online Proactive Interaction
von: Cui, Chaoqun, et al.
Veröffentlicht: (2026)
von: Cui, Chaoqun, et al.
Veröffentlicht: (2026)
Flexible Entropy Control in RLVR with a Gradient-Preserving Perspective
von: Chen, Kun, et al.
Veröffentlicht: (2026)
von: Chen, Kun, et al.
Veröffentlicht: (2026)
Metis-SPECS: Decoupling Multimodal Learning via Self-distilled Preference-based Cold Start
von: Chen, Kun, et al.
Veröffentlicht: (2025)
von: Chen, Kun, et al.
Veröffentlicht: (2025)
Reading or Reasoning? Format Decoupled Reinforcement Learning for Document OCR
von: Zhong, Yufeng, et al.
Veröffentlicht: (2025)
von: Zhong, Yufeng, et al.
Veröffentlicht: (2025)
Breaking the SFT Plateau: Multimodal Structured Reinforcement Learning for Chart-to-Code Generation
von: Chen, Lei, et al.
Veröffentlicht: (2025)
von: Chen, Lei, et al.
Veröffentlicht: (2025)
OCRVerse: Towards Holistic OCR in End-to-End Vision-Language Models
von: Zhong, Yufeng, et al.
Veröffentlicht: (2026)
von: Zhong, Yufeng, et al.
Veröffentlicht: (2026)
DocTron-Formula: Generalized Formula Recognition in Complex and Structured Scenarios
von: Zhong, Yufeng, et al.
Veröffentlicht: (2025)
von: Zhong, Yufeng, et al.
Veröffentlicht: (2025)
Length-Unbiased Sequence Policy Optimization: Revealing and Controlling Response Length Variation in RLVR
von: Liu, Fanfan, et al.
Veröffentlicht: (2026)
von: Liu, Fanfan, et al.
Veröffentlicht: (2026)
Mobile-Agent-v3: Fundamental Agents for GUI Automation
von: Ye, Jiabo, et al.
Veröffentlicht: (2025)
von: Ye, Jiabo, et al.
Veröffentlicht: (2025)
SketchFlex: Facilitating Spatial-Semantic Coherence in Text-to-Image Generation with Region-Based Sketches
von: Lin, Haichuan, et al.
Veröffentlicht: (2025)
von: Lin, Haichuan, et al.
Veröffentlicht: (2025)
MobileGUI-RL: Advancing Mobile GUI Agent through Reinforcement Learning in Online Environment
von: Shi, Yucheng, et al.
Veröffentlicht: (2025)
von: Shi, Yucheng, et al.
Veröffentlicht: (2025)
Advancing Mobile GUI Agents: A Verifier-Driven Approach to Practical Deployment
von: Dai, Gaole, et al.
Veröffentlicht: (2025)
von: Dai, Gaole, et al.
Veröffentlicht: (2025)
Mobile-Agent-v3.5: Multi-platform Fundamental GUI Agents
von: Xu, Haiyang, et al.
Veröffentlicht: (2026)
von: Xu, Haiyang, et al.
Veröffentlicht: (2026)
GUI-CEval: A Hierarchical and Comprehensive Chinese Benchmark for Mobile GUI Agents
von: Li, Yang, et al.
Veröffentlicht: (2026)
von: Li, Yang, et al.
Veröffentlicht: (2026)
DeepSketcher: Internalizing Visual Manipulation for Multimodal Reasoning
von: Zhang, Chi, et al.
Veröffentlicht: (2025)
von: Zhang, Chi, et al.
Veröffentlicht: (2025)
Faithful Mobile GUI Agents with Guided Advantage Estimator
von: Hu, Haowen, et al.
Veröffentlicht: (2026)
von: Hu, Haowen, et al.
Veröffentlicht: (2026)
MobileRL: Online Agentic Reinforcement Learning for Mobile GUI Agents
von: Xu, Yifan, et al.
Veröffentlicht: (2025)
von: Xu, Yifan, et al.
Veröffentlicht: (2025)
Chart-R1: Chain-of-Thought Supervision and Reinforcement for Advanced Chart Reasoner
von: Chen, Lei, et al.
Veröffentlicht: (2025)
von: Chen, Lei, et al.
Veröffentlicht: (2025)
SecAgent: Efficient Mobile GUI Agent with Semantic Context
von: Xie, Yiping, et al.
Veröffentlicht: (2026)
von: Xie, Yiping, et al.
Veröffentlicht: (2026)
META-GUI: Towards Multi-modal Conversational Agents on Mobile GUI
von: Sun, Liangtai, et al.
Veröffentlicht: (2022)
von: Sun, Liangtai, et al.
Veröffentlicht: (2022)
SketchAgent: Language-Driven Sequential Sketch Generation
von: Vinker, Yael, et al.
Veröffentlicht: (2024)
von: Vinker, Yael, et al.
Veröffentlicht: (2024)
Perceptual-Evidence Anchored Reinforced Learning for Multimodal Reasoning
von: Zhang, Chi, et al.
Veröffentlicht: (2025)
von: Zhang, Chi, et al.
Veröffentlicht: (2025)
WorldDreamer: Towards General World Models for Video Generation via Predicting Masked Tokens
von: Wang, Xiaofeng, et al.
Veröffentlicht: (2024)
von: Wang, Xiaofeng, et al.
Veröffentlicht: (2024)
MobileUse: A GUI Agent with Hierarchical Reflection for Autonomous Mobile Operation
von: Li, Ning, et al.
Veröffentlicht: (2025)
von: Li, Ning, et al.
Veröffentlicht: (2025)
Turing Test on Screen: A Benchmark for Mobile GUI Agent Humanization
von: Zhu, Jiachen, et al.
Veröffentlicht: (2026)
von: Zhu, Jiachen, et al.
Veröffentlicht: (2026)
MobileFlow: A Multimodal LLM For Mobile GUI Agent
von: Nong, Songqin, et al.
Veröffentlicht: (2024)
von: Nong, Songqin, et al.
Veröffentlicht: (2024)
MemGUI-Bench: Benchmarking Memory of Mobile GUI Agents in Dynamic Environments
von: Liu, Guangyi, et al.
Veröffentlicht: (2026)
von: Liu, Guangyi, et al.
Veröffentlicht: (2026)
MobileBench-OL: A Comprehensive Chinese Benchmark for Evaluating Mobile GUI Agents in Real-World Environment
von: Wu, Qinzhuo, et al.
Veröffentlicht: (2026)
von: Wu, Qinzhuo, et al.
Veröffentlicht: (2026)
STAGE: Stable and Generalizable GRPO for Autoregressive Image Generation
von: Ma, Xiaoxiao, et al.
Veröffentlicht: (2025)
von: Ma, Xiaoxiao, et al.
Veröffentlicht: (2025)
Learning When to Look: A Disentangled Curriculum for Strategic Perception in Multimodal Reasoning
von: Yang, Siqi, et al.
Veröffentlicht: (2025)
von: Yang, Siqi, et al.
Veröffentlicht: (2025)
UI-Mem: Self-Evolving Experience Memory for Online Reinforcement Learning in Mobile GUI Agents
von: Xiao, Han, et al.
Veröffentlicht: (2026)
von: Xiao, Han, et al.
Veröffentlicht: (2026)
PH-Dreamer: A Physics-Driven World Model via Port-Hamiltonian Generative Dynamics
von: Luan, Xueyu, et al.
Veröffentlicht: (2026)
von: Luan, Xueyu, et al.
Veröffentlicht: (2026)
Mobile GUI Agent Privacy Personalization with Trajectory Induced Preference Optimization
von: Lin, Zhixin, et al.
Veröffentlicht: (2026)
von: Lin, Zhixin, et al.
Veröffentlicht: (2026)
Code2World: A GUI World Model via Renderable Code Generation
von: Zheng, Yuhao, et al.
Veröffentlicht: (2026)
von: Zheng, Yuhao, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
OmniActor: A Generalist GUI and Embodied Agent for 2D&3D Worlds
von: Yang, Longrong, et al.
Veröffentlicht: (2025) -
ScaleTrack: Scaling and back-tracking Automated GUI Agents
von: Huang, Jing, et al.
Veröffentlicht: (2025) -
VinciCoder: Unifying Multimodal Code Generation via Coarse-to-fine Visual Reinforcement Learning
von: Zhao, Xuanle, et al.
Veröffentlicht: (2025) -
TreeCUA: Efficiently Scaling GUI Automation with Tree-Structured Verifiable Evolution
von: Jiang, Deyang, et al.
Veröffentlicht: (2026) -
UItron: Foundational GUI Agent with Advanced Perception and Planning
von: Zeng, Zhixiong, et al.
Veröffentlicht: (2025)