OmegaUse: Building a General-Purpose GUI Agent for Autonomous Task Execution
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Le, Xiao, Yixiong, Lu, Xinjiang, Cao, Jingjia, Zhao, Yusai, Zhou, Jingbo, An, Lang, Feng, Zikan, Sha, Wanxiang, Shi, Yu, Xiao, Congxi, Xiong, Jian, Zhang, Yankai, Wu, Hua, Wang, Haifeng |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
TimeFound: A Foundation Model for Time Series Forecasting
par: Xiao, Congxi, et autres
Publié: (2025)
par: Xiao, Congxi, et autres
Publié: (2025)
SDWPF: A Dataset for Spatial Dynamic Wind Power Forecasting Challenge at KDD Cup 2022
par: Zhou, Jingbo, et autres
Publié: (2022)
par: Zhou, Jingbo, et autres
Publié: (2022)
Identifiable Representation and Model Learning for Latent Dynamic Systems
par: Zhang, Congxi, et autres
Publié: (2024)
par: Zhang, Congxi, et autres
Publié: (2024)
Tracking control of latent dynamic systems with application to spacecraft attitude control
par: Zhang, Congxi, et autres
Publié: (2024)
par: Zhang, Congxi, et autres
Publié: (2024)
AgentCPM-GUI: Building Mobile-Use Agents with Reinforcement Fine-Tuning
par: Zhang, Zhong, et autres
Publié: (2025)
par: Zhang, Zhong, et autres
Publié: (2025)
Executable Agentic Memory for GUI Agent
par: Qin, Zerui, et autres
Publié: (2026)
par: Qin, Zerui, et autres
Publié: (2026)
"It Felt Real" Victim Perspectives on Platform Design and Longer-Running Scams
par: Xiao, Jingjia, et autres
Publié: (2025)
par: Xiao, Jingjia, et autres
Publié: (2025)
GUI-PRA: Process Reward Agent for GUI Tasks
par: Xiong, Tao, et autres
Publié: (2025)
par: Xiong, Tao, et autres
Publié: (2025)
Can GenAI Move from Individual Use to Collaborative Work? Experiences, Challenges, and Opportunities of Coordinating GenAI into Collaborative Newswork
par: Xiao, Qing, et autres
Publié: (2025)
par: Xiao, Qing, et autres
Publié: (2025)
“Exu, a Sapucaí é vossa”: as múltiplas presenças de exu na performance do carnaval
par: Vânia Zikán Cardoso
Publié: (2023)
par: Vânia Zikán Cardoso
Publié: (2023)
Danger of words: risk and (mis)comprehension in consultations with the spirits of the povo da rua
par: Vânia Zikán Cardoso
Publié: (2017)
par: Vânia Zikán Cardoso
Publié: (2017)
Breaking the Data Barrier -- Building GUI Agents Through Task Generalization
par: Zhang, Junlei, et autres
Publié: (2025)
par: Zhang, Junlei, et autres
Publié: (2025)
ChartAnchor: Chart Grounding with Structural-Semantic Fidelity
par: Li, Xinhang, et autres
Publié: (2025)
par: Li, Xinhang, et autres
Publié: (2025)
GUI Testing Arena: A Unified Benchmark for Advancing Autonomous GUI Testing Agent
par: Zhao, Kangjia, et autres
Publié: (2024)
par: Zhao, Kangjia, et autres
Publié: (2024)
Building Autonomous GUI Navigation via Agentic-Q Estimation and Step-Wise Policy Optimization
par: Wang, Yibo, et autres
Publié: (2026)
par: Wang, Yibo, et autres
Publié: (2026)
Some ergodic theorems involving Omega function and their applications
par: Xiao, Rongzhong
Publié: (2024)
par: Xiao, Rongzhong
Publié: (2024)
MobileUse: A GUI Agent with Hierarchical Reflection for Autonomous Mobile Operation
par: Li, Ning, et autres
Publié: (2025)
par: Li, Ning, et autres
Publié: (2025)
Unrewarded Exploration in Large Language Models Reveals Latent Learning from Psychology
par: Xiong, Jian, et autres
Publié: (2026)
par: Xiong, Jian, et autres
Publié: (2026)
Environment Modeling for Service Robots From a Task Execution Perspective
par: Zhang, Ying, et autres
Publié: (2025)
par: Zhang, Ying, et autres
Publié: (2025)
GUI-explorer: Autonomous Exploration and Mining of Transition-aware Knowledge for GUI Agent
par: Xie, Bin, et autres
Publié: (2025)
par: Xie, Bin, et autres
Publié: (2025)
GUI-Bee: Align GUI Action Grounding to Novel Environments via Autonomous Exploration
par: Fan, Yue, et autres
Publié: (2025)
par: Fan, Yue, et autres
Publié: (2025)
BEVWorld: A Multimodal World Simulator for Autonomous Driving via Scene-Level BEV Latents
par: Zhang, Yumeng, et autres
Publié: (2024)
par: Zhang, Yumeng, et autres
Publié: (2024)
BridgeTower: Building Bridges Between Encoders in Vision-Language Representation Learning
par: Xu, Xiao, et autres
Publié: (2022)
par: Xu, Xiao, et autres
Publié: (2022)
ClawGUI: A Unified Framework for Training, Evaluating, and Deploying GUI Agents
par: Tang, Fei, et autres
Publié: (2026)
par: Tang, Fei, et autres
Publié: (2026)
ProgRM: Build Better GUI Agents with Progress Rewards
par: Zhang, Danyang, et autres
Publié: (2025)
par: Zhang, Danyang, et autres
Publié: (2025)
CRAFT-GUI: Curriculum-Reinforced Agent For GUI Tasks
par: Nong, Songqin, et autres
Publié: (2025)
par: Nong, Songqin, et autres
Publié: (2025)
The Digital Landscape of God: Narrative, Visuals and Viewer Engagement of Religious Videos on YouTube
par: Chen, Rongyi, et autres
Publié: (2025)
par: Chen, Rongyi, et autres
Publié: (2025)
Android in the Zoo: Chain-of-Action-Thought for GUI Agents
par: Zhang, Jiwen, et autres
Publié: (2024)
par: Zhang, Jiwen, et autres
Publié: (2024)
EchoTrail-GUI: Building Actionable Memory for GUI Agents via Critic-Guided Self-Exploration
par: Li, Runze, et autres
Publié: (2025)
par: Li, Runze, et autres
Publié: (2025)
Aguvis: Unified Pure Vision Agents for Autonomous GUI Interaction
par: Xu, Yiheng, et autres
Publié: (2024)
par: Xu, Yiheng, et autres
Publié: (2024)
Purposive Selection of Building Typologies
par: Onwukwe, Chukwuemeka Ozioma Stanislaus
Publié: (2026)
par: Onwukwe, Chukwuemeka Ozioma Stanislaus
Publié: (2026)
GoClick: Lightweight Element Grounding Model for Autonomous GUI Interaction
par: Li, Hongxin, et autres
Publié: (2026)
par: Li, Hongxin, et autres
Publié: (2026)
Advances in the Development of Dual‐Atom Catalysts: Structural Characterization and Diversified Catalytic Applications
par: Liping Zhang, et autres
Publié: (2024)
par: Liping Zhang, et autres
Publié: (2024)
Finite‐Time Control of Time‐Varying Delay Nonlinear Systems With Multiple Disturbances
par: Xinjiang Wei, et autres
Publié: (2025)
par: Xinjiang Wei, et autres
Publié: (2025)
Composite observer based finite time control for nonlinear systems subjecting to multiple disturbances
par: Huifeng Zhang, et autres
Publié: (2024)
par: Huifeng Zhang, et autres
Publié: (2024)
Mobile-Env: Building Qualified Evaluation Benchmarks for LLM-GUI Interaction
par: Zhang, Danyang, et autres
Publié: (2023)
par: Zhang, Danyang, et autres
Publié: (2023)
GUI-G$^2$: Gaussian Reward Modeling for GUI Grounding
par: Tang, Fei, et autres
Publié: (2025)
par: Tang, Fei, et autres
Publié: (2025)
GUI Knowledge Bench: Revealing the Knowledge Gap of VLMs in GUI Tasks
par: Shi, Chenrui, et autres
Publié: (2025)
par: Shi, Chenrui, et autres
Publié: (2025)
BEAP-Agent: Backtrackable Execution and Adaptive Planning for GUI Agents
par: Lu, Ziyu, et autres
Publié: (2026)
par: Lu, Ziyu, et autres
Publié: (2026)
Training High-Level Schedulers with Execution-Feedback Reinforcement Learning for Long-Horizon GUI Automation
par: Deng, Zehao, et autres
Publié: (2025)
par: Deng, Zehao, et autres
Publié: (2025)
Documents similaires
-
TimeFound: A Foundation Model for Time Series Forecasting
par: Xiao, Congxi, et autres
Publié: (2025) -
SDWPF: A Dataset for Spatial Dynamic Wind Power Forecasting Challenge at KDD Cup 2022
par: Zhou, Jingbo, et autres
Publié: (2022) -
Identifiable Representation and Model Learning for Latent Dynamic Systems
par: Zhang, Congxi, et autres
Publié: (2024) -
Tracking control of latent dynamic systems with application to spacecraft attitude control
par: Zhang, Congxi, et autres
Publié: (2024) -
AgentCPM-GUI: Building Mobile-Use Agents with Reinforcement Fine-Tuning
par: Zhang, Zhong, et autres
Publié: (2025)