ScaleCUA: Scaling Open-Source Computer Use Agents with Cross-Platform Data
Fuente:
arXiv
Saved in:
| Main Authors: | Liu, Zhaoyang, Xie, Jingjing, Ding, Zichen, Li, Zehao, Yang, Bowen, Wu, Zhenyu, Wang, Xuehui, Sun, Qiushi, Liu, Shi, Wang, Weiyun, Ye, Shenglong, Li, Qingyun, Dong, Xuan, Yu, Yue, Lu, Chenyu, Mo, YunXiang, Yan, Yao, Tian, Zeyue, Zhang, Xiao, Huang, Yuan, Liu, Yiqian, Su, Weijie, Luo, Gen, Yue, Xiangyu, Qi, Biqing, Chen, Kai, Zhou, Bowen, Qiao, Yu, Chen, Qifeng, Wang, Wenhai |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
CUA-Gym: Scaling Verifiable Training Environments and Tasks for Computer-Use Agents
by: Wang, Bowen, et al.
Published: (2026)
by: Wang, Bowen, et al.
Published: (2026)
OS-Oracle: A Comprehensive Framework for Cross-Platform GUI Critic Models
by: Wu, Zhenyu, et al.
Published: (2025)
by: Wu, Zhenyu, et al.
Published: (2025)
MMBench-GUI: Hierarchical Multi-Platform Evaluation Framework for GUI Agents
by: Wang, Xuehui, et al.
Published: (2025)
by: Wang, Xuehui, et al.
Published: (2025)
OS-Symphony: A Holistic Framework for Robust and Generalist Computer-Using Agent
by: Yang, Bowen, et al.
Published: (2026)
by: Yang, Bowen, et al.
Published: (2026)
ViCO: A Training Strategy towards Semantic Aware Dynamic High-Resolution
by: Cui, Long, et al.
Published: (2025)
by: Cui, Long, et al.
Published: (2025)
ZeroGUI: Automating Online GUI Learning at Zero Human Cost
by: Yang, Chenyu, et al.
Published: (2025)
by: Yang, Chenyu, et al.
Published: (2025)
TreeCUA: Efficiently Scaling GUI Automation with Tree-Structured Verifiable Evolution
by: Jiang, Deyang, et al.
Published: (2026)
by: Jiang, Deyang, et al.
Published: (2026)
Flavor Nernst effects in quantum paramagnets
by: Lu, Bowen, et al.
Published: (2024)
by: Lu, Bowen, et al.
Published: (2024)
Scaling Instruction-Based Video Editing with a High-Quality Synthetic Dataset
by: Bai, Qingyan, et al.
Published: (2025)
by: Bai, Qingyan, et al.
Published: (2025)
VidMuse: A Simple Video-to-Music Generation Framework with Long-Short-Term Modeling
by: Tian, Zeyue, et al.
Published: (2024)
by: Tian, Zeyue, et al.
Published: (2024)
Sequential Diffusion Language Models
by: Liu, Yangzhou, et al.
Published: (2025)
by: Liu, Yangzhou, et al.
Published: (2025)
LLMs Meet Multimodal Generation and Editing: A Survey
by: He, Yingqing, et al.
Published: (2024)
by: He, Yingqing, et al.
Published: (2024)
MagicQuill: An Intelligent Interactive Image Editing System
by: Liu, Zichen, et al.
Published: (2024)
by: Liu, Zichen, et al.
Published: (2024)
Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
by: Chen, Zhe, et al.
Published: (2024)
by: Chen, Zhe, et al.
Published: (2024)
OpenCUA: Open Foundations for Computer-Use Agents
by: Wang, Xinyuan, et al.
Published: (2025)
by: Wang, Xinyuan, et al.
Published: (2025)
VisualPRM: An Effective Process Reward Model for Multimodal Reasoning
by: Wang, Weiyun, et al.
Published: (2025)
by: Wang, Weiyun, et al.
Published: (2025)
AD^2-Bench: A Hierarchical CoT Benchmark for MLLM in Autonomous Driving under Adverse Conditions
by: Wei, Zhaoyang, et al.
Published: (2025)
by: Wei, Zhaoyang, et al.
Published: (2025)
High-charge relativistic electrons by vacuum laser acceleration from plasma mirrors using flying focus pulses
by: Liu, Jiaxin, et al.
Published: (2025)
by: Liu, Jiaxin, et al.
Published: (2025)
Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization
by: Wang, Weiyun, et al.
Published: (2024)
by: Wang, Weiyun, et al.
Published: (2024)
Atomic-Scale Roughness of Freestanding Oxide Membranes Revealed by Electron Ptychography
by: Yuan, Huaicheng, et al.
Published: (2025)
by: Yuan, Huaicheng, et al.
Published: (2025)
Impact of policy interventions on low‐carbon technology innovation diffusion in supply networks
by: Zehao Wang, et al.
Published: (2024)
by: Zehao Wang, et al.
Published: (2024)
Seeing and Hearing: Open-domain Visual-Audio Generation with Diffusion Latent Aligners
by: Xing, Yazhou, et al.
Published: (2024)
by: Xing, Yazhou, et al.
Published: (2024)
OS-Themis: A Scalable Critic Framework for Generalist GUI Rewards
by: Li, Zehao, et al.
Published: (2026)
by: Li, Zehao, et al.
Published: (2026)
MARS$^2$: Scaling Multi-Agent Tree Search via Reinforcement Learning for Code Generation
by: Li, Pengfei, et al.
Published: (2026)
by: Li, Pengfei, et al.
Published: (2026)
MSI-Agent: Incorporating Multi-Scale Insight into Embodied Agents for Superior Planning and Decision-Making
by: Fu, Dayuan, et al.
Published: (2024)
by: Fu, Dayuan, et al.
Published: (2024)
Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling
by: Liu, Runze, et al.
Published: (2025)
by: Liu, Runze, et al.
Published: (2025)
Towards Building Specialized Generalist AI with System 1 and System 2 Fusion
by: Zhang, Kaiyan, et al.
Published: (2024)
by: Zhang, Kaiyan, et al.
Published: (2024)
Size Distributions of Arcsecond-Scale Properties of Solar Flare Ribbons
by: Zhang, Yue, et al.
Published: (2025)
by: Zhang, Yue, et al.
Published: (2025)
SDAR: A Synergistic Diffusion-AutoRegression Paradigm for Scalable Sequence Generation
by: Cheng, Shuang, et al.
Published: (2025)
by: Cheng, Shuang, et al.
Published: (2025)
Regenerating Family Protein 3α‐Loaded Responsive Hydrogel Accelerates Infected Diabetic Wound Healing
by: Qingyun Wu, et al.
Published: (2025)
by: Qingyun Wu, et al.
Published: (2025)
LSReGen: Large-Scale Regional Generator via Backward Guidance Framework
by: Zhang, Bowen, et al.
Published: (2024)
by: Zhang, Bowen, et al.
Published: (2024)
MMInstruct: A High-Quality Multi-Modal Instruction Tuning Dataset with Extensive Diversity
by: Liu, Yangzhou, et al.
Published: (2024)
by: Liu, Yangzhou, et al.
Published: (2024)
Scaling the Scaling Logic: Agentic Meta-Synthesis of Logic Reasoning
by: Liu, Bowen, et al.
Published: (2026)
by: Liu, Bowen, et al.
Published: (2026)
VisReason: A Large-Scale Dataset for Visual Chain-of-Thought Reasoning
by: Li, Lingxiao, et al.
Published: (2025)
by: Li, Lingxiao, et al.
Published: (2025)
Enhancing Adversarial Transferability via Information Bottleneck Constraints
by: Qi, Biqing, et al.
Published: (2024)
by: Qi, Biqing, et al.
Published: (2024)
Light 'em Up: Enabling Few-Shot Low-Light 3D Gaussian Splatting with Multi-Scale Explicit Retinex Illumination Decoupling
by: Yin, YuHao, et al.
Published: (2026)
by: Yin, YuHao, et al.
Published: (2026)
Adaptive Mixed-Scale Feature Fusion Network for Blind AI-Generated Image Quality Assessment
by: Zhou, Tianwei, et al.
Published: (2024)
by: Zhou, Tianwei, et al.
Published: (2024)
Applications of Large Scale Foundation Models for Autonomous Driving
by: Huang, Yu, et al.
Published: (2023)
by: Huang, Yu, et al.
Published: (2023)
S$^4$ST: A Strong, Self-transferable, faSt, and Simple Scale Transformation for Transferable Targeted Attack
by: Liu, Yongxiang, et al.
Published: (2024)
by: Liu, Yongxiang, et al.
Published: (2024)
AudioX: A Unified Framework for Anything-to-Audio Generation
by: Tian, Zeyue, et al.
Published: (2025)
by: Tian, Zeyue, et al.
Published: (2025)
Similar Items
-
CUA-Gym: Scaling Verifiable Training Environments and Tasks for Computer-Use Agents
by: Wang, Bowen, et al.
Published: (2026) -
OS-Oracle: A Comprehensive Framework for Cross-Platform GUI Critic Models
by: Wu, Zhenyu, et al.
Published: (2025) -
MMBench-GUI: Hierarchical Multi-Platform Evaluation Framework for GUI Agents
by: Wang, Xuehui, et al.
Published: (2025) -
OS-Symphony: A Holistic Framework for Robust and Generalist Computer-Using Agent
by: Yang, Bowen, et al.
Published: (2026) -
ViCO: A Training Strategy towards Semantic Aware Dynamic High-Resolution
by: Cui, Long, et al.
Published: (2025)