PRO-CUA: Process-Reward Optimization for Computer Use Agents
Fuente:
arXiv
Salvato in:
| Autori principali: | He, Yifei, Yang, Rui, Bai, Hao, Zhang, Tong, Zhao, Han |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
CUA-Gym: Scaling Verifiable Training Environments and Tasks for Computer-Use Agents
di: Wang, Bowen, et al.
Pubblicazione: (2026)
di: Wang, Bowen, et al.
Pubblicazione: (2026)
OpenCUA: Open Foundations for Computer-Use Agents
di: Wang, Xinyuan, et al.
Pubblicazione: (2025)
di: Wang, Xinyuan, et al.
Pubblicazione: (2025)
ToolCUA: Towards Optimal GUI-Tool Path Orchestration for Computer Use Agents
di: Hu, Xuhao, et al.
Pubblicazione: (2026)
di: Hu, Xuhao, et al.
Pubblicazione: (2026)
CUA-Skill: Develop Skills for Computer Using Agent
di: Chen, Tianyi, et al.
Pubblicazione: (2026)
di: Chen, Tianyi, et al.
Pubblicazione: (2026)
LiteCUA: Computer as MCP Server for Computer-Use Agent on AIOS
di: Mei, Kai, et al.
Pubblicazione: (2025)
di: Mei, Kai, et al.
Pubblicazione: (2025)
CUA-Suite: Massive Human-annotated Video Demonstrations for Computer-Use Agents
di: Jian, Xiangru, et al.
Pubblicazione: (2026)
di: Jian, Xiangru, et al.
Pubblicazione: (2026)
EvoCUA: Evolving Computer Use Agents via Learning from Scalable Synthetic Experience
di: Xue, Taofeng, et al.
Pubblicazione: (2026)
di: Xue, Taofeng, et al.
Pubblicazione: (2026)
IntentCUA: Learning Intent-level Representations for Skill Abstraction and Multi-Agent Planning in Computer-Use Agents
di: Lee, Seoyoung, et al.
Pubblicazione: (2026)
di: Lee, Seoyoung, et al.
Pubblicazione: (2026)
WebSTAR: Scalable Data Synthesis for Computer Use Agents with Step-Level Filtering
di: He, Yifei, et al.
Pubblicazione: (2025)
di: He, Yifei, et al.
Pubblicazione: (2025)
WebArbiter: A Principle-Guided Reasoning Process Reward Model for Web Agents
di: Zhang, Yao, et al.
Pubblicazione: (2026)
di: Zhang, Yao, et al.
Pubblicazione: (2026)
On the Reliability of Computer Use Agents
di: Gonzalez-Pumariega, Gonzalo, et al.
Pubblicazione: (2026)
di: Gonzalez-Pumariega, Gonzalo, et al.
Pubblicazione: (2026)
ComputerRL: Scaling End-to-End Online Reinforcement Learning for Computer Use Agents
di: Lai, Hanyu, et al.
Pubblicazione: (2025)
di: Lai, Hanyu, et al.
Pubblicazione: (2025)
The Agent Use of Agent Beings: Agent Cybernetics Is the Missing Science of Foundation Agents
di: Wang, Xinrun, et al.
Pubblicazione: (2026)
di: Wang, Xinrun, et al.
Pubblicazione: (2026)
GUI-PRA: Process Reward Agent for GUI Tasks
di: Xiong, Tao, et al.
Pubblicazione: (2025)
di: Xiong, Tao, et al.
Pubblicazione: (2025)
CaMeLs Can Use Computers Too: System-level Security for Computer Use Agents
di: Foerster, Hanna, et al.
Pubblicazione: (2026)
di: Foerster, Hanna, et al.
Pubblicazione: (2026)
PRO-V-R1: Reasoning Enhanced Programming Agent for RTL Verification
di: Zhao, Yujie, et al.
Pubblicazione: (2025)
di: Zhao, Yujie, et al.
Pubblicazione: (2025)
Process Reward Agents for Steering Knowledge-Intensive Reasoning
di: Sohn, Jiwoong, et al.
Pubblicazione: (2026)
di: Sohn, Jiwoong, et al.
Pubblicazione: (2026)
Evaluate-as-Action: Self-Evaluated Process Rewards for Retrieval-Augmented Agents
di: Shu, Jiangming, et al.
Pubblicazione: (2026)
di: Shu, Jiangming, et al.
Pubblicazione: (2026)
Mutual Information as Intrinsic Reward of Reinforcement Learning Agents for On-demand Ride Pooling
di: Zhang, Xianjie, et al.
Pubblicazione: (2023)
di: Zhang, Xianjie, et al.
Pubblicazione: (2023)
AgentHijack: Benchmarking Computer Use Agent Robustness to Common Environment Corruptions
di: Sun, Jingwei, et al.
Pubblicazione: (2026)
di: Sun, Jingwei, et al.
Pubblicazione: (2026)
Beyond Correctness: Harmonizing Process and Outcome Rewards through RL Training
di: Ye, Chenlu, et al.
Pubblicazione: (2025)
di: Ye, Chenlu, et al.
Pubblicazione: (2025)
RRO: LLM Agent Optimization Through Rising Reward Trajectories
di: Wang, Zilong, et al.
Pubblicazione: (2025)
di: Wang, Zilong, et al.
Pubblicazione: (2025)
Reward Difference Optimization For Sample Reweighting In Offline RLHF
di: Wang, Shiqi, et al.
Pubblicazione: (2024)
di: Wang, Shiqi, et al.
Pubblicazione: (2024)
Regularizing Hidden States Enables Learning Generalizable Reward Model for LLMs
di: Yang, Rui, et al.
Pubblicazione: (2024)
di: Yang, Rui, et al.
Pubblicazione: (2024)
Trust Region Reward Optimization and Proximal Inverse Reward Optimization Algorithm
di: Chen, Yang, et al.
Pubblicazione: (2025)
di: Chen, Yang, et al.
Pubblicazione: (2025)
Efficient Agent Training for Computer Use
di: He, Yanheng, et al.
Pubblicazione: (2025)
di: He, Yanheng, et al.
Pubblicazione: (2025)
Self-Guided Process Reward Optimization with Redefined Step-wise Advantage for Process Reinforcement Learning
di: Fei, Wu, et al.
Pubblicazione: (2025)
di: Fei, Wu, et al.
Pubblicazione: (2025)
Training Computer Use Agents to Assess the Usability of Graphical User Interfaces
di: Gao, Alice, et al.
Pubblicazione: (2026)
di: Gao, Alice, et al.
Pubblicazione: (2026)
Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction
di: Shen, Junhong, et al.
Pubblicazione: (2025)
di: Shen, Junhong, et al.
Pubblicazione: (2025)
RiOSWorld: Benchmarking the Risk of Multimodal Computer-Use Agents
di: Yang, Jingyi, et al.
Pubblicazione: (2025)
di: Yang, Jingyi, et al.
Pubblicazione: (2025)
OpenComputer: Verifiable Software Worlds for Computer-Use Agents
di: Wei, Jinbiao, et al.
Pubblicazione: (2026)
di: Wei, Jinbiao, et al.
Pubblicazione: (2026)
MagicGUI-RMS: A Multi-Agent Reward Model System for Self-Evolving GUI Agents via Automated Feedback Reflux
di: Li, Zecheng, et al.
Pubblicazione: (2026)
di: Li, Zecheng, et al.
Pubblicazione: (2026)
SmartSearch: Process Reward-Guided Query Refinement for Search Agents
di: Wen, Tongyu, et al.
Pubblicazione: (2026)
di: Wen, Tongyu, et al.
Pubblicazione: (2026)
PRO: Enabling Precise and Robust Text Watermark for Open-Source LLMs
di: Xue, Jiaqi, et al.
Pubblicazione: (2025)
di: Xue, Jiaqi, et al.
Pubblicazione: (2025)
WebPII: Benchmarking Visual PII Detection for Computer-Use Agents
di: Zhao, Nathan
Pubblicazione: (2026)
di: Zhao, Nathan
Pubblicazione: (2026)
A Survey on the Optimization of Large Language Model-based Agents
di: Du, Shangheng, et al.
Pubblicazione: (2025)
di: Du, Shangheng, et al.
Pubblicazione: (2025)
MASPRM: Multi-Agent System Process Reward Model
di: Yazdani, Milad, et al.
Pubblicazione: (2025)
di: Yazdani, Milad, et al.
Pubblicazione: (2025)
Arithmetic Control of LLMs for Diverse User Preferences: Directional Preference Alignment with Multi-Objective Rewards
di: Wang, Haoxiang, et al.
Pubblicazione: (2024)
di: Wang, Haoxiang, et al.
Pubblicazione: (2024)
C-World: A Computer Use Agent Environment Creator
di: Xi, Ziqiao, et al.
Pubblicazione: (2026)
di: Xi, Ziqiao, et al.
Pubblicazione: (2026)
Step-level Optimization for Efficient Computer-use Agents
di: Wei, Jinbiao, et al.
Pubblicazione: (2026)
di: Wei, Jinbiao, et al.
Pubblicazione: (2026)
Documenti analoghi
-
CUA-Gym: Scaling Verifiable Training Environments and Tasks for Computer-Use Agents
di: Wang, Bowen, et al.
Pubblicazione: (2026) -
OpenCUA: Open Foundations for Computer-Use Agents
di: Wang, Xinyuan, et al.
Pubblicazione: (2025) -
ToolCUA: Towards Optimal GUI-Tool Path Orchestration for Computer Use Agents
di: Hu, Xuhao, et al.
Pubblicazione: (2026) -
CUA-Skill: Develop Skills for Computer Using Agent
di: Chen, Tianyi, et al.
Pubblicazione: (2026) -
LiteCUA: Computer as MCP Server for Computer-Use Agent on AIOS
di: Mei, Kai, et al.
Pubblicazione: (2025)