TGPO: Tree-Guided Preference Optimization for Robust Web Agent Reinforcement Learning
Fuente:
arXiv
Saved in:
| Main Authors: | Chen, Ziyuan, Zhao, Zhenghui, Han, Zhangye, Liu, Miancan, Ye, Xianhang, Li, Yiqing, Min, Hongbo, Ren, Jinkui, Zhang, Xiantao, Cao, Guitao |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
GUI-ARP: Enhancing Grounding with Adaptive Region Perception for GUI Agents
by: Ye, Xianhang, et al.
Published: (2025)
by: Ye, Xianhang, et al.
Published: (2025)
TGPO: Temporal Grounded Policy Optimization for Signal Temporal Logic Tasks
by: Meng, Yue, et al.
Published: (2025)
by: Meng, Yue, et al.
Published: (2025)
A note on irreducible representations of symmetric groups and Sergeev superalgebras
by: Chen, Minjia, et al.
Published: (2026)
by: Chen, Minjia, et al.
Published: (2026)
Cross-Modal Content Optimization for Steering Web Agent Preferences
by: Jiang, Tanqiu, et al.
Published: (2025)
by: Jiang, Tanqiu, et al.
Published: (2025)
A$^2$TGPO: Agentic Turn-Group Policy Optimization with Adaptive Turn-level Clipping
by: Chen, Dingwei, et al.
Published: (2026)
by: Chen, Dingwei, et al.
Published: (2026)
Knowledge-Guided Wasserstein Distributionally Robust Optimization
by: Wang, Zitao, et al.
Published: (2025)
by: Wang, Zitao, et al.
Published: (2025)
Partially Observable Mean Field Multi-Agent Reinforcement Learning Based on Graph-Attention
by: Yang, Min, et al.
Published: (2023)
by: Yang, Min, et al.
Published: (2023)
PGPO: Enhancing Agent Reasoning via Pseudocode-style Planning Guided Preference Optimization
by: Cao, Zouying, et al.
Published: (2025)
by: Cao, Zouying, et al.
Published: (2025)
QuIDE: Mastering the Quantized Intelligence Trade-off via Active Optimization
by: Jiang, Xiantao
Published: (2026)
by: Jiang, Xiantao
Published: (2026)
POLO: Preference-Guided Multi-Turn Reinforcement Learning for Lead Optimization
by: Wang, Ziqing, et al.
Published: (2025)
by: Wang, Ziqing, et al.
Published: (2025)
Distributed State Estimation for Discrete-Time Systems With Unknown Inputs: An Optimization Approach
by: Zhao, Ruixuan, et al.
Published: (2026)
by: Zhao, Ruixuan, et al.
Published: (2026)
Reinforced Preference Optimization for Recommendation
by: Tan, Junfei, et al.
Published: (2025)
by: Tan, Junfei, et al.
Published: (2025)
Nanozymes as Antibacterial Agents: New Concerns in Design and Enhancement Strategies
by: Xianhang Yan, et al.
Published: (2024)
by: Xianhang Yan, et al.
Published: (2024)
Construction of $\varepsilon_{d}$-ASIC-POVMs via $2$-to-$1$ PN functions and the Li bound
by: Cao, Meng, et al.
Published: (2023)
by: Cao, Meng, et al.
Published: (2023)
Preference-Guided Learning for Sparse-Reward Multi-Agent Reinforcement Learning
by: Bui, The Viet, et al.
Published: (2025)
by: Bui, The Viet, et al.
Published: (2025)
DynaWeb: Model-Based Reinforcement Learning of Web Agents
by: Ding, Hang, et al.
Published: (2026)
by: Ding, Hang, et al.
Published: (2026)
Adversarial Policy Optimization for Offline Preference-based Reinforcement Learning
by: Kang, Hyungkyu, et al.
Published: (2025)
by: Kang, Hyungkyu, et al.
Published: (2025)
TO-Agents: A Multi-Agent AI Pipeline for Preference-Guided Topology Optimization
by: Stewart, Isabella A., et al.
Published: (2026)
by: Stewart, Isabella A., et al.
Published: (2026)
Effect of a Dihydroxyacetone‐Based Camouflage Agent on Ultraviolet‐Induced Erythema
by: Dan Shu, et al.
Published: (2025)
by: Dan Shu, et al.
Published: (2025)
Web-Shepherd: Advancing PRMs for Reinforcing Web Agents
by: Chae, Hyungjoo, et al.
Published: (2025)
by: Chae, Hyungjoo, et al.
Published: (2025)
WebArbiter: A Principle-Guided Reasoning Process Reward Model for Web Agents
by: Zhang, Yao, et al.
Published: (2026)
by: Zhang, Yao, et al.
Published: (2026)
Multi-Agent Reinforcement Learning: Methods, Applications, Visionary Prospects, and Challenges
by: Zhou, Ziyuan, et al.
Published: (2023)
by: Zhou, Ziyuan, et al.
Published: (2023)
DEPO: Dual-Efficiency Preference Optimization for LLM Agents
by: Chen, Sirui, et al.
Published: (2025)
by: Chen, Sirui, et al.
Published: (2025)
Formality is Favored: Unraveling the Learning Preferences of Large Language Models on Data with Conflicting Knowledge
by: Li, Jiahuan, et al.
Published: (2024)
by: Li, Jiahuan, et al.
Published: (2024)
Mirabolic Hecke algebras, Schur-Weyl duality and Frobenius character formulas
by: Wan, Jinkui
Published: (2026)
by: Wan, Jinkui
Published: (2026)
WEPO: Web Element Preference Optimization for LLM-based Web Navigation
by: Liu, Jiarun, et al.
Published: (2024)
by: Liu, Jiarun, et al.
Published: (2024)
MODELLING THE GEOMETRIC VIARIABILITY OF 3D WOVEN GLASS FIBRE FABRIC AND ITS EFFECTS ON PERMEABILITY
by: Xiantao Zhao, et al.
Published: (2015)
by: Xiantao Zhao, et al.
Published: (2015)
Catching the Infection Before It Spreads: Foresight-Guided Defense in Multi-Agent Systems
by: Ma, Yue, et al.
Published: (2026)
by: Ma, Yue, et al.
Published: (2026)
EPO: Diverse and Realistic Protein Ensemble Generation via Energy Preference Optimization
by: Sun, Yuancheng, et al.
Published: (2025)
by: Sun, Yuancheng, et al.
Published: (2025)
Causal Direct Preference Optimization for Distributionally Robust Generative Recommendation
by: Zhao, Chu, et al.
Published: (2026)
by: Zhao, Chu, et al.
Published: (2026)
RIME: Robust Preference-based Reinforcement Learning with Noisy Preferences
by: Cheng, Jie, et al.
Published: (2024)
by: Cheng, Jie, et al.
Published: (2024)
Reinforced Preference Optimization for Reasoning-Augmented Recommendations
by: Gao, Jingtong, et al.
Published: (2026)
by: Gao, Jingtong, et al.
Published: (2026)
MACPO: Weak-to-Strong Alignment via Multi-Agent Contrastive Preference Optimization
by: Lyu, Yougang, et al.
Published: (2024)
by: Lyu, Yougang, et al.
Published: (2024)
ROPO: Robust Preference Optimization for Large Language Models
by: Liang, Xize, et al.
Published: (2024)
by: Liang, Xize, et al.
Published: (2024)
Human-in-the-Loop Policy Optimization for Preference-Based Multi-Objective Reinforcement Learning
by: Li, Ke, et al.
Published: (2024)
by: Li, Ke, et al.
Published: (2024)
WARD: Adversarially Robust Defense of Web Agents Against Prompt Injections
by: Cao, Tri, et al.
Published: (2026)
by: Cao, Tri, et al.
Published: (2026)
Nonreciprocal and Geometric Frustration in Dissipative Quantum Spins
by: Lyu, Guitao, et al.
Published: (2025)
by: Lyu, Guitao, et al.
Published: (2025)
Preference-Guided Reinforcement Learning for Efficient Exploration
by: Wang, Guojian, et al.
Published: (2024)
by: Wang, Guojian, et al.
Published: (2024)
EPO: Hierarchical LLM Agents with Environment Preference Optimization
by: Zhao, Qi, et al.
Published: (2024)
by: Zhao, Qi, et al.
Published: (2024)
Exponential Quantum Speedup for Simulating Classical Lattice Dynamics
by: Li, Xiantao
Published: (2025)
by: Li, Xiantao
Published: (2025)
Similar Items
-
GUI-ARP: Enhancing Grounding with Adaptive Region Perception for GUI Agents
by: Ye, Xianhang, et al.
Published: (2025) -
TGPO: Temporal Grounded Policy Optimization for Signal Temporal Logic Tasks
by: Meng, Yue, et al.
Published: (2025) -
A note on irreducible representations of symmetric groups and Sergeev superalgebras
by: Chen, Minjia, et al.
Published: (2026) -
Cross-Modal Content Optimization for Steering Web Agent Preferences
by: Jiang, Tanqiu, et al.
Published: (2025) -
A$^2$TGPO: Agentic Turn-Group Policy Optimization with Adaptive Turn-level Clipping
by: Chen, Dingwei, et al.
Published: (2026)