ETR: Outcome-Guided Elastic Trust Regions for Policy Optimization
Fuente:
arXiv
Saved in:
| Main Authors: | Zhang, Shijie, Zhang, Kevin, Gu, Zheyuan, Guo, Xiang, Guo, Rujun, Liu, Shaoyu, Jiang, Guanjun, Wang, Xiaozhao |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Answer First, Reason Later: Aligning Search Relevance via Mode-Balanced Reinforcement Learning
by: Zhang, Shijie, et al.
Published: (2026)
by: Zhang, Shijie, et al.
Published: (2026)
Trust-Region Adaptive Policy Optimization
by: Su, Mingyu, et al.
Published: (2025)
by: Su, Mingyu, et al.
Published: (2025)
CLPO: Curriculum Learning meets Policy Optimization for LLM Reasoning
by: Zhang, Shijie, et al.
Published: (2025)
by: Zhang, Shijie, et al.
Published: (2025)
From Item-Only to Query-Item: Query-Conditioned Generative Search with QGS in Quark
by: Song, Yanglong, et al.
Published: (2026)
by: Song, Yanglong, et al.
Published: (2026)
Trust Regions Sell, But Who's Buying? Overlap Geometry as an Alternative Trust Region for Policy Optimization
by: Trivedi, Gaurish, et al.
Published: (2026)
by: Trivedi, Gaurish, et al.
Published: (2026)
Trust Region On-Policy Distillation
by: Xing, Xingrun, et al.
Published: (2026)
by: Xing, Xingrun, et al.
Published: (2026)
Matrix Low-Rank Trust Region Policy Optimization
by: Rozada, Sergio, et al.
Published: (2024)
by: Rozada, Sergio, et al.
Published: (2024)
Trust-Region Twisted Policy Improvement
by: de Vries, Joery A., et al.
Published: (2025)
by: de Vries, Joery A., et al.
Published: (2025)
Trust Region Reward Optimization and Proximal Inverse Reward Optimization Algorithm
by: Chen, Yang, et al.
Published: (2025)
by: Chen, Yang, et al.
Published: (2025)
Memory-Guided Trust-Region Bayesian Optimization (MG-TuRBO) for High Dimensions
by: Saroj, Abhilasha, et al.
Published: (2026)
by: Saroj, Abhilasha, et al.
Published: (2026)
QUATRO: Query-Adaptive Trust Region Policy Optimization for LLM Fine-tuning
by: Lee, Doyeon, et al.
Published: (2026)
by: Lee, Doyeon, et al.
Published: (2026)
Graph-attention-based Casual Discovery with Trust Region-navigated Clipping Policy Optimization
by: Liu, Shixuan, et al.
Published: (2024)
by: Liu, Shixuan, et al.
Published: (2024)
Rethinking Ratio-Based Trust Regions for Policy Optimization in Multi-Agent Reinforcement Learning
by: Wijesundara, Chulabhaya, et al.
Published: (2026)
by: Wijesundara, Chulabhaya, et al.
Published: (2026)
Beyond State-Wise Mirror Descent: Offline Policy Optimization with Parametric Policies
by: Li, Xiang, et al.
Published: (2026)
by: Li, Xiang, et al.
Published: (2026)
CLIPO: Contrastive Learning in Policy Optimization Generalizes RLVR
by: Cui, Sijia, et al.
Published: (2026)
by: Cui, Sijia, et al.
Published: (2026)
PNAct: Crafting Backdoor Attacks in Safe Reinforcement Learning
by: Guo, Weiran, et al.
Published: (2025)
by: Guo, Weiran, et al.
Published: (2025)
Why Semantic Entropy Fails: Geometry-Aware and Calibrated Uncertainty for Policy Optimization
by: Zhang, Zheyuan, et al.
Published: (2026)
by: Zhang, Zheyuan, et al.
Published: (2026)
SOREL: A Stochastic Algorithm for Spectral Risks Minimization
by: Ge, Yuze, et al.
Published: (2024)
by: Ge, Yuze, et al.
Published: (2024)
On the Tension Between Optimality and Adversarial Robustness in Policy Optimization
by: Li, Haoran, et al.
Published: (2025)
by: Li, Haoran, et al.
Published: (2025)
Trust-Region Behavior Blending for On-Policy Distillation
by: Plyusov, Daniil, et al.
Published: (2026)
by: Plyusov, Daniil, et al.
Published: (2026)
A Combinatorial Approach to Neural Emergent Communication
by: Zhang, Zheyuan
Published: (2024)
by: Zhang, Zheyuan
Published: (2024)
Beyond Sharp Minima: Robust LLM Unlearning via Feedback-Guided Multi-Point Optimization
by: Wu, Wenhan, et al.
Published: (2025)
by: Wu, Wenhan, et al.
Published: (2025)
Feasibility-Driven Trust Region Bayesian Optimization
by: Ascia, Paolo, et al.
Published: (2025)
by: Ascia, Paolo, et al.
Published: (2025)
Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games
by: Ocello, Antonio, et al.
Published: (2025)
by: Ocello, Antonio, et al.
Published: (2025)
Reinforced Model Predictive Control via Trust-Region Quasi-Newton Policy Optimization
by: Brandner, Dean, et al.
Published: (2024)
by: Brandner, Dean, et al.
Published: (2024)
Labeled TrustSet Guided: Batch Active Learning with Reinforcement Learning
by: Cui, Guofeng, et al.
Published: (2026)
by: Cui, Guofeng, et al.
Published: (2026)
A Physics Prior-Guided Dual-Stream Attention Network for Motion Prediction of Elastic Bragg Breakwaters
by: Jiang, Lianzi, et al.
Published: (2025)
by: Jiang, Lianzi, et al.
Published: (2025)
CTR-LoRA: Curvature-Aware and Trust-Region Guided Low-Rank Adaptation for Large Language Models
by: Wang, Zhuxuanzi, et al.
Published: (2025)
by: Wang, Zhuxuanzi, et al.
Published: (2025)
OGLS-SD: On-Policy Self-Distillation with Outcome-Guided Logit Steering for LLM Reasoning
by: Yang, Yuxiao, et al.
Published: (2026)
by: Yang, Yuxiao, et al.
Published: (2026)
Policy4OOD: A Knowledge-Guided World Model for Policy Intervention Simulation against the Opioid Overdose Crisis
by: Ma, Yijun, et al.
Published: (2026)
by: Ma, Yijun, et al.
Published: (2026)
Diffusion Policies creating a Trust Region for Offline Reinforcement Learning
by: Chen, Tianyu, et al.
Published: (2024)
by: Chen, Tianyu, et al.
Published: (2024)
Rethinking Trust Region Bayesian Optimization in High Dimensions
by: Tang, Wei-Ting, et al.
Published: (2026)
by: Tang, Wei-Ting, et al.
Published: (2026)
TRE: Encouraging Exploration in the Trust Region
by: Huang, Chao, et al.
Published: (2026)
by: Huang, Chao, et al.
Published: (2026)
PPO-BR: Dual-Signal Entropy-Reward Adaptation for Trust Region Policy Optimization
by: Rahman, Ben
Published: (2025)
by: Rahman, Ben
Published: (2025)
Trust Region Constrained Bayesian Optimization with Penalized Constraint Handling
by: Chowdhury, Raju, et al.
Published: (2026)
by: Chowdhury, Raju, et al.
Published: (2026)
Enhancing Trust-Region Bayesian Optimization via Newton Methods
by: Chen, Quanlin, et al.
Published: (2025)
by: Chen, Quanlin, et al.
Published: (2025)
Inpainting-Guided Policy Optimization for Diffusion Large Language Models
by: Zhao, Siyan, et al.
Published: (2025)
by: Zhao, Siyan, et al.
Published: (2025)
TrasMuon: Trust-Region Adaptive Scaling for Orthogonalized Momentum Optimizers
by: Cheng, Peng, et al.
Published: (2026)
by: Cheng, Peng, et al.
Published: (2026)
Regional Expected Improvement for Efficient Trust Region Selection in High-Dimensional Bayesian Optimization
by: Namura, Nobuo, et al.
Published: (2024)
by: Namura, Nobuo, et al.
Published: (2024)
Enhancing the Robustness of QMIX against State-adversarial Attacks
by: Guo, Weiran, et al.
Published: (2023)
by: Guo, Weiran, et al.
Published: (2023)
Similar Items
-
Answer First, Reason Later: Aligning Search Relevance via Mode-Balanced Reinforcement Learning
by: Zhang, Shijie, et al.
Published: (2026) -
Trust-Region Adaptive Policy Optimization
by: Su, Mingyu, et al.
Published: (2025) -
CLPO: Curriculum Learning meets Policy Optimization for LLM Reasoning
by: Zhang, Shijie, et al.
Published: (2025) -
From Item-Only to Query-Item: Query-Conditioned Generative Search with QGS in Quark
by: Song, Yanglong, et al.
Published: (2026) -
Trust Regions Sell, But Who's Buying? Overlap Geometry as an Alternative Trust Region for Policy Optimization
by: Trivedi, Gaurish, et al.
Published: (2026)