Extreme Value Policy Optimization for Safe Reinforcement Learning
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Gao, Shiqing, Zhou, Yihang, Shao, Shuai, Luo, Haoyu, Bing, Yiheng, Ding, Jiaxin, Fu, Luoyi, Wang, Xinbing |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Controlling Underestimation Bias in Constrained Reinforcement Learning for Safe Exploration
von: Gao, Shiqing, et al.
Veröffentlicht: (2026)
von: Gao, Shiqing, et al.
Veröffentlicht: (2026)
Exterior Penalty Policy Optimization with Penalty Metric Network under Constraints
von: Gao, Shiqing, et al.
Veröffentlicht: (2024)
von: Gao, Shiqing, et al.
Veröffentlicht: (2024)
Characterizing the Influence of Topology on Graph Learning Tasks
von: Wu, Kailong, et al.
Veröffentlicht: (2024)
von: Wu, Kailong, et al.
Veröffentlicht: (2024)
Constraint-Conditioned Policy Optimization for Versatile Safe Reinforcement Learning
von: Yao, Yihang, et al.
Veröffentlicht: (2023)
von: Yao, Yihang, et al.
Veröffentlicht: (2023)
Feasibility Consistent Representation Learning for Safe Reinforcement Learning
von: Cen, Zhepeng, et al.
Veröffentlicht: (2024)
von: Cen, Zhepeng, et al.
Veröffentlicht: (2024)
CHAINSFORMER: Numerical Reasoning on Knowledge Graphs from a Chain Perspective
von: Zhao, Ze, et al.
Veröffentlicht: (2025)
von: Zhao, Ze, et al.
Veröffentlicht: (2025)
OASIS: Conditional Distribution Shaping for Offline Safe Reinforcement Learning
von: Yao, Yihang, et al.
Veröffentlicht: (2024)
von: Yao, Yihang, et al.
Veröffentlicht: (2024)
Exchange Policy Optimization Algorithm for Semi-Infinite Safe Reinforcement Learning
von: Zhang, Jiaming, et al.
Veröffentlicht: (2025)
von: Zhang, Jiaming, et al.
Veröffentlicht: (2025)
Policy Bifurcation in Safe Reinforcement Learning
von: Zou, Wenjun, et al.
Veröffentlicht: (2024)
von: Zou, Wenjun, et al.
Veröffentlicht: (2024)
Off-Policy Primal-Dual Safe Reinforcement Learning
von: Wu, Zifan, et al.
Veröffentlicht: (2024)
von: Wu, Zifan, et al.
Veröffentlicht: (2024)
OXYGENERATOR: Reconstructing Global Ocean Deoxygenation Over a Century with Deep Learning
von: Lu, Bin, et al.
Veröffentlicht: (2024)
von: Lu, Bin, et al.
Veröffentlicht: (2024)
Constrained Policy Optimization with Explicit Behavior Density for Offline Reinforcement Learning
von: Zhang, Jing, et al.
Veröffentlicht: (2023)
von: Zhang, Jing, et al.
Veröffentlicht: (2023)
Action Robust Reinforcement Learning via Optimal Adversary Aware Policy Optimization
von: Nie, Buqing, et al.
Veröffentlicht: (2025)
von: Nie, Buqing, et al.
Veröffentlicht: (2025)
Transferable Reinforcement Learning via Probabilistic Latent Embeddings and Dynamic Policy Adaptation for Sim-to-Real Deployment
von: Han, Gengyue, et al.
Veröffentlicht: (2026)
von: Han, Gengyue, et al.
Veröffentlicht: (2026)
Towards Safe Reinforcement Learning via Constraining Conditional Value-at-Risk
von: Ying, Chengyang, et al.
Veröffentlicht: (2022)
von: Ying, Chengyang, et al.
Veröffentlicht: (2022)
Path-Space Mirror Descent for On-Policy Reinforcement Learning under the Generalized Schrödinger Bridge
von: Gong, Yuehu, et al.
Veröffentlicht: (2026)
von: Gong, Yuehu, et al.
Veröffentlicht: (2026)
What Makes Value Learning Efficient in Residual Reinforcement Learning?
von: Ma, Guozheng, et al.
Veröffentlicht: (2026)
von: Ma, Guozheng, et al.
Veröffentlicht: (2026)
Feasible Policy Iteration for Safe Reinforcement Learning
von: Yang, Yujie, et al.
Veröffentlicht: (2023)
von: Yang, Yujie, et al.
Veröffentlicht: (2023)
Diffusion Policies with Value-Conditional Optimization for Offline Reinforcement Learning
von: Ma, Yunchang, et al.
Veröffentlicht: (2025)
von: Ma, Yunchang, et al.
Veröffentlicht: (2025)
SafeAdapt: Provably Safe Policy Updates in Deep Reinforcement Learning
von: Anisimov, Maksim, et al.
Veröffentlicht: (2026)
von: Anisimov, Maksim, et al.
Veröffentlicht: (2026)
RADAR: Reasoning as Discrimination with Aligned Representations for LLM-based Knowledge Graph Reasoning
von: Xue, Bo, et al.
Veröffentlicht: (2026)
von: Xue, Bo, et al.
Veröffentlicht: (2026)
Safety through Permissibility: Shield Construction for Fast and Safe Reinforcement Learning
von: Politowicz, Alexander, et al.
Veröffentlicht: (2024)
von: Politowicz, Alexander, et al.
Veröffentlicht: (2024)
Preferred-Action-Optimized Diffusion Policies for Offline Reinforcement Learning
von: Zhang, Tianle, et al.
Veröffentlicht: (2024)
von: Zhang, Tianle, et al.
Veröffentlicht: (2024)
Semiparametric Off-Policy Inference for Optimal Policy Values under Possible Non-Uniqueness
von: Wei, Haoyu
Veröffentlicht: (2025)
von: Wei, Haoyu
Veröffentlicht: (2025)
Off-Policy Safe Reinforcement Learning with Constrained Optimistic Exploration
von: Li, Guopeng, et al.
Veröffentlicht: (2026)
von: Li, Guopeng, et al.
Veröffentlicht: (2026)
Latent Safety-Constrained Policy Approach for Safe Offline Reinforcement Learning
von: Koirala, Prajwal, et al.
Veröffentlicht: (2024)
von: Koirala, Prajwal, et al.
Veröffentlicht: (2024)
Safe Reinforcement Learning using Action Projection: Safeguard the Policy or the Environment?
von: Markgraf, Hannah, et al.
Veröffentlicht: (2025)
von: Markgraf, Hannah, et al.
Veröffentlicht: (2025)
Balance Reward and Safety Optimization for Safe Reinforcement Learning: A Perspective of Gradient Manipulation
von: Gu, Shangding, et al.
Veröffentlicht: (2024)
von: Gu, Shangding, et al.
Veröffentlicht: (2024)
Causally-Enhanced Reinforcement Policy Optimization
von: Wang, Xiangqi, et al.
Veröffentlicht: (2025)
von: Wang, Xiangqi, et al.
Veröffentlicht: (2025)
Safe Flow Q-Learning: Offline Safe Reinforcement Learning with Reachability-Based Flow Policies
von: Tayal, Mumuksh, et al.
Veröffentlicht: (2026)
von: Tayal, Mumuksh, et al.
Veröffentlicht: (2026)
Online Optimization for Offline Safe Reinforcement Learning
von: Chemingui, Yassine, et al.
Veröffentlicht: (2025)
von: Chemingui, Yassine, et al.
Veröffentlicht: (2025)
Your Offline Policy is Not Trustworthy: Bilevel Reinforcement Learning for Sequential Portfolio Optimization
von: Yuan, Haochen, et al.
Veröffentlicht: (2025)
von: Yuan, Haochen, et al.
Veröffentlicht: (2025)
Diffusion-based Reinforcement Learning via Q-weighted Variational Policy Optimization
von: Ding, Shutong, et al.
Veröffentlicht: (2024)
von: Ding, Shutong, et al.
Veröffentlicht: (2024)
Constraint-Adaptive Policy Switching for Offline Safe Reinforcement Learning
von: Chemingui, Yassine, et al.
Veröffentlicht: (2024)
von: Chemingui, Yassine, et al.
Veröffentlicht: (2024)
VisPCO: Visual Token Pruning Configuration Optimization via Budget-Aware Pareto-Frontier Learning for Vision-Language Models
von: Ji, Huawei, et al.
Veröffentlicht: (2026)
von: Ji, Huawei, et al.
Veröffentlicht: (2026)
GenPO: Generative Diffusion Models Meet On-Policy Reinforcement Learning
von: Ding, Shutong, et al.
Veröffentlicht: (2025)
von: Ding, Shutong, et al.
Veröffentlicht: (2025)
Policy Improvement Reinforcement Learning
von: Wang, Huaiyang, et al.
Veröffentlicht: (2026)
von: Wang, Huaiyang, et al.
Veröffentlicht: (2026)
Conditional Sequence Modeling for Safe Reinforcement Learning
von: Bai, Wensong, et al.
Veröffentlicht: (2026)
von: Bai, Wensong, et al.
Veröffentlicht: (2026)
Instrumental Variable Value Iteration for Causal Offline Reinforcement Learning
von: Liao, Luofeng, et al.
Veröffentlicht: (2021)
von: Liao, Luofeng, et al.
Veröffentlicht: (2021)
From Learning to Mastery: Achieving Safe and Efficient Real-World Autonomous Driving with Human-In-The-Loop Reinforcement Learning
von: Zeqiao, Li, et al.
Veröffentlicht: (2025)
von: Zeqiao, Li, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Controlling Underestimation Bias in Constrained Reinforcement Learning for Safe Exploration
von: Gao, Shiqing, et al.
Veröffentlicht: (2026) -
Exterior Penalty Policy Optimization with Penalty Metric Network under Constraints
von: Gao, Shiqing, et al.
Veröffentlicht: (2024) -
Characterizing the Influence of Topology on Graph Learning Tasks
von: Wu, Kailong, et al.
Veröffentlicht: (2024) -
Constraint-Conditioned Policy Optimization for Versatile Safe Reinforcement Learning
von: Yao, Yihang, et al.
Veröffentlicht: (2023) -
Feasibility Consistent Representation Learning for Safe Reinforcement Learning
von: Cen, Zhepeng, et al.
Veröffentlicht: (2024)