Offline Safe Policy Optimization From Heterogeneous Feedback
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Gong, Ze, Varakantham, Pradeep, Kumar, Akshat |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Offline Safe Reinforcement Learning Using Trajectory Classification
par: Gong, Ze, et autres
Publié: (2024)
par: Gong, Ze, et autres
Publié: (2024)
UNIQ: Offline Inverse Q-learning for Avoiding Undesirable Demonstrations
par: Hoang, Huy, et autres
Publié: (2024)
par: Hoang, Huy, et autres
Publié: (2024)
SPRINQL: Sub-optimal Demonstrations driven Offline Imitation Learning
par: Hoang, Huy, et autres
Publié: (2024)
par: Hoang, Huy, et autres
Publié: (2024)
Imitate the Good and Avoid the Bad: An Incremental Approach to Safe Reinforcement Learning
par: Hoang, Huy, et autres
Publié: (2023)
par: Hoang, Huy, et autres
Publié: (2023)
Semantic Loss Guided Data Efficient Supervised Fine Tuning for Safe Responses in LLMs
par: Lu, Yuxiao, et autres
Publié: (2024)
par: Lu, Yuxiao, et autres
Publié: (2024)
Efficient Unsupervised Environment Design through Hierarchical Policy Representation Learning
par: Li, Dexun, et autres
Publié: (2026)
par: Li, Dexun, et autres
Publié: (2026)
Learning What to Do and What Not To Do: Offline Imitation from Expert and Undesirable Demonstrations
par: Hoang, Huy, et autres
Publié: (2025)
par: Hoang, Huy, et autres
Publié: (2025)
Beyond Hard Constraints: Budget-Conditioned Reachability For Safe Offline Reinforcement Learning
par: Brahmanage, Janaka Chathuranga, et autres
Publié: (2026)
par: Brahmanage, Janaka Chathuranga, et autres
Publié: (2026)
Optimizing Ride-Pooling Operations with Extended Pickup and Drop-Off Flexibility
par: Jiang, Hao, et autres
Publié: (2025)
par: Jiang, Hao, et autres
Publié: (2025)
Enhancing the Hierarchical Environment Design via Generative Trajectory Modeling
par: Li, Dexun, et autres
Publié: (2023)
par: Li, Dexun, et autres
Publié: (2023)
Unlocking Large Language Model's Planning Capabilities with Maximum Diversity Fine-tuning
par: Li, Wenjun, et autres
Publié: (2024)
par: Li, Wenjun, et autres
Publié: (2024)
Automatic LLM Red Teaming
par: Belaire, Roman, et autres
Publié: (2025)
par: Belaire, Roman, et autres
Publié: (2025)
Handling Long and Richly Constrained Tasks through Constrained Hierarchical Reinforcement Learning
par: Lu, Yuxiao, et autres
Publié: (2023)
par: Lu, Yuxiao, et autres
Publié: (2023)
On Minimizing Adversarial Counterfactual Error in Adversarial RL
par: Belaire, Roman, et autres
Publié: (2024)
par: Belaire, Roman, et autres
Publié: (2024)
Preserving the Privacy of Reward Functions in MDPs through Deception
par: Chirra, Shashank Reddy, et autres
Publié: (2024)
par: Chirra, Shashank Reddy, et autres
Publié: (2024)
Safety through feedback in Constrained RL
par: Chirra, Shashank Reddy, et autres
Publié: (2024)
par: Chirra, Shashank Reddy, et autres
Publié: (2024)
TraCeS: Trajectory Based Credit Assignment From Sparse Safety Feedback
par: Low, Siow Meng, et autres
Publié: (2025)
par: Low, Siow Meng, et autres
Publié: (2025)
Imitating Cost-Constrained Behaviors in Reinforcement Learning
par: Shao, Qian, et autres
Publié: (2024)
par: Shao, Qian, et autres
Publié: (2024)
EduQate: Generating Adaptive Curricula through RMABs in Education Settings
par: Tio, Sidney, et autres
Publié: (2024)
par: Tio, Sidney, et autres
Publié: (2024)
On Discovering Algorithms for Adversarial Imitation Learning
par: Chirra, Shashank Reddy, et autres
Publié: (2025)
par: Chirra, Shashank Reddy, et autres
Publié: (2025)
Safe Reinforcement Learning with Learned Non-Markovian Safety Constraints
par: Low, Siow Meng, et autres
Publié: (2024)
par: Low, Siow Meng, et autres
Publié: (2024)
On Learning Informative Trajectory Embeddings for Imitation, Classification and Regression
par: Ge, Zichang, et autres
Publié: (2025)
par: Ge, Zichang, et autres
Publié: (2025)
Regret-Based Defense in Adversarial Reinforcement Learning
par: Belaire, Roman, et autres
Publié: (2023)
par: Belaire, Roman, et autres
Publié: (2023)
Safe Equilibrium Policy Optimization for Strategic Agent Policies
par: Arumugam, Karthika, et autres
Publié: (2026)
par: Arumugam, Karthika, et autres
Publié: (2026)
Online Optimization for Offline Safe Reinforcement Learning
par: Chemingui, Yassine, et autres
Publié: (2025)
par: Chemingui, Yassine, et autres
Publié: (2025)
Offline Policy Optimization with Posterior Sampling
par: Lin, Hongqiang, et autres
Publié: (2026)
par: Lin, Hongqiang, et autres
Publié: (2026)
SafeMIL: Learning Offline Safe Imitation Policy from Non-Preferred Trajectories
par: Burnwal, Returaj, et autres
Publié: (2025)
par: Burnwal, Returaj, et autres
Publié: (2025)
Constraint-Adaptive Policy Switching for Offline Safe Reinforcement Learning
par: Chemingui, Yassine, et autres
Publié: (2024)
par: Chemingui, Yassine, et autres
Publié: (2024)
Safe Flow Q-Learning: Offline Safe Reinforcement Learning with Reachability-Based Flow Policies
par: Tayal, Mumuksh, et autres
Publié: (2026)
par: Tayal, Mumuksh, et autres
Publié: (2026)
Offline Inverse Constrained Reinforcement Learning for Safe-Critical Decision Making in Healthcare
par: Fang, Nan, et autres
Publié: (2024)
par: Fang, Nan, et autres
Publié: (2024)
FlowPG: Action-constrained Policy Gradient with Normalizing Flows
par: Brahmanage, Janaka Chathuranga, et autres
Publié: (2024)
par: Brahmanage, Janaka Chathuranga, et autres
Publié: (2024)
Federated Offline Policy Optimization with Dual Regularization
par: Yue, Sheng, et autres
Publié: (2024)
par: Yue, Sheng, et autres
Publié: (2024)
IRL for Restless Multi-Armed Bandits with Applications in Maternal and Child Health
par: Jain, Gauri, et autres
Publié: (2024)
par: Jain, Gauri, et autres
Publié: (2024)
COOPO: Cyclic Offline-Online Policy Optimization Algorithm
par: Liu, Qisai, et autres
Publié: (2026)
par: Liu, Qisai, et autres
Publié: (2026)
Model-Based Proactive Cost Generation for Learning Safe Policies Offline with Limited Violation Data
par: Xue, Ruiqi, et autres
Publié: (2026)
par: Xue, Ruiqi, et autres
Publié: (2026)
OSIL: Learning Offline Safe Imitation Policies with Safety Inferred from Non-preferred Trajectories
par: Burnwal, Returaj, et autres
Publié: (2026)
par: Burnwal, Returaj, et autres
Publié: (2026)
Beyond State-Wise Mirror Descent: Offline Policy Optimization with Parametric Policies
par: Li, Xiang, et autres
Publié: (2026)
par: Li, Xiang, et autres
Publié: (2026)
COSBO: Conservative Offline Simulation-Based Policy Optimization
par: Kargar, Eshagh, et autres
Publié: (2024)
par: Kargar, Eshagh, et autres
Publié: (2024)
Safe Planning and Policy Optimization via World Model Learning
par: Latyshev, Artem, et autres
Publié: (2025)
par: Latyshev, Artem, et autres
Publié: (2025)
Analytic Energy-Guided Policy Optimization for Offline Reinforcement Learning
par: Hu, Jifeng, et autres
Publié: (2025)
par: Hu, Jifeng, et autres
Publié: (2025)
Documents similaires
-
Offline Safe Reinforcement Learning Using Trajectory Classification
par: Gong, Ze, et autres
Publié: (2024) -
UNIQ: Offline Inverse Q-learning for Avoiding Undesirable Demonstrations
par: Hoang, Huy, et autres
Publié: (2024) -
SPRINQL: Sub-optimal Demonstrations driven Offline Imitation Learning
par: Hoang, Huy, et autres
Publié: (2024) -
Imitate the Good and Avoid the Bad: An Incremental Approach to Safe Reinforcement Learning
par: Hoang, Huy, et autres
Publié: (2023) -
Semantic Loss Guided Data Efficient Supervised Fine Tuning for Safe Responses in LLMs
par: Lu, Yuxiao, et autres
Publié: (2024)