Towards Fast Safe Online Reinforcement Learning via Policy Finetuning
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Chen, Keru, Wei, Honghao, Deng, Zhigang, Lin, Sen |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Constraint-Adaptive Policy Switching for Offline Safe Reinforcement Learning
von: Chemingui, Yassine, et al.
Veröffentlicht: (2024)
von: Chemingui, Yassine, et al.
Veröffentlicht: (2024)
HIPO: Instruction Hierarchy via Constrained Reinforcement Learning
von: Chen, Keru, et al.
Veröffentlicht: (2026)
von: Chen, Keru, et al.
Veröffentlicht: (2026)
OLLIE: Imitation Learning from Offline Pretraining to Online Finetuning
von: Yue, Sheng, et al.
Veröffentlicht: (2024)
von: Yue, Sheng, et al.
Veröffentlicht: (2024)
Reinforcement Learning Gradients as Vitamin for Online Finetuning Decision Transformers
von: Yan, Kai, et al.
Veröffentlicht: (2024)
von: Yan, Kai, et al.
Veröffentlicht: (2024)
Towards Safe Reinforcement Learning via Constraining Conditional Value-at-Risk
von: Ying, Chengyang, et al.
Veröffentlicht: (2022)
von: Ying, Chengyang, et al.
Veröffentlicht: (2022)
Online Optimization for Offline Safe Reinforcement Learning
von: Chemingui, Yassine, et al.
Veröffentlicht: (2025)
von: Chemingui, Yassine, et al.
Veröffentlicht: (2025)
SafeAdapt: Provably Safe Policy Updates in Deep Reinforcement Learning
von: Anisimov, Maksim, et al.
Veröffentlicht: (2026)
von: Anisimov, Maksim, et al.
Veröffentlicht: (2026)
Enhancing Safety in Reinforcement Learning with Human Feedback via Rectified Policy Optimization
von: Peng, Xiyue, et al.
Veröffentlicht: (2024)
von: Peng, Xiyue, et al.
Veröffentlicht: (2024)
Information-Directed Offline-to-Online Reinforcement Learning
von: Chen, Keru
Veröffentlicht: (2026)
von: Chen, Keru
Veröffentlicht: (2026)
Safe Flow Q-Learning: Offline Safe Reinforcement Learning with Reachability-Based Flow Policies
von: Tayal, Mumuksh, et al.
Veröffentlicht: (2026)
von: Tayal, Mumuksh, et al.
Veröffentlicht: (2026)
Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search
von: Najib, Amna, et al.
Veröffentlicht: (2024)
von: Najib, Amna, et al.
Veröffentlicht: (2024)
Learning by Doing: An Online Causal Reinforcement Learning Framework with Causal-Aware Policy
von: Cai, Ruichu, et al.
Veröffentlicht: (2024)
von: Cai, Ruichu, et al.
Veröffentlicht: (2024)
Constraint-Conditioned Policy Optimization for Versatile Safe Reinforcement Learning
von: Yao, Yihang, et al.
Veröffentlicht: (2023)
von: Yao, Yihang, et al.
Veröffentlicht: (2023)
Flow-Based Policy for Online Reinforcement Learning
von: Lv, Lei, et al.
Veröffentlicht: (2025)
von: Lv, Lei, et al.
Veröffentlicht: (2025)
SB-TRPO: Towards Safe Reinforcement Learning with Hard Constraints
von: Wagner, Dominik, et al.
Veröffentlicht: (2025)
von: Wagner, Dominik, et al.
Veröffentlicht: (2025)
Fast Explanations via Policy Gradient-Optimized Explainer
von: Pan, Deng, et al.
Veröffentlicht: (2024)
von: Pan, Deng, et al.
Veröffentlicht: (2024)
How to Weight Multitask Finetuning? Fast Previews via Bayesian Model-Merging
von: Maldonado, Hugo Monzón, et al.
Veröffentlicht: (2024)
von: Maldonado, Hugo Monzón, et al.
Veröffentlicht: (2024)
GUARD: A Safe Reinforcement Learning Benchmark
von: Zhao, Weiye, et al.
Veröffentlicht: (2023)
von: Zhao, Weiye, et al.
Veröffentlicht: (2023)
Online Reinforcement Learning in Non-Stationary Context-Driven Environments
von: Hamadanian, Pouya, et al.
Veröffentlicht: (2023)
von: Hamadanian, Pouya, et al.
Veröffentlicht: (2023)
Towards Off-Policy Reinforcement Learning for Ranking Policies with Human Feedback
von: Xiao, Teng, et al.
Veröffentlicht: (2024)
von: Xiao, Teng, et al.
Veröffentlicht: (2024)
Towards Efficient Online Tuning of VLM Agents via Counterfactual Soft Reinforcement Learning
von: Feng, Lang, et al.
Veröffentlicht: (2025)
von: Feng, Lang, et al.
Veröffentlicht: (2025)
Representation Finetuning for Continual Learning
von: Luo, Haihua, et al.
Veröffentlicht: (2026)
von: Luo, Haihua, et al.
Veröffentlicht: (2026)
Online Finetuning Decision Transformers with Pure RL Gradients
von: Luo, Junkai, et al.
Veröffentlicht: (2026)
von: Luo, Junkai, et al.
Veröffentlicht: (2026)
HERO: Human-Feedback Efficient Reinforcement Learning for Online Diffusion Model Finetuning
von: Hiranaka, Ayano, et al.
Veröffentlicht: (2024)
von: Hiranaka, Ayano, et al.
Veröffentlicht: (2024)
Fine-Tuning Diffusion Models for Molecular Generation via Reinforcement Learning and Fast Sampling
von: Lin, Guang, et al.
Veröffentlicht: (2026)
von: Lin, Guang, et al.
Veröffentlicht: (2026)
Decoupled Guidance Diffusion for Adaptive Offline Safe Reinforcement Learning
von: Chen, Rufeng, et al.
Veröffentlicht: (2026)
von: Chen, Rufeng, et al.
Veröffentlicht: (2026)
Reinforcement Learning by Guided Safe Exploration
von: Yang, Qisong, et al.
Veröffentlicht: (2023)
von: Yang, Qisong, et al.
Veröffentlicht: (2023)
Probabilistic Shielding for Safe Reinforcement Learning
von: Court, Edwin Hamel-De le, et al.
Veröffentlicht: (2025)
von: Court, Edwin Hamel-De le, et al.
Veröffentlicht: (2025)
Towards Few-Shot Adaptation of Foundation Models via Multitask Finetuning
von: Xu, Zhuoyan, et al.
Veröffentlicht: (2024)
von: Xu, Zhuoyan, et al.
Veröffentlicht: (2024)
Safe RLHF-V: Safe Reinforcement Learning from Multi-modal Human Feedback
von: Ji, Jiaming, et al.
Veröffentlicht: (2025)
von: Ji, Jiaming, et al.
Veröffentlicht: (2025)
Safe Reinforcement Learning in Black-Box Environments via Adaptive Shielding
von: Bethell, Daniel, et al.
Veröffentlicht: (2024)
von: Bethell, Daniel, et al.
Veröffentlicht: (2024)
SAMG: Offline-to-Online Reinforcement Learning via State-Action-Conditional Offline Model Guidance
von: Zhang, Liyu, et al.
Veröffentlicht: (2024)
von: Zhang, Liyu, et al.
Veröffentlicht: (2024)
Towards Interpretable Reinforcement Learning with Constrained Normalizing Flow Policies
von: Rietz, Finn, et al.
Veröffentlicht: (2024)
von: Rietz, Finn, et al.
Veröffentlicht: (2024)
PRDP: Proximal Reward Difference Prediction for Large-Scale Reward Finetuning of Diffusion Models
von: Deng, Fei, et al.
Veröffentlicht: (2024)
von: Deng, Fei, et al.
Veröffentlicht: (2024)
Offline Inverse Constrained Reinforcement Learning for Safe-Critical Decision Making in Healthcare
von: Fang, Nan, et al.
Veröffentlicht: (2024)
von: Fang, Nan, et al.
Veröffentlicht: (2024)
Preferred-Action-Optimized Diffusion Policies for Offline Reinforcement Learning
von: Zhang, Tianle, et al.
Veröffentlicht: (2024)
von: Zhang, Tianle, et al.
Veröffentlicht: (2024)
Learning Dynamics of VLM Finetuning
von: Zhang, Jusheng, et al.
Veröffentlicht: (2025)
von: Zhang, Jusheng, et al.
Veröffentlicht: (2025)
Safe and Balanced: A Framework for Constrained Multi-Objective Reinforcement Learning
von: Gu, Shangding, et al.
Veröffentlicht: (2024)
von: Gu, Shangding, et al.
Veröffentlicht: (2024)
Safe Exploration via Policy Priors
von: Wendl, Manuel, et al.
Veröffentlicht: (2026)
von: Wendl, Manuel, et al.
Veröffentlicht: (2026)
dUltra: Ultra-Fast Diffusion Language Models via Reinforcement Learning
von: Chen, Shirui, et al.
Veröffentlicht: (2025)
von: Chen, Shirui, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Constraint-Adaptive Policy Switching for Offline Safe Reinforcement Learning
von: Chemingui, Yassine, et al.
Veröffentlicht: (2024) -
HIPO: Instruction Hierarchy via Constrained Reinforcement Learning
von: Chen, Keru, et al.
Veröffentlicht: (2026) -
OLLIE: Imitation Learning from Offline Pretraining to Online Finetuning
von: Yue, Sheng, et al.
Veröffentlicht: (2024) -
Reinforcement Learning Gradients as Vitamin for Online Finetuning Decision Transformers
von: Yan, Kai, et al.
Veröffentlicht: (2024) -
Towards Safe Reinforcement Learning via Constraining Conditional Value-at-Risk
von: Ying, Chengyang, et al.
Veröffentlicht: (2022)