GAS: Enhancing Reward-Cost Balance of Generative Model-assisted Offline Safe RL
Fuente:
arXiv
Salvato in:
| Autori principali: | Liu, Zifan, Li, Xinran, Chen, Shibo, Zhang, Jun |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Puzzle it Out: Local-to-Global World Model for Offline Multi-Agent Reinforcement Learning
di: Li, Sijia, et al.
Pubblicazione: (2026)
di: Li, Sijia, et al.
Pubblicazione: (2026)
Reinforcement Learning with Intrinsically Motivated Feedback Graph for Lost-sales Inventory Control
di: Liu, Zifan, et al.
Pubblicazione: (2024)
di: Liu, Zifan, et al.
Pubblicazione: (2024)
Individual Contributions as Intrinsic Exploration Scaffolds for Multi-agent Reinforcement Learning
di: Li, Xinran, et al.
Pubblicazione: (2024)
di: Li, Xinran, et al.
Pubblicazione: (2024)
Advancing Safe Mechanical Ventilation Using Offline RL With Hybrid Actions and Clinically Aligned Rewards
di: Yousuf, Muhammad Hamza, et al.
Pubblicazione: (2025)
di: Yousuf, Muhammad Hamza, et al.
Pubblicazione: (2025)
OMG-RL:Offline Model-based Guided Reward Learning for Heparin Treatment
di: Lim, Yooseok, et al.
Pubblicazione: (2024)
di: Lim, Yooseok, et al.
Pubblicazione: (2024)
Model-Based Proactive Cost Generation for Learning Safe Policies Offline with Limited Violation Data
di: Xue, Ruiqi, et al.
Pubblicazione: (2026)
di: Xue, Ruiqi, et al.
Pubblicazione: (2026)
Enhancing Generative Auto-bidding with Offline Reward Evaluation and Policy Search
di: Mou, Zhiyu, et al.
Pubblicazione: (2025)
di: Mou, Zhiyu, et al.
Pubblicazione: (2025)
Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood
di: Yao, Qingmao, et al.
Pubblicazione: (2025)
di: Yao, Qingmao, et al.
Pubblicazione: (2025)
Are Expressive Models Truly Necessary for Offline RL?
di: Wang, Guan, et al.
Pubblicazione: (2024)
di: Wang, Guan, et al.
Pubblicazione: (2024)
Budgeting Counterfactual for Offline RL
di: Liu, Yao, et al.
Pubblicazione: (2023)
di: Liu, Yao, et al.
Pubblicazione: (2023)
STO-RL: Offline RL under Sparse Rewards via LLM-Guided Subgoal Temporal Order
di: Gu, Chengyang, et al.
Pubblicazione: (2026)
di: Gu, Chengyang, et al.
Pubblicazione: (2026)
Safe Offline Reinforcement Learning with Real-Time Budget Constraints
di: Lin, Qian, et al.
Pubblicazione: (2023)
di: Lin, Qian, et al.
Pubblicazione: (2023)
Accelerating Diffusion Planners in Offline RL via Reward-Aware Consistency Trajectory Distillation
di: Duan, Xintong, et al.
Pubblicazione: (2025)
di: Duan, Xintong, et al.
Pubblicazione: (2025)
Dual Alignment Maximin Optimization for Offline Model-based RL
di: Zhou, Chi, et al.
Pubblicazione: (2025)
di: Zhou, Chi, et al.
Pubblicazione: (2025)
A Tractable Inference Perspective of Offline RL
di: Liu, Xuejie, et al.
Pubblicazione: (2023)
di: Liu, Xuejie, et al.
Pubblicazione: (2023)
An Empirical Study on the Effectiveness of Incorporating Offline RL As Online RL Subroutines
di: Su, Jianhai, et al.
Pubblicazione: (2025)
di: Su, Jianhai, et al.
Pubblicazione: (2025)
Policy-regularized Offline Multi-objective Reinforcement Learning
di: Lin, Qian, et al.
Pubblicazione: (2024)
di: Lin, Qian, et al.
Pubblicazione: (2024)
CROP: Conservative Reward for Model-based Offline Policy Optimization
di: Li, Hao, et al.
Pubblicazione: (2023)
di: Li, Hao, et al.
Pubblicazione: (2023)
Automatic Reward Shaping from Confounded Offline Data
di: Li, Mingxuan, et al.
Pubblicazione: (2025)
di: Li, Mingxuan, et al.
Pubblicazione: (2025)
Scalable Offline Model-Based RL with Action Chunks
di: Park, Kwanyoung, et al.
Pubblicazione: (2025)
di: Park, Kwanyoung, et al.
Pubblicazione: (2025)
Safe Offline Reinforcement Learning with Feasibility-Guided Diffusion Model
di: Zheng, Yinan, et al.
Pubblicazione: (2024)
di: Zheng, Yinan, et al.
Pubblicazione: (2024)
Decoupled Guidance Diffusion for Adaptive Offline Safe Reinforcement Learning
di: Chen, Rufeng, et al.
Pubblicazione: (2026)
di: Chen, Rufeng, et al.
Pubblicazione: (2026)
Reward Generation via Large Vision-Language Model in Offline Reinforcement Learning
di: Lee, Younghwan, et al.
Pubblicazione: (2025)
di: Lee, Younghwan, et al.
Pubblicazione: (2025)
Selective Uncertainty Propagation in Offline RL
di: Krishnamurthy, Sanath Kumar, et al.
Pubblicazione: (2023)
di: Krishnamurthy, Sanath Kumar, et al.
Pubblicazione: (2023)
Decoupled Prioritized Resampling for Offline RL
di: Yue, Yang, et al.
Pubblicazione: (2023)
di: Yue, Yang, et al.
Pubblicazione: (2023)
Augmenting Offline RL with Unlabeled Data
di: Wang, Zhao, et al.
Pubblicazione: (2024)
di: Wang, Zhao, et al.
Pubblicazione: (2024)
Balance Reward and Safety Optimization for Safe Reinforcement Learning: A Perspective of Gradient Manipulation
di: Gu, Shangding, et al.
Pubblicazione: (2024)
di: Gu, Shangding, et al.
Pubblicazione: (2024)
Towards Improving Reward Design in RL: A Reward Alignment Metric for RL Practitioners
di: Muslimani, Calarina, et al.
Pubblicazione: (2025)
di: Muslimani, Calarina, et al.
Pubblicazione: (2025)
Exploring and Addressing Reward Confusion in Offline Preference Learning
di: Chen, Xin, et al.
Pubblicazione: (2024)
di: Chen, Xin, et al.
Pubblicazione: (2024)
Boundary-to-Region Supervision for Offline Safe Reinforcement Learning
di: Su, Huikang, et al.
Pubblicazione: (2025)
di: Su, Huikang, et al.
Pubblicazione: (2025)
Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone
di: Mark, Max Sobol, et al.
Pubblicazione: (2024)
di: Mark, Max Sobol, et al.
Pubblicazione: (2024)
Scaling Offline Model-Based RL via Jointly-Optimized World-Action Model Pretraining
di: Cheng, Jie, et al.
Pubblicazione: (2024)
di: Cheng, Jie, et al.
Pubblicazione: (2024)
Offline Reinforcement Learning with Imputed Rewards
di: Romeo, Carlo, et al.
Pubblicazione: (2024)
di: Romeo, Carlo, et al.
Pubblicazione: (2024)
Design Considerations in Offline Preference-based RL
di: Agarwal, Alekh, et al.
Pubblicazione: (2025)
di: Agarwal, Alekh, et al.
Pubblicazione: (2025)
OGBench: Benchmarking Offline Goal-Conditioned RL
di: Park, Seohong, et al.
Pubblicazione: (2024)
di: Park, Seohong, et al.
Pubblicazione: (2024)
Offline vs. Online Learning in Model-based RL: Lessons for Data Collection Strategies
di: Chen, Jiaqi, et al.
Pubblicazione: (2025)
di: Chen, Jiaqi, et al.
Pubblicazione: (2025)
Decision MetaMamba: Enhancing Selective SSM in Offline RL with Heterogeneous Sequence Mixing
di: Kim, Wall, et al.
Pubblicazione: (2026)
di: Kim, Wall, et al.
Pubblicazione: (2026)
Decision MetaMamba: Enhancing Selective SSM in Offline RL with Heterogeneous Sequence Mixing
di: Kim, Wall, et al.
Pubblicazione: (2024)
di: Kim, Wall, et al.
Pubblicazione: (2024)
Safety Modulation: Enhancing Safety in Reinforcement Learning through Cost-Modulated Rewards
di: Zhang, Hanping, et al.
Pubblicazione: (2025)
di: Zhang, Hanping, et al.
Pubblicazione: (2025)
Online Optimization for Offline Safe Reinforcement Learning
di: Chemingui, Yassine, et al.
Pubblicazione: (2025)
di: Chemingui, Yassine, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Puzzle it Out: Local-to-Global World Model for Offline Multi-Agent Reinforcement Learning
di: Li, Sijia, et al.
Pubblicazione: (2026) -
Reinforcement Learning with Intrinsically Motivated Feedback Graph for Lost-sales Inventory Control
di: Liu, Zifan, et al.
Pubblicazione: (2024) -
Individual Contributions as Intrinsic Exploration Scaffolds for Multi-agent Reinforcement Learning
di: Li, Xinran, et al.
Pubblicazione: (2024) -
Advancing Safe Mechanical Ventilation Using Offline RL With Hybrid Actions and Clinically Aligned Rewards
di: Yousuf, Muhammad Hamza, et al.
Pubblicazione: (2025) -
OMG-RL:Offline Model-based Guided Reward Learning for Heparin Treatment
di: Lim, Yooseok, et al.
Pubblicazione: (2024)