Taming OOD Actions for Offline Reinforcement Learning: An Advantage-Based Approach
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chen, Xuyang, Yan, Keyu, Cao, Wenhan, Zhao, Lin |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
VIPO: Value Function Inconsistency Penalized Offline Reinforcement Learning
par: Chen, Xuyang, et autres
Publié: (2025)
par: Chen, Xuyang, et autres
Publié: (2025)
Offline Reinforcement Learning with OOD State Correction and OOD Action Suppression
par: Mao, Yixiu, et autres
Publié: (2024)
par: Mao, Yixiu, et autres
Publié: (2024)
One-Step Sampler for Boltzmann Distributions via Drifting
par: Cao, Wenhan, et autres
Publié: (2026)
par: Cao, Wenhan, et autres
Publié: (2026)
Variational OOD State Correction for Offline Reinforcement Learning
par: Jiang, Ke, et autres
Publié: (2025)
par: Jiang, Ke, et autres
Publié: (2025)
Active Advantage-Aligned Online Reinforcement Learning with Offline Data
par: Liu, Xuefeng, et autres
Publié: (2025)
par: Liu, Xuefeng, et autres
Publié: (2025)
An Advantage-based Optimization Method for Reinforcement Learning in Large Action Space
par: Lin, Hai, et autres
Publié: (2024)
par: Lin, Hai, et autres
Publié: (2024)
Preferred-Action-Optimized Diffusion Policies for Offline Reinforcement Learning
par: Zhang, Tianle, et autres
Publié: (2024)
par: Zhang, Tianle, et autres
Publié: (2024)
SALSA-RL: Stability Analysis in the Latent Space of Actions for Reinforcement Learning
par: Li, Xuyang, et autres
Publié: (2025)
par: Li, Xuyang, et autres
Publié: (2025)
Adaptive Advantage-Guided Policy Regularization for Offline Reinforcement Learning
par: Liu, Tenglong, et autres
Publié: (2024)
par: Liu, Tenglong, et autres
Publié: (2024)
Flow Matching for Offline Reinforcement Learning with Discrete Actions
par: Khan, Fairoz Nower, et autres
Publié: (2026)
par: Khan, Fairoz Nower, et autres
Publié: (2026)
An Investigation of Offline Reinforcement Learning in Factorisable Action Spaces
par: Beeson, Alex, et autres
Publié: (2024)
par: Beeson, Alex, et autres
Publié: (2024)
FAWAC: Feasibility Informed Advantage Weighted Regression for Persistent Safety in Offline Reinforcement Learning
par: Koirala, Prajwal, et autres
Publié: (2024)
par: Koirala, Prajwal, et autres
Publié: (2024)
Constrained Latent Action Policies for Model-Based Offline Reinforcement Learning
par: Alles, Marvin, et autres
Publié: (2024)
par: Alles, Marvin, et autres
Publié: (2024)
Two-Step Offline Preference-Based Reinforcement Learning with Constrained Actions
par: Xu, Yinglun, et autres
Publié: (2023)
par: Xu, Yinglun, et autres
Publié: (2023)
Impact of Computation in Integral Reinforcement Learning for Continuous-Time Control
par: Cao, Wenhan, et autres
Publié: (2024)
par: Cao, Wenhan, et autres
Publié: (2024)
Global Optimality of Single-Timescale Actor-Critic under Continuous State-Action Space: A Study on Linear Quadratic Regulator
par: Chen, Xuyang, et autres
Publié: (2025)
par: Chen, Xuyang, et autres
Publié: (2025)
A2PO: Towards Effective Offline Reinforcement Learning from an Advantage-aware Perspective
par: Qing, Yunpeng, et autres
Publié: (2024)
par: Qing, Yunpeng, et autres
Publié: (2024)
Offline Reinforcement Learning with Penalized Action Noise Injection
par: Oh, JunHyeok, et autres
Publié: (2025)
par: Oh, JunHyeok, et autres
Publié: (2025)
M3OOD: Automatic Selection of Multimodal OOD Detectors
par: Qin, Yuehan, et autres
Publié: (2025)
par: Qin, Yuehan, et autres
Publié: (2025)
Action Gaps and Advantages in Continuous-Time Distributional Reinforcement Learning
par: Wiltzer, Harley, et autres
Publié: (2024)
par: Wiltzer, Harley, et autres
Publié: (2024)
Offline Trajectory Optimization for Offline Reinforcement Learning
par: Zhao, Ziqi, et autres
Publié: (2024)
par: Zhao, Ziqi, et autres
Publié: (2024)
BraVE: Offline Reinforcement Learning for Discrete Combinatorial Action Spaces
par: Landers, Matthew, et autres
Publié: (2024)
par: Landers, Matthew, et autres
Publié: (2024)
CO-RFT: Efficient Fine-Tuning of Vision-Language-Action Models through Chunked Offline Reinforcement Learning
par: Huang, Dongchi, et autres
Publié: (2025)
par: Huang, Dongchi, et autres
Publié: (2025)
Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood
par: Yao, Qingmao, et autres
Publié: (2025)
par: Yao, Qingmao, et autres
Publié: (2025)
Mutual Information Regularized Offline Reinforcement Learning
par: Ma, Xiao, et autres
Publié: (2022)
par: Ma, Xiao, et autres
Publié: (2022)
SAMG: Offline-to-Online Reinforcement Learning via State-Action-Conditional Offline Model Guidance
par: Zhang, Liyu, et autres
Publié: (2024)
par: Zhang, Liyu, et autres
Publié: (2024)
ADORA: Training Reasoning Models with Dynamic Advantage Estimation on Reinforcement Learning
par: Ren, Qingnan, et autres
Publié: (2026)
par: Ren, Qingnan, et autres
Publié: (2026)
Proximal Action Replacement for Behavior Cloning Actor-Critic in Offline Reinforcement Learning
par: Dong, Jinzong, et autres
Publié: (2026)
par: Dong, Jinzong, et autres
Publié: (2026)
Model-Based Offline Reinforcement Learning with Adversarial Data Augmentation
par: Cao, Hongye, et autres
Publié: (2025)
par: Cao, Hongye, et autres
Publié: (2025)
An Information-Theoretic Analysis of OOD Generalization in Meta-Reinforcement Learning
par: Liu, Xingtu
Publié: (2025)
par: Liu, Xingtu
Publié: (2025)
Information-Directed Offline-to-Online Reinforcement Learning
par: Chen, Keru
Publié: (2026)
par: Chen, Keru
Publié: (2026)
Penalizing Infeasible Actions and Reward Scaling in Reinforcement Learning with Offline Data
par: Kim, Jeonghye, et autres
Publié: (2025)
par: Kim, Jeonghye, et autres
Publié: (2025)
Video-Enhanced Offline Reinforcement Learning: A Model-Based Approach
par: Pan, Minting, et autres
Publié: (2025)
par: Pan, Minting, et autres
Publié: (2025)
Robustness Evaluation of Offline Reinforcement Learning for Robot Control Against Action Perturbations
par: Ayabe, Shingo, et autres
Publié: (2024)
par: Ayabe, Shingo, et autres
Publié: (2024)
DAWM: Diffusion Action World Models for Offline Reinforcement Learning via Action-Inferred Transitions
par: Li, Zongyue, et autres
Publié: (2025)
par: Li, Zongyue, et autres
Publié: (2025)
OASIS: Conditional Distribution Shaping for Offline Safe Reinforcement Learning
par: Yao, Yihang, et autres
Publié: (2024)
par: Yao, Yihang, et autres
Publié: (2024)
Achieving the Asymptotically Optimal Sample Complexity of Offline Reinforcement Learning: A DRO-Based Approach
par: Wang, Yue, et autres
Publié: (2023)
par: Wang, Yue, et autres
Publié: (2023)
MetaOOD: Automatic Selection of OOD Detection Models
par: Qin, Yuehan, et autres
Publié: (2024)
par: Qin, Yuehan, et autres
Publié: (2024)
Latent Safety-Constrained Policy Approach for Safe Offline Reinforcement Learning
par: Koirala, Prajwal, et autres
Publié: (2024)
par: Koirala, Prajwal, et autres
Publié: (2024)
A Non-Monolithic Policy Approach of Offline-to-Online Reinforcement Learning
par: Kim, JaeYoon, et autres
Publié: (2024)
par: Kim, JaeYoon, et autres
Publié: (2024)
Documents similaires
-
VIPO: Value Function Inconsistency Penalized Offline Reinforcement Learning
par: Chen, Xuyang, et autres
Publié: (2025) -
Offline Reinforcement Learning with OOD State Correction and OOD Action Suppression
par: Mao, Yixiu, et autres
Publié: (2024) -
One-Step Sampler for Boltzmann Distributions via Drifting
par: Cao, Wenhan, et autres
Publié: (2026) -
Variational OOD State Correction for Offline Reinforcement Learning
par: Jiang, Ke, et autres
Publié: (2025) -
Active Advantage-Aligned Online Reinforcement Learning with Offline Data
par: Liu, Xuefeng, et autres
Publié: (2025)