On the Reuse Bias in Off-Policy Reinforcement Learning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ying, Chengyang, Hao, Zhongkai, Zhou, Xinning, Su, Hang, Yan, Dong, Zhu, Jun |
|---|---|
| Format: | Preprint |
| Publié: |
2022
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Task Aware Dreamer for Task Generalization in Reinforcement Learning
par: Ying, Chengyang, et autres
Publié: (2023)
par: Ying, Chengyang, et autres
Publié: (2023)
Exploratory Diffusion Model for Unsupervised Reinforcement Learning
par: Ying, Chengyang, et autres
Publié: (2025)
par: Ying, Chengyang, et autres
Publié: (2025)
PEAC: Unsupervised Pre-training for Cross-Embodiment Reinforcement Learning
par: Ying, Chengyang, et autres
Publié: (2024)
par: Ying, Chengyang, et autres
Publié: (2024)
Towards Safe Reinforcement Learning via Constraining Conditional Value-at-Risk
par: Ying, Chengyang, et autres
Publié: (2022)
par: Ying, Chengyang, et autres
Publié: (2022)
Self-Consistent Model-based Adaptation for Visual Reinforcement Learning
par: Zhou, Xinning, et autres
Publié: (2025)
par: Zhou, Xinning, et autres
Publié: (2025)
Helix: Evolutionary Reinforcement Learning for Open-Ended Scientific Problem Solving
par: Su, Chang, et autres
Publié: (2026)
par: Su, Chang, et autres
Publié: (2026)
DPOT: Auto-Regressive Denoising Operator Transformer for Large-Scale PDE Pre-Training
par: Hao, Zhongkai, et autres
Publié: (2024)
par: Hao, Zhongkai, et autres
Publié: (2024)
Consistent Attack: Universal Adversarial Perturbation on Embodied Vision Navigation
par: Ying, Chengyang, et autres
Publié: (2022)
par: Ying, Chengyang, et autres
Publié: (2022)
Fourier Controller Networks for Real-Time Decision-Making in Embodied Learning
par: Tan, Hengkai, et autres
Publié: (2024)
par: Tan, Hengkai, et autres
Publié: (2024)
Improved Operator Learning by Orthogonal Attention
par: Xiao, Zipeng, et autres
Publié: (2023)
par: Xiao, Zipeng, et autres
Publié: (2023)
Succeed or Learn Slowly: Sample Efficient Off-Policy Reinforcement Learning for Mobile App Control
par: Papoudakis, Georgios, et autres
Publié: (2025)
par: Papoudakis, Georgios, et autres
Publié: (2025)
Off-Policy Primal-Dual Safe Reinforcement Learning
par: Wu, Zifan, et autres
Publié: (2024)
par: Wu, Zifan, et autres
Publié: (2024)
TOP-ERL: Transformer-based Off-Policy Episodic Reinforcement Learning
par: Li, Ge, et autres
Publié: (2024)
par: Li, Ge, et autres
Publié: (2024)
Preconditioning for Physics-Informed Neural Networks
par: Liu, Songming, et autres
Publié: (2024)
par: Liu, Songming, et autres
Publié: (2024)
Your Diffusion Model is Secretly a Certifiably Robust Classifier
par: Chen, Huanran, et autres
Publié: (2024)
par: Chen, Huanran, et autres
Publié: (2024)
IPD: Boosting Sequential Policy with Imaginary Planning Distillation in Offline Reinforcement Learning
par: Qin, Yihao, et autres
Publié: (2026)
par: Qin, Yihao, et autres
Publié: (2026)
Low-Rank Adaptation for Critic Learning in Off-Policy Reinforcement Learning
par: Zhuang, Yuan, et autres
Publié: (2026)
par: Zhuang, Yuan, et autres
Publié: (2026)
Prism: Policy Reuse via Interpretable Strategy Mapping in Reinforcement Learning
par: Pravetz, Thomas
Publié: (2026)
par: Pravetz, Thomas
Publié: (2026)
Trajectory-Aware Eligibility Traces for Off-Policy Reinforcement Learning
par: Daley, Brett, et autres
Publié: (2023)
par: Daley, Brett, et autres
Publié: (2023)
Off Policy Lyapunov Stability in Reinforcement Learning
par: Gill, Sarvan, et autres
Publié: (2025)
par: Gill, Sarvan, et autres
Publié: (2025)
Hybrid Training for Enhanced Multi-task Generalization in Multi-agent Reinforcement Learning
par: Zhang, Mingliang, et autres
Publié: (2024)
par: Zhang, Mingliang, et autres
Publié: (2024)
Towards Off-Policy Reinforcement Learning for Ranking Policies with Human Feedback
par: Xiao, Teng, et autres
Publié: (2024)
par: Xiao, Teng, et autres
Publié: (2024)
BAPO: Stabilizing Off-Policy Reinforcement Learning for LLMs via Balanced Policy Optimization with Adaptive Clipping
par: Xi, Zhiheng, et autres
Publié: (2025)
par: Xi, Zhiheng, et autres
Publié: (2025)
Bootstrapping Reinforcement Learning with Sub-optimal Policies for Autonomous Driving
par: Zhang, Zhihao, et autres
Publié: (2025)
par: Zhang, Zhihao, et autres
Publié: (2025)
Off-Policy Safe Reinforcement Learning with Constrained Optimistic Exploration
par: Li, Guopeng, et autres
Publié: (2026)
par: Li, Guopeng, et autres
Publié: (2026)
Staggered Environment Resets Improve Massively Parallel On-Policy Reinforcement Learning
par: Bharthulwar, Sid, et autres
Publié: (2025)
par: Bharthulwar, Sid, et autres
Publié: (2025)
Recurrent Off-Policy Deep Reinforcement Learning Doesn't Have to be Slow
par: Clark, Tyler, et autres
Publié: (2025)
par: Clark, Tyler, et autres
Publié: (2025)
Off-Policy Reinforcement Learning with High Dimensional Reward
par: Lee, Dong Neuck, et autres
Publié: (2024)
par: Lee, Dong Neuck, et autres
Publié: (2024)
Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation
par: Zhou, Hongyi, et autres
Publié: (2025)
par: Zhou, Hongyi, et autres
Publié: (2025)
Scaling Off-Policy Reinforcement Learning with Batch and Weight Normalization
par: Palenicek, Daniel, et autres
Publié: (2025)
par: Palenicek, Daniel, et autres
Publié: (2025)
Score Regularized Policy Optimization through Diffusion Behavior
par: Chen, Huayu, et autres
Publié: (2023)
par: Chen, Huayu, et autres
Publié: (2023)
ManiBox: Enhancing Embodied Spatial Generalization via Scalable Simulation Data Generations
par: Tan, Hengkai, et autres
Publié: (2024)
par: Tan, Hengkai, et autres
Publié: (2024)
Scalable Quantum Reinforcement Learning on NISQ Devices with Dynamic-Circuit Qubit Reuse and Grover Optimization
par: Su, Thet Htar, et autres
Publié: (2025)
par: Su, Thet Htar, et autres
Publié: (2025)
Off-Policy Value-Based Reinforcement Learning for Large Language Models
par: Wang, Peng-Yuan, et autres
Publié: (2026)
par: Wang, Peng-Yuan, et autres
Publié: (2026)
Reuse your FLOPs: Scaling RL on Hard Problems by Conditioning on Very Off-Policy Prefixes
par: Setlur, Amrith, et autres
Publié: (2026)
par: Setlur, Amrith, et autres
Publié: (2026)
Formulating Reinforcement Learning for Human-Robot Collaboration through Off-Policy Evaluation
par: Singh, Saurav, et autres
Publié: (2026)
par: Singh, Saurav, et autres
Publié: (2026)
On-Policy RL Meets Off-Policy Experts: Harmonizing Supervised Fine-Tuning and Reinforcement Learning via Dynamic Weighting
par: Zhang, Wenhao, et autres
Publié: (2025)
par: Zhang, Wenhao, et autres
Publié: (2025)
Behaviour Policy Optimization: Provably Lower Variance Return Estimates for Off-Policy Reinforcement Learning
par: Goodall, Alexander W., et autres
Publié: (2025)
par: Goodall, Alexander W., et autres
Publié: (2025)
Off-Policy Learning with Limited Supply
par: Tanaka, Koichi, et autres
Publié: (2026)
par: Tanaka, Koichi, et autres
Publié: (2026)
Accelerating PDE-Constrained Optimization by the Derivative of Neural Operators
par: Cheng, Ze, et autres
Publié: (2025)
par: Cheng, Ze, et autres
Publié: (2025)
Documents similaires
-
Task Aware Dreamer for Task Generalization in Reinforcement Learning
par: Ying, Chengyang, et autres
Publié: (2023) -
Exploratory Diffusion Model for Unsupervised Reinforcement Learning
par: Ying, Chengyang, et autres
Publié: (2025) -
PEAC: Unsupervised Pre-training for Cross-Embodiment Reinforcement Learning
par: Ying, Chengyang, et autres
Publié: (2024) -
Towards Safe Reinforcement Learning via Constraining Conditional Value-at-Risk
par: Ying, Chengyang, et autres
Publié: (2022) -
Self-Consistent Model-based Adaptation for Visual Reinforcement Learning
par: Zhou, Xinning, et autres
Publié: (2025)