Mixed Policy Gradient: off-policy reinforcement learning driven jointly by data and model
Fuente:
arXiv
Guardado en:
| Autores principales: | Guan, Yang, Duan, Jingliang, Li, Shengbo Eben, Li, Jie, Chen, Jianyu, Cheng, Bo |
|---|---|
| Formato: | Preprint |
| Publicado: |
2021
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Distributional Soft Actor-Critic with Harmonic Gradient for Safe and Efficient Autonomous Driving in Multi-lane Scenarios
por: Zhang, Feihong, et al.
Publicado: (2025)
por: Zhang, Feihong, et al.
Publicado: (2025)
Policy Bifurcation in Safe Reinforcement Learning
por: Zou, Wenjun, et al.
Publicado: (2024)
por: Zou, Wenjun, et al.
Publicado: (2024)
Enhance Sample Efficiency and Robustness of End-to-end Urban Autonomous Driving via Semantic Masked World Model
por: Gao, Zeyu, et al.
Publicado: (2022)
por: Gao, Zeyu, et al.
Publicado: (2022)
Distributional Soft Actor-Critic with Diffusion Policy
por: Liu, Tong, et al.
Publicado: (2025)
por: Liu, Tong, et al.
Publicado: (2025)
Mind Your Entropy: From Maximum Entropy to Trajectory Entropy-Constrained RL
por: Zhan, Guojian, et al.
Publicado: (2025)
por: Zhan, Guojian, et al.
Publicado: (2025)
Distributional Soft Actor-Critic with Three Refinements
por: Duan, Jingliang, et al.
Publicado: (2023)
por: Duan, Jingliang, et al.
Publicado: (2023)
Conformal Symplectic Optimization for Stable Reinforcement Learning
por: Lyu, Yao, et al.
Publicado: (2024)
por: Lyu, Yao, et al.
Publicado: (2024)
Exchange Policy Optimization Algorithm for Semi-Infinite Safe Reinforcement Learning
por: Zhang, Jiaming, et al.
Publicado: (2025)
por: Zhang, Jiaming, et al.
Publicado: (2025)
On the Equilibrium between Feasible Zone and Uncertain Model in Safe Exploration
por: Yang, Yujie, et al.
Publicado: (2026)
por: Yang, Yujie, et al.
Publicado: (2026)
Predictive Lagrangian Optimization for Constrained Reinforcement Learning
por: Zhang, Tianqi, et al.
Publicado: (2025)
por: Zhang, Tianqi, et al.
Publicado: (2025)
Bootstrap Off-policy with World Model
por: Zhan, Guojian, et al.
Publicado: (2025)
por: Zhan, Guojian, et al.
Publicado: (2025)
Off-policy Reinforcement Learning with Model-based Exploration Augmentation
por: Wang, Likun, et al.
Publicado: (2025)
por: Wang, Likun, et al.
Publicado: (2025)
Counterfactual experience augmented off-policy reinforcement learning
por: Lee, Sunbowen, et al.
Publicado: (2025)
por: Lee, Sunbowen, et al.
Publicado: (2025)
Feasible Policy Iteration for Safe Reinforcement Learning
por: Yang, Yujie, et al.
Publicado: (2023)
por: Yang, Yujie, et al.
Publicado: (2023)
Zeroth-Order Actor-Critic: An Evolutionary Framework for Sequential Decision Problems
por: Lei, Yuheng, et al.
Publicado: (2022)
por: Lei, Yuheng, et al.
Publicado: (2022)
On the Optimization Landscape of Observer-based Dynamic Linear Quadratic Control
por: Duan, Jingliang, et al.
Publicado: (2026)
por: Duan, Jingliang, et al.
Publicado: (2026)
Causal prompting model-based offline reinforcement learning
por: Yu, Xuehui, et al.
Publicado: (2024)
por: Yu, Xuehui, et al.
Publicado: (2024)
Natural Gradient Gaussian Approximation Filter with Positive Definiteness Guarantee
por: Zhang, Tianyi, et al.
Publicado: (2026)
por: Zhang, Tianyi, et al.
Publicado: (2026)
Algorithm Design and Comparative Test of Natural Gradient Gaussian Approximation Filter
por: Cao, Wenhan, et al.
Publicado: (2025)
por: Cao, Wenhan, et al.
Publicado: (2025)
Diffusion Actor-Critic with Entropy Regulator
por: Wang, Yinuo, et al.
Publicado: (2024)
por: Wang, Yinuo, et al.
Publicado: (2024)
Augmented Lagrangian Multiplier Network for State-wise Safety in Reinforcement Learning
por: Zhang, Jiaming, et al.
Publicado: (2026)
por: Zhang, Jiaming, et al.
Publicado: (2026)
Mean Flow Policy with Instantaneous Velocity Constraint for One-step Action Generation
por: Zhan, Guojian, et al.
Publicado: (2026)
por: Zhan, Guojian, et al.
Publicado: (2026)
Analysis of On-policy Policy Gradient Methods under the Distribution Mismatch
por: Wang, Weizhen, et al.
Publicado: (2025)
por: Wang, Weizhen, et al.
Publicado: (2025)
A Spectral Revisit of the Distributional Bellman Operator under the Cramér Metric
por: Wang, Keru, et al.
Publicado: (2026)
por: Wang, Keru, et al.
Publicado: (2026)
Global Optimality of Single-Timescale Actor-Critic under Continuous State-Action Space: A Study on Linear Quadratic Regulator
por: Chen, Xuyang, et al.
Publicado: (2025)
por: Chen, Xuyang, et al.
Publicado: (2025)
Smoothed functional-based gradient algorithms for off-policy reinforcement learning: A non-asymptotic viewpoint
por: Vijayan, Nithia, et al.
Publicado: (2021)
por: Vijayan, Nithia, et al.
Publicado: (2021)
Real-Time Generative Policy via Langevin-Guided Flow Matching for Autonomous Driving
por: Zhu, Tianze, et al.
Publicado: (2026)
por: Zhu, Tianze, et al.
Publicado: (2026)
Safe Offline Reinforcement Learning with Feasibility-Guided Diffusion Model
por: Zheng, Yinan, et al.
Publicado: (2024)
por: Zheng, Yinan, et al.
Publicado: (2024)
Indirect Shared Control of Highly Automated Vehicles for Cooperative Driving between Driver and Automation
por: Li, Renjie, et al.
Publicado: (2017)
por: Li, Renjie, et al.
Publicado: (2017)
Jump-Start Reinforcement Learning with Self-Evolving Priors for Extreme Monopedal Locomotion
por: Zheng, Ziang, et al.
Publicado: (2025)
por: Zheng, Ziang, et al.
Publicado: (2025)
Enhanced DACER Algorithm with High Diffusion Efficiency
por: Wang, Yinuo, et al.
Publicado: (2025)
por: Wang, Yinuo, et al.
Publicado: (2025)
One Filters All: A Generalist Filter for State Estimation
por: Liu, Shiqi, et al.
Publicado: (2025)
por: Liu, Shiqi, et al.
Publicado: (2025)
Convolutional Bayesian Filtering
por: Cao, Wenhan, et al.
Publicado: (2024)
por: Cao, Wenhan, et al.
Publicado: (2024)
On the Stability of Datatic Control Systems
por: Yang, Yujie, et al.
Publicado: (2024)
por: Yang, Yujie, et al.
Publicado: (2024)
Policy-shaped prediction: avoiding distractions in model-based reinforcement learning
por: Hutson, Miles, et al.
Publicado: (2024)
por: Hutson, Miles, et al.
Publicado: (2024)
Nonlocal Kramers-Moyal formulas and data-driven discovery of stochastic dynamical systems with multiplicative Lévy noise
por: Li, Yang, et al.
Publicado: (2026)
por: Li, Yang, et al.
Publicado: (2026)
Falsification-driven reinforcement learning for maritime motion planning
por: Müller, Marlon, et al.
Publicado: (2025)
por: Müller, Marlon, et al.
Publicado: (2025)
Taming "data-hungry" reinforcement learning? Stability in continuous state-action spaces
por: Duan, Yaqi, et al.
Publicado: (2024)
por: Duan, Yaqi, et al.
Publicado: (2024)
Soft $Q(λ)$: A multi-step off-policy method for entropy regularised reinforcement learning using eligibility traces
por: Mahajan, Pranav, et al.
Publicado: (2026)
por: Mahajan, Pranav, et al.
Publicado: (2026)
Natural Gradient Gaussian Approximation Filter on Lie Groups for Robot State Estimation
por: Zhang, Tianyi, et al.
Publicado: (2026)
por: Zhang, Tianyi, et al.
Publicado: (2026)
Ejemplares similares
-
Distributional Soft Actor-Critic with Harmonic Gradient for Safe and Efficient Autonomous Driving in Multi-lane Scenarios
por: Zhang, Feihong, et al.
Publicado: (2025) -
Policy Bifurcation in Safe Reinforcement Learning
por: Zou, Wenjun, et al.
Publicado: (2024) -
Enhance Sample Efficiency and Robustness of End-to-end Urban Autonomous Driving via Semantic Masked World Model
por: Gao, Zeyu, et al.
Publicado: (2022) -
Distributional Soft Actor-Critic with Diffusion Policy
por: Liu, Tong, et al.
Publicado: (2025) -
Mind Your Entropy: From Maximum Entropy to Trajectory Entropy-Constrained RL
por: Zhan, Guojian, et al.
Publicado: (2025)