Off-policy Reinforcement Learning with Model-based Exploration Augmentation
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Likun, Zhang, Xiangteng, Wang, Yinuo, Zhan, Guojian, Wang, Wenxuan, Gao, Haoyu, Duan, Jingliang, Li, Shengbo Eben |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Bootstrap Off-policy with World Model
di: Zhan, Guojian, et al.
Pubblicazione: (2025)
di: Zhan, Guojian, et al.
Pubblicazione: (2025)
Mind Your Entropy: From Maximum Entropy to Trajectory Entropy-Constrained RL
di: Zhan, Guojian, et al.
Pubblicazione: (2025)
di: Zhan, Guojian, et al.
Pubblicazione: (2025)
Conformal Symplectic Optimization for Stable Reinforcement Learning
di: Lyu, Yao, et al.
Pubblicazione: (2024)
di: Lyu, Yao, et al.
Pubblicazione: (2024)
Distributional Soft Actor-Critic with Harmonic Gradient for Safe and Efficient Autonomous Driving in Multi-lane Scenarios
di: Zhang, Feihong, et al.
Pubblicazione: (2025)
di: Zhang, Feihong, et al.
Pubblicazione: (2025)
Enhanced DACER Algorithm with High Diffusion Efficiency
di: Wang, Yinuo, et al.
Pubblicazione: (2025)
di: Wang, Yinuo, et al.
Pubblicazione: (2025)
STAPO: Stabilizing Reinforcement Learning for LLMs by Silencing Rare Spurious Tokens
di: Liu, Shiqi, et al.
Pubblicazione: (2026)
di: Liu, Shiqi, et al.
Pubblicazione: (2026)
Canonical Form of Datatic Description in Control Systems
di: Zhan, Guojian, et al.
Pubblicazione: (2024)
di: Zhan, Guojian, et al.
Pubblicazione: (2024)
Diffusion Actor-Critic with Entropy Regulator
di: Wang, Yinuo, et al.
Pubblicazione: (2024)
di: Wang, Yinuo, et al.
Pubblicazione: (2024)
Distributional Soft Actor-Critic with Diffusion Policy
di: Liu, Tong, et al.
Pubblicazione: (2025)
di: Liu, Tong, et al.
Pubblicazione: (2025)
Augmented Lagrangian Multiplier Network for State-wise Safety in Reinforcement Learning
di: Zhang, Jiaming, et al.
Pubblicazione: (2026)
di: Zhang, Jiaming, et al.
Pubblicazione: (2026)
Transferable Latent-to-Latent Locomotion Policy for Efficient and Versatile Motion Control of Diverse Legged Robots
di: Zheng, Ziang, et al.
Pubblicazione: (2025)
di: Zheng, Ziang, et al.
Pubblicazione: (2025)
Learning Off-policy with Model-based Intrinsic Motivation For Active Online Exploration
di: Wang, Yibo, et al.
Pubblicazione: (2024)
di: Wang, Yibo, et al.
Pubblicazione: (2024)
Mean Flow Policy with Instantaneous Velocity Constraint for One-step Action Generation
di: Zhan, Guojian, et al.
Pubblicazione: (2026)
di: Zhan, Guojian, et al.
Pubblicazione: (2026)
Hierarchical End-to-End Autonomous Driving: Integrating BEV Perception with Deep Reinforcement Learning
di: Lu, Siyi, et al.
Pubblicazione: (2024)
di: Lu, Siyi, et al.
Pubblicazione: (2024)
Safe Offline Reinforcement Learning with Feasibility-Guided Diffusion Model
di: Zheng, Yinan, et al.
Pubblicazione: (2024)
di: Zheng, Yinan, et al.
Pubblicazione: (2024)
Zeroth-Order Actor-Critic: An Evolutionary Framework for Sequential Decision Problems
di: Lei, Yuheng, et al.
Pubblicazione: (2022)
di: Lei, Yuheng, et al.
Pubblicazione: (2022)
Predictive Lagrangian Optimization for Constrained Reinforcement Learning
di: Zhang, Tianqi, et al.
Pubblicazione: (2025)
di: Zhang, Tianqi, et al.
Pubblicazione: (2025)
Return Augmented Decision Transformer for Off-Dynamics Reinforcement Learning
di: Wang, Ruhan, et al.
Pubblicazione: (2024)
di: Wang, Ruhan, et al.
Pubblicazione: (2024)
VIPO: Value Function Inconsistency Penalized Offline Reinforcement Learning
di: Chen, Xuyang, et al.
Pubblicazione: (2025)
di: Chen, Xuyang, et al.
Pubblicazione: (2025)
An Explicit Discrete-Time Dynamic Vehicle Model with Assured Numerical Stability
di: Zhan, Guojian, et al.
Pubblicazione: (2024)
di: Zhan, Guojian, et al.
Pubblicazione: (2024)
Risk-Aware Vehicle Trajectory Prediction Under Safety-Critical Scenarios
di: Wang, Qingfan, et al.
Pubblicazione: (2024)
di: Wang, Qingfan, et al.
Pubblicazione: (2024)
Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation
di: Guo, Yihong, et al.
Pubblicazione: (2024)
di: Guo, Yihong, et al.
Pubblicazione: (2024)
Minds on the Move: Decoding Trajectory Prediction in Autonomous Driving with Cognitive Insights
di: Liao, Haicheng, et al.
Pubblicazione: (2025)
di: Liao, Haicheng, et al.
Pubblicazione: (2025)
A Cognitive-Based Trajectory Prediction Approach for Autonomous Driving
di: Liao, Haicheng, et al.
Pubblicazione: (2024)
di: Liao, Haicheng, et al.
Pubblicazione: (2024)
Jump-Start Reinforcement Learning with Self-Evolving Priors for Extreme Monopedal Locomotion
di: Zheng, Ziang, et al.
Pubblicazione: (2025)
di: Zheng, Ziang, et al.
Pubblicazione: (2025)
Targeted Exploration via Unified Entropy Control for Reinforcement Learning
di: Wang, Chen, et al.
Pubblicazione: (2026)
di: Wang, Chen, et al.
Pubblicazione: (2026)
Learning Diverse Policies with Soft Self-Generated Guidance
di: Wang, Guojian, et al.
Pubblicazione: (2024)
di: Wang, Guojian, et al.
Pubblicazione: (2024)
Efficient Reinforcement Learning for Large Language Models with Intrinsic Exploration
di: Sun, Yan, et al.
Pubblicazione: (2025)
di: Sun, Yan, et al.
Pubblicazione: (2025)
Buffer Matters: Unleashing the Power of Off-Policy Reinforcement Learning in Large Language Model Reasoning
di: Wan, Xu, et al.
Pubblicazione: (2026)
di: Wan, Xu, et al.
Pubblicazione: (2026)
One Filters All: A Generalist Filter for State Estimation
di: Liu, Shiqi, et al.
Pubblicazione: (2025)
di: Liu, Shiqi, et al.
Pubblicazione: (2025)
Guardian: Decoupling Exploration from Safety in Reinforcement Learning
di: Cai, Kaitong, et al.
Pubblicazione: (2025)
di: Cai, Kaitong, et al.
Pubblicazione: (2025)
LocoMamba: Vision-Driven Locomotion via End-to-End Deep Reinforcement Learning with Mamba
di: Wang, Yinuo, et al.
Pubblicazione: (2025)
di: Wang, Yinuo, et al.
Pubblicazione: (2025)
QuadKAN: KAN-Enhanced Quadruped Motion Control via End-to-End Reinforcement Learning
di: Wang, Yinuo, et al.
Pubblicazione: (2025)
di: Wang, Yinuo, et al.
Pubblicazione: (2025)
Mixed Policy Gradient: off-policy reinforcement learning driven jointly by data and model
di: Guan, Yang, et al.
Pubblicazione: (2021)
di: Guan, Yang, et al.
Pubblicazione: (2021)
Towards Off-Policy Reinforcement Learning for Ranking Policies with Human Feedback
di: Xiao, Teng, et al.
Pubblicazione: (2024)
di: Xiao, Teng, et al.
Pubblicazione: (2024)
Boosting Maximum Entropy Reinforcement Learning via One-Step Flow Matching
di: Li, Zeqiao, et al.
Pubblicazione: (2026)
di: Li, Zeqiao, et al.
Pubblicazione: (2026)
MAGE: Meta-Reinforcement Learning for Language Agents toward Strategic Exploration and Exploitation
di: Yang, Lu, et al.
Pubblicazione: (2026)
di: Yang, Lu, et al.
Pubblicazione: (2026)
Reinforcement Learning-based Sequential Route Recommendation for System-Optimal Traffic Assignment
di: Wang, Leizhen, et al.
Pubblicazione: (2025)
di: Wang, Leizhen, et al.
Pubblicazione: (2025)
Neighboring State-based Exploration for Reinforcement Learning
di: Li, Yu-Teng, et al.
Pubblicazione: (2022)
di: Li, Yu-Teng, et al.
Pubblicazione: (2022)
Direct Preference-Based Evolutionary Multi-Objective Optimization with Dueling Bandit
di: Huang, Tian, et al.
Pubblicazione: (2023)
di: Huang, Tian, et al.
Pubblicazione: (2023)
Documenti analoghi
-
Bootstrap Off-policy with World Model
di: Zhan, Guojian, et al.
Pubblicazione: (2025) -
Mind Your Entropy: From Maximum Entropy to Trajectory Entropy-Constrained RL
di: Zhan, Guojian, et al.
Pubblicazione: (2025) -
Conformal Symplectic Optimization for Stable Reinforcement Learning
di: Lyu, Yao, et al.
Pubblicazione: (2024) -
Distributional Soft Actor-Critic with Harmonic Gradient for Safe and Efficient Autonomous Driving in Multi-lane Scenarios
di: Zhang, Feihong, et al.
Pubblicazione: (2025) -
Enhanced DACER Algorithm with High Diffusion Efficiency
di: Wang, Yinuo, et al.
Pubblicazione: (2025)