Preference-Guided Reinforcement Learning for Efficient Exploration
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Guojian, Liu, Jianxiang, Li, Xinyuan, Wu, Faguo, Zhang, Xiao, Chen, Tianyuan, Chen, Xuyang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Policy Optimization with Smooth Guidance Learned from State-Only Demonstrations
di: Wang, Guojian, et al.
Pubblicazione: (2023)
di: Wang, Guojian, et al.
Pubblicazione: (2023)
Learning Diverse Policies with Soft Self-Generated Guidance
di: Wang, Guojian, et al.
Pubblicazione: (2024)
di: Wang, Guojian, et al.
Pubblicazione: (2024)
Trajectory-Oriented Policy Optimization with Sparse Rewards
di: Wang, Guojian, et al.
Pubblicazione: (2024)
di: Wang, Guojian, et al.
Pubblicazione: (2024)
Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood
di: Yao, Qingmao, et al.
Pubblicazione: (2025)
di: Yao, Qingmao, et al.
Pubblicazione: (2025)
Adaptive trajectory-constrained exploration strategy for deep reinforcement learning
di: Wang, Guojian, et al.
Pubblicazione: (2023)
di: Wang, Guojian, et al.
Pubblicazione: (2023)
VIPO: Value Function Inconsistency Penalized Offline Reinforcement Learning
di: Chen, Xuyang, et al.
Pubblicazione: (2025)
di: Chen, Xuyang, et al.
Pubblicazione: (2025)
Data Fusion-Enhanced Decision Transformer for Stable Cross-Domain Generalization
di: Wang, Guojian, et al.
Pubblicazione: (2025)
di: Wang, Guojian, et al.
Pubblicazione: (2025)
Goal-Guided Efficient Exploration via Large Language Model in Reinforcement Learning
di: Qi, Yajie, et al.
Pubblicazione: (2025)
di: Qi, Yajie, et al.
Pubblicazione: (2025)
Hindsight Preference Learning for Offline Preference-based Reinforcement Learning
di: Gao, Chen-Xiao, et al.
Pubblicazione: (2024)
di: Gao, Chen-Xiao, et al.
Pubblicazione: (2024)
Hyper: Hyperparameter Robust Efficient Exploration in Reinforcement Learning
di: Wang, Yiran, et al.
Pubblicazione: (2024)
di: Wang, Yiran, et al.
Pubblicazione: (2024)
POLO: Preference-Guided Multi-Turn Reinforcement Learning for Lead Optimization
di: Wang, Ziqing, et al.
Pubblicazione: (2025)
di: Wang, Ziqing, et al.
Pubblicazione: (2025)
OPRIDE: Offline Preference-based Reinforcement Learning via In-Dataset Exploration
di: Yang, Yiqin, et al.
Pubblicazione: (2026)
di: Yang, Yiqin, et al.
Pubblicazione: (2026)
TGPO: Tree-Guided Preference Optimization for Robust Web Agent Reinforcement Learning
di: Chen, Ziyuan, et al.
Pubblicazione: (2025)
di: Chen, Ziyuan, et al.
Pubblicazione: (2025)
Efficient Preference-Based Reinforcement Learning: Randomized Exploration Meets Experimental Design
di: Schlaginhaufen, Andreas, et al.
Pubblicazione: (2025)
di: Schlaginhaufen, Andreas, et al.
Pubblicazione: (2025)
Provably Efficient Exploration in Inverse Constrained Reinforcement Learning
di: Yue, Bo, et al.
Pubblicazione: (2024)
di: Yue, Bo, et al.
Pubblicazione: (2024)
SALSA-RL: Stability Analysis in the Latent Space of Actions for Reinforcement Learning
di: Li, Xuyang, et al.
Pubblicazione: (2025)
di: Li, Xuyang, et al.
Pubblicazione: (2025)
Multi-Type Preference Learning: Empowering Preference-Based Reinforcement Learning with Equal Preferences
di: Liu, Ziang, et al.
Pubblicazione: (2024)
di: Liu, Ziang, et al.
Pubblicazione: (2024)
EvoCoT: Overcoming the Exploration Bottleneck in Reinforcement Learning
di: Liu, Huanyu, et al.
Pubblicazione: (2025)
di: Liu, Huanyu, et al.
Pubblicazione: (2025)
Reinforcement Learning by Guided Safe Exploration
di: Yang, Qisong, et al.
Pubblicazione: (2023)
di: Yang, Qisong, et al.
Pubblicazione: (2023)
Efficient Reinforcement Learning via Decoupling Exploration and Utilization
di: Yang, Jingpu, et al.
Pubblicazione: (2023)
di: Yang, Jingpu, et al.
Pubblicazione: (2023)
Query-Policy Misalignment in Preference-Based Reinforcement Learning
di: Hu, Xiao, et al.
Pubblicazione: (2023)
di: Hu, Xiao, et al.
Pubblicazione: (2023)
Efficient Preference-Based Reinforcement Learning Using Learned Dynamics Models
di: Liu, Yi, et al.
Pubblicazione: (2023)
di: Liu, Yi, et al.
Pubblicazione: (2023)
Taming OOD Actions for Offline Reinforcement Learning: An Advantage-Based Approach
di: Chen, Xuyang, et al.
Pubblicazione: (2025)
di: Chen, Xuyang, et al.
Pubblicazione: (2025)
Jump-Start Reinforcement Learning with Self-Evolving Priors for Extreme Monopedal Locomotion
di: Zheng, Ziang, et al.
Pubblicazione: (2025)
di: Zheng, Ziang, et al.
Pubblicazione: (2025)
Efficient Exploration for Iterative Nash Preference Optimization
di: Nan, Tianlong, et al.
Pubblicazione: (2026)
di: Nan, Tianlong, et al.
Pubblicazione: (2026)
Efficient Multi-Policy Evaluation for Reinforcement Learning
di: Liu, Shuze Daniel, et al.
Pubblicazione: (2024)
di: Liu, Shuze Daniel, et al.
Pubblicazione: (2024)
Efficient Reinforcement Learning for Large Language Models with Intrinsic Exploration
di: Sun, Yan, et al.
Pubblicazione: (2025)
di: Sun, Yan, et al.
Pubblicazione: (2025)
LEASE: Offline Preference-based Reinforcement Learning with High Sample Efficiency
di: Liu, Xiao-Yin, et al.
Pubblicazione: (2024)
di: Liu, Xiao-Yin, et al.
Pubblicazione: (2024)
Goal Exploration via Adaptive Skill Distribution for Goal-Conditioned Reinforcement Learning
di: Wu, Lisheng, et al.
Pubblicazione: (2024)
di: Wu, Lisheng, et al.
Pubblicazione: (2024)
On Efficient Bayesian Exploration in Model-Based Reinforcement Learning
di: Caron, Alberto, et al.
Pubblicazione: (2025)
di: Caron, Alberto, et al.
Pubblicazione: (2025)
Energy-Guided Diffusion Sampling for Offline-to-Online Reinforcement Learning
di: Liu, Xu-Hui, et al.
Pubblicazione: (2024)
di: Liu, Xu-Hui, et al.
Pubblicazione: (2024)
Improving Offline-to-Online Reinforcement Learning with Q Conditioned State Entropy Exploration
di: Zhang, Ziqi, et al.
Pubblicazione: (2023)
di: Zhang, Ziqi, et al.
Pubblicazione: (2023)
Efficient Policy Evaluation with Safety Constraint for Reinforcement Learning
di: Chen, Claire, et al.
Pubblicazione: (2024)
di: Chen, Claire, et al.
Pubblicazione: (2024)
PB$^2$: Preference Space Exploration via Population-Based Methods in Preference-Based Reinforcement Learning
di: Driss, Brahim, et al.
Pubblicazione: (2025)
di: Driss, Brahim, et al.
Pubblicazione: (2025)
MIR: Efficient Exploration in Episodic Multi-Agent Reinforcement Learning via Mutual Intrinsic Reward
di: Chen, Kesheng, et al.
Pubblicazione: (2025)
di: Chen, Kesheng, et al.
Pubblicazione: (2025)
Knockoff-Guided Feature Selection via A Single Pre-trained Reinforced Agent
di: Wang, Xinyuan, et al.
Pubblicazione: (2024)
di: Wang, Xinyuan, et al.
Pubblicazione: (2024)
Sparse-PGD: A Unified Framework for Sparse Adversarial Perturbations Generation
di: Zhong, Xuyang, et al.
Pubblicazione: (2024)
di: Zhong, Xuyang, et al.
Pubblicazione: (2024)
Guided Exploration for Efficient Relational Model Learning
di: Feng, Annie, et al.
Pubblicazione: (2025)
di: Feng, Annie, et al.
Pubblicazione: (2025)
Novelty-Guided Data Reuse for Efficient and Diversified Multi-Agent Reinforcement Learning
di: Chen, Yangkun, et al.
Pubblicazione: (2024)
di: Chen, Yangkun, et al.
Pubblicazione: (2024)
Hybrid Belief Reinforcement Learning for Efficient Coordinated Spatial Exploration
di: Rizvi, Danish, et al.
Pubblicazione: (2026)
di: Rizvi, Danish, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Policy Optimization with Smooth Guidance Learned from State-Only Demonstrations
di: Wang, Guojian, et al.
Pubblicazione: (2023) -
Learning Diverse Policies with Soft Self-Generated Guidance
di: Wang, Guojian, et al.
Pubblicazione: (2024) -
Trajectory-Oriented Policy Optimization with Sparse Rewards
di: Wang, Guojian, et al.
Pubblicazione: (2024) -
Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood
di: Yao, Qingmao, et al.
Pubblicazione: (2025) -
Adaptive trajectory-constrained exploration strategy for deep reinforcement learning
di: Wang, Guojian, et al.
Pubblicazione: (2023)