Hindsight Preference Replay Improves Preference-Conditioned Multi-Objective Reinforcement Learning
Fuente:
arXiv
Salvato in:
| Autori principali: | Shianifar, Jonaid, Schukat, Michael, Mason, Karl |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Optimizing Deep Reinforcement Learning for Adaptive Robotic Arm Control
di: Shianifar, Jonaid, et al.
Pubblicazione: (2024)
di: Shianifar, Jonaid, et al.
Pubblicazione: (2024)
Hindsight Preference Learning for Offline Preference-based Reinforcement Learning
di: Gao, Chen-Xiao, et al.
Pubblicazione: (2024)
di: Gao, Chen-Xiao, et al.
Pubblicazione: (2024)
Demonstration Guided Multi-Objective Reinforcement Learning
di: Lu, Junlin, et al.
Pubblicazione: (2024)
di: Lu, Junlin, et al.
Pubblicazione: (2024)
Preference Conditioned Multi-Objective Reinforcement Learning: Decomposed, Diversity-Driven Policy Optimization
di: Ambadkar, Tanmay, et al.
Pubblicazione: (2026)
di: Ambadkar, Tanmay, et al.
Pubblicazione: (2026)
CodeIt: Self-Improving Language Models with Prioritized Hindsight Replay
di: Butt, Natasha, et al.
Pubblicazione: (2024)
di: Butt, Natasha, et al.
Pubblicazione: (2024)
A Meta-Learning Approach for Multi-Objective Reinforcement Learning in Sustainable Home Environments
di: Lu, Junlin, et al.
Pubblicazione: (2024)
di: Lu, Junlin, et al.
Pubblicazione: (2024)
Hindsight Preference Optimization for Financial Time Series Advisory
di: Cui, Yanwei, et al.
Pubblicazione: (2026)
di: Cui, Yanwei, et al.
Pubblicazione: (2026)
D-SPEAR: Dual-Stream Prioritized Experience Adaptive Replay for Stable Reinforcement Learning in Robotic Manipulation
di: Zhang, Yu, et al.
Pubblicazione: (2026)
di: Zhang, Yu, et al.
Pubblicazione: (2026)
Hindsight PRIORs for Reward Learning from Human Preferences
di: Verma, Mudit, et al.
Pubblicazione: (2024)
di: Verma, Mudit, et al.
Pubblicazione: (2024)
Human-Aware Robot Navigation via Reinforcement Learning with Hindsight Experience Replay and Curriculum Learning
di: Li, Keyu, et al.
Pubblicazione: (2021)
di: Li, Keyu, et al.
Pubblicazione: (2021)
Enabling Option Learning in Sparse Rewards with Hindsight Experience Replay
di: Romio, Gabriel, et al.
Pubblicazione: (2026)
di: Romio, Gabriel, et al.
Pubblicazione: (2026)
Adaptive Alignment: Dynamic Preference Adjustments via Multi-Objective Reinforcement Learning for Pluralistic AI
di: Harland, Hadassah, et al.
Pubblicazione: (2024)
di: Harland, Hadassah, et al.
Pubblicazione: (2024)
MODULI: Unlocking Preference Generalization via Diffusion Models for Offline Multi-Objective Reinforcement Learning
di: Yuan, Yifu, et al.
Pubblicazione: (2024)
di: Yuan, Yifu, et al.
Pubblicazione: (2024)
GCHR : Goal-Conditioned Hindsight Regularization for Sample-Efficient Reinforcement Learning
di: Lei, Xing, et al.
Pubblicazione: (2025)
di: Lei, Xing, et al.
Pubblicazione: (2025)
Meta-Learning Objectives for Preference Optimization
di: Alfano, Carlo, et al.
Pubblicazione: (2024)
di: Alfano, Carlo, et al.
Pubblicazione: (2024)
Beyond One-Preference-Fits-All Alignment: Multi-Objective Direct Preference Optimization
di: Zhou, Zhanhui, et al.
Pubblicazione: (2023)
di: Zhou, Zhanhui, et al.
Pubblicazione: (2023)
Interactive Multi-Objective Probabilistic Preference Learning with Soft and Hard Bounds
di: Chen, Edward, et al.
Pubblicazione: (2025)
di: Chen, Edward, et al.
Pubblicazione: (2025)
Interactive Hyperparameter Optimization in Multi-Objective Problems via Preference Learning
di: Giovanelli, Joseph, et al.
Pubblicazione: (2023)
di: Giovanelli, Joseph, et al.
Pubblicazione: (2023)
Preference-Guided Diffusion for Multi-Objective Offline Optimization
di: Annadani, Yashas, et al.
Pubblicazione: (2025)
di: Annadani, Yashas, et al.
Pubblicazione: (2025)
Adaptable Hindsight Experience Replay for Search-Based Learning
di: Vazaios, Alexandros, et al.
Pubblicazione: (2025)
di: Vazaios, Alexandros, et al.
Pubblicazione: (2025)
Learning Pareto-Optimal Rewards from Noisy Preferences: A Framework for Multi-Objective Inverse Reinforcement Learning
di: Cherukuri, Kalyan, et al.
Pubblicazione: (2025)
di: Cherukuri, Kalyan, et al.
Pubblicazione: (2025)
RIME: Robust Preference-based Reinforcement Learning with Noisy Preferences
di: Cheng, Jie, et al.
Pubblicazione: (2024)
di: Cheng, Jie, et al.
Pubblicazione: (2024)
Preference Elicitation for Offline Reinforcement Learning
di: Pace, Alizée, et al.
Pubblicazione: (2024)
di: Pace, Alizée, et al.
Pubblicazione: (2024)
Property-driven Protein Inverse Folding With Multi-Objective Preference Alignment
di: Hou, Xiaoyang, et al.
Pubblicazione: (2026)
di: Hou, Xiaoyang, et al.
Pubblicazione: (2026)
Learning Interpretable Policies in Hindsight-Observable POMDPs through Partially Supervised Reinforcement Learning
di: Lanier, Michael, et al.
Pubblicazione: (2024)
di: Lanier, Michael, et al.
Pubblicazione: (2024)
Arithmetic Control of LLMs for Diverse User Preferences: Directional Preference Alignment with Multi-Objective Rewards
di: Wang, Haoxiang, et al.
Pubblicazione: (2024)
di: Wang, Haoxiang, et al.
Pubblicazione: (2024)
POLO: Preference-Guided Multi-Turn Reinforcement Learning for Lead Optimization
di: Wang, Ziqing, et al.
Pubblicazione: (2025)
di: Wang, Ziqing, et al.
Pubblicazione: (2025)
Meta-Aligner: Bidirectional Preference-Policy Optimization for Multi-Objective LLMs Alignment
di: Xu, Wenzhe, et al.
Pubblicazione: (2026)
di: Xu, Wenzhe, et al.
Pubblicazione: (2026)
Behavior Preference Regression for Offline Reinforcement Learning
di: Srinivasan, Padmanaba, et al.
Pubblicazione: (2025)
di: Srinivasan, Padmanaba, et al.
Pubblicazione: (2025)
Learning Preference-Based Objectives from Clinical Narratives for Dynamic Sepsis Treatment
di: Tan, Daniel J., et al.
Pubblicazione: (2026)
di: Tan, Daniel J., et al.
Pubblicazione: (2026)
Inferring Preferences from Demonstrations in Multi-objective Reinforcement Learning
di: Lu, Junlin, et al.
Pubblicazione: (2024)
di: Lu, Junlin, et al.
Pubblicazione: (2024)
PB$^2$: Preference Space Exploration via Population-Based Methods in Preference-Based Reinforcement Learning
di: Driss, Brahim, et al.
Pubblicazione: (2025)
di: Driss, Brahim, et al.
Pubblicazione: (2025)
Adaptive Preference Scaling for Reinforcement Learning with Human Feedback
di: Hong, Ilgee, et al.
Pubblicazione: (2024)
di: Hong, Ilgee, et al.
Pubblicazione: (2024)
Deep Reinforcement Learning from Hierarchical Preference Design
di: Bukharin, Alexander, et al.
Pubblicazione: (2023)
di: Bukharin, Alexander, et al.
Pubblicazione: (2023)
Inferring Preferences from Demonstrations in Multi-Objective Residential Energy Management
di: Lu, Junlin, et al.
Pubblicazione: (2024)
di: Lu, Junlin, et al.
Pubblicazione: (2024)
Interpretability by Design for Efficient Multi-Objective Reinforcement Learning
di: Xia, Qiyue, et al.
Pubblicazione: (2025)
di: Xia, Qiyue, et al.
Pubblicazione: (2025)
LLMAP: LLM-Assisted Multi-Objective Route Planning with User Preferences
di: Yuan, Liangqi, et al.
Pubblicazione: (2025)
di: Yuan, Liangqi, et al.
Pubblicazione: (2025)
PARM: Multi-Objective Test-Time Alignment via Preference-Aware Autoregressive Reward Model
di: Lin, Baijiong, et al.
Pubblicazione: (2025)
di: Lin, Baijiong, et al.
Pubblicazione: (2025)
Prioritized Trajectory Replay: A Replay Memory for Data-driven Reinforcement Learning
di: Liu, Jinyi, et al.
Pubblicazione: (2023)
di: Liu, Jinyi, et al.
Pubblicazione: (2023)
Policy-labeled Preference Learning: Is Preference Enough for RLHF?
di: Cho, Taehyun, et al.
Pubblicazione: (2025)
di: Cho, Taehyun, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Optimizing Deep Reinforcement Learning for Adaptive Robotic Arm Control
di: Shianifar, Jonaid, et al.
Pubblicazione: (2024) -
Hindsight Preference Learning for Offline Preference-based Reinforcement Learning
di: Gao, Chen-Xiao, et al.
Pubblicazione: (2024) -
Demonstration Guided Multi-Objective Reinforcement Learning
di: Lu, Junlin, et al.
Pubblicazione: (2024) -
Preference Conditioned Multi-Objective Reinforcement Learning: Decomposed, Diversity-Driven Policy Optimization
di: Ambadkar, Tanmay, et al.
Pubblicazione: (2026) -
CodeIt: Self-Improving Language Models with Prioritized Hindsight Replay
di: Butt, Natasha, et al.
Pubblicazione: (2024)