PB$^2$: Preference Space Exploration via Population-Based Methods in Preference-Based Reinforcement Learning
Fuente:
arXiv
Guardado en:
| Autores principales: | Driss, Brahim, Davey, Alex, Akrour, Riad |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
StaQ it! Growing neural networks for Policy Mirror Descent
por: Shilova, Alena, et al.
Publicado: (2025)
por: Shilova, Alena, et al.
Publicado: (2025)
Limits of Actor-Critic Algorithms for Decision Tree Policies Learning in IBMDPs
por: Kohler, Hector, et al.
Publicado: (2023)
por: Kohler, Hector, et al.
Publicado: (2023)
Evaluating Interpretable Reinforcement Learning by Distilling Policies into Programs
por: Kohler, Hector, et al.
Publicado: (2025)
por: Kohler, Hector, et al.
Publicado: (2025)
Interpretable and Editable Programmatic Tree Policies for Reinforcement Learning
por: Kohler, Hector, et al.
Publicado: (2024)
por: Kohler, Hector, et al.
Publicado: (2024)
Efficient Preference-Based Reinforcement Learning: Randomized Exploration Meets Experimental Design
por: Schlaginhaufen, Andreas, et al.
Publicado: (2025)
por: Schlaginhaufen, Andreas, et al.
Publicado: (2025)
OPRIDE: Offline Preference-based Reinforcement Learning via In-Dataset Exploration
por: Yang, Yiqin, et al.
Publicado: (2026)
por: Yang, Yiqin, et al.
Publicado: (2026)
Performative Policy Gradient: Optimality in Performative Reinforcement Learning
por: Basu, Debabrota, et al.
Publicado: (2025)
por: Basu, Debabrota, et al.
Publicado: (2025)
Search-Based Credit Assignment for Offline Preference-Based Reinforcement Learning
por: Gao, Xiancheng, et al.
Publicado: (2025)
por: Gao, Xiancheng, et al.
Publicado: (2025)
Hindsight Preference Learning for Offline Preference-based Reinforcement Learning
por: Gao, Chen-Xiao, et al.
Publicado: (2024)
por: Gao, Chen-Xiao, et al.
Publicado: (2024)
Fine-tuning Behavioral Cloning Policies with Preference-Based Reinforcement Learning
por: Macuglia, Maël, et al.
Publicado: (2025)
por: Macuglia, Maël, et al.
Publicado: (2025)
Two-Step Offline Preference-Based Reinforcement Learning with Constrained Actions
por: Xu, Yinglun, et al.
Publicado: (2023)
por: Xu, Yinglun, et al.
Publicado: (2023)
Provable Reward-Agnostic Preference-Based Reinforcement Learning
por: Zhan, Wenhao, et al.
Publicado: (2023)
por: Zhan, Wenhao, et al.
Publicado: (2023)
When (and How) to Trust the Expert: Diagnosing Query-Time Expert-Guided Reinforcement Learning
por: Berthelot, Yann, et al.
Publicado: (2026)
por: Berthelot, Yann, et al.
Publicado: (2026)
RIME: Robust Preference-based Reinforcement Learning with Noisy Preferences
por: Cheng, Jie, et al.
Publicado: (2024)
por: Cheng, Jie, et al.
Publicado: (2024)
Preference Elicitation for Offline Reinforcement Learning
por: Pace, Alizée, et al.
Publicado: (2024)
por: Pace, Alizée, et al.
Publicado: (2024)
Hindsight Preference Replay Improves Preference-Conditioned Multi-Objective Reinforcement Learning
por: Shianifar, Jonaid, et al.
Publicado: (2026)
por: Shianifar, Jonaid, et al.
Publicado: (2026)
Debiasing Online Preference Learning via Preference Feature Preservation
por: Kim, Dongyoung, et al.
Publicado: (2025)
por: Kim, Dongyoung, et al.
Publicado: (2025)
Sample Efficient Preference Alignment in LLMs via Active Exploration
por: Mehta, Viraj, et al.
Publicado: (2023)
por: Mehta, Viraj, et al.
Publicado: (2023)
Bootstrapping LLMs via Preference-Based Policy Optimization
por: Jia, Chen
Publicado: (2025)
por: Jia, Chen
Publicado: (2025)
Behavior Preference Regression for Offline Reinforcement Learning
por: Srinivasan, Padmanaba, et al.
Publicado: (2025)
por: Srinivasan, Padmanaba, et al.
Publicado: (2025)
Trust, Don't Trust, or Flip: Robust Preference-Based Reinforcement Learning with Multi-Expert Feedback
por: Hosseini, Seyed Amir, et al.
Publicado: (2026)
por: Hosseini, Seyed Amir, et al.
Publicado: (2026)
Efficient Exploration for Iterative Nash Preference Optimization
por: Nan, Tianlong, et al.
Publicado: (2026)
por: Nan, Tianlong, et al.
Publicado: (2026)
Efficient Reinforcement Learning from Human Feedback via Bayesian Preference Inference
por: Cercola, Matteo, et al.
Publicado: (2025)
por: Cercola, Matteo, et al.
Publicado: (2025)
Adaptive Preference Scaling for Reinforcement Learning with Human Feedback
por: Hong, Ilgee, et al.
Publicado: (2024)
por: Hong, Ilgee, et al.
Publicado: (2024)
Deep Reinforcement Learning from Hierarchical Preference Design
por: Bukharin, Alexander, et al.
Publicado: (2023)
por: Bukharin, Alexander, et al.
Publicado: (2023)
Using LLMs to Model the Beliefs and Preferences of Targeted Populations
por: Namikoshi, Keiichi, et al.
Publicado: (2024)
por: Namikoshi, Keiichi, et al.
Publicado: (2024)
Policy-labeled Preference Learning: Is Preference Enough for RLHF?
por: Cho, Taehyun, et al.
Publicado: (2025)
por: Cho, Taehyun, et al.
Publicado: (2025)
Spurious Correlation Learning in Preference Optimization: Mechanisms, Consequences, and Mitigation via Tie Training
por: Moya, Christian, et al.
Publicado: (2026)
por: Moya, Christian, et al.
Publicado: (2026)
Adversarial Policy Optimization for Offline Preference-based Reinforcement Learning
por: Kang, Hyungkyu, et al.
Publicado: (2025)
por: Kang, Hyungkyu, et al.
Publicado: (2025)
Reinforcement Learning with Pairwise Preferences in Long-Term Decision Problems
por: Carr, Jonathan Colaço, et al.
Publicado: (2026)
por: Carr, Jonathan Colaço, et al.
Publicado: (2026)
Preferred-Action-Optimized Diffusion Policies for Offline Reinforcement Learning
por: Zhang, Tianle, et al.
Publicado: (2024)
por: Zhang, Tianle, et al.
Publicado: (2024)
Listwise Reward Estimation for Offline Preference-based Reinforcement Learning
por: Choi, Heewoong, et al.
Publicado: (2024)
por: Choi, Heewoong, et al.
Publicado: (2024)
Evaluating Feature Dependent Noise in Preference-based Reinforcement Learning
por: Li, Yuxuan, et al.
Publicado: (2026)
por: Li, Yuxuan, et al.
Publicado: (2026)
Preference-Based Alignment of Discrete Diffusion Models
por: Borso, Umberto, et al.
Publicado: (2025)
por: Borso, Umberto, et al.
Publicado: (2025)
Efficient On-Policy Reinforcement Learning via Exploration of Sparse Parameter Space
por: Zhang, Xinyu, et al.
Publicado: (2025)
por: Zhang, Xinyu, et al.
Publicado: (2025)
Residual Reward Models for Preference-based Reinforcement Learning
por: Cao, Chenyang, et al.
Publicado: (2025)
por: Cao, Chenyang, et al.
Publicado: (2025)
Preference-Based Learning in Audio Applications: A Systematic Analysis
por: Broukhim, Aaron, et al.
Publicado: (2025)
por: Broukhim, Aaron, et al.
Publicado: (2025)
Pref-GUIDE: Continual Policy Learning from Real-Time Human Feedback via Preference-Based Learning
por: Ji, Zhengran, et al.
Publicado: (2025)
por: Ji, Zhengran, et al.
Publicado: (2025)
Adaptive Alignment: Dynamic Preference Adjustments via Multi-Objective Reinforcement Learning for Pluralistic AI
por: Harland, Hadassah, et al.
Publicado: (2024)
por: Harland, Hadassah, et al.
Publicado: (2024)
MODULI: Unlocking Preference Generalization via Diffusion Models for Offline Multi-Objective Reinforcement Learning
por: Yuan, Yifu, et al.
Publicado: (2024)
por: Yuan, Yifu, et al.
Publicado: (2024)
Ejemplares similares
-
StaQ it! Growing neural networks for Policy Mirror Descent
por: Shilova, Alena, et al.
Publicado: (2025) -
Limits of Actor-Critic Algorithms for Decision Tree Policies Learning in IBMDPs
por: Kohler, Hector, et al.
Publicado: (2023) -
Evaluating Interpretable Reinforcement Learning by Distilling Policies into Programs
por: Kohler, Hector, et al.
Publicado: (2025) -
Interpretable and Editable Programmatic Tree Policies for Reinforcement Learning
por: Kohler, Hector, et al.
Publicado: (2024) -
Efficient Preference-Based Reinforcement Learning: Randomized Exploration Meets Experimental Design
por: Schlaginhaufen, Andreas, et al.
Publicado: (2025)