Reinforcement Learning with Pairwise Preferences in Long-Term Decision Problems
Fuente:
arXiv
Salvato in:
| Autori principali: | Carr, Jonathan Colaço, Panangaden, Prakash, Precup, Doina, Van Roy, Benjamin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Conditions on Preference Relations that Guarantee the Existence of Optimal Policies
di: Carr, Jonathan Colaço, et al.
Pubblicazione: (2023)
di: Carr, Jonathan Colaço, et al.
Pubblicazione: (2023)
Policy Gradient Methods in the Presence of Symmetries and State Abstractions
di: Panangaden, Prakash, et al.
Pubblicazione: (2023)
di: Panangaden, Prakash, et al.
Pubblicazione: (2023)
A Look at Value-Based Decision-Time vs. Background Planning Methods Across Different Settings
di: Alver, Safa, et al.
Pubblicazione: (2022)
di: Alver, Safa, et al.
Pubblicazione: (2022)
Capacity-Constrained Continual Learning
di: Wen, Zheng, et al.
Pubblicazione: (2025)
di: Wen, Zheng, et al.
Pubblicazione: (2025)
Partial Models for Building Adaptive Model-Based Reinforcement Learning Agents
di: Alver, Safa, et al.
Pubblicazione: (2024)
di: Alver, Safa, et al.
Pubblicazione: (2024)
Parseval Regularization for Continual Reinforcement Learning
di: Chung, Wesley, et al.
Pubblicazione: (2024)
di: Chung, Wesley, et al.
Pubblicazione: (2024)
Sparse-Reg: Improving Sample Complexity in Offline Reinforcement Learning using Sparsity
di: Arnob, Samin Yeasar, et al.
Pubblicazione: (2025)
di: Arnob, Samin Yeasar, et al.
Pubblicazione: (2025)
Fluid-Agent Reinforcement Learning
di: Sharma, Shishir, et al.
Pubblicazione: (2026)
di: Sharma, Shishir, et al.
Pubblicazione: (2026)
Diversity-Enriched Option-Critic
di: Kamat, Anand, et al.
Pubblicazione: (2020)
di: Kamat, Anand, et al.
Pubblicazione: (2020)
Functional Acceleration for Policy Mirror Descent
di: Chelu, Veronica, et al.
Pubblicazione: (2024)
di: Chelu, Veronica, et al.
Pubblicazione: (2024)
Incorporating Spatial Information into Goal-Conditioned Hierarchical Reinforcement Learning via Graph Representations
di: Zhang, Shuyuan, et al.
Pubblicazione: (2025)
di: Zhang, Shuyuan, et al.
Pubblicazione: (2025)
Focused Skill Discovery: Learning to Control Specific State Variables while Minimizing Side Effects
di: Carr, Jonathan Colaço, et al.
Pubblicazione: (2025)
di: Carr, Jonathan Colaço, et al.
Pubblicazione: (2025)
Understanding Behavioral Metric Learning: A Large-Scale Study on Distracting Reinforcement Learning Environments
di: Luo, Ziyan, et al.
Pubblicazione: (2025)
di: Luo, Ziyan, et al.
Pubblicazione: (2025)
Consciousness-Inspired Spatio-Temporal Abstractions for Better Generalization in Reinforcement Learning
di: Zhao, Mingde, et al.
Pubblicazione: (2023)
di: Zhao, Mingde, et al.
Pubblicazione: (2023)
Adaptive Exploration for Data-Efficient General Value Function Evaluations
di: Jain, Arushi, et al.
Pubblicazione: (2024)
di: Jain, Arushi, et al.
Pubblicazione: (2024)
More Efficient Randomized Exploration for Reinforcement Learning via Approximate Sampling
di: Ishfaq, Haque, et al.
Pubblicazione: (2024)
di: Ishfaq, Haque, et al.
Pubblicazione: (2024)
Uncovering a Universal Abstract Algorithm for Modular Addition in Neural Networks
di: McCracken, Gavin, et al.
Pubblicazione: (2025)
di: McCracken, Gavin, et al.
Pubblicazione: (2025)
Preference-based Reinforcement Learning beyond Pairwise Comparisons: Benefits of Multiple Options
di: Lee, Joongkyu, et al.
Pubblicazione: (2025)
di: Lee, Joongkyu, et al.
Pubblicazione: (2025)
Capturing Individual Human Preferences with Reward Features
di: Barreto, André, et al.
Pubblicazione: (2025)
di: Barreto, André, et al.
Pubblicazione: (2025)
Studying the Interplay Between the Actor and Critic Representations in Reinforcement Learning
di: Garcin, Samuel, et al.
Pubblicazione: (2025)
di: Garcin, Samuel, et al.
Pubblicazione: (2025)
Finite time analysis of temporal difference learning with linear function approximation: Tail averaging and regularisation
di: Patil, Gandharv, et al.
Pubblicazione: (2022)
di: Patil, Gandharv, et al.
Pubblicazione: (2022)
Affordances Enable Partial World Modeling with LLMs
di: Khetarpal, Khimya, et al.
Pubblicazione: (2026)
di: Khetarpal, Khimya, et al.
Pubblicazione: (2026)
Satisficing Exploration for Deep Reinforcement Learning
di: Arumugam, Dilip, et al.
Pubblicazione: (2024)
di: Arumugam, Dilip, et al.
Pubblicazione: (2024)
Rotation-Preserving Supervised Fine-Tuning
di: Jin, Hangzhan, et al.
Pubblicazione: (2026)
di: Jin, Hangzhan, et al.
Pubblicazione: (2026)
Should We Ever Prefer Decision Transformer for Offline Reinforcement Learning?
di: Omori, Yumi, et al.
Pubblicazione: (2025)
di: Omori, Yumi, et al.
Pubblicazione: (2025)
RLLTE: Long-Term Evolution Project of Reinforcement Learning
di: Yuan, Mingqi, et al.
Pubblicazione: (2023)
di: Yuan, Mingqi, et al.
Pubblicazione: (2023)
Local Pairwise Distance Matching for Backpropagation-Free Reinforcement Learning
di: Tanneberg, Daniel
Pubblicazione: (2025)
di: Tanneberg, Daniel
Pubblicazione: (2025)
RL Fine-Tuning Heals OOD Forgetting in SFT
di: Jin, Hangzhan, et al.
Pubblicazione: (2025)
di: Jin, Hangzhan, et al.
Pubblicazione: (2025)
Continual Learning as Computationally Constrained Reinforcement Learning
di: Kumar, Saurabh, et al.
Pubblicazione: (2023)
di: Kumar, Saurabh, et al.
Pubblicazione: (2023)
Hindsight Preference Learning for Offline Preference-based Reinforcement Learning
di: Gao, Chen-Xiao, et al.
Pubblicazione: (2024)
di: Gao, Chen-Xiao, et al.
Pubblicazione: (2024)
Effective Protein-Protein Interaction Exploration with PPIretrieval
di: Hua, Chenqing, et al.
Pubblicazione: (2024)
di: Hua, Chenqing, et al.
Pubblicazione: (2024)
Information-Theoretic Foundations for Machine Learning
di: Jeon, Hong Jun, et al.
Pubblicazione: (2024)
di: Jeon, Hong Jun, et al.
Pubblicazione: (2024)
Pairwise Difference Learning for Classification
di: Belaid, Mohamed Karim, et al.
Pubblicazione: (2024)
di: Belaid, Mohamed Karim, et al.
Pubblicazione: (2024)
$i$REPO: $i$mplicit Reward Pairwise Difference based Empirical Preference Optimization
di: Le, Long Tan, et al.
Pubblicazione: (2024)
di: Le, Long Tan, et al.
Pubblicazione: (2024)
Preference Conditioned Multi-Objective Reinforcement Learning: Decomposed, Diversity-Driven Policy Optimization
di: Ambadkar, Tanmay, et al.
Pubblicazione: (2026)
di: Ambadkar, Tanmay, et al.
Pubblicazione: (2026)
Preference Elicitation for Offline Reinforcement Learning
di: Pace, Alizée, et al.
Pubblicazione: (2024)
di: Pace, Alizée, et al.
Pubblicazione: (2024)
Reinforcement Learning-based Approach for Vehicle-to-Building Charging with Heterogeneous Agents and Long Term Rewards
di: Liu, Fangqi, et al.
Pubblicazione: (2025)
di: Liu, Fangqi, et al.
Pubblicazione: (2025)
Long and Short-Term Constraints Driven Safe Reinforcement Learning for Autonomous Driving
di: Hu, Xuemin, et al.
Pubblicazione: (2024)
di: Hu, Xuemin, et al.
Pubblicazione: (2024)
Maintaining Plasticity in Continual Learning via Regenerative Regularization
di: Kumar, Saurabh, et al.
Pubblicazione: (2023)
di: Kumar, Saurabh, et al.
Pubblicazione: (2023)
Behavior Preference Regression for Offline Reinforcement Learning
di: Srinivasan, Padmanaba, et al.
Pubblicazione: (2025)
di: Srinivasan, Padmanaba, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Conditions on Preference Relations that Guarantee the Existence of Optimal Policies
di: Carr, Jonathan Colaço, et al.
Pubblicazione: (2023) -
Policy Gradient Methods in the Presence of Symmetries and State Abstractions
di: Panangaden, Prakash, et al.
Pubblicazione: (2023) -
A Look at Value-Based Decision-Time vs. Background Planning Methods Across Different Settings
di: Alver, Safa, et al.
Pubblicazione: (2022) -
Capacity-Constrained Continual Learning
di: Wen, Zheng, et al.
Pubblicazione: (2025) -
Partial Models for Building Adaptive Model-Based Reinforcement Learning Agents
di: Alver, Safa, et al.
Pubblicazione: (2024)