Issues with Value-Based Multi-objective Reinforcement Learning: Value Function Interference and Overestimation Sensitivity
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Vamplew, Peter, Ethan, Watkins, Foale, Cameron, Dazeley, Richard |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
An Empirical Investigation of Value-Based Multi-objective Reinforcement Learning for Stochastic Environments
par: Ding, Kewen, et autres
Publié: (2024)
par: Ding, Kewen, et autres
Publié: (2024)
Multi-objective Reinforcement Learning With Augmented States Requires Rewards After Deployment
par: Vamplew, Peter, et autres
Publié: (2026)
par: Vamplew, Peter, et autres
Publié: (2026)
Multi-objective Reinforcement Learning: A Tool for Pluralistic Alignment
par: Vamplew, Peter, et autres
Publié: (2024)
par: Vamplew, Peter, et autres
Publié: (2024)
ES-C51: Expected Sarsa Based C51 Distributional Reinforcement Learning Algorithm
par: Tandon, Rijul, et autres
Publié: (2025)
par: Tandon, Rijul, et autres
Publié: (2025)
Learning the Value Systems of Societies with Preference-based Multi-objective Reinforcement Learning
par: Holgado-Sánchez, Andrés, et autres
Publié: (2026)
par: Holgado-Sánchez, Andrés, et autres
Publié: (2026)
Utility-Based Reinforcement Learning: Unifying Single-objective and Multi-objective Reinforcement Learning
par: Vamplew, Peter, et autres
Publié: (2024)
par: Vamplew, Peter, et autres
Publié: (2024)
Adaptive Alignment: Dynamic Preference Adjustments via Multi-Objective Reinforcement Learning for Pluralistic AI
par: Harland, Hadassah, et autres
Publié: (2024)
par: Harland, Hadassah, et autres
Publié: (2024)
Ensemble Elastic DQN: A novel multi-step ensemble approach to address overestimation in deep value-based reinforcement learning
par: Ly, Adrian, et autres
Publié: (2025)
par: Ly, Adrian, et autres
Publié: (2025)
On Generalization Across Environments In Multi-Objective Reinforcement Learning
par: Teoh, Jayden, et autres
Publié: (2025)
par: Teoh, Jayden, et autres
Publié: (2025)
Factored Value Functions for Graph-Based Multi-Agent Reinforcement Learning
par: Rashwan, Ahmed, et autres
Publié: (2026)
par: Rashwan, Ahmed, et autres
Publié: (2026)
Fixing Incomplete Value Function Decomposition for Multi-Agent Reinforcement Learning
par: Baisero, Andrea, et autres
Publié: (2025)
par: Baisero, Andrea, et autres
Publié: (2025)
Learning Rewards, Not Labels: Adversarial Inverse Reinforcement Learning for Machinery Fault Detection
par: Neupane, Dhiraj, et autres
Publié: (2026)
par: Neupane, Dhiraj, et autres
Publié: (2026)
Ensemble Value Functions for Efficient Exploration in Multi-Agent Reinforcement Learning
par: Schäfer, Lukas, et autres
Publié: (2023)
par: Schäfer, Lukas, et autres
Publié: (2023)
Robust Risk-Sensitive Reinforcement Learning with Conditional Value-at-Risk
par: Ni, Xinyi, et autres
Publié: (2024)
par: Ni, Xinyi, et autres
Publié: (2024)
A Tensor Low-Rank Approximation for Value Functions in Multi-Task Reinforcement Learning
par: Rozada, Sergio, et autres
Publié: (2025)
par: Rozada, Sergio, et autres
Publié: (2025)
Distributed Multi-Agent Reinforcement Learning Based on Graph-Induced Local Value Functions
par: Jing, Gangshan, et autres
Publié: (2022)
par: Jing, Gangshan, et autres
Publié: (2022)
Value-Based Deep Multi-Agent Reinforcement Learning with Dynamic Sparse Training
par: Hu, Pihe, et autres
Publié: (2024)
par: Hu, Pihe, et autres
Publié: (2024)
Is there Value in Reinforcement Learning?
par: Fox, Lior, et autres
Publié: (2025)
par: Fox, Lior, et autres
Publié: (2025)
Value-Distributional Model-Based Reinforcement Learning
par: Luis, Carlos E., et autres
Publié: (2023)
par: Luis, Carlos E., et autres
Publié: (2023)
Overestimation, Overfitting, and Plasticity in Actor-Critic: the Bitter Lesson of Reinforcement Learning
par: Nauman, Michal, et autres
Publié: (2024)
par: Nauman, Michal, et autres
Publié: (2024)
Statistical Inference of the Value Function for Reinforcement Learning in Infinite Horizon Settings
par: Shi, C., et autres
Publié: (2020)
par: Shi, C., et autres
Publié: (2020)
VIPO: Value Function Inconsistency Penalized Offline Reinforcement Learning
par: Chen, Xuyang, et autres
Publié: (2025)
par: Chen, Xuyang, et autres
Publié: (2025)
The Value of Reward Lookahead in Reinforcement Learning
par: Merlis, Nadav, et autres
Publié: (2024)
par: Merlis, Nadav, et autres
Publié: (2024)
Wireless Communication Enhanced Value Decomposition for Multi-Agent Reinforcement Learning
par: Hu, Diyi, et autres
Publié: (2026)
par: Hu, Diyi, et autres
Publié: (2026)
Value-Guidance MeanFlow for Offline Multi-Agent Reinforcement Learning
par: Pang, Teng, et autres
Publié: (2026)
par: Pang, Teng, et autres
Publié: (2026)
Nonparametric Additive Value Functions: Interpretable Reinforcement Learning with an Application to Surgical Recovery
par: Emedom-Nnamdi, Patrick, et autres
Publié: (2023)
par: Emedom-Nnamdi, Patrick, et autres
Publié: (2023)
MACTAS: Self-Attention-Based Inter-Agent Communication in Multi-Agent Reinforcement Learning with Action-Value Function Decomposition
par: Wojtala, Maciej, et autres
Publié: (2025)
par: Wojtala, Maciej, et autres
Publié: (2025)
Continuous-Time Value Iteration for Multi-Agent Reinforcement Learning
par: Wang, Xuefeng, et autres
Publié: (2025)
par: Wang, Xuefeng, et autres
Publié: (2025)
Is Value Functions Estimation with Classification Plug-and-play for Offline Reinforcement Learning?
par: Tarasov, Denis, et autres
Publié: (2024)
par: Tarasov, Denis, et autres
Publié: (2024)
Tensor and Matrix Low-Rank Value-Function Approximation in Reinforcement Learning
par: Rozada, Sergio, et autres
Publié: (2022)
par: Rozada, Sergio, et autres
Publié: (2022)
Value Gradient Sampler: Learning Invariant Value Functions for Equivariant Diffusion Sampling
par: Hwang, Himchan, et autres
Publié: (2025)
par: Hwang, Himchan, et autres
Publié: (2025)
Walking the Values in Bayesian Inverse Reinforcement Learning
par: Bajgar, Ondrej, et autres
Publié: (2024)
par: Bajgar, Ondrej, et autres
Publié: (2024)
Utilizing Maximum Mean Discrepancy Barycenter for Propagating the Uncertainty of Value Functions in Reinforcement Learning
par: Roy, Srinjoy, et autres
Publié: (2024)
par: Roy, Srinjoy, et autres
Publié: (2024)
Safety-Aware Reinforcement Learning for Control via Risk-Sensitive Action-Value Iteration and Quantile Regression
par: Enwerem, Clinton, et autres
Publié: (2025)
par: Enwerem, Clinton, et autres
Publié: (2025)
QSIM: Mitigating Overestimation in Multi-Agent Reinforcement Learning via Action Similarity Weighted Q-Learning
par: Li, Yuanjun, et autres
Publié: (2026)
par: Li, Yuanjun, et autres
Publié: (2026)
Don't Forget the Critic: Value-Based Data Rehearsal for Multi-Cyclic Continual Reinforcement Learning
par: Poole, Benjamin, et autres
Publié: (2026)
par: Poole, Benjamin, et autres
Publié: (2026)
On the Reduction of Variance and Overestimation of Deep Q-Learning
par: Sabry, Mohammed, et autres
Publié: (2019)
par: Sabry, Mohammed, et autres
Publié: (2019)
Sample and Oracle Efficient Reinforcement Learning for MDPs with Linearly-Realizable Value Functions
par: Mhammedi, Zakaria
Publié: (2024)
par: Mhammedi, Zakaria
Publié: (2024)
UDQL: Bridging The Gap between MSE Loss and The Optimal Value Function in Offline Reinforcement Learning
par: Zhang, Yu, et autres
Publié: (2024)
par: Zhang, Yu, et autres
Publié: (2024)
Extreme Value Policy Optimization for Safe Reinforcement Learning
par: Gao, Shiqing, et autres
Publié: (2026)
par: Gao, Shiqing, et autres
Publié: (2026)
Documents similaires
-
An Empirical Investigation of Value-Based Multi-objective Reinforcement Learning for Stochastic Environments
par: Ding, Kewen, et autres
Publié: (2024) -
Multi-objective Reinforcement Learning With Augmented States Requires Rewards After Deployment
par: Vamplew, Peter, et autres
Publié: (2026) -
Multi-objective Reinforcement Learning: A Tool for Pluralistic Alignment
par: Vamplew, Peter, et autres
Publié: (2024) -
ES-C51: Expected Sarsa Based C51 Distributional Reinforcement Learning Algorithm
par: Tandon, Rijul, et autres
Publié: (2025) -
Learning the Value Systems of Societies with Preference-based Multi-objective Reinforcement Learning
par: Holgado-Sánchez, Andrés, et autres
Publié: (2026)