To the Max: Reinventing Reward in Reinforcement Learning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Veviurko, Grigorii, Böhmer, Wendelin, de Weerdt, Mathijs |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
You Shall Pass: Dealing with the Zero-Gradient Problem in Predict and Optimize for Convex Optimization
par: Veviurko, Grigorii, et autres
Publié: (2023)
par: Veviurko, Grigorii, et autres
Publié: (2023)
A Penalty-Based Guardrail Algorithm for Non-Decreasing Optimization with Inequality Constraints
par: Stepanovic, Ksenija, et autres
Publié: (2024)
par: Stepanovic, Ksenija, et autres
Publié: (2024)
Sufficient Decision Proxies for Decision-Focused Learning
par: Schutte, Noah, et autres
Publié: (2025)
par: Schutte, Noah, et autres
Publié: (2025)
Diverse Projection Ensembles for Distributional Reinforcement Learning
par: Zanger, Moritz A., et autres
Publié: (2023)
par: Zanger, Moritz A., et autres
Publié: (2023)
Improving Robustness of AlphaZero Algorithms to Test-Time Environment Changes
par: Tamassia, Isidoro, et autres
Publié: (2025)
par: Tamassia, Isidoro, et autres
Publié: (2025)
TransZero: Parallel Tree Expansion in MuZero using Transformer Networks
par: Malmsten, Emil, et autres
Publié: (2025)
par: Malmsten, Emil, et autres
Publié: (2025)
Explore-Go: Leveraging Exploration for Generalisation in Deep Reinforcement Learning
par: Weltevrede, Max, et autres
Publié: (2024)
par: Weltevrede, Max, et autres
Publié: (2024)
Bayesian Meta-Reinforcement Learning with Laplace Variational Recurrent Networks
par: de Vries, Joery A., et autres
Publié: (2025)
par: de Vries, Joery A., et autres
Publié: (2025)
How Ensembles of Distilled Policies Improve Generalisation in Reinforcement Learning
par: Weltevrede, Max, et autres
Publié: (2025)
par: Weltevrede, Max, et autres
Publié: (2025)
Generalisation to unseen topologies: Towards control of biological neural network activity
par: Engwegen, Laurens, et autres
Publié: (2024)
par: Engwegen, Laurens, et autres
Publié: (2024)
VariBASed: Variational Bayes-Adaptive Sequential Monte-Carlo Planning for Deep Reinforcement Learning
par: de Vries, Joery A., et autres
Publié: (2026)
par: de Vries, Joery A., et autres
Publié: (2026)
Learning From Scenarios for Stochastic Repairable Scheduling
par: Houten, Kim van den, et autres
Publié: (2023)
par: Houten, Kim van den, et autres
Publié: (2023)
Exploration Implies Data Augmentation: Reachability and Generalisation in Contextual MDPs
par: Weltevrede, Max, et autres
Publié: (2024)
par: Weltevrede, Max, et autres
Publié: (2024)
Epistemic Monte Carlo Tree Search
par: Oren, Yaniv, et autres
Publié: (2022)
par: Oren, Yaniv, et autres
Publié: (2022)
Sparse Masked Attention Policies for Reliable Generalization
par: Horsch, Caroline, et autres
Publié: (2026)
par: Horsch, Caroline, et autres
Publié: (2026)
MaxCode: A Max-Reward Reinforcement Learning Framework for Automated Code Optimization
par: Ou, Jiefu, et autres
Publié: (2026)
par: Ou, Jiefu, et autres
Publié: (2026)
Efficient Reward Identification In Max Entropy Reinforcement Learning with Sparsity and Rank Priors
par: Shehab, Mohamad Louai, et autres
Publié: (2025)
par: Shehab, Mohamad Louai, et autres
Publié: (2025)
EfficientTDMPC: Improved MPC Objectives for Sample-Efficient Continuous Control
par: Evers, Thomas, et autres
Publié: (2026)
par: Evers, Thomas, et autres
Publié: (2026)
EXPObench: Benchmarking Surrogate-based Optimisation Algorithms on Expensive Black-box Functions
par: Bliek, Laurens, et autres
Publié: (2021)
par: Bliek, Laurens, et autres
Publié: (2021)
PMCTS: Particle Monte Carlo Tree Search for Principled Parallelized Inference Time Scaling
par: Oren, Yaniv, et autres
Publié: (2026)
par: Oren, Yaniv, et autres
Publié: (2026)
Optimal or Greedy Decision Trees? Revisiting their Objectives, Tuning, and Performance
par: van der Linden, Jacobus G. M., et autres
Publié: (2024)
par: van der Linden, Jacobus G. M., et autres
Publié: (2024)
Contextual Similarity Distillation: Ensemble Uncertainties with a Single Model
par: Zanger, Moritz A., et autres
Publié: (2025)
par: Zanger, Moritz A., et autres
Publié: (2025)
TamedPUMA: safe and stable imitation learning with geometric fabrics
par: Bakker, Saray, et autres
Publié: (2025)
par: Bakker, Saray, et autres
Publié: (2025)
Twice Sequential Monte Carlo for Tree Search
par: Oren, Yaniv, et autres
Publié: (2025)
par: Oren, Yaniv, et autres
Publié: (2025)
Reward-Conditioned Reinforcement Learning
par: Nauman, Michal, et autres
Publié: (2026)
par: Nauman, Michal, et autres
Publié: (2026)
On the Equivalence of Random Network Distillation, Deep Ensembles, and Bayesian Inference
par: Zanger, Moritz A., et autres
Publié: (2026)
par: Zanger, Moritz A., et autres
Publié: (2026)
Reinforcement Learning from Bagged Reward
par: Tang, Yuting, et autres
Publié: (2024)
par: Tang, Yuting, et autres
Publié: (2024)
The Value of Reward Lookahead in Reinforcement Learning
par: Merlis, Nadav, et autres
Publié: (2024)
par: Merlis, Nadav, et autres
Publié: (2024)
Informativeness of Reward Functions in Reinforcement Learning
par: Devidze, Rati, et autres
Publié: (2024)
par: Devidze, Rati, et autres
Publié: (2024)
Reward Design for Reinforcement Learning Agents
par: Devidze, Rati
Publié: (2025)
par: Devidze, Rati
Publié: (2025)
The Distributional Reward Critic Framework for Reinforcement Learning Under Perturbed Rewards
par: Chen, Xi, et autres
Publié: (2024)
par: Chen, Xi, et autres
Publié: (2024)
Focal Reward: Balanced Reinforcement Learning under Rubric-Based Rewards
par: Huang, Yu, et autres
Publié: (2026)
par: Huang, Yu, et autres
Publié: (2026)
On-Robot Reinforcement Learning with Goal-Contrastive Rewards
par: Biza, Ondrej, et autres
Publié: (2024)
par: Biza, Ondrej, et autres
Publié: (2024)
Constrained Multi-Objective Reinforcement Learning with Max-Min Criterion
par: Park, Giseung, et autres
Publié: (2026)
par: Park, Giseung, et autres
Publié: (2026)
Code as Reward: Empowering Reinforcement Learning with VLMs
par: Venuto, David, et autres
Publié: (2024)
par: Venuto, David, et autres
Publié: (2024)
Effective Reward Specification in Deep Reinforcement Learning
par: Roy, Julien
Publié: (2024)
par: Roy, Julien
Publié: (2024)
Binary Reward Labeling: Bridging Offline Preference and Reward-Based Reinforcement Learning
par: Xu, Yinglun, et autres
Publié: (2024)
par: Xu, Yinglun, et autres
Publié: (2024)
Risk-Averse Total-Reward Reinforcement Learning
par: Su, Xihong, et autres
Publié: (2025)
par: Su, Xihong, et autres
Publié: (2025)
Reward-Preserving Attacks For Robust Reinforcement Learning
par: Schott, Lucas, et autres
Publié: (2026)
par: Schott, Lucas, et autres
Publié: (2026)
Reward-Aware Proto-Representations in Reinforcement Learning
par: Tse, Hon Tik, et autres
Publié: (2025)
par: Tse, Hon Tik, et autres
Publié: (2025)
Documents similaires
-
You Shall Pass: Dealing with the Zero-Gradient Problem in Predict and Optimize for Convex Optimization
par: Veviurko, Grigorii, et autres
Publié: (2023) -
A Penalty-Based Guardrail Algorithm for Non-Decreasing Optimization with Inequality Constraints
par: Stepanovic, Ksenija, et autres
Publié: (2024) -
Sufficient Decision Proxies for Decision-Focused Learning
par: Schutte, Noah, et autres
Publié: (2025) -
Diverse Projection Ensembles for Distributional Reinforcement Learning
par: Zanger, Moritz A., et autres
Publié: (2023) -
Improving Robustness of AlphaZero Algorithms to Test-Time Environment Changes
par: Tamassia, Isidoro, et autres
Publié: (2025)