Beyond Expected Return: Accounting for Policy Reproducibility when Evaluating Reinforcement Learning Algorithms
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Flageat, Manon, Lim, Bryan, Cully, Antoine |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Large Language Models as In-context AI Generators for Quality-Diversity
par: Lim, Bryan, et autres
Publié: (2024)
par: Lim, Bryan, et autres
Publié: (2024)
Enhancing MAP-Elites with Multiple Parallel Evolution Strategies
par: Flageat, Manon, et autres
Publié: (2023)
par: Flageat, Manon, et autres
Publié: (2023)
Synergizing Quality-Diversity with Descriptor-Conditioned Reinforcement Learning
par: Faldor, Maxence, et autres
Publié: (2023)
par: Faldor, Maxence, et autres
Publié: (2023)
Exploring the Performance-Reproducibility Trade-off in Quality-Diversity
par: Flageat, Manon, et autres
Publié: (2024)
par: Flageat, Manon, et autres
Publié: (2024)
Multi-objective Reinforcement Learning with Nonlinear Preferences: Provable Approximation for Maximizing Expected Scalarized Return
par: Peng, Nianli, et autres
Publié: (2023)
par: Peng, Nianli, et autres
Publié: (2023)
CAX: Cellular Automata Accelerated in JAX
par: Faldor, Maxence, et autres
Publié: (2024)
par: Faldor, Maxence, et autres
Publié: (2024)
Expected Return Causes Outcome-Level Mode Collapse in Reinforcement Learning and How to Fix It with Inverse Probability Scaling
par: Sinha, Abhijeet, et autres
Publié: (2026)
par: Sinha, Abhijeet, et autres
Publié: (2026)
Development and Validation of Heparin Dosing Policies Using an Offline Reinforcement Learning Algorithm
par: Lim, Yooseok, et autres
Publié: (2024)
par: Lim, Yooseok, et autres
Publié: (2024)
Behaviour Policy Optimization: Provably Lower Variance Return Estimates for Off-Policy Reinforcement Learning
par: Goodall, Alexander W., et autres
Publié: (2025)
par: Goodall, Alexander W., et autres
Publié: (2025)
Policy Newton Algorithm in Reproducing Kernel Hilbert Space
par: Zhang, Yixian, et autres
Publié: (2025)
par: Zhang, Yixian, et autres
Publié: (2025)
Dreaming in Code for Curriculum Learning in Open-Ended Worlds
par: Mitsides, Konstantinos, et autres
Publié: (2026)
par: Mitsides, Konstantinos, et autres
Publié: (2026)
Scaling Policy Gradient Quality-Diversity with Massive Parallelization via Behavioral Variations
par: Mitsides, Konstantinos, et autres
Publié: (2025)
par: Mitsides, Konstantinos, et autres
Publié: (2025)
Multi-Objective Quality-Diversity in Unstructured and Unbounded Spaces
par: Janmohamed, Hannah, et autres
Publié: (2025)
par: Janmohamed, Hannah, et autres
Publié: (2025)
Quality-Diversity Actor-Critic: Learning High-Performing and Diverse Behaviors via Value and Successor Features Critics
par: Grillotti, Luca, et autres
Publié: (2024)
par: Grillotti, Luca, et autres
Publié: (2024)
R2L: Reliable Reinforcement Learning: Guaranteed Return & Reliable Policies in Reinforcement Learning
par: Farhi, Nadir
Publié: (2025)
par: Farhi, Nadir
Publié: (2025)
Meta-Learning Reinforcement Learning for Crypto-Return Prediction
par: Wang, Junqiao, et autres
Publié: (2025)
par: Wang, Junqiao, et autres
Publié: (2025)
Towards Assessing and Benchmarking Risk-Return Tradeoff of Off-Policy Evaluation
par: Kiyohara, Haruka, et autres
Publié: (2023)
par: Kiyohara, Haruka, et autres
Publié: (2023)
Evaluation-Time Policy Switching for Offline Reinforcement Learning
par: Neggatu, Natinael Solomon, et autres
Publié: (2025)
par: Neggatu, Natinael Solomon, et autres
Publié: (2025)
Evaluating Interpretable Reinforcement Learning by Distilling Policies into Programs
par: Kohler, Hector, et autres
Publié: (2025)
par: Kohler, Hector, et autres
Publié: (2025)
Revisiting Generative Policies: A Simpler Reinforcement Learning Algorithmic Perspective
par: Zhang, Jinouwen, et autres
Publié: (2024)
par: Zhang, Jinouwen, et autres
Publié: (2024)
Evaluating Robustness of Reinforcement Learning Algorithms for Autonomous Shipping
par: Lesy, Bavo, et autres
Publié: (2024)
par: Lesy, Bavo, et autres
Publié: (2024)
Offline Policy Evaluation for Reinforcement Learning with Adaptively Collected Data
par: Madhow, Sunil, et autres
Publié: (2023)
par: Madhow, Sunil, et autres
Publié: (2023)
The Definitive Guide to Policy Gradients in Deep Reinforcement Learning: Theory, Algorithms and Implementations
par: Lehmann, Matthias
Publié: (2024)
par: Lehmann, Matthias
Publié: (2024)
STAS: Spatial-Temporal Return Decomposition for Multi-agent Reinforcement Learning
par: Chen, Sirui, et autres
Publié: (2023)
par: Chen, Sirui, et autres
Publié: (2023)
Events as Triggers for Behavioral Diversity in Multi-Agent Reinforcement Learning
par: Büchi, Hannes, et autres
Publié: (2026)
par: Büchi, Hannes, et autres
Publié: (2026)
In-Dataset Trajectory Return Regularization for Offline Preference-based Reinforcement Learning
par: Tu, Songjun, et autres
Publié: (2024)
par: Tu, Songjun, et autres
Publié: (2024)
Return Augmented Decision Transformer for Off-Dynamics Reinforcement Learning
par: Wang, Ruhan, et autres
Publié: (2024)
par: Wang, Ruhan, et autres
Publié: (2024)
Scaling of Search and Learning: A Roadmap to Reproduce o1 from Reinforcement Learning Perspective
par: Zeng, Zhiyuan, et autres
Publié: (2024)
par: Zeng, Zhiyuan, et autres
Publié: (2024)
CUER: Corrected Uniform Experience Replay for Off-Policy Continuous Deep Reinforcement Learning Algorithms
par: Yenicesu, Arda Sarp, et autres
Publié: (2024)
par: Yenicesu, Arda Sarp, et autres
Publié: (2024)
Enhancing Hardware Fault Tolerance in Machines with Reinforcement Learning Policy Gradient Algorithms
par: Schoepp, Sheila, et autres
Publié: (2024)
par: Schoepp, Sheila, et autres
Publié: (2024)
From Tabula Rasa to Emergent Abilities: Discovering Robot Skills via Real-World Unsupervised Quality-Diversity
par: Grillotti, Luca, et autres
Publié: (2025)
par: Grillotti, Luca, et autres
Publié: (2025)
Uncertainty-aware Evaluation of Auxiliary Anomalies with the Expected Anomaly Posterior
par: Perini, Lorenzo, et autres
Publié: (2024)
par: Perini, Lorenzo, et autres
Publié: (2024)
Q-Policy: Quantum-Enhanced Policy Evaluation for Scalable Reinforcement Learning
par: Cherukuri, Kalyan, et autres
Publié: (2025)
par: Cherukuri, Kalyan, et autres
Publié: (2025)
Moments Matter:Stabilizing Policy Optimization using Return Distributions
par: Jabs, Dennis, et autres
Publié: (2026)
par: Jabs, Dennis, et autres
Publié: (2026)
SCOPE-RL: A Python Library for Offline Reinforcement Learning and Off-Policy Evaluation
par: Kiyohara, Haruka, et autres
Publié: (2023)
par: Kiyohara, Haruka, et autres
Publié: (2023)
Reinforcement Learning for Durable Algorithmic Recourse
par: Ceccon, Marina, et autres
Publié: (2025)
par: Ceccon, Marina, et autres
Publié: (2025)
MiWaves Reinforcement Learning Algorithm
par: Ghosh, Susobhan, et autres
Publié: (2024)
par: Ghosh, Susobhan, et autres
Publié: (2024)
Agnostic Reinforcement Learning: Foundations and Algorithms
par: Li, Gene
Publié: (2025)
par: Li, Gene
Publié: (2025)
Return Capping: Sample-Efficient CVaR Policy Gradient Optimisation
par: Mead, Harry, et autres
Publié: (2025)
par: Mead, Harry, et autres
Publié: (2025)
Beyond Rewards in Reinforcement Learning for Cyber Defence
par: Bates, Elizabeth, et autres
Publié: (2026)
par: Bates, Elizabeth, et autres
Publié: (2026)
Documents similaires
-
Large Language Models as In-context AI Generators for Quality-Diversity
par: Lim, Bryan, et autres
Publié: (2024) -
Enhancing MAP-Elites with Multiple Parallel Evolution Strategies
par: Flageat, Manon, et autres
Publié: (2023) -
Synergizing Quality-Diversity with Descriptor-Conditioned Reinforcement Learning
par: Faldor, Maxence, et autres
Publié: (2023) -
Exploring the Performance-Reproducibility Trade-off in Quality-Diversity
par: Flageat, Manon, et autres
Publié: (2024) -
Multi-objective Reinforcement Learning with Nonlinear Preferences: Provable Approximation for Maximizing Expected Scalarized Return
par: Peng, Nianli, et autres
Publié: (2023)