Exploration Implies Data Augmentation: Reachability and Generalisation in Contextual MDPs
Fuente:
arXiv
Salvato in:
| Autori principali: | Weltevrede, Max, Horsch, Caroline, Spaan, Matthijs T. J., Böhmer, Wendelin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Explore-Go: Leveraging Exploration for Generalisation in Deep Reinforcement Learning
di: Weltevrede, Max, et al.
Pubblicazione: (2024)
di: Weltevrede, Max, et al.
Pubblicazione: (2024)
How Ensembles of Distilled Policies Improve Generalisation in Reinforcement Learning
di: Weltevrede, Max, et al.
Pubblicazione: (2025)
di: Weltevrede, Max, et al.
Pubblicazione: (2025)
Sparse Masked Attention Policies for Reliable Generalization
di: Horsch, Caroline, et al.
Pubblicazione: (2026)
di: Horsch, Caroline, et al.
Pubblicazione: (2026)
Universal Value-Function Uncertainties
di: Zanger, Moritz A., et al.
Pubblicazione: (2025)
di: Zanger, Moritz A., et al.
Pubblicazione: (2025)
Diverse Projection Ensembles for Distributional Reinforcement Learning
di: Zanger, Moritz A., et al.
Pubblicazione: (2023)
di: Zanger, Moritz A., et al.
Pubblicazione: (2023)
Epistemic Monte Carlo Tree Search
di: Oren, Yaniv, et al.
Pubblicazione: (2022)
di: Oren, Yaniv, et al.
Pubblicazione: (2022)
Contextual Similarity Distillation: Ensemble Uncertainties with a Single Model
di: Zanger, Moritz A., et al.
Pubblicazione: (2025)
di: Zanger, Moritz A., et al.
Pubblicazione: (2025)
On the Equivalence of Random Network Distillation, Deep Ensembles, and Bayesian Inference
di: Zanger, Moritz A., et al.
Pubblicazione: (2026)
di: Zanger, Moritz A., et al.
Pubblicazione: (2026)
Twice Sequential Monte Carlo for Tree Search
di: Oren, Yaniv, et al.
Pubblicazione: (2025)
di: Oren, Yaniv, et al.
Pubblicazione: (2025)
Modular Recurrence in Contextual MDPs for Universal Morphology Control
di: Engwegen, Laurens, et al.
Pubblicazione: (2025)
di: Engwegen, Laurens, et al.
Pubblicazione: (2025)
Value Improved Actor Critic Algorithms
di: Oren, Yaniv, et al.
Pubblicazione: (2024)
di: Oren, Yaniv, et al.
Pubblicazione: (2024)
Generalisation to unseen topologies: Towards control of biological neural network activity
di: Engwegen, Laurens, et al.
Pubblicazione: (2024)
di: Engwegen, Laurens, et al.
Pubblicazione: (2024)
Improving Robustness of AlphaZero Algorithms to Test-Time Environment Changes
di: Tamassia, Isidoro, et al.
Pubblicazione: (2025)
di: Tamassia, Isidoro, et al.
Pubblicazione: (2025)
TransZero: Parallel Tree Expansion in MuZero using Transformer Networks
di: Malmsten, Emil, et al.
Pubblicazione: (2025)
di: Malmsten, Emil, et al.
Pubblicazione: (2025)
Reinforcement Learning by Guided Safe Exploration
di: Yang, Qisong, et al.
Pubblicazione: (2023)
di: Yang, Qisong, et al.
Pubblicazione: (2023)
Positive Experience Reflection for Agents in Interactive Text Environments
di: Lippmann, Philip, et al.
Pubblicazione: (2024)
di: Lippmann, Philip, et al.
Pubblicazione: (2024)
EfficientTDMPC: Improved MPC Objectives for Sample-Efficient Continuous Control
di: Evers, Thomas, et al.
Pubblicazione: (2026)
di: Evers, Thomas, et al.
Pubblicazione: (2026)
Priors Matter: Addressing Misspecification in Bayesian Deep Q-Learning
di: van der Vaart, Pascal R., et al.
Pubblicazione: (2025)
di: van der Vaart, Pascal R., et al.
Pubblicazione: (2025)
PMCTS: Particle Monte Carlo Tree Search for Principled Parallelized Inference Time Scaling
di: Oren, Yaniv, et al.
Pubblicazione: (2026)
di: Oren, Yaniv, et al.
Pubblicazione: (2026)
RecBayes: Recurrent Bayesian Ad Hoc Teamwork in Large Partially Observable Domains
di: Ribeiro, João G., et al.
Pubblicazione: (2025)
di: Ribeiro, João G., et al.
Pubblicazione: (2025)
Missingness-MDPs: Bridging the Theory of Missing Data and POMDPs
di: Wendland, Joshua, et al.
Pubblicazione: (2026)
di: Wendland, Joshua, et al.
Pubblicazione: (2026)
Pessimistic Iterative Planning with RNNs for Robust POMDPs
di: Galesloot, Maris F. L., et al.
Pubblicazione: (2024)
di: Galesloot, Maris F. L., et al.
Pubblicazione: (2024)
Leveraging Skills from Unlabeled Prior Data for Efficient Online Exploration
di: Wilcoxson, Max, et al.
Pubblicazione: (2024)
di: Wilcoxson, Max, et al.
Pubblicazione: (2024)
packetLSTM: Dynamic LSTM Framework for Streaming Data with Varying Feature Space
di: Agarwal, Rohit, et al.
Pubblicazione: (2024)
di: Agarwal, Rohit, et al.
Pubblicazione: (2024)
No-Regret Reinforcement Learning in Smooth MDPs
di: Maran, Davide, et al.
Pubblicazione: (2024)
di: Maran, Davide, et al.
Pubblicazione: (2024)
The Impact of Off-Policy Training Data on Probe Generalisation
di: Kirch, Nathalie, et al.
Pubblicazione: (2025)
di: Kirch, Nathalie, et al.
Pubblicazione: (2025)
Low-Rank MDPs with Continuous Action Spaces
di: Bennett, Andrew, et al.
Pubblicazione: (2023)
di: Bennett, Andrew, et al.
Pubblicazione: (2023)
Efficient Solution and Learning of Robust Factored MDPs
di: Schnitzer, Yannik, et al.
Pubblicazione: (2025)
di: Schnitzer, Yannik, et al.
Pubblicazione: (2025)
What Representational Similarity Measures Imply about Decodable Information
di: Harvey, Sarah E., et al.
Pubblicazione: (2024)
di: Harvey, Sarah E., et al.
Pubblicazione: (2024)
Beyond Scalar Rewards: An Axiomatic Framework for Lexicographic MDPs
di: Shakerinava, Mehran, et al.
Pubblicazione: (2025)
di: Shakerinava, Mehran, et al.
Pubblicazione: (2025)
Geometry of Drifting MDPs with Path-Integral Stability Certificates
di: Zhang, Zuyuan, et al.
Pubblicazione: (2026)
di: Zhang, Zuyuan, et al.
Pubblicazione: (2026)
When Does Closeness in Distribution Imply Representational Similarity? An Identifiability Perspective
di: Nielsen, Beatrix M. G., et al.
Pubblicazione: (2025)
di: Nielsen, Beatrix M. G., et al.
Pubblicazione: (2025)
Last-Iterate Convergence of General Parameterized Policies in Constrained MDPs
di: Mondal, Washim Uddin, et al.
Pubblicazione: (2024)
di: Mondal, Washim Uddin, et al.
Pubblicazione: (2024)
Solving Multi-Model MDPs by Coordinate Ascent and Dynamic Programming
di: Su, Xihong, et al.
Pubblicazione: (2024)
di: Su, Xihong, et al.
Pubblicazione: (2024)
Risk-averse Total-reward MDPs with ERM and EVaR
di: Su, Xihong, et al.
Pubblicazione: (2024)
di: Su, Xihong, et al.
Pubblicazione: (2024)
Learning Policy Committees for Effective Personalization in MDPs with Diverse Tasks
di: Ge, Luise, et al.
Pubblicazione: (2025)
di: Ge, Luise, et al.
Pubblicazione: (2025)
ACPO: A Policy Optimization Algorithm for Average MDPs with Constraints
di: Agnihotri, Akhil, et al.
Pubblicazione: (2023)
di: Agnihotri, Akhil, et al.
Pubblicazione: (2023)
Bourbaki: Self-Generated and Goal-Conditioned MDPs for Theorem Proving
di: Zimmer, Matthieu, et al.
Pubblicazione: (2025)
di: Zimmer, Matthieu, et al.
Pubblicazione: (2025)
On-line Learning in Tree MDPs by Treating Policies as Bandit Arms
di: Shah, Anvay, et al.
Pubblicazione: (2026)
di: Shah, Anvay, et al.
Pubblicazione: (2026)
On the Convergence of Monte Carlo UCB for Random-Length Episodic MDPs
di: Dong, Zixuan, et al.
Pubblicazione: (2022)
di: Dong, Zixuan, et al.
Pubblicazione: (2022)
Documenti analoghi
-
Explore-Go: Leveraging Exploration for Generalisation in Deep Reinforcement Learning
di: Weltevrede, Max, et al.
Pubblicazione: (2024) -
How Ensembles of Distilled Policies Improve Generalisation in Reinforcement Learning
di: Weltevrede, Max, et al.
Pubblicazione: (2025) -
Sparse Masked Attention Policies for Reliable Generalization
di: Horsch, Caroline, et al.
Pubblicazione: (2026) -
Universal Value-Function Uncertainties
di: Zanger, Moritz A., et al.
Pubblicazione: (2025) -
Diverse Projection Ensembles for Distributional Reinforcement Learning
di: Zanger, Moritz A., et al.
Pubblicazione: (2023)