VariBASed: Variational Bayes-Adaptive Sequential Monte-Carlo Planning for Deep Reinforcement Learning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | de Vries, Joery A., He, Jinke, Oren, Yaniv, van der Vaart, Pascal R., de Weerdt, Mathijs M., Spaan, Matthijs T. J. |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Twice Sequential Monte Carlo for Tree Search
par: Oren, Yaniv, et autres
Publié: (2025)
par: Oren, Yaniv, et autres
Publié: (2025)
Bayesian Meta-Reinforcement Learning with Laplace Variational Recurrent Networks
par: de Vries, Joery A., et autres
Publié: (2025)
par: de Vries, Joery A., et autres
Publié: (2025)
Trust-Region Twisted Policy Improvement
par: de Vries, Joery A., et autres
Publié: (2025)
par: de Vries, Joery A., et autres
Publié: (2025)
PMCTS: Particle Monte Carlo Tree Search for Principled Parallelized Inference Time Scaling
par: Oren, Yaniv, et autres
Publié: (2026)
par: Oren, Yaniv, et autres
Publié: (2026)
Epistemic Monte Carlo Tree Search
par: Oren, Yaniv, et autres
Publié: (2022)
par: Oren, Yaniv, et autres
Publié: (2022)
AlphaExploitem: Going Beyond the Nash Equilibrium in Poker by Learning to Exploit Suboptimal Play
par: Murgoci, Vlad, et autres
Publié: (2026)
par: Murgoci, Vlad, et autres
Publié: (2026)
Priors Matter: Addressing Misspecification in Bayesian Deep Q-Learning
par: van der Vaart, Pascal R., et autres
Publié: (2025)
par: van der Vaart, Pascal R., et autres
Publié: (2025)
Value Improved Actor Critic Algorithms
par: Oren, Yaniv, et autres
Publié: (2024)
par: Oren, Yaniv, et autres
Publié: (2024)
Universal Value-Function Uncertainties
par: Zanger, Moritz A., et autres
Publié: (2025)
par: Zanger, Moritz A., et autres
Publié: (2025)
RecBayes: Recurrent Bayesian Ad Hoc Teamwork in Large Partially Observable Domains
par: Ribeiro, João G., et autres
Publié: (2025)
par: Ribeiro, João G., et autres
Publié: (2025)
On the Equivalence of Random Network Distillation, Deep Ensembles, and Bayesian Inference
par: Zanger, Moritz A., et autres
Publié: (2026)
par: Zanger, Moritz A., et autres
Publié: (2026)
Contextual Similarity Distillation: Ensemble Uncertainties with a Single Model
par: Zanger, Moritz A., et autres
Publié: (2025)
par: Zanger, Moritz A., et autres
Publié: (2025)
To the Max: Reinventing Reward in Reinforcement Learning
par: Veviurko, Grigorii, et autres
Publié: (2024)
par: Veviurko, Grigorii, et autres
Publié: (2024)
Revisiting Landmarks: Learning from Previous Plans to Generalize over Problem Instances
par: Hanou, Issa, et autres
Publié: (2025)
par: Hanou, Issa, et autres
Publié: (2025)
What model does MuZero learn?
par: He, Jinke, et autres
Publié: (2023)
par: He, Jinke, et autres
Publié: (2023)
Explore-Go: Leveraging Exploration for Generalisation in Deep Reinforcement Learning
par: Weltevrede, Max, et autres
Publié: (2024)
par: Weltevrede, Max, et autres
Publié: (2024)
Complexity of Scheduling Charging in the Smart Grid
par: de Weerdt, Mathijs, et autres
Publié: (2017)
par: de Weerdt, Mathijs, et autres
Publié: (2017)
A Penalty-Based Guardrail Algorithm for Non-Decreasing Optimization with Inequality Constraints
par: Stepanovic, Ksenija, et autres
Publié: (2024)
par: Stepanovic, Ksenija, et autres
Publié: (2024)
You Shall Pass: Dealing with the Zero-Gradient Problem in Predict and Optimize for Convex Optimization
par: Veviurko, Grigorii, et autres
Publié: (2023)
par: Veviurko, Grigorii, et autres
Publié: (2023)
Deep Variational Sequential Monte Carlo for High-Dimensional Observations
par: van Nierop, Wessel L., et autres
Publié: (2025)
par: van Nierop, Wessel L., et autres
Publié: (2025)
Diverse Projection Ensembles for Distributional Reinforcement Learning
par: Zanger, Moritz A., et autres
Publié: (2023)
par: Zanger, Moritz A., et autres
Publié: (2023)
Online Variational Sequential Monte Carlo
par: Mastrototaro, Alessandro, et autres
Publié: (2023)
par: Mastrototaro, Alessandro, et autres
Publié: (2023)
Distributed Influence-Augmented Local Simulators for Parallel MARL in Large Networked Systems
par: Suau, Miguel, et autres
Publié: (2022)
par: Suau, Miguel, et autres
Publié: (2022)
Necessary and Sufficient Conditions for Optimal Decision Trees using Dynamic Programming
par: van der Linden, Jacobus G. M., et autres
Publié: (2023)
par: van der Linden, Jacobus G. M., et autres
Publié: (2023)
Off-Policy Safe Reinforcement Learning with Constrained Optimistic Exploration
par: Li, Guopeng, et autres
Publié: (2026)
par: Li, Guopeng, et autres
Publié: (2026)
Precomputing Multi-Agent Path Replanning using Temporal Flexibility
par: Hanou, Issa, et autres
Publié: (2026)
par: Hanou, Issa, et autres
Publié: (2026)
How Ensembles of Distilled Policies Improve Generalisation in Reinforcement Learning
par: Weltevrede, Max, et autres
Publié: (2025)
par: Weltevrede, Max, et autres
Publié: (2025)
EXPObench: Benchmarking Surrogate-based Optimisation Algorithms on Expensive Black-box Functions
par: Bliek, Laurens, et autres
Publié: (2021)
par: Bliek, Laurens, et autres
Publié: (2021)
Positive Experience Reflection for Agents in Interactive Text Environments
par: Lippmann, Philip, et autres
Publié: (2024)
par: Lippmann, Philip, et autres
Publié: (2024)
VeRecycle: Reclaiming Guarantees from Probabilistic Certificates for Stochastic Dynamical Systems after Change
par: Lutz, Sterre, et autres
Publié: (2025)
par: Lutz, Sterre, et autres
Publié: (2025)
Illuminating Blind Spots of Language Models with Targeted Agent-in-the-Loop Synthetic Data
par: Lippmann, Philip, et autres
Publié: (2024)
par: Lippmann, Philip, et autres
Publié: (2024)
How To Discover Short, Shorter, and the Shortest Proofs of Unsatisfiability: A Branch-and-Bound Approach for Resolution Proof Length Minimization
par: Sidorov, Konstantin, et autres
Publié: (2024)
par: Sidorov, Konstantin, et autres
Publié: (2024)
Bayes Adaptive Monte Carlo Tree Search for Offline Model-based Reinforcement Learning
par: Chen, Jiayu, et autres
Publié: (2024)
par: Chen, Jiayu, et autres
Publié: (2024)
Sequential Monte Carlo for Inclusive KL Minimization in Amortized Variational Inference
par: McNamara, Declan, et autres
Publié: (2024)
par: McNamara, Declan, et autres
Publié: (2024)
Variational Combinatorial Sequential Monte Carlo for Bayesian Phylogenetics in Hyperbolic Space
par: Chen, Alex, et autres
Publié: (2025)
par: Chen, Alex, et autres
Publié: (2025)
Risk-Sensitive Model Predictive Control for Interaction-Aware Planning -- A Sequential Convexification Algorithm
par: Wang, Renzi, et autres
Publié: (2025)
par: Wang, Renzi, et autres
Publié: (2025)
Reinforcement Learning by Guided Safe Exploration
par: Yang, Qisong, et autres
Publié: (2023)
par: Yang, Qisong, et autres
Publié: (2023)
Optimal or Greedy Decision Trees? Revisiting their Objectives, Tuning, and Performance
par: van der Linden, Jacobus G. M., et autres
Publié: (2024)
par: van der Linden, Jacobus G. M., et autres
Publié: (2024)
Bad Habits: Policy Confounding and Out-of-Trajectory Generalization in RL
par: Suau, Miguel, et autres
Publié: (2023)
par: Suau, Miguel, et autres
Publié: (2023)
Fragmenting the Chieftain – Catalogue
par: van der Vaart-Verschoof, Sasja
Publié: (2021)
par: van der Vaart-Verschoof, Sasja
Publié: (2021)
Documents similaires
-
Twice Sequential Monte Carlo for Tree Search
par: Oren, Yaniv, et autres
Publié: (2025) -
Bayesian Meta-Reinforcement Learning with Laplace Variational Recurrent Networks
par: de Vries, Joery A., et autres
Publié: (2025) -
Trust-Region Twisted Policy Improvement
par: de Vries, Joery A., et autres
Publié: (2025) -
PMCTS: Particle Monte Carlo Tree Search for Principled Parallelized Inference Time Scaling
par: Oren, Yaniv, et autres
Publié: (2026) -
Epistemic Monte Carlo Tree Search
par: Oren, Yaniv, et autres
Publié: (2022)