Posterior Sampling Reinforcement Learning with Gaussian Processes for Continuous Control: Sublinear Regret Bounds for Unbounded State Spaces
Fuente:
arXiv
Guardado en:
| Autores principales: | Flynn, Hamish, Watson, Joe, Posner, Ingmar, Peters, Jan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
XQC: Well-conditioned Optimization Accelerates Deep Reinforcement Learning
por: Palenicek, Daniel, et al.
Publicado: (2025)
por: Palenicek, Daniel, et al.
Publicado: (2025)
Relative Information Gain and Gaussian Process Regression
por: Flynn, Hamish
Publicado: (2025)
por: Flynn, Hamish
Publicado: (2025)
Coherent Off-Policy Improvement of Large Behavior Models with Learned Rewards
por: Scherer, Christian, et al.
Publicado: (2026)
por: Scherer, Christian, et al.
Publicado: (2026)
XQCfD: Accelerating Fast Actor-Critic Algorithms with Prior Data and Prior Policies
por: Palenicek, Daniel, et al.
Publicado: (2026)
por: Palenicek, Daniel, et al.
Publicado: (2026)
Improved Algorithms for Stochastic Linear Bandits Using Tail Bounds for Martingale Mixtures
por: Flynn, Hamish, et al.
Publicado: (2023)
por: Flynn, Hamish, et al.
Publicado: (2023)
Isoperimetry is All We Need: Langevin Posterior Sampling for RL with Sublinear Regret
por: Jorge, Emilio, et al.
Publicado: (2024)
por: Jorge, Emilio, et al.
Publicado: (2024)
Disentangling Dynamical Systems: Causal Representation Learning Meets Local Sparse Attention
por: Baumgartner, Markus W., et al.
Publicado: (2026)
por: Baumgartner, Markus W., et al.
Publicado: (2026)
Tighter Confidence Bounds for Sequential Kernel Regression
por: Flynn, Hamish, et al.
Publicado: (2024)
por: Flynn, Hamish, et al.
Publicado: (2024)
Posterior Sampling-Based Bayesian Optimization with Tighter Bayesian Regret Bounds
por: Takeno, Shion, et al.
Publicado: (2023)
por: Takeno, Shion, et al.
Publicado: (2023)
Frequentist Regret Analysis of Gaussian Process Thompson Sampling via Fractional Posteriors
por: Roy, Somjit, et al.
Publicado: (2026)
por: Roy, Somjit, et al.
Publicado: (2026)
Confidence Sequences for Generalized Linear Models via Regret Analysis
por: Clerico, Eugenio, et al.
Publicado: (2025)
por: Clerico, Eugenio, et al.
Publicado: (2025)
Learning to Stabilize Online Reinforcement Learning in Unbounded State Spaces
por: Pavse, Brahma S., et al.
Publicado: (2023)
por: Pavse, Brahma S., et al.
Publicado: (2023)
Sparse Optimistic Information Directed Sampling
por: Schwartz, Ludovic, et al.
Publicado: (2025)
por: Schwartz, Ludovic, et al.
Publicado: (2025)
Scaling Off-Policy Reinforcement Learning with Batch and Weight Normalization
por: Palenicek, Daniel, et al.
Publicado: (2025)
por: Palenicek, Daniel, et al.
Publicado: (2025)
Sublinear Regret for a Class of Continuous-Time Linear-Quadratic Reinforcement Learning Problems
por: Huang, Yilie, et al.
Publicado: (2024)
por: Huang, Yilie, et al.
Publicado: (2024)
Reinforcement Learning and Regret Bounds for Admission Control
por: Weber, Lucas, et al.
Publicado: (2024)
por: Weber, Lucas, et al.
Publicado: (2024)
Improved Bayesian Regret Bounds for Thompson Sampling in Reinforcement Learning
por: Moradipari, Ahmadreza, et al.
Publicado: (2023)
por: Moradipari, Ahmadreza, et al.
Publicado: (2023)
Efficient Exploration in Average-Reward Constrained Reinforcement Learning: Achieving Near-Optimal Regret With Posterior Sampling
por: Provodin, Danil, et al.
Publicado: (2024)
por: Provodin, Danil, et al.
Publicado: (2024)
Regret Analysis for Randomized Gaussian Process Upper Confidence Bound
por: Takeno, Shion, et al.
Publicado: (2024)
por: Takeno, Shion, et al.
Publicado: (2024)
Improved Regret Bounds for Gaussian Process Upper Confidence Bound in Bayesian Optimization
por: Iwazaki, Shogo
Publicado: (2025)
por: Iwazaki, Shogo
Publicado: (2025)
No-Regret Thompson Sampling for Finite-Horizon Markov Decision Processes with Gaussian Processes
por: Bayrooti, Jasmine, et al.
Publicado: (2025)
por: Bayrooti, Jasmine, et al.
Publicado: (2025)
Gaussian Process Upper Confidence Bound Achieves Nearly-Optimal Regret in Noise-Free Gaussian Process Bandits
por: Iwazaki, Shogo
Publicado: (2025)
por: Iwazaki, Shogo
Publicado: (2025)
Eventually LIL Regret: Almost Sure $\ln\ln T$ Regret for a sub-Gaussian Mixture on Unbounded Data
por: Agrawal, Shubhada, et al.
Publicado: (2025)
por: Agrawal, Shubhada, et al.
Publicado: (2025)
CHIRPs: Change-Induced Regret Proxy metrics for Lifelong Reinforcement Learning
por: Birkbeck, John, et al.
Publicado: (2024)
por: Birkbeck, John, et al.
Publicado: (2024)
Optimal Scalarizations for Sublinear Hypervolume Regret
por: Zhang, Qiuyi
Publicado: (2023)
por: Zhang, Qiuyi
Publicado: (2023)
Regret Bounds for Expected Improvement Algorithms in Gaussian Process Bandit Optimization
por: Tran-The, Hung, et al.
Publicado: (2022)
por: Tran-The, Hung, et al.
Publicado: (2022)
Efficient Stochastic Optimal Control through Approximate Bayesian Input Inference
por: Watson, Joe, et al.
Publicado: (2021)
por: Watson, Joe, et al.
Publicado: (2021)
Tighter Regret Bounds for Contextual Action-Set Reinforcement Learning
por: Chen, Zijun, et al.
Publicado: (2026)
por: Chen, Zijun, et al.
Publicado: (2026)
Regret Analysis of Posterior Sampling-Based Expected Improvement for Bayesian Optimization
por: Takeno, Shion, et al.
Publicado: (2025)
por: Takeno, Shion, et al.
Publicado: (2025)
Reward-Free Curricula for Training Robust World Models
por: Rigter, Marc, et al.
Publicado: (2023)
por: Rigter, Marc, et al.
Publicado: (2023)
SPARTAN: A Sparse Transformer World Model Attending to What Matters
por: Lei, Anson, et al.
Publicado: (2024)
por: Lei, Anson, et al.
Publicado: (2024)
Compete and Compose: Learning Independent Mechanisms for Modular World Models
por: Lei, Anson, et al.
Publicado: (2024)
por: Lei, Anson, et al.
Publicado: (2024)
Tighter Regret Lower Bound for Gaussian Process Bandits with Squared Exponential Kernel in Hypersphere
por: Iwazaki, Shogo
Publicado: (2026)
por: Iwazaki, Shogo
Publicado: (2026)
On Regret Bounds of Thompson Sampling for Bayesian Optimization
por: Takeno, Shion, et al.
Publicado: (2026)
por: Takeno, Shion, et al.
Publicado: (2026)
Sampling from Gaussian Process Posteriors using Stochastic Gradient Descent
por: Lin, Jihao Andreas, et al.
Publicado: (2023)
por: Lin, Jihao Andreas, et al.
Publicado: (2023)
Kernelized Reinforcement Learning with Order Optimal Regret Bounds
por: Vakili, Sattar, et al.
Publicado: (2023)
por: Vakili, Sattar, et al.
Publicado: (2023)
Transfer in Reinforcement Learning via Regret Bounds for Learning Agents
por: Tuynman, Adrienne, et al.
Publicado: (2022)
por: Tuynman, Adrienne, et al.
Publicado: (2022)
Regret Lower Bounds for Learning Linear Quadratic Gaussian Systems
por: Ziemann, Ingvar, et al.
Publicado: (2022)
por: Ziemann, Ingvar, et al.
Publicado: (2022)
On Improved Regret Bounds In Bayesian Optimization with Gaussian Noise
por: Wang, Jingyi, et al.
Publicado: (2024)
por: Wang, Jingyi, et al.
Publicado: (2024)
Regret Bounds for Reinforcement Learning from Multi-Source Imperfect Preferences
por: Shi, Ming, et al.
Publicado: (2026)
por: Shi, Ming, et al.
Publicado: (2026)
Ejemplares similares
-
XQC: Well-conditioned Optimization Accelerates Deep Reinforcement Learning
por: Palenicek, Daniel, et al.
Publicado: (2025) -
Relative Information Gain and Gaussian Process Regression
por: Flynn, Hamish
Publicado: (2025) -
Coherent Off-Policy Improvement of Large Behavior Models with Learned Rewards
por: Scherer, Christian, et al.
Publicado: (2026) -
XQCfD: Accelerating Fast Actor-Critic Algorithms with Prior Data and Prior Policies
por: Palenicek, Daniel, et al.
Publicado: (2026) -
Improved Algorithms for Stochastic Linear Bandits Using Tail Bounds for Martingale Mixtures
por: Flynn, Hamish, et al.
Publicado: (2023)