No-Regret Thompson Sampling for Finite-Horizon Markov Decision Processes with Gaussian Processes
Fuente:
arXiv
Guardado en:
| Autores principales: | Bayrooti, Jasmine, Vakili, Sattar, Prorok, Amanda, Ek, Carl Henrik |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Efficient Model-Based Reinforcement Learning Through Optimistic Thompson Sampling
por: Bayrooti, Jasmine, et al.
Publicado: (2024)
por: Bayrooti, Jasmine, et al.
Publicado: (2024)
Generalizing Differentially Private Decentralized Deep Learning with Multi-Agent Consensus
por: Bayrooti, Jasmine, et al.
Publicado: (2023)
por: Bayrooti, Jasmine, et al.
Publicado: (2023)
Open Problem: Order Optimal Regret Bounds for Kernel-Based Reinforcement Learning
por: Vakili, Sattar
Publicado: (2024)
por: Vakili, Sattar
Publicado: (2024)
Generalized Intention Modeling in Multi-Agent Reinforcement Learning
por: Odrowaz-Sypniewski, Mateusz, et al.
Publicado: (2026)
por: Odrowaz-Sypniewski, Mateusz, et al.
Publicado: (2026)
A Finite Time Analysis of Thompson Sampling for Bayesian Optimization with Preferential Feedback
por: Lazzaro, Joseph, et al.
Publicado: (2026)
por: Lazzaro, Joseph, et al.
Publicado: (2026)
Horizon-Free Regret for Linear Markov Decision Processes
por: Zhang, Zihan, et al.
Publicado: (2024)
por: Zhang, Zihan, et al.
Publicado: (2024)
Kernelized Reinforcement Learning with Order Optimal Regret Bounds
por: Vakili, Sattar, et al.
Publicado: (2023)
por: Vakili, Sattar, et al.
Publicado: (2023)
Kernel-Based Function Approximation for Average Reward Reinforcement Learning: An Optimist No-Regret Algorithm
por: Vakili, Sattar, et al.
Publicado: (2024)
por: Vakili, Sattar, et al.
Publicado: (2024)
Random Exploration in Bayesian Optimization: Order-Optimal Regret and Computational Efficiency
por: Salgia, Sudeep, et al.
Publicado: (2023)
por: Salgia, Sudeep, et al.
Publicado: (2023)
Frequentist Regret Analysis of Gaussian Process Thompson Sampling via Fractional Posteriors
por: Roy, Somjit, et al.
Publicado: (2026)
por: Roy, Somjit, et al.
Publicado: (2026)
Thompson Sampling for Infinite-Horizon Discounted Decision Processes
por: Adelman, Daniel, et al.
Publicado: (2024)
por: Adelman, Daniel, et al.
Publicado: (2024)
A policy gradient approach for Finite Horizon Constrained Markov Decision Processes
por: Guin, Soumyajit, et al.
Publicado: (2022)
por: Guin, Soumyajit, et al.
Publicado: (2022)
Achieving Constant Regret in Linear Markov Decision Processes
por: Zhang, Weitong, et al.
Publicado: (2024)
por: Zhang, Weitong, et al.
Publicado: (2024)
Quantum Speedups in Regret Analysis of Infinite Horizon Average-Reward Markov Decision Processes
por: Ganguly, Bhargav, et al.
Publicado: (2023)
por: Ganguly, Bhargav, et al.
Publicado: (2023)
Regret Analysis of Policy Gradient Algorithm for Infinite Horizon Average Reward Markov Decision Processes
por: Bai, Qinbo, et al.
Publicado: (2023)
por: Bai, Qinbo, et al.
Publicado: (2023)
Logarithmic Regret of Exploration in Average Reward Markov Decision Processes
por: Boone, Victor, et al.
Publicado: (2025)
por: Boone, Victor, et al.
Publicado: (2025)
Gaussian Process Thompson Sampling via Rootfinding
por: Adebiyi, Taiwo A., et al.
Publicado: (2024)
por: Adebiyi, Taiwo A., et al.
Publicado: (2024)
Learning Mixture Density via Natural Gradient Expectation Maximization
por: Chen, Yutao, et al.
Publicado: (2026)
por: Chen, Yutao, et al.
Publicado: (2026)
Adaptive Prior Selection in Gaussian Process Bandits with Thompson Sampling
por: Sandberg, Jack, et al.
Publicado: (2025)
por: Sandberg, Jack, et al.
Publicado: (2025)
Optimistic Regret Bounds for Online Learning in Adversarial Markov Decision Processes
por: Moon, Sang Bin, et al.
Publicado: (2024)
por: Moon, Sang Bin, et al.
Publicado: (2024)
Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds
por: Kayal, Aya, et al.
Publicado: (2025)
por: Kayal, Aya, et al.
Publicado: (2025)
Warm-up Free Policy Optimization: Improved Regret in Linear Markov Decision Processes
por: Cassel, Asaf, et al.
Publicado: (2024)
por: Cassel, Asaf, et al.
Publicado: (2024)
On Regret Bounds of Thompson Sampling for Bayesian Optimization
por: Takeno, Shion, et al.
Publicado: (2026)
por: Takeno, Shion, et al.
Publicado: (2026)
The Number of Trials Matters in Infinite-Horizon General-Utility Markov Decision Processes
por: Santos, Pedro P., et al.
Publicado: (2024)
por: Santos, Pedro P., et al.
Publicado: (2024)
Near-Optimal Sample Complexity in Reward-Free Kernel-Based Reinforcement Learning
por: Kayal, Aya, et al.
Publicado: (2025)
por: Kayal, Aya, et al.
Publicado: (2025)
Identification and Adaptive Control of Markov Jump Systems: Sample Complexity and Regret Bounds
por: Sattar, Yahya, et al.
Publicado: (2021)
por: Sattar, Yahya, et al.
Publicado: (2021)
Thompson Sampling For Combinatorial Bandits: Polynomial Regret and Mismatched Sampling Paradox
por: Zhang, Raymond, et al.
Publicado: (2024)
por: Zhang, Raymond, et al.
Publicado: (2024)
Monitored Markov Decision Processes
por: Parisi, Simone, et al.
Publicado: (2024)
por: Parisi, Simone, et al.
Publicado: (2024)
Optimal Posterior Sampling for Policy Identification in Tabular Markov Decision Processes
por: Kone, Cyrille, et al.
Publicado: (2026)
por: Kone, Cyrille, et al.
Publicado: (2026)
Prior-Aligned Meta-RL: Thompson Sampling with Learned Priors and Guarantees in Finite-Horizon MDPs
por: Zhou, Runlin, et al.
Publicado: (2025)
por: Zhou, Runlin, et al.
Publicado: (2025)
Learning Kernel-Based MDPs from Episodic Preferential Feedback
por: Pavlovic, Nikola, et al.
Publicado: (2026)
por: Pavlovic, Nikola, et al.
Publicado: (2026)
Optimal Sample Complexity for Average Reward Markov Decision Processes
por: Wang, Shengbo, et al.
Publicado: (2023)
por: Wang, Shengbo, et al.
Publicado: (2023)
Generalized Linear Markov Decision Process
por: Zhang, Sinian, et al.
Publicado: (2025)
por: Zhang, Sinian, et al.
Publicado: (2025)
Federated Control in Markov Decision Processes
por: Jin, Hao, et al.
Publicado: (2024)
por: Jin, Hao, et al.
Publicado: (2024)
Achieving Instance-dependent Sample Complexity for Constrained Markov Decision Process
por: Jiang, Jiashuo, et al.
Publicado: (2024)
por: Jiang, Jiashuo, et al.
Publicado: (2024)
Sample Complexity of Offline Distributionally Robust Linear Markov Decision Processes
por: Wang, He, et al.
Publicado: (2024)
por: Wang, He, et al.
Publicado: (2024)
Improved Bayesian Regret Bounds for Thompson Sampling in Reinforcement Learning
por: Moradipari, Ahmadreza, et al.
Publicado: (2023)
por: Moradipari, Ahmadreza, et al.
Publicado: (2023)
Markov Decision Processes under External Temporal Processes
por: Ayyagari, Ranga Shaarad, et al.
Publicado: (2023)
por: Ayyagari, Ranga Shaarad, et al.
Publicado: (2023)
Regret Analysis for Randomized Gaussian Process Upper Confidence Bound
por: Takeno, Shion, et al.
Publicado: (2024)
por: Takeno, Shion, et al.
Publicado: (2024)
Gaussian Process Upper Confidence Bound Achieves Nearly-Optimal Regret in Noise-Free Gaussian Process Bandits
por: Iwazaki, Shogo
Publicado: (2025)
por: Iwazaki, Shogo
Publicado: (2025)
Ejemplares similares
-
Efficient Model-Based Reinforcement Learning Through Optimistic Thompson Sampling
por: Bayrooti, Jasmine, et al.
Publicado: (2024) -
Generalizing Differentially Private Decentralized Deep Learning with Multi-Agent Consensus
por: Bayrooti, Jasmine, et al.
Publicado: (2023) -
Open Problem: Order Optimal Regret Bounds for Kernel-Based Reinforcement Learning
por: Vakili, Sattar
Publicado: (2024) -
Generalized Intention Modeling in Multi-Agent Reinforcement Learning
por: Odrowaz-Sypniewski, Mateusz, et al.
Publicado: (2026) -
A Finite Time Analysis of Thompson Sampling for Bayesian Optimization with Preferential Feedback
por: Lazzaro, Joseph, et al.
Publicado: (2026)