Learning Kernel-Based MDPs from Episodic Preferential Feedback
Fuente:
arXiv
Salvato in:
| Autori principali: | Pavlovic, Nikola, Vakili, Sattar, Zhao, Qing |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Open Problem: Order Optimal Regret Bounds for Kernel-Based Reinforcement Learning
di: Vakili, Sattar
Pubblicazione: (2024)
di: Vakili, Sattar
Pubblicazione: (2024)
A Finite Time Analysis of Thompson Sampling for Bayesian Optimization with Preferential Feedback
di: Lazzaro, Joseph, et al.
Pubblicazione: (2026)
di: Lazzaro, Joseph, et al.
Pubblicazione: (2026)
Kernel-Based Function Approximation for Average Reward Reinforcement Learning: An Optimist No-Regret Algorithm
di: Vakili, Sattar, et al.
Pubblicazione: (2024)
di: Vakili, Sattar, et al.
Pubblicazione: (2024)
Kernelized Reinforcement Learning with Order Optimal Regret Bounds
di: Vakili, Sattar, et al.
Pubblicazione: (2023)
di: Vakili, Sattar, et al.
Pubblicazione: (2023)
Differentially Private Kernelized Contextual Bandits
di: Pavlovic, Nikola, et al.
Pubblicazione: (2025)
di: Pavlovic, Nikola, et al.
Pubblicazione: (2025)
Near-Optimal Sample Complexity in Reward-Free Kernel-Based Reinforcement Learning
di: Kayal, Aya, et al.
Pubblicazione: (2025)
di: Kayal, Aya, et al.
Pubblicazione: (2025)
Differential Privacy in Kernelized Contextual Bandits via Random Projections
di: Pavlovic, Nikola, et al.
Pubblicazione: (2025)
di: Pavlovic, Nikola, et al.
Pubblicazione: (2025)
Random Exploration in Bayesian Optimization: Order-Optimal Regret and Computational Efficiency
di: Salgia, Sudeep, et al.
Pubblicazione: (2023)
di: Salgia, Sudeep, et al.
Pubblicazione: (2023)
Order-Optimal Regret in Distributed Kernel Bandits using Uniform Sampling with Shared Randomness
di: Pavlovic, Nikola, et al.
Pubblicazione: (2024)
di: Pavlovic, Nikola, et al.
Pubblicazione: (2024)
Adapting to Stochastic and Adversarial Losses in Episodic MDPs with Aggregate Bandit Feedback
di: Ito, Shinji, et al.
Pubblicazione: (2025)
di: Ito, Shinji, et al.
Pubblicazione: (2025)
Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds
di: Kayal, Aya, et al.
Pubblicazione: (2025)
di: Kayal, Aya, et al.
Pubblicazione: (2025)
Characterizing the Accuracy-Communication-Privacy Trade-off in Distributed Stochastic Convex Optimization
di: Salgia, Sudeep, et al.
Pubblicazione: (2025)
di: Salgia, Sudeep, et al.
Pubblicazione: (2025)
Reinforcement Learning Using known Invariances
di: Cioba, Alexandru, et al.
Pubblicazione: (2025)
di: Cioba, Alexandru, et al.
Pubblicazione: (2025)
On the Convergence of Monte Carlo UCB for Random-Length Episodic MDPs
di: Dong, Zixuan, et al.
Pubblicazione: (2022)
di: Dong, Zixuan, et al.
Pubblicazione: (2022)
No-Regret Thompson Sampling for Finite-Horizon Markov Decision Processes with Gaussian Processes
di: Bayrooti, Jasmine, et al.
Pubblicazione: (2025)
di: Bayrooti, Jasmine, et al.
Pubblicazione: (2025)
Reinforcement Learning from Multi-level and Episodic Human Feedback
di: Elahi, Muhammad Qasim, et al.
Pubblicazione: (2025)
di: Elahi, Muhammad Qasim, et al.
Pubblicazione: (2025)
Provably Efficient RL under Episode-Wise Safety in Constrained MDPs with Linear Function Approximation
di: Kitamura, Toshinori, et al.
Pubblicazione: (2025)
di: Kitamura, Toshinori, et al.
Pubblicazione: (2025)
Improved Algorithm for Adversarial Linear Mixture MDPs with Bandit Feedback and Unknown Transition
di: Li, Long-Fei, et al.
Pubblicazione: (2024)
di: Li, Long-Fei, et al.
Pubblicazione: (2024)
Near-Optimal Regret in Linear MDPs with Aggregate Bandit Feedback
di: Cassel, Asaf, et al.
Pubblicazione: (2024)
di: Cassel, Asaf, et al.
Pubblicazione: (2024)
Beating Adversarial Low-Rank MDPs with Unknown Transition and Bandit Feedback
di: Liu, Haolin, et al.
Pubblicazione: (2024)
di: Liu, Haolin, et al.
Pubblicazione: (2024)
Many Needles in a Haystack: Active Hit Discovery for Perturbation Experiments
di: Rubbi, Andrea, et al.
Pubblicazione: (2026)
di: Rubbi, Andrea, et al.
Pubblicazione: (2026)
Bring Your Own (Non-Robust) Algorithm to Solve Robust MDPs by Estimating The Worst Kernel
di: Wang, Kaixin, et al.
Pubblicazione: (2023)
di: Wang, Kaixin, et al.
Pubblicazione: (2023)
Near-optimal Regret Using Policy Optimization in Online MDPs with Aggregate Bandit Feedback
di: Lancewicki, Tal, et al.
Pubblicazione: (2025)
di: Lancewicki, Tal, et al.
Pubblicazione: (2025)
Robust Parameter Learning for Uncertain MDPs
di: Schnitzer, Yannik, et al.
Pubblicazione: (2026)
di: Schnitzer, Yannik, et al.
Pubblicazione: (2026)
Truly No-Regret Learning in Constrained MDPs
di: Müller, Adrian, et al.
Pubblicazione: (2024)
di: Müller, Adrian, et al.
Pubblicazione: (2024)
Reinforcement Learning from Adversarial Preferences in Tabular MDPs
di: Tsuchiya, Taira, et al.
Pubblicazione: (2025)
di: Tsuchiya, Taira, et al.
Pubblicazione: (2025)
Anchor-Based Heteroscedastic Noise for Preferential Bayesian Optimization
di: Sinaga, Marshal Arijona, et al.
Pubblicazione: (2024)
di: Sinaga, Marshal Arijona, et al.
Pubblicazione: (2024)
Reinforcement Learning for Infinite-Horizon Average-Reward Linear MDPs via Approximation by Discounted-Reward MDPs
di: Hong, Kihyuk, et al.
Pubblicazione: (2024)
di: Hong, Kihyuk, et al.
Pubblicazione: (2024)
Preferential Normalizing Flows
di: Mikkola, Petrus, et al.
Pubblicazione: (2024)
di: Mikkola, Petrus, et al.
Pubblicazione: (2024)
Learning Adversarial MDPs with Stochastic Hard Constraints
di: Stradi, Francesco Emanuele, et al.
Pubblicazione: (2024)
di: Stradi, Francesco Emanuele, et al.
Pubblicazione: (2024)
Nonparametric Kernel Clustering with Bandit Feedback
di: Thuot, Victor, et al.
Pubblicazione: (2026)
di: Thuot, Victor, et al.
Pubblicazione: (2026)
Local Preferential Bayesian Optimization
di: Menn, Johanna, et al.
Pubblicazione: (2026)
di: Menn, Johanna, et al.
Pubblicazione: (2026)
Principled Preferential Bayesian Optimization
di: Xu, Wenjie, et al.
Pubblicazione: (2024)
di: Xu, Wenjie, et al.
Pubblicazione: (2024)
Consecutive Preferential Bayesian Optimization
di: Erarslan, Aras, et al.
Pubblicazione: (2025)
di: Erarslan, Aras, et al.
Pubblicazione: (2025)
No-Regret Reinforcement Learning in Smooth MDPs
di: Maran, Davide, et al.
Pubblicazione: (2024)
di: Maran, Davide, et al.
Pubblicazione: (2024)
Online Learning in MDPs with Partially Adversarial Transitions and Losses
di: Schlisselberg, Ofir, et al.
Pubblicazione: (2026)
di: Schlisselberg, Ofir, et al.
Pubblicazione: (2026)
Online Episodic Convex Reinforcement Learning
di: Moreno, Bianca Marin, et al.
Pubblicazione: (2025)
di: Moreno, Bianca Marin, et al.
Pubblicazione: (2025)
Revisiting Weighted Strategy for Non-stationary Parametric Bandits and MDPs
di: Wang, Jing, et al.
Pubblicazione: (2026)
di: Wang, Jing, et al.
Pubblicazione: (2026)
Reinforcement Learning for Exponential Utility: Algorithms and Convergence in Discounted MDPs
di: Thoppe, Gugan, et al.
Pubblicazione: (2026)
di: Thoppe, Gugan, et al.
Pubblicazione: (2026)
Time-Constrained Robust MDPs
di: Zouitine, Adil, et al.
Pubblicazione: (2024)
di: Zouitine, Adil, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Open Problem: Order Optimal Regret Bounds for Kernel-Based Reinforcement Learning
di: Vakili, Sattar
Pubblicazione: (2024) -
A Finite Time Analysis of Thompson Sampling for Bayesian Optimization with Preferential Feedback
di: Lazzaro, Joseph, et al.
Pubblicazione: (2026) -
Kernel-Based Function Approximation for Average Reward Reinforcement Learning: An Optimist No-Regret Algorithm
di: Vakili, Sattar, et al.
Pubblicazione: (2024) -
Kernelized Reinforcement Learning with Order Optimal Regret Bounds
di: Vakili, Sattar, et al.
Pubblicazione: (2023) -
Differentially Private Kernelized Contextual Bandits
di: Pavlovic, Nikola, et al.
Pubblicazione: (2025)