Near-Optimal Regret for Policy Optimization in Contextual MDPs with General Offline Function Approximation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Levy, Orin, Rosenberg, Aviv, Cohen, Alon, Mansour, Yishay |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Eluder-based Regret for Stochastic Contextual MDPs
par: Levy, Orin, et autres
Publié: (2022)
par: Levy, Orin, et autres
Publié: (2022)
Optimal Regret for Policy Optimization in Contextual Bandits
par: Levy, Orin, et autres
Publié: (2026)
par: Levy, Orin, et autres
Publié: (2026)
Regret Bounds for Adversarial Contextual Bandits with General Function Approximation and Delayed Feedback
par: Levy, Orin, et autres
Publié: (2025)
par: Levy, Orin, et autres
Publié: (2025)
Near-optimal Regret Using Policy Optimization in Online MDPs with Aggregate Bandit Feedback
par: Lancewicki, Tal, et autres
Publié: (2025)
par: Lancewicki, Tal, et autres
Publié: (2025)
Batch Ensemble for Variance Dependent Regret in Stochastic Bandits
par: Cassel, Asaf, et autres
Publié: (2024)
par: Cassel, Asaf, et autres
Publié: (2024)
Near-Optimal Regret in Linear MDPs with Aggregate Bandit Feedback
par: Cassel, Asaf, et autres
Publié: (2024)
par: Cassel, Asaf, et autres
Publié: (2024)
The Horizon Threshold in Cooperative Multi-Agent Reward-Free Exploration
par: Barnea, Idan, et autres
Publié: (2026)
par: Barnea, Idan, et autres
Publié: (2026)
Rate-Optimal Policy Optimization for Linear Markov Decision Processes
par: Sherman, Uri, et autres
Publié: (2023)
par: Sherman, Uri, et autres
Publié: (2023)
Online Weighted Paging with Unknown Weights
par: Levy, Orin, et autres
Publié: (2024)
par: Levy, Orin, et autres
Publié: (2024)
Warm-up Free Policy Optimization: Improved Regret in Linear Markov Decision Processes
par: Cassel, Asaf, et autres
Publié: (2024)
par: Cassel, Asaf, et autres
Publié: (2024)
Convergence of Policy Mirror Descent Beyond Compatible Function Approximation
par: Sherman, Uri, et autres
Publié: (2025)
par: Sherman, Uri, et autres
Publié: (2025)
Regret Guarantees for Linear Contextual Stochastic Shortest Path
par: Polikar, Dor, et autres
Publié: (2025)
par: Polikar, Dor, et autres
Publié: (2025)
Online Learning in MDPs with Partially Adversarial Transitions and Losses
par: Schlisselberg, Ofir, et autres
Publié: (2026)
par: Schlisselberg, Ofir, et autres
Publié: (2026)
Optimal Strong Regret and Violation in Constrained MDPs via Policy Optimization
par: Stradi, Francesco Emanuele, et autres
Publié: (2024)
par: Stradi, Francesco Emanuele, et autres
Publié: (2024)
Individual Regret in Cooperative Stochastic Multi-Armed Bandits
par: Barnea, Idan, et autres
Publié: (2024)
par: Barnea, Idan, et autres
Publié: (2024)
The Sample Complexity of Multiclass and Sparse Contextual Bandits
par: Erez, Liad, et autres
Publié: (2026)
par: Erez, Liad, et autres
Publié: (2026)
Probably Approximately Precision and Recall Learning
par: Cohen, Lee, et autres
Publié: (2024)
par: Cohen, Lee, et autres
Publié: (2024)
Near-Optimal Dynamic Regret for Adversarial Linear Mixture MDPs
par: Li, Long-Fei, et autres
Publié: (2024)
par: Li, Long-Fei, et autres
Publié: (2024)
Adaptive Estimation and Optimal Control in Offline Contextual MDPs without Stationarity
par: Bhattacharyya, Riddhiman, et autres
Publié: (2026)
par: Bhattacharyya, Riddhiman, et autres
Publié: (2026)
Improved Best-of-Both-Worlds Regret for Bandits with Delayed Feedback
par: Schlisselberg, Ofir, et autres
Publié: (2025)
par: Schlisselberg, Ofir, et autres
Publié: (2025)
The Real Price of Bandit Information in Multiclass Classification
par: Erez, Liad, et autres
Publié: (2024)
par: Erez, Liad, et autres
Publié: (2024)
Fast Rates for Bandit PAC Multiclass Classification
par: Erez, Liad, et autres
Publié: (2024)
par: Erez, Liad, et autres
Publié: (2024)
How to Boost Any Loss Function
par: Nock, Richard, et autres
Publié: (2024)
par: Nock, Richard, et autres
Publié: (2024)
Theoretical Foundations and Effective Algorithms for Policy-Aware Simulator Learning
par: Dann, Christoph, et autres
Publié: (2026)
par: Dann, Christoph, et autres
Publié: (2026)
Regret Minimization and Convergence to Equilibria in General-sum Markov Games
par: Erez, Liad, et autres
Publié: (2022)
par: Erez, Liad, et autres
Publié: (2022)
The Hidden Cost of Approximation in Online Mirror Descent
par: Schlisselberg, Ofir, et autres
Publié: (2025)
par: Schlisselberg, Ofir, et autres
Publié: (2025)
Order-Optimal Regret with Novel Policy Gradient Approaches in Infinite-Horizon Average Reward MDPs
par: Ganesh, Swetha, et autres
Publié: (2024)
par: Ganesh, Swetha, et autres
Publié: (2024)
Rising Rested MAB with Linear Drift
par: Amichay, Omer, et autres
Publié: (2025)
par: Amichay, Omer, et autres
Publié: (2025)
Non-stochastic Bandits With Evolving Observations
par: Bar-On, Yogev, et autres
Publié: (2024)
par: Bar-On, Yogev, et autres
Publié: (2024)
Sample Complexity of Agnostic Multiclass Classification: Natarajan Dimension Strikes Back
par: Cohen, Alon, et autres
Publié: (2025)
par: Cohen, Alon, et autres
Publié: (2025)
Online Set Learning from Precision and Recall Feedback
par: Cohen, Lee, et autres
Publié: (2026)
par: Cohen, Lee, et autres
Publié: (2026)
Delay as Payoff in MAB
par: Schlisselberg, Ofir, et autres
Publié: (2024)
par: Schlisselberg, Ofir, et autres
Publié: (2024)
Bayesian Risk-Sensitive Policy Optimization For MDPs With General Loss Functions
par: Wang, Xiaoshuang, et autres
Publié: (2025)
par: Wang, Xiaoshuang, et autres
Publié: (2025)
Offline Oracle-Efficient Learning for Contextual MDPs via Layerwise Exploration-Exploitation Tradeoff
par: Qian, Jian, et autres
Publié: (2024)
par: Qian, Jian, et autres
Publié: (2024)
Truly No-Regret Learning in Constrained MDPs
par: Müller, Adrian, et autres
Publié: (2024)
par: Müller, Adrian, et autres
Publié: (2024)
Towards Optimal Differentially Private Regret Bounds in Linear MDPs
par: Sahu, Sharan
Publié: (2025)
par: Sahu, Sharan
Publié: (2025)
Optimal Variance-Dependent Regret Bounds for Infinite-Horizon MDPs
par: Zamir, Guy, et autres
Publié: (2026)
par: Zamir, Guy, et autres
Publié: (2026)
Achieving Tractable Minimax Optimal Regret in Average Reward MDPs
par: Boone, Victor, et autres
Publié: (2024)
par: Boone, Victor, et autres
Publié: (2024)
Learnability Gaps of Strategic Classification
par: Cohen, Lee, et autres
Publié: (2024)
par: Cohen, Lee, et autres
Publié: (2024)
Near-Optimal Sample Complexity for Online Constrained MDPs
par: Liu, Chang, et autres
Publié: (2026)
par: Liu, Chang, et autres
Publié: (2026)
Documents similaires
-
Eluder-based Regret for Stochastic Contextual MDPs
par: Levy, Orin, et autres
Publié: (2022) -
Optimal Regret for Policy Optimization in Contextual Bandits
par: Levy, Orin, et autres
Publié: (2026) -
Regret Bounds for Adversarial Contextual Bandits with General Function Approximation and Delayed Feedback
par: Levy, Orin, et autres
Publié: (2025) -
Near-optimal Regret Using Policy Optimization in Online MDPs with Aggregate Bandit Feedback
par: Lancewicki, Tal, et autres
Publié: (2025) -
Batch Ensemble for Variance Dependent Regret in Stochastic Bandits
par: Cassel, Asaf, et autres
Publié: (2024)