Near-optimal Regret Using Policy Optimization in Online MDPs with Aggregate Bandit Feedback
Fuente:
arXiv
Salvato in:
| Autori principali: | Lancewicki, Tal, Mansour, Yishay |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Improved Best-of-Both-Worlds Regret for Bandits with Delayed Feedback
di: Schlisselberg, Ofir, et al.
Pubblicazione: (2025)
di: Schlisselberg, Ofir, et al.
Pubblicazione: (2025)
Individual Regret in Cooperative Stochastic Multi-Armed Bandits
di: Barnea, Idan, et al.
Pubblicazione: (2024)
di: Barnea, Idan, et al.
Pubblicazione: (2024)
Online Learning in MDPs with Partially Adversarial Transitions and Losses
di: Schlisselberg, Ofir, et al.
Pubblicazione: (2026)
di: Schlisselberg, Ofir, et al.
Pubblicazione: (2026)
Optimal Regret for Policy Optimization in Contextual Bandits
di: Levy, Orin, et al.
Pubblicazione: (2026)
di: Levy, Orin, et al.
Pubblicazione: (2026)
Near-Optimal Regret for Policy Optimization in Contextual MDPs with General Offline Function Approximation
di: Levy, Orin, et al.
Pubblicazione: (2026)
di: Levy, Orin, et al.
Pubblicazione: (2026)
Near-Optimal Regret in Linear MDPs with Aggregate Bandit Feedback
di: Cassel, Asaf, et al.
Pubblicazione: (2024)
di: Cassel, Asaf, et al.
Pubblicazione: (2024)
Regret Minimization and Convergence to Equilibria in General-sum Markov Games
di: Erez, Liad, et al.
Pubblicazione: (2022)
di: Erez, Liad, et al.
Pubblicazione: (2022)
Delay as Payoff in MAB
di: Schlisselberg, Ofir, et al.
Pubblicazione: (2024)
di: Schlisselberg, Ofir, et al.
Pubblicazione: (2024)
Eluder-based Regret for Stochastic Contextual MDPs
di: Levy, Orin, et al.
Pubblicazione: (2022)
di: Levy, Orin, et al.
Pubblicazione: (2022)
Regret Bounds for Adversarial Contextual Bandits with General Function Approximation and Delayed Feedback
di: Levy, Orin, et al.
Pubblicazione: (2025)
di: Levy, Orin, et al.
Pubblicazione: (2025)
Batch Ensemble for Variance Dependent Regret in Stochastic Bandits
di: Cassel, Asaf, et al.
Pubblicazione: (2024)
di: Cassel, Asaf, et al.
Pubblicazione: (2024)
Non-stochastic Bandits With Evolving Observations
di: Bar-On, Yogev, et al.
Pubblicazione: (2024)
di: Bar-On, Yogev, et al.
Pubblicazione: (2024)
Online Set Learning from Precision and Recall Feedback
di: Cohen, Lee, et al.
Pubblicazione: (2026)
di: Cohen, Lee, et al.
Pubblicazione: (2026)
Collaborating in Multi-Armed Bandits with Strategic Agents
di: Barnea, Idan, et al.
Pubblicazione: (2026)
di: Barnea, Idan, et al.
Pubblicazione: (2026)
Adapting to Stochastic and Adversarial Losses in Episodic MDPs with Aggregate Bandit Feedback
di: Ito, Shinji, et al.
Pubblicazione: (2025)
di: Ito, Shinji, et al.
Pubblicazione: (2025)
Optimal High-Probability Regret for Online Convex Optimization with Two-Point Bandit Feedback
di: Ye, Haishan
Pubblicazione: (2026)
di: Ye, Haishan
Pubblicazione: (2026)
Near-optimal Per-Action Regret Bounds for Sleeping Bandits
di: Nguyen, Quan, et al.
Pubblicazione: (2024)
di: Nguyen, Quan, et al.
Pubblicazione: (2024)
Improved Regret for Bandit Convex Optimization with Delayed Feedback
di: Wan, Yuanyu, et al.
Pubblicazione: (2024)
di: Wan, Yuanyu, et al.
Pubblicazione: (2024)
Rate-Optimal Policy Optimization for Linear Markov Decision Processes
di: Sherman, Uri, et al.
Pubblicazione: (2023)
di: Sherman, Uri, et al.
Pubblicazione: (2023)
Optimal Strong Regret and Violation in Constrained MDPs via Policy Optimization
di: Stradi, Francesco Emanuele, et al.
Pubblicazione: (2024)
di: Stradi, Francesco Emanuele, et al.
Pubblicazione: (2024)
Stochastic Online Instrumental Variable Regression: Regrets for Endogeneity and Bandit Feedback
di: Della Vecchia, Riccardo, et al.
Pubblicazione: (2023)
di: Della Vecchia, Riccardo, et al.
Pubblicazione: (2023)
Theoretical Foundations and Effective Algorithms for Policy-Aware Simulator Learning
di: Dann, Christoph, et al.
Pubblicazione: (2026)
di: Dann, Christoph, et al.
Pubblicazione: (2026)
Near-Optimal Dynamic Regret for Adversarial Linear Mixture MDPs
di: Li, Long-Fei, et al.
Pubblicazione: (2024)
di: Li, Long-Fei, et al.
Pubblicazione: (2024)
Distributed Online Bandit Nonconvex Optimization with One-Point Residual Feedback via Dynamic Regret
di: Hua, Youqing, et al.
Pubblicazione: (2024)
di: Hua, Youqing, et al.
Pubblicazione: (2024)
Data- and Variance-dependent Regret Bounds for Online Tabular MDPs
di: Li, Mingyi, et al.
Pubblicazione: (2026)
di: Li, Mingyi, et al.
Pubblicazione: (2026)
Convergence of Policy Mirror Descent Beyond Compatible Function Approximation
di: Sherman, Uri, et al.
Pubblicazione: (2025)
di: Sherman, Uri, et al.
Pubblicazione: (2025)
The Real Price of Bandit Information in Multiclass Classification
di: Erez, Liad, et al.
Pubblicazione: (2024)
di: Erez, Liad, et al.
Pubblicazione: (2024)
Fast Rates for Bandit PAC Multiclass Classification
di: Erez, Liad, et al.
Pubblicazione: (2024)
di: Erez, Liad, et al.
Pubblicazione: (2024)
Near-Optimal Regret in Adversarial Kernel Bandits
di: Zhang, Yu-Jie, et al.
Pubblicazione: (2026)
di: Zhang, Yu-Jie, et al.
Pubblicazione: (2026)
Rising Rested MAB with Linear Drift
di: Amichay, Omer, et al.
Pubblicazione: (2025)
di: Amichay, Omer, et al.
Pubblicazione: (2025)
The Hidden Cost of Approximation in Online Mirror Descent
di: Schlisselberg, Ofir, et al.
Pubblicazione: (2025)
di: Schlisselberg, Ofir, et al.
Pubblicazione: (2025)
Fast Inference via Hierarchical Speculative Decoding
di: Mohri, Clara, et al.
Pubblicazione: (2025)
di: Mohri, Clara, et al.
Pubblicazione: (2025)
Beating Adversarial Low-Rank MDPs with Unknown Transition and Bandit Feedback
di: Liu, Haolin, et al.
Pubblicazione: (2024)
di: Liu, Haolin, et al.
Pubblicazione: (2024)
Information Capacity Regret Bounds for Bandits with Mediator Feedback
di: Eldowa, Khaled, et al.
Pubblicazione: (2024)
di: Eldowa, Khaled, et al.
Pubblicazione: (2024)
Competing Bandits: The Perils of Exploration Under Competition
di: Aridor, Guy, et al.
Pubblicazione: (2020)
di: Aridor, Guy, et al.
Pubblicazione: (2020)
Nearly Minimax Optimal Regret for Multinomial Logistic Bandit
di: Lee, Joongkyu, et al.
Pubblicazione: (2024)
di: Lee, Joongkyu, et al.
Pubblicazione: (2024)
Towards Principled, Practical Policy Gradient for Bandits and Tabular MDPs
di: Lu, Michael, et al.
Pubblicazione: (2024)
di: Lu, Michael, et al.
Pubblicazione: (2024)
Modeling Attrition in Recommender Systems with Departing Bandits
di: Ben-Porat, Omer, et al.
Pubblicazione: (2022)
di: Ben-Porat, Omer, et al.
Pubblicazione: (2022)
Efficient, Low-Regret, Online Reinforcement Learning for Linear MDPs
di: John, Philips George, et al.
Pubblicazione: (2024)
di: John, Philips George, et al.
Pubblicazione: (2024)
Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds
di: Kayal, Aya, et al.
Pubblicazione: (2025)
di: Kayal, Aya, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Improved Best-of-Both-Worlds Regret for Bandits with Delayed Feedback
di: Schlisselberg, Ofir, et al.
Pubblicazione: (2025) -
Individual Regret in Cooperative Stochastic Multi-Armed Bandits
di: Barnea, Idan, et al.
Pubblicazione: (2024) -
Online Learning in MDPs with Partially Adversarial Transitions and Losses
di: Schlisselberg, Ofir, et al.
Pubblicazione: (2026) -
Optimal Regret for Policy Optimization in Contextual Bandits
di: Levy, Orin, et al.
Pubblicazione: (2026) -
Near-Optimal Regret for Policy Optimization in Contextual MDPs with General Offline Function Approximation
di: Levy, Orin, et al.
Pubblicazione: (2026)