Batch Ensemble for Variance Dependent Regret in Stochastic Bandits
Fuente:
arXiv
Salvato in:
| Autori principali: | Cassel, Asaf, Levy, Orin, Mansour, Yishay |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Eluder-based Regret for Stochastic Contextual MDPs
di: Levy, Orin, et al.
Pubblicazione: (2022)
di: Levy, Orin, et al.
Pubblicazione: (2022)
Optimal Regret for Policy Optimization in Contextual Bandits
di: Levy, Orin, et al.
Pubblicazione: (2026)
di: Levy, Orin, et al.
Pubblicazione: (2026)
Regret Bounds for Adversarial Contextual Bandits with General Function Approximation and Delayed Feedback
di: Levy, Orin, et al.
Pubblicazione: (2025)
di: Levy, Orin, et al.
Pubblicazione: (2025)
Near-Optimal Regret for Policy Optimization in Contextual MDPs with General Offline Function Approximation
di: Levy, Orin, et al.
Pubblicazione: (2026)
di: Levy, Orin, et al.
Pubblicazione: (2026)
The Horizon Threshold in Cooperative Multi-Agent Reward-Free Exploration
di: Barnea, Idan, et al.
Pubblicazione: (2026)
di: Barnea, Idan, et al.
Pubblicazione: (2026)
Individual Regret in Cooperative Stochastic Multi-Armed Bandits
di: Barnea, Idan, et al.
Pubblicazione: (2024)
di: Barnea, Idan, et al.
Pubblicazione: (2024)
Near-optimal Regret Using Policy Optimization in Online MDPs with Aggregate Bandit Feedback
di: Lancewicki, Tal, et al.
Pubblicazione: (2025)
di: Lancewicki, Tal, et al.
Pubblicazione: (2025)
Near-Optimal Regret in Linear MDPs with Aggregate Bandit Feedback
di: Cassel, Asaf, et al.
Pubblicazione: (2024)
di: Cassel, Asaf, et al.
Pubblicazione: (2024)
Improved Best-of-Both-Worlds Regret for Bandits with Delayed Feedback
di: Schlisselberg, Ofir, et al.
Pubblicazione: (2025)
di: Schlisselberg, Ofir, et al.
Pubblicazione: (2025)
Warm-up Free Policy Optimization: Improved Regret in Linear Markov Decision Processes
di: Cassel, Asaf, et al.
Pubblicazione: (2024)
di: Cassel, Asaf, et al.
Pubblicazione: (2024)
Non-stochastic Bandits With Evolving Observations
di: Bar-On, Yogev, et al.
Pubblicazione: (2024)
di: Bar-On, Yogev, et al.
Pubblicazione: (2024)
Variance-Dependent Regret Lower Bounds for Contextual Bandits
di: He, Jiafan, et al.
Pubblicazione: (2025)
di: He, Jiafan, et al.
Pubblicazione: (2025)
Collaborating in Multi-Armed Bandits with Strategic Agents
di: Barnea, Idan, et al.
Pubblicazione: (2026)
di: Barnea, Idan, et al.
Pubblicazione: (2026)
Variance-Aware Regret Bounds for Stochastic Contextual Dueling Bandits
di: Di, Qiwei, et al.
Pubblicazione: (2023)
di: Di, Qiwei, et al.
Pubblicazione: (2023)
Variance-Dependent Regret Bounds for Non-stationary Linear Bandits
di: Wang, Zhiyong, et al.
Pubblicazione: (2024)
di: Wang, Zhiyong, et al.
Pubblicazione: (2024)
How Does Variance Shape the Regret in Contextual Bandits?
di: Jia, Zeyu, et al.
Pubblicazione: (2024)
di: Jia, Zeyu, et al.
Pubblicazione: (2024)
Batched Stochastic Bandit for Nondegenerate Functions
di: Liu, Yu, et al.
Pubblicazione: (2024)
di: Liu, Yu, et al.
Pubblicazione: (2024)
The Real Price of Bandit Information in Multiclass Classification
di: Erez, Liad, et al.
Pubblicazione: (2024)
di: Erez, Liad, et al.
Pubblicazione: (2024)
Fast Rates for Bandit PAC Multiclass Classification
di: Erez, Liad, et al.
Pubblicazione: (2024)
di: Erez, Liad, et al.
Pubblicazione: (2024)
Rising Rested MAB with Linear Drift
di: Amichay, Omer, et al.
Pubblicazione: (2025)
di: Amichay, Omer, et al.
Pubblicazione: (2025)
Competing Bandits: The Perils of Exploration Under Competition
di: Aridor, Guy, et al.
Pubblicazione: (2020)
di: Aridor, Guy, et al.
Pubblicazione: (2020)
Regret Minimization and Convergence to Equilibria in General-sum Markov Games
di: Erez, Liad, et al.
Pubblicazione: (2022)
di: Erez, Liad, et al.
Pubblicazione: (2022)
Modeling Attrition in Recommender Systems with Departing Bandits
di: Ben-Porat, Omer, et al.
Pubblicazione: (2022)
di: Ben-Porat, Omer, et al.
Pubblicazione: (2022)
p-Mean Regret for Stochastic Bandits
di: Krishna, Anand, et al.
Pubblicazione: (2024)
di: Krishna, Anand, et al.
Pubblicazione: (2024)
How to Boost Any Loss Function
di: Nock, Richard, et al.
Pubblicazione: (2024)
di: Nock, Richard, et al.
Pubblicazione: (2024)
Bandits with Stochastic Experts: Constant Regret, Empirical Experts and Episodes
di: Sharma, Nihal, et al.
Pubblicazione: (2021)
di: Sharma, Nihal, et al.
Pubblicazione: (2021)
Graph-Dependent Regret Bounds in Multi-Armed Bandits with Interference
di: Jamshidi, Fateme, et al.
Pubblicazione: (2025)
di: Jamshidi, Fateme, et al.
Pubblicazione: (2025)
Swap Regret and Correlated Equilibria Beyond Normal-Form Games
di: Arunachaleswaran, Eshwar Ram, et al.
Pubblicazione: (2025)
di: Arunachaleswaran, Eshwar Ram, et al.
Pubblicazione: (2025)
The Sample Complexity of Multiclass and Sparse Contextual Bandits
di: Erez, Liad, et al.
Pubblicazione: (2026)
di: Erez, Liad, et al.
Pubblicazione: (2026)
Online Weighted Paging with Unknown Weights
di: Levy, Orin, et al.
Pubblicazione: (2024)
di: Levy, Orin, et al.
Pubblicazione: (2024)
Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs
di: Chen, Shulun, et al.
Pubblicazione: (2025)
di: Chen, Shulun, et al.
Pubblicazione: (2025)
Theoretical Foundations and Effective Algorithms for Policy-Aware Simulator Learning
di: Dann, Christoph, et al.
Pubblicazione: (2026)
di: Dann, Christoph, et al.
Pubblicazione: (2026)
A Characterization of Semi-Supervised Adversarially-Robust PAC Learnability
di: Attias, Idan, et al.
Pubblicazione: (2022)
di: Attias, Idan, et al.
Pubblicazione: (2022)
Online Learning in MDPs with Partially Adversarial Transitions and Losses
di: Schlisselberg, Ofir, et al.
Pubblicazione: (2026)
di: Schlisselberg, Ofir, et al.
Pubblicazione: (2026)
Logarithmic Regret for Unconstrained Submodular Maximization Stochastic Bandit
di: Zhou, Julien, et al.
Pubblicazione: (2024)
di: Zhou, Julien, et al.
Pubblicazione: (2024)
Stochastic Online Instrumental Variable Regression: Regrets for Endogeneity and Bandit Feedback
di: Della Vecchia, Riccardo, et al.
Pubblicazione: (2023)
di: Della Vecchia, Riccardo, et al.
Pubblicazione: (2023)
Robust Batched Bandits
di: Guo, Yunwen, et al.
Pubblicazione: (2025)
di: Guo, Yunwen, et al.
Pubblicazione: (2025)
Thompson Sampling for Stochastic Bandits with Noisy Contexts: An Information-Theoretic Regret Analysis
di: Jose, Sharu Theresa, et al.
Pubblicazione: (2024)
di: Jose, Sharu Theresa, et al.
Pubblicazione: (2024)
Near-Optimal Regret for Efficient Stochastic Combinatorial Semi-Bandits
di: Ye, Zichun, et al.
Pubblicazione: (2025)
di: Ye, Zichun, et al.
Pubblicazione: (2025)
Convergence of Policy Mirror Descent Beyond Compatible Function Approximation
di: Sherman, Uri, et al.
Pubblicazione: (2025)
di: Sherman, Uri, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Eluder-based Regret for Stochastic Contextual MDPs
di: Levy, Orin, et al.
Pubblicazione: (2022) -
Optimal Regret for Policy Optimization in Contextual Bandits
di: Levy, Orin, et al.
Pubblicazione: (2026) -
Regret Bounds for Adversarial Contextual Bandits with General Function Approximation and Delayed Feedback
di: Levy, Orin, et al.
Pubblicazione: (2025) -
Near-Optimal Regret for Policy Optimization in Contextual MDPs with General Offline Function Approximation
di: Levy, Orin, et al.
Pubblicazione: (2026) -
The Horizon Threshold in Cooperative Multi-Agent Reward-Free Exploration
di: Barnea, Idan, et al.
Pubblicazione: (2026)