Improved Best-of-Both-Worlds Regret for Bandits with Delayed Feedback
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Schlisselberg, Ofir, Lancewicki, Tal, Auer, Peter, Mansour, Yishay |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Online Learning in MDPs with Partially Adversarial Transitions and Losses
par: Schlisselberg, Ofir, et autres
Publié: (2026)
par: Schlisselberg, Ofir, et autres
Publié: (2026)
Delay as Payoff in MAB
par: Schlisselberg, Ofir, et autres
Publié: (2024)
par: Schlisselberg, Ofir, et autres
Publié: (2024)
Near-optimal Regret Using Policy Optimization in Online MDPs with Aggregate Bandit Feedback
par: Lancewicki, Tal, et autres
Publié: (2025)
par: Lancewicki, Tal, et autres
Publié: (2025)
Individual Regret in Cooperative Stochastic Multi-Armed Bandits
par: Barnea, Idan, et autres
Publié: (2024)
par: Barnea, Idan, et autres
Publié: (2024)
Collaborating in Multi-Armed Bandits with Strategic Agents
par: Barnea, Idan, et autres
Publié: (2026)
par: Barnea, Idan, et autres
Publié: (2026)
Regret Bounds for Adversarial Contextual Bandits with General Function Approximation and Delayed Feedback
par: Levy, Orin, et autres
Publié: (2025)
par: Levy, Orin, et autres
Publié: (2025)
The Hidden Cost of Approximation in Online Mirror Descent
par: Schlisselberg, Ofir, et autres
Publié: (2025)
par: Schlisselberg, Ofir, et autres
Publié: (2025)
Regret Minimization and Convergence to Equilibria in General-sum Markov Games
par: Erez, Liad, et autres
Publié: (2022)
par: Erez, Liad, et autres
Publié: (2022)
Optimal Regret for Policy Optimization in Contextual Bandits
par: Levy, Orin, et autres
Publié: (2026)
par: Levy, Orin, et autres
Publié: (2026)
Batch Ensemble for Variance Dependent Regret in Stochastic Bandits
par: Cassel, Asaf, et autres
Publié: (2024)
par: Cassel, Asaf, et autres
Publié: (2024)
Improved Regret for Bandit Convex Optimization with Delayed Feedback
par: Wan, Yuanyu, et autres
Publié: (2024)
par: Wan, Yuanyu, et autres
Publié: (2024)
Best-of-Both-Worlds Policy Optimization for CMDPs with Bandit Feedback
par: Stradi, Francesco Emanuele, et autres
Publié: (2024)
par: Stradi, Francesco Emanuele, et autres
Publié: (2024)
Non-stochastic Bandits With Evolving Observations
par: Bar-On, Yogev, et autres
Publié: (2024)
par: Bar-On, Yogev, et autres
Publié: (2024)
The impact of allocation strategies in subset learning on the expressive power of neural networks
par: Schlisselberg, Ofir, et autres
Publié: (2025)
par: Schlisselberg, Ofir, et autres
Publié: (2025)
Best-of-Both-Worlds Algorithms for Linear Contextual Bandits
par: Kuroki, Yuko, et autres
Publié: (2023)
par: Kuroki, Yuko, et autres
Publié: (2023)
Best of Both Worlds: Regret Minimization versus Minimax Play
par: Müller, Adrian, et autres
Publié: (2025)
par: Müller, Adrian, et autres
Publié: (2025)
Eluder-based Regret for Stochastic Contextual MDPs
par: Levy, Orin, et autres
Publié: (2022)
par: Levy, Orin, et autres
Publié: (2022)
Follow-the-Perturbed-Leader for Decoupled Bandits: Best-of-Both-Worlds and Practicality
par: Kim, Chaiwon, et autres
Publié: (2025)
par: Kim, Chaiwon, et autres
Publié: (2025)
Efficient Best-of-Both-Worlds Algorithms for Contextual Combinatorial Semi-Bandits
par: Li, Mengmeng, et autres
Publié: (2025)
par: Li, Mengmeng, et autres
Publié: (2025)
Near-Optimal Regret for Policy Optimization in Contextual MDPs with General Offline Function Approximation
par: Levy, Orin, et autres
Publié: (2026)
par: Levy, Orin, et autres
Publié: (2026)
A Best-of-both-worlds Algorithm for Bandits with Delayed Feedback with Robustness to Excessive Delays
par: Masoudian, Saeed, et autres
Publié: (2023)
par: Masoudian, Saeed, et autres
Publié: (2023)
Fast Best-in-Class Regret for Contextual Bandits
par: Girard, Samuel, et autres
Publié: (2025)
par: Girard, Samuel, et autres
Publié: (2025)
LC-Tsallis-INF: Generalized Best-of-Both-Worlds Linear Contextual Bandits
par: Kato, Masahiro, et autres
Publié: (2024)
par: Kato, Masahiro, et autres
Publié: (2024)
Online Set Learning from Precision and Recall Feedback
par: Cohen, Lee, et autres
Publié: (2026)
par: Cohen, Lee, et autres
Publié: (2026)
The Real Price of Bandit Information in Multiclass Classification
par: Erez, Liad, et autres
Publié: (2024)
par: Erez, Liad, et autres
Publié: (2024)
Fast Rates for Bandit PAC Multiclass Classification
par: Erez, Liad, et autres
Publié: (2024)
par: Erez, Liad, et autres
Publié: (2024)
Follow-the-Perturbed-Leader Approaches Best-of-Both-Worlds for the m-Set Semi-Bandit Problems
par: Zhan, Jingxin, et autres
Publié: (2025)
par: Zhan, Jingxin, et autres
Publié: (2025)
Rising Rested MAB with Linear Drift
par: Amichay, Omer, et autres
Publié: (2025)
par: Amichay, Omer, et autres
Publié: (2025)
Fast Inference via Hierarchical Speculative Decoding
par: Mohri, Clara, et autres
Publié: (2025)
par: Mohri, Clara, et autres
Publié: (2025)
Information Capacity Regret Bounds for Bandits with Mediator Feedback
par: Eldowa, Khaled, et autres
Publié: (2024)
par: Eldowa, Khaled, et autres
Publié: (2024)
Follow-the-Perturbed-Leader with Fréchet-type Tail Distributions: Optimality in Adversarial Bandits and Best-of-Both-Worlds
par: Lee, Jongyeong, et autres
Publié: (2024)
par: Lee, Jongyeong, et autres
Publié: (2024)
A Further Efficient Algorithm with Best-of-Both-Worlds Guarantees for $m$-Set Semi-Bandit Problem
par: Chen, Botao, et autres
Publié: (2026)
par: Chen, Botao, et autres
Publié: (2026)
Competing Bandits: The Perils of Exploration Under Competition
par: Aridor, Guy, et autres
Publié: (2020)
par: Aridor, Guy, et autres
Publié: (2020)
Modeling Attrition in Recommender Systems with Departing Bandits
par: Ben-Porat, Omer, et autres
Publié: (2022)
par: Ben-Porat, Omer, et autres
Publié: (2022)
Lipschitz Bandits with Stochastic Delayed Feedback
par: Liu, Zhongxuan, et autres
Publié: (2025)
par: Liu, Zhongxuan, et autres
Publié: (2025)
Near-Optimal Regret in Linear MDPs with Aggregate Bandit Feedback
par: Cassel, Asaf, et autres
Publié: (2024)
par: Cassel, Asaf, et autres
Publié: (2024)
How to Boost Any Loss Function
par: Nock, Richard, et autres
Publié: (2024)
par: Nock, Richard, et autres
Publié: (2024)
Improved Regret Bounds for Bandits with Expert Advice
par: Cesa-Bianchi, Nicolò, et autres
Publié: (2024)
par: Cesa-Bianchi, Nicolò, et autres
Publié: (2024)
Data-dependent Bounds with $T$-Optimal Best-of-Both-Worlds Guarantees in Multi-Armed Bandits using Stability-Penalty Matching
par: Nguyen, Quan, et autres
Publié: (2025)
par: Nguyen, Quan, et autres
Publié: (2025)
Best-of-Both-Worlds Multi-Dueling Bandits: Unified Algorithms for Stochastic and Adversarial Preferences under Condorcet and Borda Objectives
par: Akash, S, et autres
Publié: (2026)
par: Akash, S, et autres
Publié: (2026)
Documents similaires
-
Online Learning in MDPs with Partially Adversarial Transitions and Losses
par: Schlisselberg, Ofir, et autres
Publié: (2026) -
Delay as Payoff in MAB
par: Schlisselberg, Ofir, et autres
Publié: (2024) -
Near-optimal Regret Using Policy Optimization in Online MDPs with Aggregate Bandit Feedback
par: Lancewicki, Tal, et autres
Publié: (2025) -
Individual Regret in Cooperative Stochastic Multi-Armed Bandits
par: Barnea, Idan, et autres
Publié: (2024) -
Collaborating in Multi-Armed Bandits with Strategic Agents
par: Barnea, Idan, et autres
Publié: (2026)