Best-of-Both Worlds for linear contextual bandits with paid observations
Fuente:
arXiv
Salvato in:
| Autori principali: | Boyer, Nathan, Baudry, Dorian, Rebeschini, Patrick |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Non-stationary Bandit Convex Optimization: A Comprehensive Study
di: Liu, Xiaoqi, et al.
Pubblicazione: (2025)
di: Liu, Xiaoqi, et al.
Pubblicazione: (2025)
Precision autotuning for linear solvers via contextual bandit-based RL
di: Carson, Erin, et al.
Pubblicazione: (2026)
di: Carson, Erin, et al.
Pubblicazione: (2026)
VITS : Variational Inference Thompson Sampling for contextual bandits
di: Clavier, Pierre, et al.
Pubblicazione: (2023)
di: Clavier, Pierre, et al.
Pubblicazione: (2023)
Model selection for behavioral learning data and applications to contextual bandits
di: Aubert, Julien, et al.
Pubblicazione: (2025)
di: Aubert, Julien, et al.
Pubblicazione: (2025)
The Value of Reward Lookahead in Reinforcement Learning
di: Merlis, Nadav, et al.
Pubblicazione: (2024)
di: Merlis, Nadav, et al.
Pubblicazione: (2024)
A General Recipe for the Analysis of Randomized Multi-Armed Bandit Algorithms
di: Baudry, Dorian, et al.
Pubblicazione: (2023)
di: Baudry, Dorian, et al.
Pubblicazione: (2023)
Optimal cross-learning for contextual bandits with unknown context distributions
di: Schneider, Jon, et al.
Pubblicazione: (2024)
di: Schneider, Jon, et al.
Pubblicazione: (2024)
Robust Gradient Descent for Phase Retrieval
di: Buna, Alex, et al.
Pubblicazione: (2024)
di: Buna, Alex, et al.
Pubblicazione: (2024)
Leveraging heterogeneous spillover in maximizing contextual bandit rewards
di: Faruk, Ahmed Sayeed, et al.
Pubblicazione: (2023)
di: Faruk, Ahmed Sayeed, et al.
Pubblicazione: (2023)
Anytime-valid off-policy inference for contextual bandits
di: Waudby-Smith, Ian, et al.
Pubblicazione: (2022)
di: Waudby-Smith, Ian, et al.
Pubblicazione: (2022)
A conversion theorem and minimax optimality for continuum contextual bandits
di: Akhavan, Arya, et al.
Pubblicazione: (2024)
di: Akhavan, Arya, et al.
Pubblicazione: (2024)
Quantum contextual bandits and recommender systems for quantum data
di: Brahmachari, Shrigyan, et al.
Pubblicazione: (2023)
di: Brahmachari, Shrigyan, et al.
Pubblicazione: (2023)
Best-of-Both-Worlds Algorithms for Linear Contextual Bandits
di: Kuroki, Yuko, et al.
Pubblicazione: (2023)
di: Kuroki, Yuko, et al.
Pubblicazione: (2023)
The Best of Both Worlds: On the Dilemma of Out-of-distribution Detection
di: Zhang, Qingyang, et al.
Pubblicazione: (2024)
di: Zhang, Qingyang, et al.
Pubblicazione: (2024)
Vector preference-based contextual bandits under distributional shifts
di: Shukla, Apurv, et al.
Pubblicazione: (2025)
di: Shukla, Apurv, et al.
Pubblicazione: (2025)
Best of Both Worlds: Regret Minimization versus Minimax Play
di: Müller, Adrian, et al.
Pubblicazione: (2025)
di: Müller, Adrian, et al.
Pubblicazione: (2025)
Improved Best-of-Both-Worlds Regret for Bandits with Delayed Feedback
di: Schlisselberg, Ofir, et al.
Pubblicazione: (2025)
di: Schlisselberg, Ofir, et al.
Pubblicazione: (2025)
Best-of-Both-Worlds for Heavy-Tailed Markov Decision Processes
di: Chen, Yu, et al.
Pubblicazione: (2026)
di: Chen, Yu, et al.
Pubblicazione: (2026)
Best-of-Both-Worlds Policy Optimization for CMDPs with Bandit Feedback
di: Stradi, Francesco Emanuele, et al.
Pubblicazione: (2024)
di: Stradi, Francesco Emanuele, et al.
Pubblicazione: (2024)
On the optimal regret of collaborative personalized linear bandits
di: Huang, Bruce, et al.
Pubblicazione: (2025)
di: Huang, Bruce, et al.
Pubblicazione: (2025)
Follow-the-Perturbed-Leader for Decoupled Bandits: Best-of-Both-Worlds and Practicality
di: Kim, Chaiwon, et al.
Pubblicazione: (2025)
di: Kim, Chaiwon, et al.
Pubblicazione: (2025)
Efficient Best-of-Both-Worlds Algorithms for Contextual Combinatorial Semi-Bandits
di: Li, Mengmeng, et al.
Pubblicazione: (2025)
di: Li, Mengmeng, et al.
Pubblicazione: (2025)
A Perturbation Approach to Unconstrained Linear Bandits
di: Jacobsen, Andrew, et al.
Pubblicazione: (2026)
di: Jacobsen, Andrew, et al.
Pubblicazione: (2026)
When and why randomised exploration works (in linear bandits)
di: Abeille, Marc, et al.
Pubblicazione: (2025)
di: Abeille, Marc, et al.
Pubblicazione: (2025)
Ensemble sampling for linear bandits: small ensembles suffice
di: Janz, David, et al.
Pubblicazione: (2023)
di: Janz, David, et al.
Pubblicazione: (2023)
Adversarial bandit optimization for approximately linear functions
di: Cheng, Zhuoyu, et al.
Pubblicazione: (2025)
di: Cheng, Zhuoyu, et al.
Pubblicazione: (2025)
LC-Tsallis-INF: Generalized Best-of-Both-Worlds Linear Contextual Bandits
di: Kato, Masahiro, et al.
Pubblicazione: (2024)
di: Kato, Masahiro, et al.
Pubblicazione: (2024)
A Best-of-Both-Worlds Algorithm for Constrained MDPs with Long-Term Constraints
di: Germano, Jacopo, et al.
Pubblicazione: (2023)
di: Germano, Jacopo, et al.
Pubblicazione: (2023)
Best of Both Worlds: Advantages of Hybrid Graph Sequence Models
di: Behrouz, Ali, et al.
Pubblicazione: (2024)
di: Behrouz, Ali, et al.
Pubblicazione: (2024)
Sharp Risk Bounds for Early-Stopping in Gaussian Linear Regression
di: Wegel, Tobias, et al.
Pubblicazione: (2025)
di: Wegel, Tobias, et al.
Pubblicazione: (2025)
Variance-sensitive Thompson sampling for generalised linear bandits, revisited
di: Perneczky, Tom, et al.
Pubblicazione: (2026)
di: Perneczky, Tom, et al.
Pubblicazione: (2026)
uniINF: Best-of-Both-Worlds Algorithm for Parameter-Free Heavy-Tailed MABs
di: Chen, Yu, et al.
Pubblicazione: (2024)
di: Chen, Yu, et al.
Pubblicazione: (2024)
Adaptive Learning Rate for Follow-the-Regularized-Leader: Competitive Analysis and Best-of-Both-Worlds
di: Ito, Shinji, et al.
Pubblicazione: (2024)
di: Ito, Shinji, et al.
Pubblicazione: (2024)
Stochastic contextual bandits with graph feedback: from independence number to MAS number
di: Wen, Yuxiao, et al.
Pubblicazione: (2024)
di: Wen, Yuxiao, et al.
Pubblicazione: (2024)
Best of Both Worlds: Practical and Theoretically Optimal Submodular Maximization in Parallel
di: Chen, Yixin, et al.
Pubblicazione: (2021)
di: Chen, Yixin, et al.
Pubblicazione: (2021)
A Best-of-Both-Worlds Proof for Tsallis-INF without Fenchel Conjugates
di: Lee, Wei-Cheng, et al.
Pubblicazione: (2025)
di: Lee, Wei-Cheng, et al.
Pubblicazione: (2025)
Extreme bandits
di: Carpentier, Alexandra, et al.
Pubblicazione: (2026)
di: Carpentier, Alexandra, et al.
Pubblicazione: (2026)
Differentiable Cost-Parameterized Monge Map Estimators
di: Howard, Samuel, et al.
Pubblicazione: (2024)
di: Howard, Samuel, et al.
Pubblicazione: (2024)
Follow-the-Perturbed-Leader Approaches Best-of-Both-Worlds for the m-Set Semi-Bandit Problems
di: Zhan, Jingxin, et al.
Pubblicazione: (2025)
di: Zhan, Jingxin, et al.
Pubblicazione: (2025)
A Novel Framework for Policy Mirror Descent with General Parameterization and Linear Convergence
di: Alfano, Carlo, et al.
Pubblicazione: (2023)
di: Alfano, Carlo, et al.
Pubblicazione: (2023)
Documenti analoghi
-
Non-stationary Bandit Convex Optimization: A Comprehensive Study
di: Liu, Xiaoqi, et al.
Pubblicazione: (2025) -
Precision autotuning for linear solvers via contextual bandit-based RL
di: Carson, Erin, et al.
Pubblicazione: (2026) -
VITS : Variational Inference Thompson Sampling for contextual bandits
di: Clavier, Pierre, et al.
Pubblicazione: (2023) -
Model selection for behavioral learning data and applications to contextual bandits
di: Aubert, Julien, et al.
Pubblicazione: (2025) -
The Value of Reward Lookahead in Reinforcement Learning
di: Merlis, Nadav, et al.
Pubblicazione: (2024)