Design Experiments to Compare Multi-armed Bandit Algorithms
Fuente:
arXiv
Saved in:
| Main Authors: | Meng, Huiling, Chen, Ningyuan, Gao, Xuefeng |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Transfer Learning for Contextual Multi-armed Bandits
by: Cai, Changxiao, et al.
Published: (2022)
by: Cai, Changxiao, et al.
Published: (2022)
Extended UCB Policies for Multi-armed Bandit Problems
by: Liu, Keqin, et al.
Published: (2011)
by: Liu, Keqin, et al.
Published: (2011)
The Fragility of Optimized Bandit Algorithms
by: Fan, Lin, et al.
Published: (2021)
by: Fan, Lin, et al.
Published: (2021)
Choosing the Better Bandit Algorithm under Data Sharing: When Do A/B Experiments Work?
by: Li, Shuangning, et al.
Published: (2025)
by: Li, Shuangning, et al.
Published: (2025)
Reinforcement Learning for Intensity Control: An Application to Choice-Based Network Revenue Management
by: Meng, Huiling, et al.
Published: (2024)
by: Meng, Huiling, et al.
Published: (2024)
Truncated LinUCB for Stochastic Linear Bandits
by: Song, Yanglei, et al.
Published: (2022)
by: Song, Yanglei, et al.
Published: (2022)
Multimodal Bandits: Regret Lower Bounds and Optimal Algorithms
by: Réveillard, William, et al.
Published: (2025)
by: Réveillard, William, et al.
Published: (2025)
On Instability of Minimax Optimal Optimism-Based Bandit Algorithms
by: Praharaj, Samya, et al.
Published: (2025)
by: Praharaj, Samya, et al.
Published: (2025)
Is Thompson Sampling Susceptible to Algorithmic Collusion?
by: Xiong, Yi, et al.
Published: (2024)
by: Xiong, Yi, et al.
Published: (2024)
Towards Efficient and Optimal Covariance-Adaptive Algorithms for Combinatorial Semi-Bandits
by: Zhou, Julien, et al.
Published: (2024)
by: Zhou, Julien, et al.
Published: (2024)
Minimax Rate-Optimal Algorithms for High-Dimensional Stochastic Linear Bandits
by: Liu, Jingyu, et al.
Published: (2025)
by: Liu, Jingyu, et al.
Published: (2025)
Statistical Complexity and Optimal Algorithms for Non-linear Ridge Bandits
by: Rajaraman, Nived, et al.
Published: (2023)
by: Rajaraman, Nived, et al.
Published: (2023)
LIBRA: Language Model Informed Bandit Recourse Algorithm for Personalized Treatment Planning
by: Cao, Junyu, et al.
Published: (2026)
by: Cao, Junyu, et al.
Published: (2026)
Multi-Armed Bandits With Machine Learning-Generated Surrogate Rewards
by: Ji, Wenlong, et al.
Published: (2025)
by: Ji, Wenlong, et al.
Published: (2025)
Navigating Sparsities in High-Dimensional Linear Contextual Bandits
by: Zhao, Rui, et al.
Published: (2025)
by: Zhao, Rui, et al.
Published: (2025)
A Simple and Optimal Policy Design with Safety against Heavy-Tailed Risk for Stochastic Bandits
by: Simchi-Levi, David, et al.
Published: (2022)
by: Simchi-Levi, David, et al.
Published: (2022)
Batched Nonparametric Contextual Bandits
by: Jiang, Rong, et al.
Published: (2024)
by: Jiang, Rong, et al.
Published: (2024)
Optimal Batched Linear Bandits
by: Ren, Xuanfei, et al.
Published: (2024)
by: Ren, Xuanfei, et al.
Published: (2024)
Adaptive Smooth Non-Stationary Bandits
by: Suk, Joe
Published: (2024)
by: Suk, Joe
Published: (2024)
Testing the Feasibility of Linear Programs with Bandit Feedback
by: Gangrade, Aditya, et al.
Published: (2024)
by: Gangrade, Aditya, et al.
Published: (2024)
Multitask Learning and Bandits via Robust Statistics
by: Xu, Kan, et al.
Published: (2021)
by: Xu, Kan, et al.
Published: (2021)
Enjoying Non-linearity in Multinomial Logistic Bandits: A Minimax-Optimal Algorithm
by: Boudart, Pierre, et al.
Published: (2025)
by: Boudart, Pierre, et al.
Published: (2025)
Thompson sampling: Precise arm-pull dynamics and adaptive inference
by: Han, Qiyang
Published: (2026)
by: Han, Qiyang
Published: (2026)
UCB algorithms for multi-armed bandits: Precise regret and adaptive inference
by: Han, Qiyang, et al.
Published: (2024)
by: Han, Qiyang, et al.
Published: (2024)
Minimax-optimal trust-aware multi-armed bandits
by: Cai, Changxiao, et al.
Published: (2024)
by: Cai, Changxiao, et al.
Published: (2024)
Near-Optimal Regret for KL-Regularized Multi-Armed Bandits
by: Ji, Kaixuan, et al.
Published: (2026)
by: Ji, Kaixuan, et al.
Published: (2026)
Clustered Switchback Designs for Experimentation Under Spatio-temporal Interference
by: Jia, Su, et al.
Published: (2023)
by: Jia, Su, et al.
Published: (2023)
Online Clustering of Data Sequences with Bandit Information
by: Chandran, G Dhinesh, et al.
Published: (2025)
by: Chandran, G Dhinesh, et al.
Published: (2025)
Asymptotically Optimal Problem-Dependent Bandit Policies for Transfer Learning
by: Prevost, Adrien, et al.
Published: (2025)
by: Prevost, Adrien, et al.
Published: (2025)
Comparing Exploration-Exploitation Strategies of LLMs and Humans: Insights from Standard Multi-armed Bandit Experiments
by: Zhang, Ziyuan, et al.
Published: (2025)
by: Zhang, Ziyuan, et al.
Published: (2025)
On the Optimal Sample Complexity of Offline Multi-Armed Bandits with KL Regularization
by: Ji, Kaixuan, et al.
Published: (2026)
by: Ji, Kaixuan, et al.
Published: (2026)
The Sample Complexity of Multiple Change Point Identification under Bandit Feedback
by: Graf, Maximilian, et al.
Published: (2026)
by: Graf, Maximilian, et al.
Published: (2026)
FLIPHAT: Joint Differential Privacy for High Dimensional Sparse Linear Bandits
by: Chakraborty, Sunrit, et al.
Published: (2024)
by: Chakraborty, Sunrit, et al.
Published: (2024)
The Adaptivity Barrier in Batched Nonparametric Bandits: Sharp Characterization of the Price of Unknown Margin
by: Jiang, Rong, et al.
Published: (2025)
by: Jiang, Rong, et al.
Published: (2025)
Upper Counterfactual Confidence Bounds: a New Optimism Principle for Contextual Bandits
by: Xu, Yunbei, et al.
Published: (2020)
by: Xu, Yunbei, et al.
Published: (2020)
Assouad, Fano, and Le Cam with Interaction: A Unifying Lower Bound Framework and Characterization for Bandit Learnability
by: Chen, Fan, et al.
Published: (2024)
by: Chen, Fan, et al.
Published: (2024)
Stronger Neyman Regret Guarantees for Adaptive Experimental Design
by: Noarov, Georgy, et al.
Published: (2025)
by: Noarov, Georgy, et al.
Published: (2025)
PAC Learning with Bandit Feedback: Sharp Sample Complexity in the Realizable Setting
by: Hanneke, Steve, et al.
Published: (2026)
by: Hanneke, Steve, et al.
Published: (2026)
Avoiding the Price of Adaptivity: Inference in Linear Contextual Bandits via Stability
by: Praharaj, Samya, et al.
Published: (2025)
by: Praharaj, Samya, et al.
Published: (2025)
Design Stability in Adaptive Experiments: Implications for Treatment Effect Estimation
by: Sengupta, Saikat, et al.
Published: (2025)
by: Sengupta, Saikat, et al.
Published: (2025)
Similar Items
-
Transfer Learning for Contextual Multi-armed Bandits
by: Cai, Changxiao, et al.
Published: (2022) -
Extended UCB Policies for Multi-armed Bandit Problems
by: Liu, Keqin, et al.
Published: (2011) -
The Fragility of Optimized Bandit Algorithms
by: Fan, Lin, et al.
Published: (2021) -
Choosing the Better Bandit Algorithm under Data Sharing: When Do A/B Experiments Work?
by: Li, Shuangning, et al.
Published: (2025) -
Reinforcement Learning for Intensity Control: An Application to Choice-Based Network Revenue Management
by: Meng, Huiling, et al.
Published: (2024)