Multi-Armed Bandits With Machine Learning-Generated Surrogate Rewards
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ji, Wenlong, Pan, Yihan, Zhu, Ruihao, Lei, Lihua |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Near-Optimal Regret for KL-Regularized Multi-Armed Bandits
par: Ji, Kaixuan, et autres
Publié: (2026)
par: Ji, Kaixuan, et autres
Publié: (2026)
On the Optimal Sample Complexity of Offline Multi-Armed Bandits with KL Regularization
par: Ji, Kaixuan, et autres
Publié: (2026)
par: Ji, Kaixuan, et autres
Publié: (2026)
Transfer Learning for Contextual Multi-armed Bandits
par: Cai, Changxiao, et autres
Publié: (2022)
par: Cai, Changxiao, et autres
Publié: (2022)
Optimal Batched Linear Bandits
par: Ren, Xuanfei, et autres
Publié: (2024)
par: Ren, Xuanfei, et autres
Publié: (2024)
Multi-Armed Sequential Hypothesis Testing by Betting
par: Sandoval, Ricardo J., et autres
Publié: (2026)
par: Sandoval, Ricardo J., et autres
Publié: (2026)
Batched Single-Index Global Multi-Armed Bandits with Covariates
par: Arya, Sakshi, et autres
Publié: (2025)
par: Arya, Sakshi, et autres
Publié: (2025)
Kernel $ε$-Greedy for Multi-Armed Bandits with Covariates
par: Arya, Sakshi, et autres
Publié: (2023)
par: Arya, Sakshi, et autres
Publié: (2023)
Identifying All ε-Best Arms in (Misspecified) Linear Bandits
par: Li, Zhekai, et autres
Publié: (2025)
par: Li, Zhekai, et autres
Publié: (2025)
Locally Optimal Fixed-Budget Best Arm Identification in Two-Armed Gaussian Bandits with Unknown Variances
par: Kato, Masahiro
Publié: (2023)
par: Kato, Masahiro
Publié: (2023)
On Lai's Upper Confidence Bound in Multi-Armed Bandits
par: Ren, Huachen, et autres
Publié: (2024)
par: Ren, Huachen, et autres
Publié: (2024)
Design Experiments to Compare Multi-armed Bandit Algorithms
par: Meng, Huiling, et autres
Publié: (2026)
par: Meng, Huiling, et autres
Publié: (2026)
Multitask Learning and Bandits via Robust Statistics
par: Xu, Kan, et autres
Publié: (2021)
par: Xu, Kan, et autres
Publié: (2021)
Predictions as Surrogates: Revisiting Surrogate Outcomes in the Age of AI
par: Ji, Wenlong, et autres
Publié: (2025)
par: Ji, Wenlong, et autres
Publié: (2025)
Spectral Estimators for Structured Generalized Linear Models via Approximate Message Passing
par: Zhang, Yihan, et autres
Publié: (2023)
par: Zhang, Yihan, et autres
Publié: (2023)
Optimal Estimation in Orthogonally Invariant Generalized Linear Models: Spectral Initialization and Approximate Message Passing
par: Zhang, Yihan, et autres
Publié: (2026)
par: Zhang, Yihan, et autres
Publié: (2026)
Asymptotically Optimal Problem-Dependent Bandit Policies for Transfer Learning
par: Prevost, Adrien, et autres
Publié: (2025)
par: Prevost, Adrien, et autres
Publié: (2025)
Extended UCB Policies for Multi-armed Bandit Problems
par: Liu, Keqin, et autres
Publié: (2011)
par: Liu, Keqin, et autres
Publié: (2011)
Precise Asymptotics for Spectral Methods in Mixed Generalized Linear Models
par: Zhang, Yihan, et autres
Publié: (2022)
par: Zhang, Yihan, et autres
Publié: (2022)
Balancing Accuracy and Speed: A Multi-Fidelity Ensemble Kalman Filter with a Machine Learning Surrogate Model
par: van der Voort, Jeffrey, et autres
Publié: (2025)
par: van der Voort, Jeffrey, et autres
Publié: (2025)
Local Asymptotic Normality for Multi-Armed Bandits
par: Akker, Ramon van den, et autres
Publié: (2025)
par: Akker, Ramon van den, et autres
Publié: (2025)
The Fragility of Optimized Bandit Algorithms
par: Fan, Lin, et autres
Publié: (2021)
par: Fan, Lin, et autres
Publié: (2021)
Batched Nonparametric Contextual Bandits
par: Jiang, Rong, et autres
Publié: (2024)
par: Jiang, Rong, et autres
Publié: (2024)
A Simple and Optimal Policy Design with Safety against Heavy-Tailed Risk for Stochastic Bandits
par: Simchi-Levi, David, et autres
Publié: (2022)
par: Simchi-Levi, David, et autres
Publié: (2022)
Statistical Inference under Performativity
par: Li, Xiang, et autres
Publié: (2025)
par: Li, Xiang, et autres
Publié: (2025)
To bootstrap or to rollout? An optimal and adaptive interpolation
par: Mou, Wenlong, et autres
Publié: (2024)
par: Mou, Wenlong, et autres
Publié: (2024)
Adaptive Smooth Non-Stationary Bandits
par: Suk, Joe
Publié: (2024)
par: Suk, Joe
Publié: (2024)
Towards a Sharp Analysis of Offline Policy Learning for $f$-Divergence-Regularized Contextual Bandits
par: Zhao, Qingyue, et autres
Publié: (2025)
par: Zhao, Qingyue, et autres
Publié: (2025)
Model-Agnostic Covariate-Assisted Inference on Partially Identified Causal Effects
par: Ji, Wenlong, et autres
Publié: (2023)
par: Ji, Wenlong, et autres
Publié: (2023)
Spectral Estimators for Multi-Index Models: Precise Asymptotics and Optimal Weak Recovery
par: Kovačević, Filip, et autres
Publié: (2025)
par: Kovačević, Filip, et autres
Publié: (2025)
Adversarial Surrogate Risk Bounds for Binary Classification
par: Frank, Natalie S.
Publié: (2025)
par: Frank, Natalie S.
Publié: (2025)
The Adversarial Consistency of Surrogate Risks for Binary Classification
par: Frank, Natalie, et autres
Publié: (2023)
par: Frank, Natalie, et autres
Publié: (2023)
Worst-Case Optimal Multi-Armed Gaussian Best Arm Identification with a Fixed Budget
par: Kato, Masahiro
Publié: (2023)
par: Kato, Masahiro
Publié: (2023)
Sharp One-Dimensional Sub-Gaussian Comparison in Convex Order
par: Zhang, Yihan
Publié: (2026)
par: Zhang, Yihan
Publié: (2026)
Testing the Feasibility of Linear Programs with Bandit Feedback
par: Gangrade, Aditya, et autres
Publié: (2024)
par: Gangrade, Aditya, et autres
Publié: (2024)
Truncated LinUCB for Stochastic Linear Bandits
par: Song, Yanglei, et autres
Publié: (2022)
par: Song, Yanglei, et autres
Publié: (2022)
Multimodal Bandits: Regret Lower Bounds and Optimal Algorithms
par: Réveillard, William, et autres
Publié: (2025)
par: Réveillard, William, et autres
Publié: (2025)
Navigating Sparsities in High-Dimensional Linear Contextual Bandits
par: Zhao, Rui, et autres
Publié: (2025)
par: Zhao, Rui, et autres
Publié: (2025)
Learning Spectral Methods by Transformers
par: He, Yihan, et autres
Publié: (2025)
par: He, Yihan, et autres
Publié: (2025)
Regret Distribution in Stochastic Bandits: Optimal Trade-off between Expectation and Tail Risk
par: Simchi-Levi, David, et autres
Publié: (2023)
par: Simchi-Levi, David, et autres
Publié: (2023)
Existence and Minimax Theorems for Adversarial Surrogate Risks in Binary Classification
par: Frank, Natalie S., et autres
Publié: (2022)
par: Frank, Natalie S., et autres
Publié: (2022)
Documents similaires
-
Near-Optimal Regret for KL-Regularized Multi-Armed Bandits
par: Ji, Kaixuan, et autres
Publié: (2026) -
On the Optimal Sample Complexity of Offline Multi-Armed Bandits with KL Regularization
par: Ji, Kaixuan, et autres
Publié: (2026) -
Transfer Learning for Contextual Multi-armed Bandits
par: Cai, Changxiao, et autres
Publié: (2022) -
Optimal Batched Linear Bandits
par: Ren, Xuanfei, et autres
Publié: (2024) -
Multi-Armed Sequential Hypothesis Testing by Betting
par: Sandoval, Ricardo J., et autres
Publié: (2026)