On the Optimal Sample Complexity of Offline Multi-Armed Bandits with KL Regularization
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ji, Kaixuan, Di, Qiwei, Zhao, Heyang, Zhao, Qingyue, Gu, Quanquan |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Near-Optimal Regret for KL-Regularized Multi-Armed Bandits
par: Ji, Kaixuan, et autres
Publié: (2026)
par: Ji, Kaixuan, et autres
Publié: (2026)
Fast Rates for Offline Contextual Bandits with Forward-KL Regularization under Single-Policy Concentrability
par: Zhao, Qingyue, et autres
Publié: (2026)
par: Zhao, Qingyue, et autres
Publié: (2026)
Towards a Sharp Analysis of Offline Policy Learning for $f$-Divergence-Regularized Contextual Bandits
par: Zhao, Qingyue, et autres
Publié: (2025)
par: Zhao, Qingyue, et autres
Publié: (2025)
Sharp Analysis for KL-Regularized Contextual Bandits and RLHF
par: Zhao, Heyang, et autres
Publié: (2024)
par: Zhao, Heyang, et autres
Publié: (2024)
Best-of-Majority: Minimax-Optimal Strategy for Pass@$k$ Inference Scaling
par: Di, Qiwei, et autres
Publié: (2025)
par: Di, Qiwei, et autres
Publié: (2025)
Reasoning with Sampling: Cutting at Decision Points
par: Zhou, Felix, et autres
Publié: (2026)
par: Zhou, Felix, et autres
Publié: (2026)
Multi-Armed Bandits With Machine Learning-Generated Surrogate Rewards
par: Ji, Wenlong, et autres
Publié: (2025)
par: Ji, Wenlong, et autres
Publié: (2025)
Enjoying Non-linearity in Multinomial Logistic Bandits: A Minimax-Optimal Algorithm
par: Boudart, Pierre, et autres
Publié: (2025)
par: Boudart, Pierre, et autres
Publié: (2025)
Pessimistic Nonlinear Least-Squares Value Iteration for Offline Reinforcement Learning
par: Di, Qiwei, et autres
Publié: (2023)
par: Di, Qiwei, et autres
Publié: (2023)
Sample Complexity of Bias Detection with Subsampled Point-to-Subspace Distances
par: Matilla, German Martinez, et autres
Publié: (2025)
par: Matilla, German Martinez, et autres
Publié: (2025)
A Diffusion Analysis of Policy Gradient for Stochastic Bandits
par: Lattimore, Tor
Publié: (2026)
par: Lattimore, Tor
Publié: (2026)
Path Regularization: A Near-Complete and Optimal Nonasymptotic Generalization Theory for Multilayer Neural Networks and Double Descent Phenomenon
par: Yu, Hao
Publié: (2025)
par: Yu, Hao
Publié: (2025)
Feel-Good Thompson Sampling for Contextual Dueling Bandits
par: Li, Xuheng, et autres
Publié: (2024)
par: Li, Xuheng, et autres
Publié: (2024)
On the Exponential Convergence for Offline RLHF with Pairwise Comparisons
par: Chen, Zhirui, et autres
Publié: (2024)
par: Chen, Zhirui, et autres
Publié: (2024)
LIBRA: Language Model Informed Bandit Recourse Algorithm for Personalized Treatment Planning
par: Cao, Junyu, et autres
Publié: (2026)
par: Cao, Junyu, et autres
Publié: (2026)
On the Benefits of Free Exploration for Regret Minimization in Multi-Armed Bandits
par: Hou, Yunlong, et autres
Publié: (2026)
par: Hou, Yunlong, et autres
Publié: (2026)
Smooth Non-Stationary Bandits
par: Jia, Su, et autres
Publié: (2023)
par: Jia, Su, et autres
Publié: (2023)
Global Convergence and Rich Feature Learning in $L$-Layer Infinite-Width Neural Networks under $μ$P Parametrization
par: Chen, Zixiang, et autres
Publié: (2025)
par: Chen, Zixiang, et autres
Publié: (2025)
Ordinary Least Squares is a Special Case of Transformer
par: Tan, Xiaojun, et autres
Publié: (2026)
par: Tan, Xiaojun, et autres
Publié: (2026)
Robust Layerwise Scaling Rules by Proper Weight Decay Tuning
par: Fan, Zhiyuan, et autres
Publié: (2025)
par: Fan, Zhiyuan, et autres
Publié: (2025)
Adaptive Sample Aggregation In Transfer Learning
par: Hanneke, Steve, et autres
Publié: (2024)
par: Hanneke, Steve, et autres
Publié: (2024)
Diffusion Posterior Sampling is Computationally Intractable
par: Gupta, Shivam, et autres
Publié: (2024)
par: Gupta, Shivam, et autres
Publié: (2024)
Variance-Dependent Regret Lower Bounds for Contextual Bandits
par: He, Jiafan, et autres
Publié: (2025)
par: He, Jiafan, et autres
Publié: (2025)
Pessimism in the Face of Confounders: Provably Efficient Offline Reinforcement Learning in Partially Observable Markov Decision Processes
par: Lu, Miao, et autres
Publié: (2022)
par: Lu, Miao, et autres
Publié: (2022)
Neural Networks Generalize on Low Complexity Data
par: Chatterjee, Sourav, et autres
Publié: (2024)
par: Chatterjee, Sourav, et autres
Publié: (2024)
Logarithmic Regret for Online KL-Regularized Reinforcement Learning
par: Zhao, Heyang, et autres
Publié: (2025)
par: Zhao, Heyang, et autres
Publié: (2025)
Optimal rates for density and mode estimation with expand-and-sparsify representations
par: Sinha, Kaushik, et autres
Publié: (2026)
par: Sinha, Kaushik, et autres
Publié: (2026)
Flickering Multi-Armed Bandits
par: Chakraborty, Sourav, et autres
Publié: (2026)
par: Chakraborty, Sourav, et autres
Publié: (2026)
Nearly Optimal Algorithms for Contextual Dueling Bandits from Adversarial Feedback
par: Di, Qiwei, et autres
Publié: (2024)
par: Di, Qiwei, et autres
Publié: (2024)
Minimax Optimal Variance-Aware Regret Bounds for Multinomial Logistic MDPs
par: Boudart, Pierre, et autres
Publié: (2026)
par: Boudart, Pierre, et autres
Publié: (2026)
The Good, the Bad, and the Sampled: a No-Regret Approach to Safe Online Classification
par: Baharav, Tavor Z., et autres
Publié: (2025)
par: Baharav, Tavor Z., et autres
Publié: (2025)
Cross-regularization: Adaptive Model Complexity through Validation Gradients
par: Brito, Carlos Stein
Publié: (2025)
par: Brito, Carlos Stein
Publié: (2025)
Reinforcement Learning from Human Feedback with Active Queries
par: Ji, Kaixuan, et autres
Publié: (2024)
par: Ji, Kaixuan, et autres
Publié: (2024)
Offline Estimation of Controlled Markov Chains: Minimaxity and Sample Complexity
par: Banerjee, Imon, et autres
Publié: (2022)
par: Banerjee, Imon, et autres
Publié: (2022)
Variance-Aware Regret Bounds for Stochastic Contextual Dueling Bandits
par: Di, Qiwei, et autres
Publié: (2023)
par: Di, Qiwei, et autres
Publié: (2023)
Locally Optimal Fixed-Budget Best Arm Identification in Two-Armed Gaussian Bandits with Unknown Variances
par: Kato, Masahiro
Publié: (2023)
par: Kato, Masahiro
Publié: (2023)
Training Dynamics of Multi-Head Softmax Attention for In-Context Learning: Emergence, Convergence, and Optimality
par: Chen, Siyu, et autres
Publié: (2024)
par: Chen, Siyu, et autres
Publié: (2024)
Statistical Complexity and Optimal Algorithms for Non-linear Ridge Bandits
par: Rajaraman, Nived, et autres
Publié: (2023)
par: Rajaraman, Nived, et autres
Publié: (2023)
The Sample Complexity of Multiple Change Point Identification under Bandit Feedback
par: Graf, Maximilian, et autres
Publié: (2026)
par: Graf, Maximilian, et autres
Publié: (2026)
Sample Complexity of Offline Distributionally Robust Linear Markov Decision Processes
par: Wang, He, et autres
Publié: (2024)
par: Wang, He, et autres
Publié: (2024)
Documents similaires
-
Near-Optimal Regret for KL-Regularized Multi-Armed Bandits
par: Ji, Kaixuan, et autres
Publié: (2026) -
Fast Rates for Offline Contextual Bandits with Forward-KL Regularization under Single-Policy Concentrability
par: Zhao, Qingyue, et autres
Publié: (2026) -
Towards a Sharp Analysis of Offline Policy Learning for $f$-Divergence-Regularized Contextual Bandits
par: Zhao, Qingyue, et autres
Publié: (2025) -
Sharp Analysis for KL-Regularized Contextual Bandits and RLHF
par: Zhao, Heyang, et autres
Publié: (2024) -
Best-of-Majority: Minimax-Optimal Strategy for Pass@$k$ Inference Scaling
par: Di, Qiwei, et autres
Publié: (2025)