Near-Optimal Regret for KL-Regularized Multi-Armed Bandits
Fuente:
arXiv
Salvato in:
| Autori principali: | Ji, Kaixuan, Zhao, Qingyue, Zhao, Heyang, Di, Qiwei, Gu, Quanquan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
On the Optimal Sample Complexity of Offline Multi-Armed Bandits with KL Regularization
di: Ji, Kaixuan, et al.
Pubblicazione: (2026)
di: Ji, Kaixuan, et al.
Pubblicazione: (2026)
Fast Rates for Offline Contextual Bandits with Forward-KL Regularization under Single-Policy Concentrability
di: Zhao, Qingyue, et al.
Pubblicazione: (2026)
di: Zhao, Qingyue, et al.
Pubblicazione: (2026)
Towards a Sharp Analysis of Offline Policy Learning for $f$-Divergence-Regularized Contextual Bandits
di: Zhao, Qingyue, et al.
Pubblicazione: (2025)
di: Zhao, Qingyue, et al.
Pubblicazione: (2025)
On the Benefits of Free Exploration for Regret Minimization in Multi-Armed Bandits
di: Hou, Yunlong, et al.
Pubblicazione: (2026)
di: Hou, Yunlong, et al.
Pubblicazione: (2026)
Sharp Analysis for KL-Regularized Contextual Bandits and RLHF
di: Zhao, Heyang, et al.
Pubblicazione: (2024)
di: Zhao, Heyang, et al.
Pubblicazione: (2024)
Best-of-Majority: Minimax-Optimal Strategy for Pass@$k$ Inference Scaling
di: Di, Qiwei, et al.
Pubblicazione: (2025)
di: Di, Qiwei, et al.
Pubblicazione: (2025)
Variance-Dependent Regret Lower Bounds for Contextual Bandits
di: He, Jiafan, et al.
Pubblicazione: (2025)
di: He, Jiafan, et al.
Pubblicazione: (2025)
Logarithmic Regret for Online KL-Regularized Reinforcement Learning
di: Zhao, Heyang, et al.
Pubblicazione: (2025)
di: Zhao, Heyang, et al.
Pubblicazione: (2025)
Minimax Optimal Variance-Aware Regret Bounds for Multinomial Logistic MDPs
di: Boudart, Pierre, et al.
Pubblicazione: (2026)
di: Boudart, Pierre, et al.
Pubblicazione: (2026)
Variance-Aware Regret Bounds for Stochastic Contextual Dueling Bandits
di: Di, Qiwei, et al.
Pubblicazione: (2023)
di: Di, Qiwei, et al.
Pubblicazione: (2023)
Path Regularization: A Near-Complete and Optimal Nonasymptotic Generalization Theory for Multilayer Neural Networks and Double Descent Phenomenon
di: Yu, Hao
Pubblicazione: (2025)
di: Yu, Hao
Pubblicazione: (2025)
Multi-Armed Bandits With Machine Learning-Generated Surrogate Rewards
di: Ji, Wenlong, et al.
Pubblicazione: (2025)
di: Ji, Wenlong, et al.
Pubblicazione: (2025)
Enjoying Non-linearity in Multinomial Logistic Bandits: A Minimax-Optimal Algorithm
di: Boudart, Pierre, et al.
Pubblicazione: (2025)
di: Boudart, Pierre, et al.
Pubblicazione: (2025)
Nearly Optimal Algorithms for Contextual Dueling Bandits from Adversarial Feedback
di: Di, Qiwei, et al.
Pubblicazione: (2024)
di: Di, Qiwei, et al.
Pubblicazione: (2024)
Multimodal Bandits: Regret Lower Bounds and Optimal Algorithms
di: Réveillard, William, et al.
Pubblicazione: (2025)
di: Réveillard, William, et al.
Pubblicazione: (2025)
The Good, the Bad, and the Sampled: a No-Regret Approach to Safe Online Classification
di: Baharav, Tavor Z., et al.
Pubblicazione: (2025)
di: Baharav, Tavor Z., et al.
Pubblicazione: (2025)
A Diffusion Analysis of Policy Gradient for Stochastic Bandits
di: Lattimore, Tor
Pubblicazione: (2026)
di: Lattimore, Tor
Pubblicazione: (2026)
Minimax Optimal Simple Regret in Two-Armed Best-Arm Identification
di: Kato, Masahiro
Pubblicazione: (2024)
di: Kato, Masahiro
Pubblicazione: (2024)
Reasoning with Sampling: Cutting at Decision Points
di: Zhou, Felix, et al.
Pubblicazione: (2026)
di: Zhou, Felix, et al.
Pubblicazione: (2026)
LIBRA: Language Model Informed Bandit Recourse Algorithm for Personalized Treatment Planning
di: Cao, Junyu, et al.
Pubblicazione: (2026)
di: Cao, Junyu, et al.
Pubblicazione: (2026)
Nearly Minimax Optimal Regret for Learning Linear Mixture Stochastic Shortest Path
di: Di, Qiwei, et al.
Pubblicazione: (2024)
di: Di, Qiwei, et al.
Pubblicazione: (2024)
Near-Optimal Learning and Planning in Separated Latent MDPs
di: Chen, Fan, et al.
Pubblicazione: (2024)
di: Chen, Fan, et al.
Pubblicazione: (2024)
Neural Networks Learn Generic Multi-Index Models Near Information-Theoretic Limit
di: Zhang, Bohan, et al.
Pubblicazione: (2025)
di: Zhang, Bohan, et al.
Pubblicazione: (2025)
Smooth Non-Stationary Bandits
di: Jia, Su, et al.
Pubblicazione: (2023)
di: Jia, Su, et al.
Pubblicazione: (2023)
Global Convergence and Rich Feature Learning in $L$-Layer Infinite-Width Neural Networks under $μ$P Parametrization
di: Chen, Zixiang, et al.
Pubblicazione: (2025)
di: Chen, Zixiang, et al.
Pubblicazione: (2025)
Optimal Regret of Bernoulli Bandits under Global Differential Privacy
di: Azize, Achraf, et al.
Pubblicazione: (2025)
di: Azize, Achraf, et al.
Pubblicazione: (2025)
Ordinary Least Squares is a Special Case of Transformer
di: Tan, Xiaojun, et al.
Pubblicazione: (2026)
di: Tan, Xiaojun, et al.
Pubblicazione: (2026)
Asymptotically and Minimax Optimal Regret Bounds for Multi-Armed Bandits with Abstention
di: Yang, Junwen, et al.
Pubblicazione: (2024)
di: Yang, Junwen, et al.
Pubblicazione: (2024)
Robust Layerwise Scaling Rules by Proper Weight Decay Tuning
di: Fan, Zhiyuan, et al.
Pubblicazione: (2025)
di: Fan, Zhiyuan, et al.
Pubblicazione: (2025)
Regret Distribution in Stochastic Bandits: Optimal Trade-off between Expectation and Tail Risk
di: Simchi-Levi, David, et al.
Pubblicazione: (2023)
di: Simchi-Levi, David, et al.
Pubblicazione: (2023)
Optimal rates for density and mode estimation with expand-and-sparsify representations
di: Sinha, Kaushik, et al.
Pubblicazione: (2026)
di: Sinha, Kaushik, et al.
Pubblicazione: (2026)
Flickering Multi-Armed Bandits
di: Chakraborty, Sourav, et al.
Pubblicazione: (2026)
di: Chakraborty, Sourav, et al.
Pubblicazione: (2026)
Reinforcement Learning from Human Feedback with Active Queries
di: Ji, Kaixuan, et al.
Pubblicazione: (2024)
di: Ji, Kaixuan, et al.
Pubblicazione: (2024)
A Nearly Optimal and Low-Switching Algorithm for Reinforcement Learning with General Function Approximation
di: Zhao, Heyang, et al.
Pubblicazione: (2023)
di: Zhao, Heyang, et al.
Pubblicazione: (2023)
Locally Optimal Fixed-Budget Best Arm Identification in Two-Armed Gaussian Bandits with Unknown Variances
di: Kato, Masahiro
Pubblicazione: (2023)
di: Kato, Masahiro
Pubblicazione: (2023)
Training Dynamics of Multi-Head Softmax Attention for In-Context Learning: Emergence, Convergence, and Optimality
di: Chen, Siyu, et al.
Pubblicazione: (2024)
di: Chen, Siyu, et al.
Pubblicazione: (2024)
Pessimistic Nonlinear Least-Squares Value Iteration for Offline Reinforcement Learning
di: Di, Qiwei, et al.
Pubblicazione: (2023)
di: Di, Qiwei, et al.
Pubblicazione: (2023)
Statistical Inference for Optimal Transport Maps: Recent Advances and Perspectives
di: Balakrishnan, Sivaraman, et al.
Pubblicazione: (2025)
di: Balakrishnan, Sivaraman, et al.
Pubblicazione: (2025)
Feel-Good Thompson Sampling for Contextual Dueling Bandits
di: Li, Xuheng, et al.
Pubblicazione: (2024)
di: Li, Xuheng, et al.
Pubblicazione: (2024)
Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration
di: Zhao, Heyang, et al.
Pubblicazione: (2025)
di: Zhao, Heyang, et al.
Pubblicazione: (2025)
Documenti analoghi
-
On the Optimal Sample Complexity of Offline Multi-Armed Bandits with KL Regularization
di: Ji, Kaixuan, et al.
Pubblicazione: (2026) -
Fast Rates for Offline Contextual Bandits with Forward-KL Regularization under Single-Policy Concentrability
di: Zhao, Qingyue, et al.
Pubblicazione: (2026) -
Towards a Sharp Analysis of Offline Policy Learning for $f$-Divergence-Regularized Contextual Bandits
di: Zhao, Qingyue, et al.
Pubblicazione: (2025) -
On the Benefits of Free Exploration for Regret Minimization in Multi-Armed Bandits
di: Hou, Yunlong, et al.
Pubblicazione: (2026) -
Sharp Analysis for KL-Regularized Contextual Bandits and RLHF
di: Zhao, Heyang, et al.
Pubblicazione: (2024)