Feel-Good Thompson Sampling for Contextual Dueling Bandits
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Xuheng, Zhao, Heyang, Gu, Quanquan |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Variance-Aware Feel-Good Thompson Sampling for Contextual Bandits
par: Li, Xuheng, et autres
Publié: (2025)
par: Li, Xuheng, et autres
Publié: (2025)
Variance-Aware Regret Bounds for Stochastic Contextual Dueling Bandits
par: Di, Qiwei, et autres
Publié: (2023)
par: Di, Qiwei, et autres
Publié: (2023)
Understanding SGD with Exponential Moving Average: A Case Study in Linear Regression
par: Li, Xuheng, et autres
Publié: (2025)
par: Li, Xuheng, et autres
Publié: (2025)
A Nearly Optimal and Low-Switching Algorithm for Reinforcement Learning with General Function Approximation
par: Zhao, Heyang, et autres
Publié: (2023)
par: Zhao, Heyang, et autres
Publié: (2023)
Dimension-Independent Convergence of Underdamped Langevin Monte Carlo in KL Divergence
par: Zhang, Shiyuan, et autres
Publié: (2026)
par: Zhang, Shiyuan, et autres
Publié: (2026)
Pessimistic Nonlinear Least-Squares Value Iteration for Offline Reinforcement Learning
par: Di, Qiwei, et autres
Publié: (2023)
par: Di, Qiwei, et autres
Publié: (2023)
Modified Meta-Thompson Sampling for Linear Bandits and Its Bayes Regret Analysis
par: Li, Hao, et autres
Publié: (2024)
par: Li, Hao, et autres
Publié: (2024)
Riemannian Dueling Optimization
par: Ren, Yuxuan, et autres
Publié: (2026)
par: Ren, Yuxuan, et autres
Publié: (2026)
Contextual Bandits with Budgeted Information Reveal
par: Gan, Kyra, et autres
Publié: (2023)
par: Gan, Kyra, et autres
Publié: (2023)
Decentralized Contextual Bandits with Network Adaptivity
par: Deng, Chuyun, et autres
Publié: (2025)
par: Deng, Chuyun, et autres
Publié: (2025)
Unified Convergence Analysis for Score-Based Diffusion Models with Deterministic Samplers
par: Li, Runjia, et autres
Publié: (2024)
par: Li, Runjia, et autres
Publié: (2024)
Signature Approach for Contextual Bandits with Nonlinear and Path-dependent Rewards
par: Guo, Xin, et autres
Publié: (2026)
par: Guo, Xin, et autres
Publié: (2026)
Gaussian Process Thompson Sampling via Rootfinding
par: Adebiyi, Taiwo A., et autres
Publié: (2024)
par: Adebiyi, Taiwo A., et autres
Publié: (2024)
Epsilon-Greedy Thompson Sampling to Bayesian Optimization
par: Do, Bach, et autres
Publié: (2024)
par: Do, Bach, et autres
Publié: (2024)
Multi-User Contextual Cascading Bandits for Personalized Recommendation
par: Park, Jiho, et autres
Publié: (2025)
par: Park, Jiho, et autres
Publié: (2025)
Optimal Horizon-Free Reward-Free Exploration for Linear Mixture MDPs
par: Zhang, Junkai, et autres
Publié: (2023)
par: Zhang, Junkai, et autres
Publié: (2023)
MARS-M: When Variance Reduction Meets Matrices
par: Liu, Yifeng, et autres
Publié: (2025)
par: Liu, Yifeng, et autres
Publié: (2025)
Nearly Optimal Algorithms for Contextual Dueling Bandits from Adversarial Feedback
par: Di, Qiwei, et autres
Publié: (2024)
par: Di, Qiwei, et autres
Publié: (2024)
MINTS: Minimalist Thompson Sampling
par: Wang, Kaizheng
Publié: (2026)
par: Wang, Kaizheng
Publié: (2026)
Sharp Analysis for KL-Regularized Contextual Bandits and RLHF
par: Zhao, Heyang, et autres
Publié: (2024)
par: Zhao, Heyang, et autres
Publié: (2024)
Matching the Statistical Query Lower Bound for $k$-Sparse Parity Problems with Sign Stochastic Gradient Descent
par: Kou, Yiwen, et autres
Publié: (2024)
par: Kou, Yiwen, et autres
Publié: (2024)
Global Convergence and Rich Feature Learning in $L$-Layer Infinite-Width Neural Networks under $μ$P Parametrization
par: Chen, Zixiang, et autres
Publié: (2025)
par: Chen, Zixiang, et autres
Publié: (2025)
Deconfounded Warm-Start Thompson Sampling with Applications to Precision Medicine
par: Jaiswal, Prateek, et autres
Publié: (2025)
par: Jaiswal, Prateek, et autres
Publié: (2025)
Early Stopping in Contextual Bandits and Inferences
par: Cui, Zihan
Publié: (2025)
par: Cui, Zihan
Publié: (2025)
MARS: Unleashing the Power of Variance Reduction for Training Large Models
par: Yuan, Huizhuo, et autres
Publié: (2024)
par: Yuan, Huizhuo, et autres
Publié: (2024)
On the Convergence of Adaptive Gradient Methods for Nonconvex Optimization
par: Zhou, Dongruo, et autres
Publié: (2018)
par: Zhou, Dongruo, et autres
Publié: (2018)
Provably Efficient Representation Selection in Low-rank Markov Decision Processes: From Online to Offline RL
par: Zhang, Weitong, et autres
Publié: (2021)
par: Zhang, Weitong, et autres
Publié: (2021)
Distributed Thompson sampling under constrained communication
par: Zerefa, Saba, et autres
Publié: (2024)
par: Zerefa, Saba, et autres
Publié: (2024)
Towards Simple and Provable Parameter-Free Adaptive Gradient Methods
par: Tao, Yuanzhe, et autres
Publié: (2024)
par: Tao, Yuanzhe, et autres
Publié: (2024)
Frequentist Regret Analysis of Gaussian Process Thompson Sampling via Fractional Posteriors
par: Roy, Somjit, et autres
Publié: (2026)
par: Roy, Somjit, et autres
Publié: (2026)
Bandit Convex Optimisation
par: Lattimore, Tor
Publié: (2024)
par: Lattimore, Tor
Publié: (2024)
Optimism Stabilizes Thompson Sampling for Adaptive Inference
par: Yan, Shunxing, et autres
Publié: (2026)
par: Yan, Shunxing, et autres
Publié: (2026)
Reinforcement Learning from Human Feedback with Active Queries
par: Ji, Kaixuan, et autres
Publié: (2024)
par: Ji, Kaixuan, et autres
Publié: (2024)
Unified Precision-Guaranteed Stopping Rules for Contextual Learning
par: Ding, Mingrui, et autres
Publié: (2026)
par: Ding, Mingrui, et autres
Publié: (2026)
Analysis of Thompson Sampling for Controlling Unknown Linear Diffusion Processes
par: Faradonbeh, Mohamad Kazem Shirani, et autres
Publié: (2022)
par: Faradonbeh, Mohamad Kazem Shirani, et autres
Publié: (2022)
The Safety-Privacy Tradeoff in Linear Bandits
par: Zibaie, Arghavan, et autres
Publié: (2025)
par: Zibaie, Arghavan, et autres
Publié: (2025)
Learning to Sparsify Stochastic Linear Bandits
par: Wang, Zhengmiao, et autres
Publié: (2026)
par: Wang, Zhengmiao, et autres
Publié: (2026)
DOPL: Direct Online Preference Learning for Restless Bandits with Preference Feedback
par: Xiong, Guojun, et autres
Publié: (2024)
par: Xiong, Guojun, et autres
Publié: (2024)
Online Newton Method for Bandit Convex Optimisation
par: Fokkema, Hidde, et autres
Publié: (2024)
par: Fokkema, Hidde, et autres
Publié: (2024)
Tight Rates for Bandit Control Beyond Quadratics
par: Sun, Y. Jennifer, et autres
Publié: (2024)
par: Sun, Y. Jennifer, et autres
Publié: (2024)
Documents similaires
-
Variance-Aware Feel-Good Thompson Sampling for Contextual Bandits
par: Li, Xuheng, et autres
Publié: (2025) -
Variance-Aware Regret Bounds for Stochastic Contextual Dueling Bandits
par: Di, Qiwei, et autres
Publié: (2023) -
Understanding SGD with Exponential Moving Average: A Case Study in Linear Regression
par: Li, Xuheng, et autres
Publié: (2025) -
A Nearly Optimal and Low-Switching Algorithm for Reinforcement Learning with General Function Approximation
par: Zhao, Heyang, et autres
Publié: (2023) -
Dimension-Independent Convergence of Underdamped Langevin Monte Carlo in KL Divergence
par: Zhang, Shiyuan, et autres
Publié: (2026)