Variance-Aware Regret Bounds for Stochastic Contextual Dueling Bandits
Fuente:
arXiv
Salvato in:
| Autori principali: | Di, Qiwei, Jin, Tao, Wu, Yue, Zhao, Heyang, Farnoud, Farzad, Gu, Quanquan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Feel-Good Thompson Sampling for Contextual Dueling Bandits
di: Li, Xuheng, et al.
Pubblicazione: (2024)
di: Li, Xuheng, et al.
Pubblicazione: (2024)
Variance-Aware Feel-Good Thompson Sampling for Contextual Bandits
di: Li, Xuheng, et al.
Pubblicazione: (2025)
di: Li, Xuheng, et al.
Pubblicazione: (2025)
Pessimistic Nonlinear Least-Squares Value Iteration for Offline Reinforcement Learning
di: Di, Qiwei, et al.
Pubblicazione: (2023)
di: Di, Qiwei, et al.
Pubblicazione: (2023)
A Nearly Optimal and Low-Switching Algorithm for Reinforcement Learning with General Function Approximation
di: Zhao, Heyang, et al.
Pubblicazione: (2023)
di: Zhao, Heyang, et al.
Pubblicazione: (2023)
Unified Convergence Analysis for Score-Based Diffusion Models with Deterministic Samplers
di: Li, Runjia, et al.
Pubblicazione: (2024)
di: Li, Runjia, et al.
Pubblicazione: (2024)
Nearly Optimal Algorithms for Contextual Dueling Bandits from Adversarial Feedback
di: Di, Qiwei, et al.
Pubblicazione: (2024)
di: Di, Qiwei, et al.
Pubblicazione: (2024)
Variance-Dependent Regret Lower Bounds for Contextual Bandits
di: He, Jiafan, et al.
Pubblicazione: (2025)
di: He, Jiafan, et al.
Pubblicazione: (2025)
Dimension-Independent Convergence of Underdamped Langevin Monte Carlo in KL Divergence
di: Zhang, Shiyuan, et al.
Pubblicazione: (2026)
di: Zhang, Shiyuan, et al.
Pubblicazione: (2026)
MARS-M: When Variance Reduction Meets Matrices
di: Liu, Yifeng, et al.
Pubblicazione: (2025)
di: Liu, Yifeng, et al.
Pubblicazione: (2025)
MARS: Unleashing the Power of Variance Reduction for Training Large Models
di: Yuan, Huizhuo, et al.
Pubblicazione: (2024)
di: Yuan, Huizhuo, et al.
Pubblicazione: (2024)
Matching the Statistical Query Lower Bound for $k$-Sparse Parity Problems with Sign Stochastic Gradient Descent
di: Kou, Yiwen, et al.
Pubblicazione: (2024)
di: Kou, Yiwen, et al.
Pubblicazione: (2024)
Logarithmic Regret for Unconstrained Submodular Maximization Stochastic Bandit
di: Zhou, Julien, et al.
Pubblicazione: (2024)
di: Zhou, Julien, et al.
Pubblicazione: (2024)
Regret Bounds for Expected Improvement Algorithms in Gaussian Process Bandit Optimization
di: Tran-The, Hung, et al.
Pubblicazione: (2022)
di: Tran-The, Hung, et al.
Pubblicazione: (2022)
Near-Optimal Regret for KL-Regularized Multi-Armed Bandits
di: Ji, Kaixuan, et al.
Pubblicazione: (2026)
di: Ji, Kaixuan, et al.
Pubblicazione: (2026)
Optimal Variance-Dependent Regret Bounds for Infinite-Horizon MDPs
di: Zamir, Guy, et al.
Pubblicazione: (2026)
di: Zamir, Guy, et al.
Pubblicazione: (2026)
Solving Stochastic Variational Inequalities without the Bounded Variance Assumption
di: Alacaoglu, Ahmet, et al.
Pubblicazione: (2026)
di: Alacaoglu, Ahmet, et al.
Pubblicazione: (2026)
Riemannian Dueling Optimization
di: Ren, Yuxuan, et al.
Pubblicazione: (2026)
di: Ren, Yuxuan, et al.
Pubblicazione: (2026)
Understanding SGD with Exponential Moving Average: A Case Study in Linear Regression
di: Li, Xuheng, et al.
Pubblicazione: (2025)
di: Li, Xuheng, et al.
Pubblicazione: (2025)
Contextual Bandits with Budgeted Information Reveal
di: Gan, Kyra, et al.
Pubblicazione: (2023)
di: Gan, Kyra, et al.
Pubblicazione: (2023)
Decentralized Contextual Bandits with Network Adaptivity
di: Deng, Chuyun, et al.
Pubblicazione: (2025)
di: Deng, Chuyun, et al.
Pubblicazione: (2025)
Reinforcement Learning and Regret Bounds for Admission Control
di: Weber, Lucas, et al.
Pubblicazione: (2024)
di: Weber, Lucas, et al.
Pubblicazione: (2024)
Modified Meta-Thompson Sampling for Linear Bandits and Its Bayes Regret Analysis
di: Li, Hao, et al.
Pubblicazione: (2024)
di: Li, Hao, et al.
Pubblicazione: (2024)
Multi-User Contextual Cascading Bandits for Personalized Recommendation
di: Park, Jiho, et al.
Pubblicazione: (2025)
di: Park, Jiho, et al.
Pubblicazione: (2025)
Optimal Horizon-Free Reward-Free Exploration for Linear Mixture MDPs
di: Zhang, Junkai, et al.
Pubblicazione: (2023)
di: Zhang, Junkai, et al.
Pubblicazione: (2023)
Signature Approach for Contextual Bandits with Nonlinear and Path-dependent Rewards
di: Guo, Xin, et al.
Pubblicazione: (2026)
di: Guo, Xin, et al.
Pubblicazione: (2026)
Learning to Sparsify Stochastic Linear Bandits
di: Wang, Zhengmiao, et al.
Pubblicazione: (2026)
di: Wang, Zhengmiao, et al.
Pubblicazione: (2026)
Stochastic Gradient Langevin Dynamics with Variance Reduction
di: Huang, Zhishen, et al.
Pubblicazione: (2021)
di: Huang, Zhishen, et al.
Pubblicazione: (2021)
Towards Weaker Variance Assumptions for Stochastic Optimization
di: Alacaoglu, Ahmet, et al.
Pubblicazione: (2025)
di: Alacaoglu, Ahmet, et al.
Pubblicazione: (2025)
Distributed Online Bandit Nonconvex Optimization with One-Point Residual Feedback via Dynamic Regret
di: Hua, Youqing, et al.
Pubblicazione: (2024)
di: Hua, Youqing, et al.
Pubblicazione: (2024)
A Regularized Online Newton Method for Stochastic Convex Bandits with Linear Vanishing Noise
di: Zhan, Jingxin, et al.
Pubblicazione: (2025)
di: Zhan, Jingxin, et al.
Pubblicazione: (2025)
Regret Bounds for Episodic Risk-Sensitive Linear Quadratic Regulator
di: Xu, Wenhao, et al.
Pubblicazione: (2024)
di: Xu, Wenhao, et al.
Pubblicazione: (2024)
Regret Lower Bounds for Learning Linear Quadratic Gaussian Systems
di: Ziemann, Ingvar, et al.
Pubblicazione: (2022)
di: Ziemann, Ingvar, et al.
Pubblicazione: (2022)
Decentralized Non-convex Stochastic Optimization with Heterogeneous Variance
di: Chen, Hongxu, et al.
Pubblicazione: (2026)
di: Chen, Hongxu, et al.
Pubblicazione: (2026)
Beyond Bounded Variance: Variance-Reduced Normalized Methods for Nonconvex Optimization under Blum-Gladyshev Noise
di: Upadhyay, Antesh, et al.
Pubblicazione: (2026)
di: Upadhyay, Antesh, et al.
Pubblicazione: (2026)
Towards Simple and Provable Parameter-Free Adaptive Gradient Methods
di: Tao, Yuanzhe, et al.
Pubblicazione: (2024)
di: Tao, Yuanzhe, et al.
Pubblicazione: (2024)
Gradient Estimation and Variance Reduction in Stochastic and Deterministic Models
di: Keane, Ronan
Pubblicazione: (2024)
di: Keane, Ronan
Pubblicazione: (2024)
Incentive-Aware Federated Averaging with Performance Guarantees under Strategic Participation
di: Maleki, Fateme, et al.
Pubblicazione: (2026)
di: Maleki, Fateme, et al.
Pubblicazione: (2026)
Online Learning on Hidden-Convex Losses via Algorithmic Equivalence: Optimal Regret, Geometric Barrier, and Bandit Feedback
di: Barakat, Anas, et al.
Pubblicazione: (2026)
di: Barakat, Anas, et al.
Pubblicazione: (2026)
TRSVR: An Adaptive Stochastic Trust-Region Method with Variance Reduction
di: Fang, Yuchen, et al.
Pubblicazione: (2026)
di: Fang, Yuchen, et al.
Pubblicazione: (2026)
Adaptive Variance Reduction for Stochastic Optimization under Weaker Assumptions
di: Jiang, Wei, et al.
Pubblicazione: (2024)
di: Jiang, Wei, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Feel-Good Thompson Sampling for Contextual Dueling Bandits
di: Li, Xuheng, et al.
Pubblicazione: (2024) -
Variance-Aware Feel-Good Thompson Sampling for Contextual Bandits
di: Li, Xuheng, et al.
Pubblicazione: (2025) -
Pessimistic Nonlinear Least-Squares Value Iteration for Offline Reinforcement Learning
di: Di, Qiwei, et al.
Pubblicazione: (2023) -
A Nearly Optimal and Low-Switching Algorithm for Reinforcement Learning with General Function Approximation
di: Zhao, Heyang, et al.
Pubblicazione: (2023) -
Unified Convergence Analysis for Score-Based Diffusion Models with Deterministic Samplers
di: Li, Runjia, et al.
Pubblicazione: (2024)