Ensemble sampling for linear bandits: small ensembles suffice
Fuente:
arXiv
Salvato in:
| Autori principali: | Janz, David, Litvak, Alexander E., Szepesvári, Csaba |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Sharp analysis of linear ensemble sampling
di: Akhavan, Arya, et al.
Pubblicazione: (2026)
di: Akhavan, Arya, et al.
Pubblicazione: (2026)
Exploration via linearly perturbed loss minimisation
di: Janz, David, et al.
Pubblicazione: (2023)
di: Janz, David, et al.
Pubblicazione: (2023)
Variance-sensitive Thompson sampling for generalised linear bandits, revisited
di: Perneczky, Tom, et al.
Pubblicazione: (2026)
di: Perneczky, Tom, et al.
Pubblicazione: (2026)
When and why randomised exploration works (in linear bandits)
di: Abeille, Marc, et al.
Pubblicazione: (2025)
di: Abeille, Marc, et al.
Pubblicazione: (2025)
Eluder dimension: localise it!
di: Bakhtiari, Alireza, et al.
Pubblicazione: (2026)
di: Bakhtiari, Alireza, et al.
Pubblicazione: (2026)
Small steps no more: Global convergence of stochastic gradient bandits for arbitrary learning rates
di: Mei, Jincheng, et al.
Pubblicazione: (2025)
di: Mei, Jincheng, et al.
Pubblicazione: (2025)
Sharper Guarantees for Misspecified Kernelized Bandit Optimization
di: Maran, Davide, et al.
Pubblicazione: (2026)
di: Maran, Davide, et al.
Pubblicazione: (2026)
Rectifying Regression in Reinforcement Learning
di: Ayoub, Alex, et al.
Pubblicazione: (2025)
di: Ayoub, Alex, et al.
Pubblicazione: (2025)
Trajectory Data Suffices for Statistically Efficient Learning in Offline RL with Linear $q^π$-Realizability and Concentrability
di: Tkachuk, Volodymyr, et al.
Pubblicazione: (2024)
di: Tkachuk, Volodymyr, et al.
Pubblicazione: (2024)
Balancing optimism and pessimism in offline-to-online learning
di: Sentenac, Flore, et al.
Pubblicazione: (2025)
di: Sentenac, Flore, et al.
Pubblicazione: (2025)
Confident Natural Policy Gradient for Local Planning in $q_π$-realizable Constrained MDPs
di: Tian, Tian, et al.
Pubblicazione: (2024)
di: Tian, Tian, et al.
Pubblicazione: (2024)
Stochastic Gradient Descent for Gaussian Processes Done Right
di: Lin, Jihao Andreas, et al.
Pubblicazione: (2023)
di: Lin, Jihao Andreas, et al.
Pubblicazione: (2023)
Beyond Statistical Learning: Exact Learning Is Essential for General Intelligence
di: György, András, et al.
Pubblicazione: (2025)
di: György, András, et al.
Pubblicazione: (2025)
On the optimal regret of collaborative personalized linear bandits
di: Huang, Bruce, et al.
Pubblicazione: (2025)
di: Huang, Bruce, et al.
Pubblicazione: (2025)
Learning to Reason Efficiently with Discounted Reinforcement Learning
di: Ayoub, Alex, et al.
Pubblicazione: (2025)
di: Ayoub, Alex, et al.
Pubblicazione: (2025)
Optimistic Policy Optimization is Provably Efficient in Non-stationary MDPs
di: Zhong, Han, et al.
Pubblicazione: (2021)
di: Zhong, Han, et al.
Pubblicazione: (2021)
Learning What to Recommend: Minimax Optimal Simple Regret in Logistic Bandits
di: Liu, Shuai, et al.
Pubblicazione: (2026)
di: Liu, Shuai, et al.
Pubblicazione: (2026)
Almost Free: Self-concordance in Natural Exponential Families and an Application to Bandits
di: Liu, Shuai, et al.
Pubblicazione: (2024)
di: Liu, Shuai, et al.
Pubblicazione: (2024)
Adversarial bandit optimization for approximately linear functions
di: Cheng, Zhuoyu, et al.
Pubblicazione: (2025)
di: Cheng, Zhuoyu, et al.
Pubblicazione: (2025)
Regret Minimization via Saddle Point Optimization
di: Kirschner, Johannes, et al.
Pubblicazione: (2024)
di: Kirschner, Johannes, et al.
Pubblicazione: (2024)
Best-of-Both Worlds for linear contextual bandits with paid observations
di: Boyer, Nathan, et al.
Pubblicazione: (2025)
di: Boyer, Nathan, et al.
Pubblicazione: (2025)
Sublinear iterations can suffice even for DDPMs
di: Zhang, Matthew S., et al.
Pubblicazione: (2025)
di: Zhang, Matthew S., et al.
Pubblicazione: (2025)
To Believe or Not to Believe Your LLM
di: Yadkori, Yasin Abbasi, et al.
Pubblicazione: (2024)
di: Yadkori, Yasin Abbasi, et al.
Pubblicazione: (2024)
Ordering-based Conditions for Global Convergence of Policy Gradient Methods
di: Mei, Jincheng, et al.
Pubblicazione: (2025)
di: Mei, Jincheng, et al.
Pubblicazione: (2025)
Stochastic Gradient Succeeds for Bandits
di: Mei, Jincheng, et al.
Pubblicazione: (2024)
di: Mei, Jincheng, et al.
Pubblicazione: (2024)
Extreme bandits
di: Carpentier, Alexandra, et al.
Pubblicazione: (2026)
di: Carpentier, Alexandra, et al.
Pubblicazione: (2026)
Truthful mechanisms for linear bandit games with private contexts
di: Hu, Yiting, et al.
Pubblicazione: (2025)
di: Hu, Yiting, et al.
Pubblicazione: (2025)
LACONIC: Length-Aware Constrained Reinforcement Learning for LLM
di: Liu, Chang, et al.
Pubblicazione: (2026)
di: Liu, Chang, et al.
Pubblicazione: (2026)
Optimistic Actor-Critic with Parametric Policies for Linear Markov Decision Processes
di: Lin, Max Qiushi, et al.
Pubblicazione: (2026)
di: Lin, Max Qiushi, et al.
Pubblicazione: (2026)
Precision autotuning for linear solvers via contextual bandit-based RL
di: Carson, Erin, et al.
Pubblicazione: (2026)
di: Carson, Erin, et al.
Pubblicazione: (2026)
Spectral bandits
di: Kocák, Tomáš, et al.
Pubblicazione: (2026)
di: Kocák, Tomáš, et al.
Pubblicazione: (2026)
Active clustering with bandit feedback
di: Thuot, Victor, et al.
Pubblicazione: (2024)
di: Thuot, Victor, et al.
Pubblicazione: (2024)
Frontier LLMs Still Struggle with Simple Reasoning Tasks
di: Malek, Alan, et al.
Pubblicazione: (2025)
di: Malek, Alan, et al.
Pubblicazione: (2025)
Information-directed sampling for bandits: a primer
di: Hirling, Annika, et al.
Pubblicazione: (2025)
di: Hirling, Annika, et al.
Pubblicazione: (2025)
Approximate information maximization for bandit games
di: Barbier-Chebbah, Alex, et al.
Pubblicazione: (2023)
di: Barbier-Chebbah, Alex, et al.
Pubblicazione: (2023)
Online learning in bandits with predicted context
di: Guo, Yongyi, et al.
Pubblicazione: (2023)
di: Guo, Yongyi, et al.
Pubblicazione: (2023)
Instance-dependent Stochastic Lipschitz bandit
di: Potfer, Marius, et al.
Pubblicazione: (2026)
di: Potfer, Marius, et al.
Pubblicazione: (2026)
Spectral bandits for smooth graph functions
di: Valko, Michal, et al.
Pubblicazione: (2026)
di: Valko, Michal, et al.
Pubblicazione: (2026)
Switching the Loss Reduces the Cost in Batch (Offline) Reinforcement Learning
di: Ayoub, Alex, et al.
Pubblicazione: (2024)
di: Ayoub, Alex, et al.
Pubblicazione: (2024)
Risk and optimal policies in bandit experiments
di: Adusumilli, Karun
Pubblicazione: (2021)
di: Adusumilli, Karun
Pubblicazione: (2021)
Documenti analoghi
-
Sharp analysis of linear ensemble sampling
di: Akhavan, Arya, et al.
Pubblicazione: (2026) -
Exploration via linearly perturbed loss minimisation
di: Janz, David, et al.
Pubblicazione: (2023) -
Variance-sensitive Thompson sampling for generalised linear bandits, revisited
di: Perneczky, Tom, et al.
Pubblicazione: (2026) -
When and why randomised exploration works (in linear bandits)
di: Abeille, Marc, et al.
Pubblicazione: (2025) -
Eluder dimension: localise it!
di: Bakhtiari, Alireza, et al.
Pubblicazione: (2026)