Leveraging priors on distribution functions for multi-arm bandits
Fuente:
arXiv
Salvato in:
| Autori principali: | Vashishtha, Sumit, Maillard, Odalric-Ambrym |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
How Hard is it to Confuse a World Model?
di: Radji, Waris, et al.
Pubblicazione: (2025)
di: Radji, Waris, et al.
Pubblicazione: (2025)
The regret lower bound for communicating Markov Decision Processes
di: Boone, Victor, et al.
Pubblicazione: (2025)
di: Boone, Victor, et al.
Pubblicazione: (2025)
The Confusing Instance Principle for Online Linear Quadratic Control
di: Radji, Waris, et al.
Pubblicazione: (2025)
di: Radji, Waris, et al.
Pubblicazione: (2025)
How to Shrink Confidence Sets for Many Equivalent Discrete Distributions?
di: Maillard, Odalric-Ambrym, et al.
Pubblicazione: (2024)
di: Maillard, Odalric-Ambrym, et al.
Pubblicazione: (2024)
A Continual Offline Reinforcement Learning Benchmark for Navigation Tasks
di: Kobanda, Anthony, et al.
Pubblicazione: (2025)
di: Kobanda, Anthony, et al.
Pubblicazione: (2025)
Asymptotically Optimal Problem-Dependent Bandit Policies for Transfer Learning
di: Prevost, Adrien, et al.
Pubblicazione: (2025)
di: Prevost, Adrien, et al.
Pubblicazione: (2025)
Pliable rejection sampling
di: Erraqabi, Akram, et al.
Pubblicazione: (2026)
di: Erraqabi, Akram, et al.
Pubblicazione: (2026)
Hierarchical Subspaces of Policies for Continual Offline Reinforcement Learning
di: Kobanda, Anthony, et al.
Pubblicazione: (2024)
di: Kobanda, Anthony, et al.
Pubblicazione: (2024)
Offline Goal-Conditioned Reinforcement Learning with Projective Quasimetric Planning
di: Kobanda, Anthony, et al.
Pubblicazione: (2025)
di: Kobanda, Anthony, et al.
Pubblicazione: (2025)
Provably Efficient Exploration in Reward Machines with Low Regret
di: Bourel, Hippolyte, et al.
Pubblicazione: (2024)
di: Bourel, Hippolyte, et al.
Pubblicazione: (2024)
Interpolation pour l'augmentation de donnees : Application à la gestion des adventices de la canne a sucre a la Reunion
di: Ferber, Frederick Fabre, et al.
Pubblicazione: (2025)
di: Ferber, Frederick Fabre, et al.
Pubblicazione: (2025)
Functional multi-armed bandit and the best function identification problems
di: Dorn, Yuriy, et al.
Pubblicazione: (2025)
di: Dorn, Yuriy, et al.
Pubblicazione: (2025)
Trading off rewards and errors in multi-armed bandits
di: Erraqabi, Akram, et al.
Pubblicazione: (2026)
di: Erraqabi, Akram, et al.
Pubblicazione: (2026)
Minimax-optimal trust-aware multi-armed bandits
di: Cai, Changxiao, et al.
Pubblicazione: (2024)
di: Cai, Changxiao, et al.
Pubblicazione: (2024)
AdaStop: adaptive statistical testing for sound comparisons of Deep RL agents
di: Mathieu, Timothée, et al.
Pubblicazione: (2023)
di: Mathieu, Timothée, et al.
Pubblicazione: (2023)
Power Mean Estimation in Stochastic Monte-Carlo Tree_Search
di: Dam, Tuan, et al.
Pubblicazione: (2024)
di: Dam, Tuan, et al.
Pubblicazione: (2024)
Information maximization for a broad variety of multi-armed bandit games
di: Barbier-Chebbah, Alex, et al.
Pubblicazione: (2025)
di: Barbier-Chebbah, Alex, et al.
Pubblicazione: (2025)
UCB algorithms for multi-armed bandits: Precise regret and adaptive inference
di: Han, Qiyang, et al.
Pubblicazione: (2024)
di: Han, Qiyang, et al.
Pubblicazione: (2024)
Softmax gradient policy for variance minimization and risk-averse multi armed bandits
di: Turinici, Gabriel
Pubblicazione: (2026)
di: Turinici, Gabriel
Pubblicazione: (2026)
Achieving adaptivity and optimality for multi-armed bandits using Exponential-Kullback Leibler Maillard Sampling
di: Qin, Hao, et al.
Pubblicazione: (2025)
di: Qin, Hao, et al.
Pubblicazione: (2025)
A more efficient method for large-sample model-free feature screening via multi-armed bandits
di: Ouyang, Xiaxue, et al.
Pubblicazione: (2025)
di: Ouyang, Xiaxue, et al.
Pubblicazione: (2025)
HELLINGER-UCB: A novel algorithm for stochastic multi-armed bandit problem and cold start problem in recommender system
di: Yang, Ruibo, et al.
Pubblicazione: (2024)
di: Yang, Ruibo, et al.
Pubblicazione: (2024)
Spectral bandits for smooth graph functions
di: Valko, Michal, et al.
Pubblicazione: (2026)
di: Valko, Michal, et al.
Pubblicazione: (2026)
A survey on multi-player bandits
di: Boursier, Etienne, et al.
Pubblicazione: (2022)
di: Boursier, Etienne, et al.
Pubblicazione: (2022)
Efficient kernelized bandit algorithms via exploration distributions
di: Hu, Bingshan, et al.
Pubblicazione: (2025)
di: Hu, Bingshan, et al.
Pubblicazione: (2025)
Leveraging heterogeneous spillover in maximizing contextual bandit rewards
di: Faruk, Ahmed Sayeed, et al.
Pubblicazione: (2023)
di: Faruk, Ahmed Sayeed, et al.
Pubblicazione: (2023)
Extreme bandits
di: Carpentier, Alexandra, et al.
Pubblicazione: (2026)
di: Carpentier, Alexandra, et al.
Pubblicazione: (2026)
Optimal cross-learning for contextual bandits with unknown context distributions
di: Schneider, Jon, et al.
Pubblicazione: (2024)
di: Schneider, Jon, et al.
Pubblicazione: (2024)
Adversarial bandit optimization for approximately linear functions
di: Cheng, Zhuoyu, et al.
Pubblicazione: (2025)
di: Cheng, Zhuoyu, et al.
Pubblicazione: (2025)
Spectral bandits for smooth graph functions with applications in recommender systems
di: Kocák, Tomáš, et al.
Pubblicazione: (2026)
di: Kocák, Tomáš, et al.
Pubblicazione: (2026)
Spectral bandits
di: Kocák, Tomáš, et al.
Pubblicazione: (2026)
di: Kocák, Tomáš, et al.
Pubblicazione: (2026)
Active clustering with bandit feedback
di: Thuot, Victor, et al.
Pubblicazione: (2024)
di: Thuot, Victor, et al.
Pubblicazione: (2024)
Vector preference-based contextual bandits under distributional shifts
di: Shukla, Apurv, et al.
Pubblicazione: (2025)
di: Shukla, Apurv, et al.
Pubblicazione: (2025)
Performance-bounded Online Ensemble Learning Method Based on Multi-armed bandits and Its Applications in Real-time Safety Assessment
di: Hu, Songqiao, et al.
Pubblicazione: (2025)
di: Hu, Songqiao, et al.
Pubblicazione: (2025)
Instance-dependent Stochastic Lipschitz bandit
di: Potfer, Marius, et al.
Pubblicazione: (2026)
di: Potfer, Marius, et al.
Pubblicazione: (2026)
Approximate information maximization for bandit games
di: Barbier-Chebbah, Alex, et al.
Pubblicazione: (2023)
di: Barbier-Chebbah, Alex, et al.
Pubblicazione: (2023)
Online learning in bandits with predicted context
di: Guo, Yongyi, et al.
Pubblicazione: (2023)
di: Guo, Yongyi, et al.
Pubblicazione: (2023)
Leveraging User-Generated Reviews for Recommender Systems with Dynamic Headers
di: Vashishtha, Shanu, et al.
Pubblicazione: (2024)
di: Vashishtha, Shanu, et al.
Pubblicazione: (2024)
Risk and optimal policies in bandit experiments
di: Adusumilli, Karun
Pubblicazione: (2021)
di: Adusumilli, Karun
Pubblicazione: (2021)
On the optimal regret of collaborative personalized linear bandits
di: Huang, Bruce, et al.
Pubblicazione: (2025)
di: Huang, Bruce, et al.
Pubblicazione: (2025)
Documenti analoghi
-
How Hard is it to Confuse a World Model?
di: Radji, Waris, et al.
Pubblicazione: (2025) -
The regret lower bound for communicating Markov Decision Processes
di: Boone, Victor, et al.
Pubblicazione: (2025) -
The Confusing Instance Principle for Online Linear Quadratic Control
di: Radji, Waris, et al.
Pubblicazione: (2025) -
How to Shrink Confidence Sets for Many Equivalent Discrete Distributions?
di: Maillard, Odalric-Ambrym, et al.
Pubblicazione: (2024) -
A Continual Offline Reinforcement Learning Benchmark for Navigation Tasks
di: Kobanda, Anthony, et al.
Pubblicazione: (2025)