Bandits attack function optimization
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Preux, Philippe, Munos, Rémi, Valko, Michal |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Black-box optimization of noisy functions with unknown smoothness
par: Grill, Jean-Bastien, et autres
Publié: (2026)
par: Grill, Jean-Bastien, et autres
Publié: (2026)
Stochastic simultaneous optimistic optimization
par: Valko, Michal, et autres
Publié: (2026)
par: Valko, Michal, et autres
Publié: (2026)
Spectral bandits for smooth graph functions
par: Valko, Michal, et autres
Publié: (2026)
par: Valko, Michal, et autres
Publié: (2026)
Blazing the trails before beating the path: Sample-efficient Monte-Carlo planning
par: Grill, Jean-Bastien, et autres
Publié: (2026)
par: Grill, Jean-Bastien, et autres
Publié: (2026)
Spectral bandits for smooth graph functions with applications in recommender systems
par: Kocák, Tomáš, et autres
Publié: (2026)
par: Kocák, Tomáš, et autres
Publié: (2026)
Spectral Thompson sampling
par: Kocak, Tomas, et autres
Publié: (2026)
par: Kocak, Tomas, et autres
Publié: (2026)
Efficient learning by implicit exploration in bandit problems with side observations
par: Kocak, Tomas, et autres
Publié: (2026)
par: Kocak, Tomas, et autres
Publié: (2026)
VA-learning as a more efficient alternative to Q-learning
par: Tang, Yunhao, et autres
Publié: (2023)
par: Tang, Yunhao, et autres
Publié: (2023)
Bandits on graphs and structures
par: Valko, Michal
Publié: (2026)
par: Valko, Michal
Publié: (2026)
Spectral bandits
par: Kocák, Tomáš, et autres
Publié: (2026)
par: Kocák, Tomáš, et autres
Publié: (2026)
RL-finetuning LLMs from on- and off-policy data with a single algorithm
par: Tang, Yunhao, et autres
Publié: (2025)
par: Tang, Yunhao, et autres
Publié: (2025)
Planning in entropy-regularized Markov decision processes and games
par: Grill, Jean-Bastien, et autres
Publié: (2026)
par: Grill, Jean-Bastien, et autres
Publié: (2026)
Online combinatorial optimization with stochastic decision sets and adversarial losses
par: Neu, Gergely, et autres
Publié: (2026)
par: Neu, Gergely, et autres
Publié: (2026)
On two ways to use determinantal point processes for Monte Carlo integration
par: Gautier, Guillaume, et autres
Publié: (2026)
par: Gautier, Guillaume, et autres
Publié: (2026)
On a few pitfalls in KL divergence gradient estimation for RL
par: Tang, Yunhao, et autres
Publié: (2025)
par: Tang, Yunhao, et autres
Publié: (2025)
Adaptive graph-based algorithms for conditional anomaly detection and semi-supervised learning
par: Valko, Michal
Publié: (2026)
par: Valko, Michal
Publié: (2026)
Adaptive multi-fidelity optimization with fast learning rates
par: Fiegel, Come, et autres
Publié: (2026)
par: Fiegel, Come, et autres
Publié: (2026)
Model-free Posterior Sampling via Learning Rate Randomization
par: Tiapkin, Daniil, et autres
Publié: (2023)
par: Tiapkin, Daniil, et autres
Publié: (2023)
Super-Exponential Regret for UCT, AlphaGo and Variants
par: Orseau, Laurent, et autres
Publié: (2024)
par: Orseau, Laurent, et autres
Publié: (2024)
IDEQ: an improved diffusion model for the TSP
par: Basson, Mickael, et autres
Publié: (2024)
par: Basson, Mickael, et autres
Publié: (2024)
The Harder Path: Last Iterate Convergence for Uncoupled Learning in Zero-Sum Games with Bandit Feedback
par: Fiegel, Côme, et autres
Publié: (2026)
par: Fiegel, Côme, et autres
Publié: (2026)
Feature importance analysis for patient management decisions
par: Valko, Michal, et autres
Publié: (2026)
par: Valko, Michal, et autres
Publié: (2026)
Distance metric learning for conditional anomaly detection
par: Valko, Michal, et autres
Publié: (2026)
par: Valko, Michal, et autres
Publié: (2026)
Learning from a single labeled face and a stream of unlabeled data
par: Kveton, Branislav, et autres
Publié: (2026)
par: Kveton, Branislav, et autres
Publié: (2026)
Revealing graph bandits for maximizing local influence
par: Carpentier, Alexandra, et autres
Publié: (2026)
par: Carpentier, Alexandra, et autres
Publié: (2026)
Extreme bandits
par: Carpentier, Alexandra, et autres
Publié: (2026)
par: Carpentier, Alexandra, et autres
Publié: (2026)
Breiman meets Bellman: Non-Greedy Decision Trees with MDPs
par: Kohler, Hector, et autres
Publié: (2023)
par: Kohler, Hector, et autres
Publié: (2023)
Outcome-based Exploration for LLM Reasoning
par: Song, Yuda, et autres
Publié: (2025)
par: Song, Yuda, et autres
Publié: (2025)
Limits of Actor-Critic Algorithms for Decision Tree Policies Learning in IBMDPs
par: Kohler, Hector, et autres
Publié: (2023)
par: Kohler, Hector, et autres
Publié: (2023)
Beyond Verifiable Rewards: Scaling Reinforcement Learning for Language Models to Unverifiable Data
par: Tang, Yunhao, et autres
Publié: (2025)
par: Tang, Yunhao, et autres
Publié: (2025)
Optimizing Language Models for Inference Time Objectives using Reinforcement Learning
par: Tang, Yunhao, et autres
Publié: (2025)
par: Tang, Yunhao, et autres
Publié: (2025)
Generalized Preference Optimization: A Unified Approach to Offline Alignment
par: Tang, Yunhao, et autres
Publié: (2024)
par: Tang, Yunhao, et autres
Publié: (2024)
Understanding the performance gap between online and offline alignment algorithms
par: Tang, Yunhao, et autres
Publié: (2024)
par: Tang, Yunhao, et autres
Publié: (2024)
Active multiple matrix completion with adaptive confidence sets
par: Locatelli, Andrea, et autres
Publié: (2026)
par: Locatelli, Andrea, et autres
Publié: (2026)
Online learning with Erdős-Rényi side-observation graphs
par: Kocák, Tomáš, et autres
Publié: (2026)
par: Kocák, Tomáš, et autres
Publié: (2026)
Large-scale semi-supervised learning with online spectral graph sparsification
par: Calandriello, Daniele, et autres
Publié: (2026)
par: Calandriello, Daniele, et autres
Publié: (2026)
Analysis of Nystrom method with sequential ridge leverage scores
par: Calandriello, Daniele, et autres
Publié: (2026)
par: Calandriello, Daniele, et autres
Publié: (2026)
Bayesian policy gradient and actor-critic algorithms
par: Ghavamzadeh, Mohammad, et autres
Publié: (2026)
par: Ghavamzadeh, Mohammad, et autres
Publié: (2026)
Online learning with noisy side observations
par: Kocák, Tomáš, et autres
Publié: (2026)
par: Kocák, Tomáš, et autres
Publié: (2026)
Covariance-adapting algorithm for semi-bandits with application to sparse rewards
par: Perrault, Pierre, et autres
Publié: (2026)
par: Perrault, Pierre, et autres
Publié: (2026)
Documents similaires
-
Black-box optimization of noisy functions with unknown smoothness
par: Grill, Jean-Bastien, et autres
Publié: (2026) -
Stochastic simultaneous optimistic optimization
par: Valko, Michal, et autres
Publié: (2026) -
Spectral bandits for smooth graph functions
par: Valko, Michal, et autres
Publié: (2026) -
Blazing the trails before beating the path: Sample-efficient Monte-Carlo planning
par: Grill, Jean-Bastien, et autres
Publié: (2026) -
Spectral bandits for smooth graph functions with applications in recommender systems
par: Kocák, Tomáš, et autres
Publié: (2026)