Pliable rejection sampling
Fuente:
arXiv
Salvato in:
| Autori principali: | Erraqabi, Akram, Valko, Michal, Carpentier, Alexandra, Maillard, Odalric-Ambrym |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Leveraging priors on distribution functions for multi-arm bandits
di: Vashishtha, Sumit, et al.
Pubblicazione: (2025)
di: Vashishtha, Sumit, et al.
Pubblicazione: (2025)
How Hard is it to Confuse a World Model?
di: Radji, Waris, et al.
Pubblicazione: (2025)
di: Radji, Waris, et al.
Pubblicazione: (2025)
The regret lower bound for communicating Markov Decision Processes
di: Boone, Victor, et al.
Pubblicazione: (2025)
di: Boone, Victor, et al.
Pubblicazione: (2025)
The Confusing Instance Principle for Online Linear Quadratic Control
di: Radji, Waris, et al.
Pubblicazione: (2025)
di: Radji, Waris, et al.
Pubblicazione: (2025)
How to Shrink Confidence Sets for Many Equivalent Discrete Distributions?
di: Maillard, Odalric-Ambrym, et al.
Pubblicazione: (2024)
di: Maillard, Odalric-Ambrym, et al.
Pubblicazione: (2024)
A Continual Offline Reinforcement Learning Benchmark for Navigation Tasks
di: Kobanda, Anthony, et al.
Pubblicazione: (2025)
di: Kobanda, Anthony, et al.
Pubblicazione: (2025)
Asymptotically Optimal Problem-Dependent Bandit Policies for Transfer Learning
di: Prevost, Adrien, et al.
Pubblicazione: (2025)
di: Prevost, Adrien, et al.
Pubblicazione: (2025)
Revealing graph bandits for maximizing local influence
di: Carpentier, Alexandra, et al.
Pubblicazione: (2026)
di: Carpentier, Alexandra, et al.
Pubblicazione: (2026)
Extreme bandits
di: Carpentier, Alexandra, et al.
Pubblicazione: (2026)
di: Carpentier, Alexandra, et al.
Pubblicazione: (2026)
Hierarchical Subspaces of Policies for Continual Offline Reinforcement Learning
di: Kobanda, Anthony, et al.
Pubblicazione: (2024)
di: Kobanda, Anthony, et al.
Pubblicazione: (2024)
Trading off rewards and errors in multi-armed bandits
di: Erraqabi, Akram, et al.
Pubblicazione: (2026)
di: Erraqabi, Akram, et al.
Pubblicazione: (2026)
Offline Goal-Conditioned Reinforcement Learning with Projective Quasimetric Planning
di: Kobanda, Anthony, et al.
Pubblicazione: (2025)
di: Kobanda, Anthony, et al.
Pubblicazione: (2025)
Active multiple matrix completion with adaptive confidence sets
di: Locatelli, Andrea, et al.
Pubblicazione: (2026)
di: Locatelli, Andrea, et al.
Pubblicazione: (2026)
Stochastic simultaneous optimistic optimization
di: Valko, Michal, et al.
Pubblicazione: (2026)
di: Valko, Michal, et al.
Pubblicazione: (2026)
Provably Efficient Exploration in Reward Machines with Low Regret
di: Bourel, Hippolyte, et al.
Pubblicazione: (2024)
di: Bourel, Hippolyte, et al.
Pubblicazione: (2024)
Interpolation pour l'augmentation de donnees : Application à la gestion des adventices de la canne a sucre a la Reunion
di: Ferber, Frederick Fabre, et al.
Pubblicazione: (2025)
di: Ferber, Frederick Fabre, et al.
Pubblicazione: (2025)
AdaStop: adaptive statistical testing for sound comparisons of Deep RL agents
di: Mathieu, Timothée, et al.
Pubblicazione: (2023)
di: Mathieu, Timothée, et al.
Pubblicazione: (2023)
Power Mean Estimation in Stochastic Monte-Carlo Tree_Search
di: Dam, Tuan, et al.
Pubblicazione: (2024)
di: Dam, Tuan, et al.
Pubblicazione: (2024)
Bandits on graphs and structures
di: Valko, Michal
Pubblicazione: (2026)
di: Valko, Michal
Pubblicazione: (2026)
Adaptive graph-based algorithms for conditional anomaly detection and semi-supervised learning
di: Valko, Michal
Pubblicazione: (2026)
di: Valko, Michal
Pubblicazione: (2026)
Feature importance analysis for patient management decisions
di: Valko, Michal, et al.
Pubblicazione: (2026)
di: Valko, Michal, et al.
Pubblicazione: (2026)
Online combinatorial optimization with stochastic decision sets and adversarial losses
di: Neu, Gergely, et al.
Pubblicazione: (2026)
di: Neu, Gergely, et al.
Pubblicazione: (2026)
Distance metric learning for conditional anomaly detection
di: Valko, Michal, et al.
Pubblicazione: (2026)
di: Valko, Michal, et al.
Pubblicazione: (2026)
Learning from a single labeled face and a stream of unlabeled data
di: Kveton, Branislav, et al.
Pubblicazione: (2026)
di: Kveton, Branislav, et al.
Pubblicazione: (2026)
A simple and improved algorithm for noisy, convex, zeroth-order optimisation
di: Carpentier, Alexandra
Pubblicazione: (2024)
di: Carpentier, Alexandra
Pubblicazione: (2024)
Spectral Thompson sampling
di: Kocak, Tomas, et al.
Pubblicazione: (2026)
di: Kocak, Tomas, et al.
Pubblicazione: (2026)
Bandits attack function optimization
di: Preux, Philippe, et al.
Pubblicazione: (2026)
di: Preux, Philippe, et al.
Pubblicazione: (2026)
Online learning with Erdős-Rényi side-observation graphs
di: Kocák, Tomáš, et al.
Pubblicazione: (2026)
di: Kocák, Tomáš, et al.
Pubblicazione: (2026)
Large-scale semi-supervised learning with online spectral graph sparsification
di: Calandriello, Daniele, et al.
Pubblicazione: (2026)
di: Calandriello, Daniele, et al.
Pubblicazione: (2026)
Adaptive multi-fidelity optimization with fast learning rates
di: Fiegel, Come, et al.
Pubblicazione: (2026)
di: Fiegel, Come, et al.
Pubblicazione: (2026)
Analysis of Nystrom method with sequential ridge leverage scores
di: Calandriello, Daniele, et al.
Pubblicazione: (2026)
di: Calandriello, Daniele, et al.
Pubblicazione: (2026)
Bayesian policy gradient and actor-critic algorithms
di: Ghavamzadeh, Mohammad, et al.
Pubblicazione: (2026)
di: Ghavamzadeh, Mohammad, et al.
Pubblicazione: (2026)
Online learning with noisy side observations
di: Kocák, Tomáš, et al.
Pubblicazione: (2026)
di: Kocák, Tomáš, et al.
Pubblicazione: (2026)
Covariance-adapting algorithm for semi-bandits with application to sparse rewards
di: Perrault, Pierre, et al.
Pubblicazione: (2026)
di: Perrault, Pierre, et al.
Pubblicazione: (2026)
Pack only the essentials: Adaptive dictionary learning for kernel ridge regression
di: Calandriello, Daniele, et al.
Pubblicazione: (2026)
di: Calandriello, Daniele, et al.
Pubblicazione: (2026)
Learning predictive models for combinations of heterogeneous proteomic data sources
di: Valko, Michal, et al.
Pubblicazione: (2026)
di: Valko, Michal, et al.
Pubblicazione: (2026)
Language Generation with Replay: A Learning-Theoretic View of Model Collapse
di: Racca, Giorgio, et al.
Pubblicazione: (2026)
di: Racca, Giorgio, et al.
Pubblicazione: (2026)
Black-box optimization of noisy functions with unknown smoothness
di: Grill, Jean-Bastien, et al.
Pubblicazione: (2026)
di: Grill, Jean-Bastien, et al.
Pubblicazione: (2026)
Blazing the trails before beating the path: Sample-efficient Monte-Carlo planning
di: Grill, Jean-Bastien, et al.
Pubblicazione: (2026)
di: Grill, Jean-Bastien, et al.
Pubblicazione: (2026)
On two ways to use determinantal point processes for Monte Carlo integration
di: Gautier, Guillaume, et al.
Pubblicazione: (2026)
di: Gautier, Guillaume, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Leveraging priors on distribution functions for multi-arm bandits
di: Vashishtha, Sumit, et al.
Pubblicazione: (2025) -
How Hard is it to Confuse a World Model?
di: Radji, Waris, et al.
Pubblicazione: (2025) -
The regret lower bound for communicating Markov Decision Processes
di: Boone, Victor, et al.
Pubblicazione: (2025) -
The Confusing Instance Principle for Online Linear Quadratic Control
di: Radji, Waris, et al.
Pubblicazione: (2025) -
How to Shrink Confidence Sets for Many Equivalent Discrete Distributions?
di: Maillard, Odalric-Ambrym, et al.
Pubblicazione: (2024)