Information Capacity Regret Bounds for Bandits with Mediator Feedback
Fuente:
arXiv
Salvato in:
| Autori principali: | Eldowa, Khaled, Cesa-Bianchi, Nicolò, Metelli, Alberto Maria, Restelli, Marcello |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Improved Regret Bounds for Bandits with Expert Advice
di: Cesa-Bianchi, Nicolò, et al.
Pubblicazione: (2024)
di: Cesa-Bianchi, Nicolò, et al.
Pubblicazione: (2024)
Instance-Dependent Regret Bounds for Nonstochastic Linear Partial Monitoring
di: Di Gennaro, Federico, et al.
Pubblicazione: (2025)
di: Di Gennaro, Federico, et al.
Pubblicazione: (2025)
Pure Exploration under Mediators' Feedback
di: Poiani, Riccardo, et al.
Pubblicazione: (2023)
di: Poiani, Riccardo, et al.
Pubblicazione: (2023)
Achieving $\widetilde{\mathcal{O}}(\sqrt{T})$ Regret in Average-Reward POMDPs with Known Observation Models
di: Russo, Alessio, et al.
Pubblicazione: (2025)
di: Russo, Alessio, et al.
Pubblicazione: (2025)
Parameter-Free Dynamic Regret for Unconstrained Linear Bandits
di: Rumi, Alberto, et al.
Pubblicazione: (2026)
di: Rumi, Alberto, et al.
Pubblicazione: (2026)
Near-Optimal Regret for Distributed Adversarial Bandits: A Black-Box Approach
di: Qiu, Hao, et al.
Pubblicazione: (2026)
di: Qiu, Hao, et al.
Pubblicazione: (2026)
Gradient-Variation Regret Bounds for Unconstrained Online Learning
di: Zhao, Yuheng, et al.
Pubblicazione: (2026)
di: Zhao, Yuheng, et al.
Pubblicazione: (2026)
Beyond Bandit Feedback in Online Multiclass Classification
di: van der Hoeven, Dirk, et al.
Pubblicazione: (2021)
di: van der Hoeven, Dirk, et al.
Pubblicazione: (2021)
Best Arm Identification for Stochastic Rising Bandits
di: Mussi, Marco, et al.
Pubblicazione: (2023)
di: Mussi, Marco, et al.
Pubblicazione: (2023)
Interpetable Target-Feature Aggregation for Multi-Task Learning based on Bias-Variance Analysis
di: Bonetti, Paolo, et al.
Pubblicazione: (2024)
di: Bonetti, Paolo, et al.
Pubblicazione: (2024)
Efficient Learning of POMDPs with Known Observation Model in Average-Reward Setting
di: Russo, Alessio, et al.
Pubblicazione: (2024)
di: Russo, Alessio, et al.
Pubblicazione: (2024)
A Provably Efficient Option-Based Algorithm for both High-Level and Low-Level Learning
di: Drappo, Gianluca, et al.
Pubblicazione: (2024)
di: Drappo, Gianluca, et al.
Pubblicazione: (2024)
Dynamic Regret Reduces to Kernelized Static Regret
di: Jacobsen, Andrew, et al.
Pubblicazione: (2025)
di: Jacobsen, Andrew, et al.
Pubblicazione: (2025)
Online Budget Allocation with Censored Semi-Bandit Feedback
di: Bachoc, François, et al.
Pubblicazione: (2025)
di: Bachoc, François, et al.
Pubblicazione: (2025)
Autoregressive Bandits
di: Bacchiocchi, Francesco, et al.
Pubblicazione: (2022)
di: Bacchiocchi, Francesco, et al.
Pubblicazione: (2022)
Generalized Kernelized Bandits: A Novel Self-Normalized Bernstein-Like Dimension-Free Inequality and Regret Bounds
di: Metelli, Alberto Maria, et al.
Pubblicazione: (2025)
di: Metelli, Alberto Maria, et al.
Pubblicazione: (2025)
Bridging Rested and Restless Bandits with Graph-Triggering: Rising and Rotting
di: Genalti, Gianmarco, et al.
Pubblicazione: (2024)
di: Genalti, Gianmarco, et al.
Pubblicazione: (2024)
Sparsity-Agnostic Linear Bandits with Adaptive Adversaries
di: Jin, Tianyuan, et al.
Pubblicazione: (2024)
di: Jin, Tianyuan, et al.
Pubblicazione: (2024)
Truncating Trajectories in Monte Carlo Policy Evaluation: an Adaptive Approach
di: Poiani, Riccardo, et al.
Pubblicazione: (2024)
di: Poiani, Riccardo, et al.
Pubblicazione: (2024)
Local Linearity: the Key for No-regret Reinforcement Learning in Continuous MDPs
di: Maran, Davide, et al.
Pubblicazione: (2024)
di: Maran, Davide, et al.
Pubblicazione: (2024)
Policy Gradient with Active Importance Sampling
di: Papini, Matteo, et al.
Pubblicazione: (2024)
di: Papini, Matteo, et al.
Pubblicazione: (2024)
A Perturbation Approach to Unconstrained Linear Bandits
di: Jacobsen, Andrew, et al.
Pubblicazione: (2026)
di: Jacobsen, Andrew, et al.
Pubblicazione: (2026)
Best-of-Both-Worlds Algorithms for Linear Contextual Bandits
di: Kuroki, Yuko, et al.
Pubblicazione: (2023)
di: Kuroki, Yuko, et al.
Pubblicazione: (2023)
Statistical Analysis of Policy Space Compression Problem
di: Molaei, Majid, et al.
Pubblicazione: (2024)
di: Molaei, Majid, et al.
Pubblicazione: (2024)
Projection by Convolution: Optimal Sample Complexity for Reinforcement Learning in Continuous-Space MDPs
di: Maran, Davide, et al.
Pubblicazione: (2024)
di: Maran, Davide, et al.
Pubblicazione: (2024)
Inverse Reinforcement Learning with Sub-optimal Experts
di: Poiani, Riccardo, et al.
Pubblicazione: (2024)
di: Poiani, Riccardo, et al.
Pubblicazione: (2024)
$(ε, u)$-Adaptive Regret Minimization in Heavy-Tailed Bandits
di: Genalti, Gianmarco, et al.
Pubblicazione: (2023)
di: Genalti, Gianmarco, et al.
Pubblicazione: (2023)
A Regret Analysis of Bilateral Trade
di: Cesa-Bianchi, Nicolò, et al.
Pubblicazione: (2021)
di: Cesa-Bianchi, Nicolò, et al.
Pubblicazione: (2021)
No-Regret Reinforcement Learning in Smooth MDPs
di: Maran, Davide, et al.
Pubblicazione: (2024)
di: Maran, Davide, et al.
Pubblicazione: (2024)
Cooperative Online Learning with Feedback Graphs
di: Cesa-Bianchi, Nicolò, et al.
Pubblicazione: (2021)
di: Cesa-Bianchi, Nicolò, et al.
Pubblicazione: (2021)
Rising Rested Bandits: Lower Bounds and Efficient Algorithms
di: Fiandri, Marco, et al.
Pubblicazione: (2024)
di: Fiandri, Marco, et al.
Pubblicazione: (2024)
Catoni-Style Change Point Detection for Regret Minimization in Non-Stationary Heavy-Tailed Bandits
di: Genalti, Gianmarco, et al.
Pubblicazione: (2025)
di: Genalti, Gianmarco, et al.
Pubblicazione: (2025)
Optimal Multi-Fidelity Best-Arm Identification
di: Poiani, Riccardo, et al.
Pubblicazione: (2024)
di: Poiani, Riccardo, et al.
Pubblicazione: (2024)
Power Grid Control with Graph-Based Distributed Reinforcement Learning
di: Fabrizio, Carlo, et al.
Pubblicazione: (2025)
di: Fabrizio, Carlo, et al.
Pubblicazione: (2025)
Actor-Critic with Active Importance Sampling
di: Molaei, Majid, et al.
Pubblicazione: (2026)
di: Molaei, Majid, et al.
Pubblicazione: (2026)
Open Problem: Tight Bounds for Kernelized Multi-Armed Bandits with Bernoulli Rewards
di: Mussi, Marco, et al.
Pubblicazione: (2024)
di: Mussi, Marco, et al.
Pubblicazione: (2024)
Market Making without Regret
di: Cesa-Bianchi, Nicolò, et al.
Pubblicazione: (2024)
di: Cesa-Bianchi, Nicolò, et al.
Pubblicazione: (2024)
State and Action Factorization in Power Grids
di: Losapio, Gianvito, et al.
Pubblicazione: (2024)
di: Losapio, Gianvito, et al.
Pubblicazione: (2024)
Performance Improvement Bounds for Lipschitz Configurable Markov Decision Processes
di: Metelli, Alberto Maria
Pubblicazione: (2024)
di: Metelli, Alberto Maria
Pubblicazione: (2024)
Finite Sample Bounds for Non-Parametric Regression: Optimal Sample Efficiency and Space Complexity
di: Maran, Davide, et al.
Pubblicazione: (2024)
di: Maran, Davide, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Improved Regret Bounds for Bandits with Expert Advice
di: Cesa-Bianchi, Nicolò, et al.
Pubblicazione: (2024) -
Instance-Dependent Regret Bounds for Nonstochastic Linear Partial Monitoring
di: Di Gennaro, Federico, et al.
Pubblicazione: (2025) -
Pure Exploration under Mediators' Feedback
di: Poiani, Riccardo, et al.
Pubblicazione: (2023) -
Achieving $\widetilde{\mathcal{O}}(\sqrt{T})$ Regret in Average-Reward POMDPs with Known Observation Models
di: Russo, Alessio, et al.
Pubblicazione: (2025) -
Parameter-Free Dynamic Regret for Unconstrained Linear Bandits
di: Rumi, Alberto, et al.
Pubblicazione: (2026)