Autoregressive Bandits
Fuente:
arXiv
Guardado en:
| Autores principales: | Bacchiocchi, Francesco, Genalti, Gianmarco, Maran, Davide, Mussi, Marco, Restelli, Marcello, Gatti, Nicola, Metelli, Alberto Maria |
|---|---|
| Formato: | Preprint |
| Publicado: |
2022
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Bridging Rested and Restless Bandits with Graph-Triggering: Rising and Rotting
por: Genalti, Gianmarco, et al.
Publicado: (2024)
por: Genalti, Gianmarco, et al.
Publicado: (2024)
Catoni-Style Change Point Detection for Regret Minimization in Non-Stationary Heavy-Tailed Bandits
por: Genalti, Gianmarco, et al.
Publicado: (2025)
por: Genalti, Gianmarco, et al.
Publicado: (2025)
$(ε, u)$-Adaptive Regret Minimization in Heavy-Tailed Bandits
por: Genalti, Gianmarco, et al.
Publicado: (2023)
por: Genalti, Gianmarco, et al.
Publicado: (2023)
Best Arm Identification for Stochastic Rising Bandits
por: Mussi, Marco, et al.
Publicado: (2023)
por: Mussi, Marco, et al.
Publicado: (2023)
Local Linearity: the Key for No-regret Reinforcement Learning in Continuous MDPs
por: Maran, Davide, et al.
Publicado: (2024)
por: Maran, Davide, et al.
Publicado: (2024)
Projection by Convolution: Optimal Sample Complexity for Reinforcement Learning in Continuous-Space MDPs
por: Maran, Davide, et al.
Publicado: (2024)
por: Maran, Davide, et al.
Publicado: (2024)
State and Action Factorization in Power Grids
por: Losapio, Gianvito, et al.
Publicado: (2024)
por: Losapio, Gianvito, et al.
Publicado: (2024)
Online Market Making and the Value of Observing the Order Book
por: Maran, Davide, et al.
Publicado: (2026)
por: Maran, Davide, et al.
Publicado: (2026)
Finite Sample Bounds for Non-Parametric Regression: Optimal Sample Efficiency and Space Complexity
por: Maran, Davide, et al.
Publicado: (2024)
por: Maran, Davide, et al.
Publicado: (2024)
Power Grid Control with Graph-Based Distributed Reinforcement Learning
por: Fabrizio, Carlo, et al.
Publicado: (2025)
por: Fabrizio, Carlo, et al.
Publicado: (2025)
Learning in Markov Decision Processes with Exogenous Dynamics
por: Maran, Davide, et al.
Publicado: (2026)
por: Maran, Davide, et al.
Publicado: (2026)
Online Dynamic Pricing of Complementary Products
por: Mussi, Marco, et al.
Publicado: (2025)
por: Mussi, Marco, et al.
Publicado: (2025)
Open Problem: Tight Bounds for Kernelized Multi-Armed Bandits with Bernoulli Rewards
por: Mussi, Marco, et al.
Publicado: (2024)
por: Mussi, Marco, et al.
Publicado: (2024)
Information Capacity Regret Bounds for Bandits with Mediator Feedback
por: Eldowa, Khaled, et al.
Publicado: (2024)
por: Eldowa, Khaled, et al.
Publicado: (2024)
Generalized Kernelized Bandits: A Novel Self-Normalized Bernstein-Like Dimension-Free Inequality and Regret Bounds
por: Metelli, Alberto Maria, et al.
Publicado: (2025)
por: Metelli, Alberto Maria, et al.
Publicado: (2025)
Data-Dependent Regret Bounds for Constrained MABs
por: Genalti, Gianmarco, et al.
Publicado: (2025)
por: Genalti, Gianmarco, et al.
Publicado: (2025)
Replicable Constrained Bandits
por: Bollini, Matteo, et al.
Publicado: (2026)
por: Bollini, Matteo, et al.
Publicado: (2026)
Achieving $\widetilde{\mathcal{O}}(\sqrt{T})$ Regret in Average-Reward POMDPs with Known Observation Models
por: Russo, Alessio, et al.
Publicado: (2025)
por: Russo, Alessio, et al.
Publicado: (2025)
Pure Exploration under Mediators' Feedback
por: Poiani, Riccardo, et al.
Publicado: (2023)
por: Poiani, Riccardo, et al.
Publicado: (2023)
Interpetable Target-Feature Aggregation for Multi-Task Learning based on Bias-Variance Analysis
por: Bonetti, Paolo, et al.
Publicado: (2024)
por: Bonetti, Paolo, et al.
Publicado: (2024)
Efficient Learning of POMDPs with Known Observation Model in Average-Reward Setting
por: Russo, Alessio, et al.
Publicado: (2024)
por: Russo, Alessio, et al.
Publicado: (2024)
A Provably Efficient Option-Based Algorithm for both High-Level and Low-Level Learning
por: Drappo, Gianluca, et al.
Publicado: (2024)
por: Drappo, Gianluca, et al.
Publicado: (2024)
No-Regret Reinforcement Learning in Smooth MDPs
por: Maran, Davide, et al.
Publicado: (2024)
por: Maran, Davide, et al.
Publicado: (2024)
A Best-of-Both-Worlds Algorithm for Constrained MDPs with Long-Term Constraints
por: Germano, Jacopo, et al.
Publicado: (2023)
por: Germano, Jacopo, et al.
Publicado: (2023)
Truncating Trajectories in Monte Carlo Policy Evaluation: an Adaptive Approach
por: Poiani, Riccardo, et al.
Publicado: (2024)
por: Poiani, Riccardo, et al.
Publicado: (2024)
Policy Gradient with Active Importance Sampling
por: Papini, Matteo, et al.
Publicado: (2024)
por: Papini, Matteo, et al.
Publicado: (2024)
Thompson Sampling-like Algorithms for Stochastic Rising Bandits
por: Fiandri, Marco, et al.
Publicado: (2025)
por: Fiandri, Marco, et al.
Publicado: (2025)
A Refined Analysis of UCBVI
por: Drago, Simone, et al.
Publicado: (2025)
por: Drago, Simone, et al.
Publicado: (2025)
Statistical Analysis of Policy Space Compression Problem
por: Molaei, Majid, et al.
Publicado: (2024)
por: Molaei, Majid, et al.
Publicado: (2024)
Inverse Reinforcement Learning with Sub-optimal Experts
por: Poiani, Riccardo, et al.
Publicado: (2024)
por: Poiani, Riccardo, et al.
Publicado: (2024)
Rising Rested Bandits: Lower Bounds and Efficient Algorithms
por: Fiandri, Marco, et al.
Publicado: (2024)
por: Fiandri, Marco, et al.
Publicado: (2024)
Regret Minimization for Piecewise Linear Rewards: Contracts, Auctions, and Beyond
por: Bacchiocchi, Francesco, et al.
Publicado: (2025)
por: Bacchiocchi, Francesco, et al.
Publicado: (2025)
Learning Optimal Contracts: How to Exploit Small Action Spaces
por: Bacchiocchi, Francesco, et al.
Publicado: (2023)
por: Bacchiocchi, Francesco, et al.
Publicado: (2023)
Optimal Multi-Fidelity Best-Arm Identification
por: Poiani, Riccardo, et al.
Publicado: (2024)
por: Poiani, Riccardo, et al.
Publicado: (2024)
Actor-Critic with Active Importance Sampling
por: Molaei, Majid, et al.
Publicado: (2026)
por: Molaei, Majid, et al.
Publicado: (2026)
Learning Optimal Deterministic Policies with Stochastic Policy Gradients
por: Montenegro, Alessandro, et al.
Publicado: (2024)
por: Montenegro, Alessandro, et al.
Publicado: (2024)
Last-Iterate Global Convergence of Policy Gradients for Constrained Reinforcement Learning
por: Montenegro, Alessandro, et al.
Publicado: (2024)
por: Montenegro, Alessandro, et al.
Publicado: (2024)
Sharper Guarantees for Misspecified Kernelized Bandit Optimization
por: Maran, Davide, et al.
Publicado: (2026)
por: Maran, Davide, et al.
Publicado: (2026)
Multi-Armed Bandits With Best-Action Queries
por: Bacchiocchi, Francesco, et al.
Publicado: (2026)
por: Bacchiocchi, Francesco, et al.
Publicado: (2026)
Markov Persuasion Processes: Learning to Persuade from Scratch
por: Bacchiocchi, Francesco, et al.
Publicado: (2024)
por: Bacchiocchi, Francesco, et al.
Publicado: (2024)
Ejemplares similares
-
Bridging Rested and Restless Bandits with Graph-Triggering: Rising and Rotting
por: Genalti, Gianmarco, et al.
Publicado: (2024) -
Catoni-Style Change Point Detection for Regret Minimization in Non-Stationary Heavy-Tailed Bandits
por: Genalti, Gianmarco, et al.
Publicado: (2025) -
$(ε, u)$-Adaptive Regret Minimization in Heavy-Tailed Bandits
por: Genalti, Gianmarco, et al.
Publicado: (2023) -
Best Arm Identification for Stochastic Rising Bandits
por: Mussi, Marco, et al.
Publicado: (2023) -
Local Linearity: the Key for No-regret Reinforcement Learning in Continuous MDPs
por: Maran, Davide, et al.
Publicado: (2024)