Best-of-Both-Worlds Policy Optimization for CMDPs with Bandit Feedback
Fuente:
arXiv
Salvato in:
| Autori principali: | Stradi, Francesco Emanuele, Lunghi, Anna, Castiglioni, Matteo, Marchesi, Alberto, Gatti, Nicola |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Beyond Slater's Condition in Online CMDPs with Stochastic and Adversarial Constraints
di: Stradi, Francesco Emanuele, et al.
Pubblicazione: (2025)
di: Stradi, Francesco Emanuele, et al.
Pubblicazione: (2025)
A Best-of-Both-Worlds Algorithm for Constrained MDPs with Long-Term Constraints
di: Germano, Jacopo, et al.
Pubblicazione: (2023)
di: Germano, Jacopo, et al.
Pubblicazione: (2023)
Optimal Strong Regret and Violation in Constrained MDPs via Policy Optimization
di: Stradi, Francesco Emanuele, et al.
Pubblicazione: (2024)
di: Stradi, Francesco Emanuele, et al.
Pubblicazione: (2024)
Learning Constrained Markov Decision Processes With Non-stationary Rewards and Constraints
di: Stradi, Francesco Emanuele, et al.
Pubblicazione: (2024)
di: Stradi, Francesco Emanuele, et al.
Pubblicazione: (2024)
Multi-Armed Bandits With Best-Action Queries
di: Bacchiocchi, Francesco, et al.
Pubblicazione: (2026)
di: Bacchiocchi, Francesco, et al.
Pubblicazione: (2026)
Learning Adversarial MDPs with Stochastic Hard Constraints
di: Stradi, Francesco Emanuele, et al.
Pubblicazione: (2024)
di: Stradi, Francesco Emanuele, et al.
Pubblicazione: (2024)
Replicable Constrained Bandits
di: Bollini, Matteo, et al.
Pubblicazione: (2026)
di: Bollini, Matteo, et al.
Pubblicazione: (2026)
Data-Dependent Regret Bounds for Constrained MABs
di: Genalti, Gianmarco, et al.
Pubblicazione: (2025)
di: Genalti, Gianmarco, et al.
Pubblicazione: (2025)
Truly Adapting to Adversarial Constraints in Constrained MABs
di: Stradi, Francesco Emanuele, et al.
Pubblicazione: (2026)
di: Stradi, Francesco Emanuele, et al.
Pubblicazione: (2026)
Markov Persuasion Processes: Learning to Persuade from Scratch
di: Bacchiocchi, Francesco, et al.
Pubblicazione: (2024)
di: Bacchiocchi, Francesco, et al.
Pubblicazione: (2024)
No-Regret Learning Under Adversarial Resource Constraints: A Spending Plan Is All You Need!
di: Stradi, Francesco Emanuele, et al.
Pubblicazione: (2025)
di: Stradi, Francesco Emanuele, et al.
Pubblicazione: (2025)
The Sample Complexity of Uniform Approximation for Multi-Dimensional CDFs and Fixed-Price Mechanisms
di: Castiglioni, Matteo, et al.
Pubblicazione: (2026)
di: Castiglioni, Matteo, et al.
Pubblicazione: (2026)
Toward Optimal Regret in Robust Pricing: Decoupling Corruption and Time
di: Kalupahana, Kalana, et al.
Pubblicazione: (2026)
di: Kalupahana, Kalana, et al.
Pubblicazione: (2026)
Better Regret Rates in Bilateral Trade via Sublinear Budget Violation
di: Lunghi, Anna, et al.
Pubblicazione: (2025)
di: Lunghi, Anna, et al.
Pubblicazione: (2025)
Regret Minimization in Bilateral Trade With Perturbed Markets
di: Lunghi, Anna, et al.
Pubblicazione: (2026)
di: Lunghi, Anna, et al.
Pubblicazione: (2026)
Regret Minimization for Piecewise Linear Rewards: Contracts, Auctions, and Beyond
di: Bacchiocchi, Francesco, et al.
Pubblicazione: (2025)
di: Bacchiocchi, Francesco, et al.
Pubblicazione: (2025)
Learning Optimal Contracts: How to Exploit Small Action Spaces
di: Bacchiocchi, Francesco, et al.
Pubblicazione: (2023)
di: Bacchiocchi, Francesco, et al.
Pubblicazione: (2023)
Improved Best-of-Both-Worlds Regret for Bandits with Delayed Feedback
di: Schlisselberg, Ofir, et al.
Pubblicazione: (2025)
di: Schlisselberg, Ofir, et al.
Pubblicazione: (2025)
Best-of-Both-Worlds Algorithms for Linear Contextual Bandits
di: Kuroki, Yuko, et al.
Pubblicazione: (2023)
di: Kuroki, Yuko, et al.
Pubblicazione: (2023)
Bridging Rested and Restless Bandits with Graph-Triggering: Rising and Rotting
di: Genalti, Gianmarco, et al.
Pubblicazione: (2024)
di: Genalti, Gianmarco, et al.
Pubblicazione: (2024)
Model-Free, Regret-Optimal Best Policy Identification in Online CMDPs
di: Zhou, Zihan, et al.
Pubblicazione: (2023)
di: Zhou, Zihan, et al.
Pubblicazione: (2023)
Contract Design Under Approximate Best Responses
di: Bacchiocchi, Francesco, et al.
Pubblicazione: (2025)
di: Bacchiocchi, Francesco, et al.
Pubblicazione: (2025)
Online Two-Sided Markets: Many Buyers Enhance Learning
di: Lunghi, Anna, et al.
Pubblicazione: (2025)
di: Lunghi, Anna, et al.
Pubblicazione: (2025)
Safe Online Bid Optimization with Return on Investment and Budget Constraints
di: Castiglioni, Matteo, et al.
Pubblicazione: (2022)
di: Castiglioni, Matteo, et al.
Pubblicazione: (2022)
Online Resource Allocation With General Constraints
di: Chiefari, Eleonora Fidelia, et al.
Pubblicazione: (2026)
di: Chiefari, Eleonora Fidelia, et al.
Pubblicazione: (2026)
Follow-the-Perturbed-Leader for Decoupled Bandits: Best-of-Both-Worlds and Practicality
di: Kim, Chaiwon, et al.
Pubblicazione: (2025)
di: Kim, Chaiwon, et al.
Pubblicazione: (2025)
Efficient Best-of-Both-Worlds Algorithms for Contextual Combinatorial Semi-Bandits
di: Li, Mengmeng, et al.
Pubblicazione: (2025)
di: Li, Mengmeng, et al.
Pubblicazione: (2025)
Primal-Dual Policy Optimization for Linear CMDPs with Adversarial Losses
di: Yu, Kihyun, et al.
Pubblicazione: (2026)
di: Yu, Kihyun, et al.
Pubblicazione: (2026)
A Primal-Dual Online Learning Approach for Dynamic Pricing of Sequentially Displayed Complementary Items under Sale Constraints
di: Stradi, Francesco Emanuele, et al.
Pubblicazione: (2024)
di: Stradi, Francesco Emanuele, et al.
Pubblicazione: (2024)
LC-Tsallis-INF: Generalized Best-of-Both-Worlds Linear Contextual Bandits
di: Kato, Masahiro, et al.
Pubblicazione: (2024)
di: Kato, Masahiro, et al.
Pubblicazione: (2024)
Learning in Bayesian Stackelberg Games With Unknown Follower's Types
di: Bollini, Matteo, et al.
Pubblicazione: (2026)
di: Bollini, Matteo, et al.
Pubblicazione: (2026)
Follow-the-Perturbed-Leader Approaches Best-of-Both-Worlds for the m-Set Semi-Bandit Problems
di: Zhan, Jingxin, et al.
Pubblicazione: (2025)
di: Zhan, Jingxin, et al.
Pubblicazione: (2025)
Autoregressive Bandits
di: Bacchiocchi, Francesco, et al.
Pubblicazione: (2022)
di: Bacchiocchi, Francesco, et al.
Pubblicazione: (2022)
A Stronger Benchmark for Online Bilateral Trade: From Fixed Prices to Distributions
di: Lunghi, Anna, et al.
Pubblicazione: (2026)
di: Lunghi, Anna, et al.
Pubblicazione: (2026)
No-Regret is not enough! Bandits with General Constraints through Adaptive Regret Minimization
di: Bernasconi, Martino, et al.
Pubblicazione: (2024)
di: Bernasconi, Martino, et al.
Pubblicazione: (2024)
Follow-the-Perturbed-Leader with Fréchet-type Tail Distributions: Optimality in Adversarial Bandits and Best-of-Both-Worlds
di: Lee, Jongyeong, et al.
Pubblicazione: (2024)
di: Lee, Jongyeong, et al.
Pubblicazione: (2024)
A Further Efficient Algorithm with Best-of-Both-Worlds Guarantees for $m$-Set Semi-Bandit Problem
di: Chen, Botao, et al.
Pubblicazione: (2026)
di: Chen, Botao, et al.
Pubblicazione: (2026)
The Sample Complexity of Stackelberg Games
di: Bacchiocchi, Francesco, et al.
Pubblicazione: (2024)
di: Bacchiocchi, Francesco, et al.
Pubblicazione: (2024)
Contracting With a Reinforcement Learning Agent by Playing Trick or Treat
di: Bollini, Matteo, et al.
Pubblicazione: (2024)
di: Bollini, Matteo, et al.
Pubblicazione: (2024)
Online Bayesian Persuasion Without a Clue
di: Bacchiocchi, Francesco, et al.
Pubblicazione: (2024)
di: Bacchiocchi, Francesco, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Beyond Slater's Condition in Online CMDPs with Stochastic and Adversarial Constraints
di: Stradi, Francesco Emanuele, et al.
Pubblicazione: (2025) -
A Best-of-Both-Worlds Algorithm for Constrained MDPs with Long-Term Constraints
di: Germano, Jacopo, et al.
Pubblicazione: (2023) -
Optimal Strong Regret and Violation in Constrained MDPs via Policy Optimization
di: Stradi, Francesco Emanuele, et al.
Pubblicazione: (2024) -
Learning Constrained Markov Decision Processes With Non-stationary Rewards and Constraints
di: Stradi, Francesco Emanuele, et al.
Pubblicazione: (2024) -
Multi-Armed Bandits With Best-Action Queries
di: Bacchiocchi, Francesco, et al.
Pubblicazione: (2026)