Data- and Variance-dependent Regret Bounds for Online Tabular MDPs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Mingyi, Tsuchiya, Taira, Yamanishi, Kenji |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Bandit and Delayed Feedback in Online Structured Prediction
par: Shibukawa, Yuki, et autres
Publié: (2025)
par: Shibukawa, Yuki, et autres
Publié: (2025)
Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs
par: Chen, Shulun, et autres
Publié: (2025)
par: Chen, Shulun, et autres
Publié: (2025)
Reinforcement Learning from Adversarial Preferences in Tabular MDPs
par: Tsuchiya, Taira, et autres
Publié: (2025)
par: Tsuchiya, Taira, et autres
Publié: (2025)
Tight Regret Upper and Lower Bounds for Optimistic Hedge in Two-Player Zero-Sum Games
par: Tsuchiya, Taira
Publié: (2025)
par: Tsuchiya, Taira
Publié: (2025)
Online Inverse Linear Optimization: Efficient Logarithmic-Regret Algorithm, Robustness to Suboptimality, and Lower Bound
par: Sakaue, Shinsaku, et autres
Publié: (2025)
par: Sakaue, Shinsaku, et autres
Publié: (2025)
Optimal Variance-Dependent Regret Bounds for Infinite-Horizon MDPs
par: Zamir, Guy, et autres
Publié: (2026)
par: Zamir, Guy, et autres
Publié: (2026)
A Simple and Adaptive Learning Rate for FTRL in Online Learning with Minimax Regret of $Θ(T^{2/3})$ and its Application to Best-of-Both-Worlds
par: Tsuchiya, Taira, et autres
Publié: (2024)
par: Tsuchiya, Taira, et autres
Publié: (2024)
Minimax Optimal Variance-Aware Regret Bounds for Multinomial Logistic MDPs
par: Boudart, Pierre, et autres
Publié: (2026)
par: Boudart, Pierre, et autres
Publié: (2026)
Online Structured Prediction with Fenchel--Young Losses and Improved Surrogate Regret for Online Multiclass Classification with Logistic Loss
par: Sakaue, Shinsaku, et autres
Publié: (2024)
par: Sakaue, Shinsaku, et autres
Publié: (2024)
Revisiting Online Learning Approach to Inverse Linear Optimization: A Fenchel$-$Young Loss Perspective and Gap-Dependent Regret Analysis
par: Sakaue, Shinsaku, et autres
Publié: (2025)
par: Sakaue, Shinsaku, et autres
Publié: (2025)
Exploration by Optimization with Hybrid Regularizers: Logarithmic Regret with Adversarial Robustness in Partial Monitoring
par: Tsuchiya, Taira, et autres
Publié: (2024)
par: Tsuchiya, Taira, et autres
Publié: (2024)
Adapting to Stochastic and Adversarial Losses in Episodic MDPs with Aggregate Bandit Feedback
par: Ito, Shinji, et autres
Publié: (2025)
par: Ito, Shinji, et autres
Publié: (2025)
Fast Rates in Stochastic Online Convex Optimization by Exploiting the Curvature of Feasible Sets
par: Tsuchiya, Taira, et autres
Publié: (2024)
par: Tsuchiya, Taira, et autres
Publié: (2024)
Online Control of Linear Systems under Unbounded Noise
par: Ito, Kaito, et autres
Publié: (2024)
par: Ito, Kaito, et autres
Publié: (2024)
Graph Community Augmentation with GMM-based Modeling in Latent Space
par: Fukushima, Shintaro, et autres
Publié: (2024)
par: Fukushima, Shintaro, et autres
Publié: (2024)
Towards Optimal Differentially Private Regret Bounds in Linear MDPs
par: Sahu, Sharan
Publié: (2025)
par: Sahu, Sharan
Publié: (2025)
Efficient, Low-Regret, Online Reinforcement Learning for Linear MDPs
par: John, Philips George, et autres
Publié: (2024)
par: John, Philips George, et autres
Publié: (2024)
Stability-penalty-adaptive follow-the-regularized-leader: Sparsity, game-dependency, and best-of-both-worlds
par: Tsuchiya, Taira, et autres
Publié: (2023)
par: Tsuchiya, Taira, et autres
Publié: (2023)
Truly No-Regret Learning in Constrained MDPs
par: Müller, Adrian, et autres
Publié: (2024)
par: Müller, Adrian, et autres
Publié: (2024)
Normalized Maximum Likelihood Code-Length on Riemannian Data Spaces
par: Fukuzawa, Kota, et autres
Publié: (2025)
par: Fukuzawa, Kota, et autres
Publié: (2025)
Variance-Dependent Regret Lower Bounds for Contextual Bandits
par: He, Jiafan, et autres
Publié: (2025)
par: He, Jiafan, et autres
Publié: (2025)
Near-optimal Regret Using Policy Optimization in Online MDPs with Aggregate Bandit Feedback
par: Lancewicki, Tal, et autres
Publié: (2025)
par: Lancewicki, Tal, et autres
Publié: (2025)
Solving Robust MDPs through No-Regret Dynamics
par: Guha, Etash Kumar
Publié: (2023)
par: Guha, Etash Kumar
Publié: (2023)
Eluder-based Regret for Stochastic Contextual MDPs
par: Levy, Orin, et autres
Publié: (2022)
par: Levy, Orin, et autres
Publié: (2022)
No-Regret Reinforcement Learning in Smooth MDPs
par: Maran, Davide, et autres
Publié: (2024)
par: Maran, Davide, et autres
Publié: (2024)
Variance-Dependent Regret Bounds for Non-stationary Linear Bandits
par: Wang, Zhiyong, et autres
Publié: (2024)
par: Wang, Zhiyong, et autres
Publié: (2024)
Variance-Aware Regret Bounds for Stochastic Contextual Dueling Bandits
par: Di, Qiwei, et autres
Publié: (2023)
par: Di, Qiwei, et autres
Publié: (2023)
Near-Optimal Dynamic Regret for Adversarial Linear Mixture MDPs
par: Li, Long-Fei, et autres
Publié: (2024)
par: Li, Long-Fei, et autres
Publié: (2024)
Instance-Dependent Regret Bounds for Learning Two-Player Zero-Sum Games with Bandit Feedback
par: Ito, Shinji, et autres
Publié: (2025)
par: Ito, Shinji, et autres
Publié: (2025)
Learnability in Online Kernel Selection with Memory Constraint via Data-dependent Regret Analysis
par: Li, Junfan, et autres
Publié: (2024)
par: Li, Junfan, et autres
Publié: (2024)
Improved Kernel Alignment Regret Bound for Online Kernel Learning
par: Li, Junfan, et autres
Publié: (2022)
par: Li, Junfan, et autres
Publié: (2022)
Clustering Change Sign Detection by Fusing Mixture Complexity
par: Urano, Kento, et autres
Publié: (2024)
par: Urano, Kento, et autres
Publié: (2024)
Near-Optimal Regret in Linear MDPs with Aggregate Bandit Feedback
par: Cassel, Asaf, et autres
Publié: (2024)
par: Cassel, Asaf, et autres
Publié: (2024)
Gradient-Variation Regret Bounds for Unconstrained Online Learning
par: Zhao, Yuheng, et autres
Publié: (2026)
par: Zhao, Yuheng, et autres
Publié: (2026)
Foundation of Calculating Normalized Maximum Likelihood for Continuous Probability Models
par: Suzuki, Atsushi, et autres
Publié: (2024)
par: Suzuki, Atsushi, et autres
Publié: (2024)
Towards Principled, Practical Policy Gradient for Bandits and Tabular MDPs
par: Lu, Michael, et autres
Publié: (2024)
par: Lu, Michael, et autres
Publié: (2024)
Regret Analysis of Unichain Average Reward Constrained MDPs with General Parameterization
par: Satheesh, Anirudh, et autres
Publié: (2026)
par: Satheesh, Anirudh, et autres
Publié: (2026)
Optimal Strong Regret and Violation in Constrained MDPs via Policy Optimization
par: Stradi, Francesco Emanuele, et autres
Publié: (2024)
par: Stradi, Francesco Emanuele, et autres
Publié: (2024)
Online-to-PAC Conversions: Generalization Bounds via Regret Analysis
par: Lugosi, Gábor, et autres
Publié: (2023)
par: Lugosi, Gábor, et autres
Publié: (2023)
Data-Dependent Regret Bounds for Constrained MABs
par: Genalti, Gianmarco, et autres
Publié: (2025)
par: Genalti, Gianmarco, et autres
Publié: (2025)
Documents similaires
-
Bandit and Delayed Feedback in Online Structured Prediction
par: Shibukawa, Yuki, et autres
Publié: (2025) -
Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs
par: Chen, Shulun, et autres
Publié: (2025) -
Reinforcement Learning from Adversarial Preferences in Tabular MDPs
par: Tsuchiya, Taira, et autres
Publié: (2025) -
Tight Regret Upper and Lower Bounds for Optimistic Hedge in Two-Player Zero-Sum Games
par: Tsuchiya, Taira
Publié: (2025) -
Online Inverse Linear Optimization: Efficient Logarithmic-Regret Algorithm, Robustness to Suboptimality, and Lower Bound
par: Sakaue, Shinsaku, et autres
Publié: (2025)