Learning Weakly Communicating Average-Reward CMDPs: Strong Duality and Improved Regret
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yu, Kihyun, Baek, Beomhan, Lee, Dabeen |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Near-Optimal Primal-Dual Algorithm for Learning Linear Mixture CMDPs with Adversarial Rewards
par: Yu, Kihyun, et autres
Publié: (2026)
par: Yu, Kihyun, et autres
Publié: (2026)
Improved Regret Bound for Safe Reinforcement Learning via Tighter Cost Pessimism and Reward Optimism
par: Yu, Kihyun, et autres
Publié: (2024)
par: Yu, Kihyun, et autres
Publié: (2024)
Provably Efficient Infinite-Horizon Average-Reward Reinforcement Learning with Linear Function Approximation
par: Chae, Woojin, et autres
Publié: (2024)
par: Chae, Woojin, et autres
Publié: (2024)
Learning Infinite-Horizon Average-Reward Linear Mixture MDPs of Bounded Span
par: Chae, Woojin, et autres
Publié: (2024)
par: Chae, Woojin, et autres
Publié: (2024)
On Convergence of Average-Reward Q-Learning in Weakly Communicating Markov Decision Processes
par: Wan, Yi, et autres
Publié: (2024)
par: Wan, Yi, et autres
Publié: (2024)
Implicit Bias of Per-sample Adam on Separable Data: Departure from the Full-batch Regime
par: Baek, Beomhan, et autres
Publié: (2025)
par: Baek, Beomhan, et autres
Publié: (2025)
Primal-Dual Policy Optimization for Linear CMDPs with Adversarial Losses
par: Yu, Kihyun, et autres
Publié: (2026)
par: Yu, Kihyun, et autres
Publié: (2026)
Parameter-Free Algorithms for Performative Regret Minimization under Decision-Dependent Distributions
par: Park, Sungwoo, et autres
Publié: (2024)
par: Park, Sungwoo, et autres
Publié: (2024)
Achieving Tractable Minimax Optimal Regret in Average Reward MDPs
par: Boone, Victor, et autres
Publié: (2024)
par: Boone, Victor, et autres
Publié: (2024)
Through the River: Understanding the Benefit of Schedule-Free Methods for Language Model Training
par: Song, Minhak, et autres
Publié: (2025)
par: Song, Minhak, et autres
Publié: (2025)
Stochastic-Constrained Stochastic Optimization with Markovian Data
par: Kim, Yeongjong, et autres
Publié: (2023)
par: Kim, Yeongjong, et autres
Publié: (2023)
Infinite-Horizon Reinforcement Learning with Multinomial Logistic Function Approximation
par: Park, Jaehyun, et autres
Publié: (2024)
par: Park, Jaehyun, et autres
Publié: (2024)
Span-Based Optimal Sample Complexity for Weakly Communicating and General Average Reward MDPs
par: Zurek, Matthew, et autres
Publié: (2024)
par: Zurek, Matthew, et autres
Publié: (2024)
Chebyshev Center-Based Direction Selection for Multi-Objective Optimization and Training PINNs
par: Yoon, Hoyeol, et autres
Publié: (2026)
par: Yoon, Hoyeol, et autres
Publié: (2026)
Sample Complexity of Distributionally Robust Average-Reward Reinforcement Learning
par: Chen, Zijun, et autres
Publié: (2025)
par: Chen, Zijun, et autres
Publié: (2025)
Quotient-Categorical Representations for Bellman-Compatible Average-Reward Distributional Reinforcement Learning
par: Kaya, Ege C., et autres
Publié: (2026)
par: Kaya, Ege C., et autres
Publié: (2026)
Optimal Sample Complexity for Average Reward Markov Decision Processes
par: Wang, Shengbo, et autres
Publié: (2023)
par: Wang, Shengbo, et autres
Publié: (2023)
Non-Rectangular Average-Reward Robust MDPs: Optimal Policies and Their Transient Values
par: Wang, Shengbo, et autres
Publié: (2026)
par: Wang, Shengbo, et autres
Publié: (2026)
Bellman Optimality of Average-Reward Robust Markov Decision Processes with a Constant Gain
par: Wang, Shengbo, et autres
Publié: (2025)
par: Wang, Shengbo, et autres
Publié: (2025)
Tail Distribution of Regret in Optimistic Reinforcement Learning
par: Khodadadian, Sajad, et autres
Publié: (2025)
par: Khodadadian, Sajad, et autres
Publié: (2025)
Reinforcement Learning and Regret Bounds for Admission Control
par: Weber, Lucas, et autres
Publié: (2024)
par: Weber, Lucas, et autres
Publié: (2024)
Learning Decentralized Linear Quadratic Regulators with $\sqrt{T}$ Regret
par: Ye, Lintao, et autres
Publié: (2022)
par: Ye, Lintao, et autres
Publié: (2022)
Probabilistic Safety Guarantee for Stochastic Control Systems Using Average Reward MDPs
par: Omidi, Saber, et autres
Publié: (2025)
par: Omidi, Saber, et autres
Publié: (2025)
Regret Lower Bounds for Learning Linear Quadratic Gaussian Systems
par: Ziemann, Ingvar, et autres
Publié: (2022)
par: Ziemann, Ingvar, et autres
Publié: (2022)
Adaptivity and Universality: Problem-dependent Universal Regret for Online Convex Optimization
par: Zhao, Peng, et autres
Publié: (2025)
par: Zhao, Peng, et autres
Publié: (2025)
Span-Based Optimal Sample Complexity for Average Reward MDPs
par: Zurek, Matthew, et autres
Publié: (2023)
par: Zurek, Matthew, et autres
Publié: (2023)
Robust Regression over Averaged Uncertainty
par: Bertsimas, Dimitris, et autres
Publié: (2023)
par: Bertsimas, Dimitris, et autres
Publié: (2023)
Regret of exploratory policy improvement and $q$-learning
par: Tang, Wenpin, et autres
Publié: (2024)
par: Tang, Wenpin, et autres
Publié: (2024)
Planning and Learning in Average Risk-aware MDPs
par: Wang, Weikai, et autres
Publié: (2025)
par: Wang, Weikai, et autres
Publié: (2025)
Wasserstein Distributionally Robust Regret Optimization
par: Fiechtner, Lukas-Benedikt, et autres
Publié: (2025)
par: Fiechtner, Lukas-Benedikt, et autres
Publié: (2025)
Rethinking PCA Through Duality
par: Quan, Jan, et autres
Publié: (2025)
par: Quan, Jan, et autres
Publié: (2025)
Regret Analysis: a control perspective
par: Gibson, Travis E., et autres
Publié: (2025)
par: Gibson, Travis E., et autres
Publié: (2025)
Doubly Optimal No-Regret Online Learning in Strongly Monotone Games with Bandit Feedback
par: Ba, Wenjia, et autres
Publié: (2021)
par: Ba, Wenjia, et autres
Publié: (2021)
Rate-Optimal Regret for the Safe Learning-based Control of the Constrained Linear Quadratic Regulator
par: Hutchinson, Spencer, et autres
Publié: (2026)
par: Hutchinson, Spencer, et autres
Publié: (2026)
Lagrangian Index Policy for Restless Bandits with Average Reward
par: Avrachenkov, Konstantin, et autres
Publié: (2024)
par: Avrachenkov, Konstantin, et autres
Publié: (2024)
Central Limit Theorems for Asynchronous Averaged Q-Learning
par: Liu, Xingtu
Publié: (2025)
par: Liu, Xingtu
Publié: (2025)
Double Duality: Variational Primal-Dual Policy Optimization for Constrained Reinforcement Learning
par: Li, Zihao, et autres
Publié: (2024)
par: Li, Zihao, et autres
Publié: (2024)
An Equivalence Between Static and Dynamic Regret Minimization
par: Jacobsen, Andrew, et autres
Publié: (2024)
par: Jacobsen, Andrew, et autres
Publié: (2024)
Federated ADMM from Bayesian Duality
par: Möllenhoff, Thomas, et autres
Publié: (2025)
par: Möllenhoff, Thomas, et autres
Publié: (2025)
The Plug-in Approach for Average-Reward and Discounted MDPs: Optimal Sample Complexity Analysis
par: Zurek, Matthew, et autres
Publié: (2024)
par: Zurek, Matthew, et autres
Publié: (2024)
Documents similaires
-
Near-Optimal Primal-Dual Algorithm for Learning Linear Mixture CMDPs with Adversarial Rewards
par: Yu, Kihyun, et autres
Publié: (2026) -
Improved Regret Bound for Safe Reinforcement Learning via Tighter Cost Pessimism and Reward Optimism
par: Yu, Kihyun, et autres
Publié: (2024) -
Provably Efficient Infinite-Horizon Average-Reward Reinforcement Learning with Linear Function Approximation
par: Chae, Woojin, et autres
Publié: (2024) -
Learning Infinite-Horizon Average-Reward Linear Mixture MDPs of Bounded Span
par: Chae, Woojin, et autres
Publié: (2024) -
On Convergence of Average-Reward Q-Learning in Weakly Communicating Markov Decision Processes
par: Wan, Yi, et autres
Publié: (2024)