Non-Rectangular Average-Reward Robust MDPs: Optimal Policies and Their Transient Values
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Shengbo, Si, Nian |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Bellman Optimality of Average-Reward Robust Markov Decision Processes with a Constant Gain
par: Wang, Shengbo, et autres
Publié: (2025)
par: Wang, Shengbo, et autres
Publié: (2025)
Sample Complexity of Distributionally Robust Average-Reward Reinforcement Learning
par: Chen, Zijun, et autres
Publié: (2025)
par: Chen, Zijun, et autres
Publié: (2025)
Optimal Sample Complexity for Average Reward Markov Decision Processes
par: Wang, Shengbo, et autres
Publié: (2023)
par: Wang, Shengbo, et autres
Publié: (2023)
Achieving Tractable Minimax Optimal Regret in Average Reward MDPs
par: Boone, Victor, et autres
Publié: (2024)
par: Boone, Victor, et autres
Publié: (2024)
On the Foundation of Distributionally Robust Reinforcement Learning
par: Wang, Shengbo, et autres
Publié: (2023)
par: Wang, Shengbo, et autres
Publié: (2023)
Sample Complexity of Variance-reduced Distributionally Robust Q-learning
par: Wang, Shengbo, et autres
Publié: (2023)
par: Wang, Shengbo, et autres
Publié: (2023)
Span-Based Optimal Sample Complexity for Average Reward MDPs
par: Zurek, Matthew, et autres
Publié: (2023)
par: Zurek, Matthew, et autres
Publié: (2023)
Policy Gradient Algorithms for Robust MDPs with Non-Rectangular Uncertainty Sets
par: Li, Mengmeng, et autres
Publié: (2023)
par: Li, Mengmeng, et autres
Publié: (2023)
The Plug-in Approach for Average-Reward and Discounted MDPs: Optimal Sample Complexity Analysis
par: Zurek, Matthew, et autres
Publié: (2024)
par: Zurek, Matthew, et autres
Publié: (2024)
Optimal Single-Policy Sample Complexity and Transient Coverage for Average-Reward Offline RL
par: Zurek, Matthew, et autres
Publié: (2025)
par: Zurek, Matthew, et autres
Publié: (2025)
Span-Based Optimal Sample Complexity for Weakly Communicating and General Average Reward MDPs
par: Zurek, Matthew, et autres
Publié: (2024)
par: Zurek, Matthew, et autres
Publié: (2024)
Learning Infinite-Horizon Average-Reward Linear Mixture MDPs of Bounded Span
par: Chae, Woojin, et autres
Publié: (2024)
par: Chae, Woojin, et autres
Publié: (2024)
Planning and Learning in Average Risk-aware MDPs
par: Wang, Weikai, et autres
Publié: (2025)
par: Wang, Weikai, et autres
Publié: (2025)
Probabilistic Safety Guarantee for Stochastic Control Systems Using Average Reward MDPs
par: Omidi, Saber, et autres
Publié: (2025)
par: Omidi, Saber, et autres
Publié: (2025)
Optimal Horizon-Free Reward-Free Exploration for Linear Mixture MDPs
par: Zhang, Junkai, et autres
Publié: (2023)
par: Zhang, Junkai, et autres
Publié: (2023)
Soft Robust MDPs and Risk-Sensitive MDPs: Equivalence, Policy Gradient, and Sample Complexity
par: Zhang, Runyu, et autres
Publié: (2023)
par: Zhang, Runyu, et autres
Publié: (2023)
Central Limit Theorem for Two-Time-Scale Approximate Distributionally Robust RL
par: Wang, Shengbo, et autres
Publié: (2026)
par: Wang, Shengbo, et autres
Publié: (2026)
Efficient Duple Perturbation Robustness in Low-rank MDPs
par: Hu, Yang, et autres
Publié: (2024)
par: Hu, Yang, et autres
Publié: (2024)
Q-Measure-Learning for Continuous State RL: Efficient Implementation and Convergence
par: Wang, Shengbo
Publié: (2026)
par: Wang, Shengbo
Publié: (2026)
Tractable Robust Markov Decision Processes
par: Grand-Clément, Julien, et autres
Publié: (2024)
par: Grand-Clément, Julien, et autres
Publié: (2024)
Policy Gradient Algorithms in Average-Reward Multichain MDPs
par: Lee, Jongmin, et autres
Publié: (2026)
par: Lee, Jongmin, et autres
Publié: (2026)
Efficient Algorithms for Robust Markov Decision Processes with $s$-Rectangular Ambiguity Sets
par: Ho, Chin Pang, et autres
Publié: (2026)
par: Ho, Chin Pang, et autres
Publié: (2026)
Landscape of Policy Optimization for Finite Horizon MDPs with General State and Action
par: Chen, Xin, et autres
Publié: (2024)
par: Chen, Xin, et autres
Publié: (2024)
Lagrangian Index Policy for Restless Bandits with Average Reward
par: Avrachenkov, Konstantin, et autres
Publié: (2024)
par: Avrachenkov, Konstantin, et autres
Publié: (2024)
Epsilon-Optimal Policies for Average-Cost Separable MDPs with Perturbations
par: Kantawala, Dhairya
Publié: (2025)
par: Kantawala, Dhairya
Publié: (2025)
Last-Iterate Convergent Policy Gradient Primal-Dual Methods for Constrained MDPs
par: Ding, Dongsheng, et autres
Publié: (2023)
par: Ding, Dongsheng, et autres
Publié: (2023)
Constrained Average-Reward Intermittently Observable MDPs
par: Avrachenkov, Konstantin, et autres
Publié: (2025)
par: Avrachenkov, Konstantin, et autres
Publié: (2025)
Span-Agnostic Optimal Sample Complexity and Oracle Inequalities for Average-Reward RL
par: Zurek, Matthew, et autres
Publié: (2025)
par: Zurek, Matthew, et autres
Publié: (2025)
Robust Regression over Averaged Uncertainty
par: Bertsimas, Dimitris, et autres
Publié: (2023)
par: Bertsimas, Dimitris, et autres
Publié: (2023)
Learning Weakly Communicating Average-Reward CMDPs: Strong Duality and Improved Regret
par: Yu, Kihyun, et autres
Publié: (2026)
par: Yu, Kihyun, et autres
Publié: (2026)
Quotient-Categorical Representations for Bellman-Compatible Average-Reward Distributional Reinforcement Learning
par: Kaya, Ege C., et autres
Publié: (2026)
par: Kaya, Ege C., et autres
Publié: (2026)
On Convergence of Average-Reward Q-Learning in Weakly Communicating Markov Decision Processes
par: Wan, Yi, et autres
Publié: (2024)
par: Wan, Yi, et autres
Publié: (2024)
Learning Sequential Decisions from Multiple Sources via Group-Robust Markov Decision Processes
par: Xu, Mingyuan, et autres
Publié: (2026)
par: Xu, Mingyuan, et autres
Publié: (2026)
Optimal Variance-Dependent Regret Bounds for Infinite-Horizon MDPs
par: Zamir, Guy, et autres
Publié: (2026)
par: Zamir, Guy, et autres
Publié: (2026)
Regularized Q-learning through Robust Averaging
par: Schmitt-Förster, Peter, et autres
Publié: (2024)
par: Schmitt-Förster, Peter, et autres
Publié: (2024)
Faster Fixed-Point Methods for Multichain MDPs
par: Zurek, Matthew, et autres
Publié: (2025)
par: Zurek, Matthew, et autres
Publié: (2025)
Optimal Parameter Adaptation for Safety-Critical Control via Safe Barrier Bayesian Optimization
par: Wang, Shengbo, et autres
Publié: (2025)
par: Wang, Shengbo, et autres
Publié: (2025)
Offline-Online Reinforcement Learning for Linear Mixture MDPs
par: Zhang, Zhongjun, et autres
Publié: (2026)
par: Zhang, Zhongjun, et autres
Publié: (2026)
Joint MDPs and Reinforcement Learning in Coupled-Dynamics Environments
par: Kaya, Ege C., et autres
Publié: (2026)
par: Kaya, Ege C., et autres
Publié: (2026)
Efficient Model-Free Exploration in Low-Rank MDPs
par: Mhammedi, Zakaria, et autres
Publié: (2023)
par: Mhammedi, Zakaria, et autres
Publié: (2023)
Documents similaires
-
Bellman Optimality of Average-Reward Robust Markov Decision Processes with a Constant Gain
par: Wang, Shengbo, et autres
Publié: (2025) -
Sample Complexity of Distributionally Robust Average-Reward Reinforcement Learning
par: Chen, Zijun, et autres
Publié: (2025) -
Optimal Sample Complexity for Average Reward Markov Decision Processes
par: Wang, Shengbo, et autres
Publié: (2023) -
Achieving Tractable Minimax Optimal Regret in Average Reward MDPs
par: Boone, Victor, et autres
Publié: (2024) -
On the Foundation of Distributionally Robust Reinforcement Learning
par: Wang, Shengbo, et autres
Publié: (2023)