The Plug-in Approach for Average-Reward and Discounted MDPs: Optimal Sample Complexity Analysis
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zurek, Matthew, Chen, Yudong |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Span-Based Optimal Sample Complexity for Average Reward MDPs
par: Zurek, Matthew, et autres
Publié: (2023)
par: Zurek, Matthew, et autres
Publié: (2023)
Span-Based Optimal Sample Complexity for Weakly Communicating and General Average Reward MDPs
par: Zurek, Matthew, et autres
Publié: (2024)
par: Zurek, Matthew, et autres
Publié: (2024)
Span-Agnostic Optimal Sample Complexity and Oracle Inequalities for Average-Reward RL
par: Zurek, Matthew, et autres
Publié: (2025)
par: Zurek, Matthew, et autres
Publié: (2025)
Optimal Single-Policy Sample Complexity and Transient Coverage for Average-Reward Offline RL
par: Zurek, Matthew, et autres
Publié: (2025)
par: Zurek, Matthew, et autres
Publié: (2025)
Optimal Variance-Dependent Regret Bounds for Infinite-Horizon MDPs
par: Zamir, Guy, et autres
Publié: (2026)
par: Zamir, Guy, et autres
Publié: (2026)
Faster Fixed-Point Methods for Multichain MDPs
par: Zurek, Matthew, et autres
Publié: (2025)
par: Zurek, Matthew, et autres
Publié: (2025)
Gap-Free Clustering: Sensitivity and Robustness of SDP
par: Zurek, Matthew, et autres
Publié: (2023)
par: Zurek, Matthew, et autres
Publié: (2023)
Is Q-Learning Minimax Optimal? A Tight Sample Complexity Analysis
par: Li, Gen, et autres
Publié: (2021)
par: Li, Gen, et autres
Publié: (2021)
Achieving Tractable Minimax Optimal Regret in Average Reward MDPs
par: Boone, Victor, et autres
Publié: (2024)
par: Boone, Victor, et autres
Publié: (2024)
Non-Rectangular Average-Reward Robust MDPs: Optimal Policies and Their Transient Values
par: Wang, Shengbo, et autres
Publié: (2026)
par: Wang, Shengbo, et autres
Publié: (2026)
Optimal Sample Complexity for Average Reward Markov Decision Processes
par: Wang, Shengbo, et autres
Publié: (2023)
par: Wang, Shengbo, et autres
Publié: (2023)
Sample Complexity of Distributionally Robust Average-Reward Reinforcement Learning
par: Chen, Zijun, et autres
Publié: (2025)
par: Chen, Zijun, et autres
Publié: (2025)
Recursive Entropic Risk Optimization in Discounted MDPs: Sample Complexity Bounds with a Generative Model
par: Mortensen, Oliver, et autres
Publié: (2025)
par: Mortensen, Oliver, et autres
Publié: (2025)
Stochastic Zeroth-Order Optimization under Strongly Convexity and Lipschitz Hessian: Minimax Sample Complexity
par: Yu, Qian, et autres
Publié: (2024)
par: Yu, Qian, et autres
Publié: (2024)
Learning Infinite-Horizon Average-Reward Linear Mixture MDPs of Bounded Span
par: Chae, Woojin, et autres
Publié: (2024)
par: Chae, Woojin, et autres
Publié: (2024)
Geometry, Computation, and Optimality in Stochastic Optimization
par: Cheng, Chen, et autres
Publié: (2019)
par: Cheng, Chen, et autres
Publié: (2019)
Wasserstein Distributionally Robust Estimation in High Dimensions: Performance Analysis and Optimal Hyperparameter Tuning
par: Aolaritei, Liviu, et autres
Publié: (2022)
par: Aolaritei, Liviu, et autres
Publié: (2022)
Probabilistic Safety Guarantee for Stochastic Control Systems Using Average Reward MDPs
par: Omidi, Saber, et autres
Publié: (2025)
par: Omidi, Saber, et autres
Publié: (2025)
Soft Robust MDPs and Risk-Sensitive MDPs: Equivalence, Policy Gradient, and Sample Complexity
par: Zhang, Runyu, et autres
Publié: (2023)
par: Zhang, Runyu, et autres
Publié: (2023)
Optimal Horizon-Free Reward-Free Exploration for Linear Mixture MDPs
par: Zhang, Junkai, et autres
Publié: (2023)
par: Zhang, Junkai, et autres
Publié: (2023)
On the Robustness of Cross-Concentrated Sampling for Matrix Completion
par: Cai, HanQin, et autres
Publié: (2024)
par: Cai, HanQin, et autres
Publié: (2024)
Structured Sampling for Robust Euclidean Distance Geometry
par: Kundu, Chandra, et autres
Publié: (2024)
par: Kundu, Chandra, et autres
Publié: (2024)
Optimal transport natural gradient for statistical manifolds with continuous sample space
par: Chen, Yifan, et autres
Publié: (2018)
par: Chen, Yifan, et autres
Publié: (2018)
Finite-Time Minimax Bounds and an Optimal Lyapunov Policy in Queueing Control
par: Liu, Yujie, et autres
Publié: (2025)
par: Liu, Yujie, et autres
Publié: (2025)
Planning and Learning in Average Risk-aware MDPs
par: Wang, Weikai, et autres
Publié: (2025)
par: Wang, Weikai, et autres
Publié: (2025)
Breaking the Sample Size Barrier in Model-Based Reinforcement Learning with a Generative Model
par: Li, Gen, et autres
Publié: (2020)
par: Li, Gen, et autres
Publié: (2020)
On the Convergence Analysis of Muon
par: Shen, Wei, et autres
Publié: (2025)
par: Shen, Wei, et autres
Publié: (2025)
A Dual Basis Approach for Structured Robust Euclidean Distance Geometry
par: Kundu, Chandra, et autres
Publié: (2025)
par: Kundu, Chandra, et autres
Publié: (2025)
Group Projected Subspace Pursuit for Block Sparse Signal Reconstruction: Convergence Analysis and Applications
par: He, Roy Y., et autres
Publié: (2024)
par: He, Roy Y., et autres
Publié: (2024)
Second-Order Mirror Descent: Convergence in Games Beyond Averaging and Discounting
par: Gao, Bolin, et autres
Publié: (2021)
par: Gao, Bolin, et autres
Publié: (2021)
Fast Computation of Optimal Transport via Entropy-Regularized Extragradient Methods
par: Li, Gen, et autres
Publié: (2023)
par: Li, Gen, et autres
Publié: (2023)
Bellman Optimality of Average-Reward Robust Markov Decision Processes with a Constant Gain
par: Wang, Shengbo, et autres
Publié: (2025)
par: Wang, Shengbo, et autres
Publié: (2025)
Optimal Online Bookmaking for Binary Games
par: Bhatt, Alankrita, et autres
Publié: (2025)
par: Bhatt, Alankrita, et autres
Publié: (2025)
Variational Inference on the Boolean Hypercube with the Quantum Entropy
par: Beyler, Eliot, et autres
Publié: (2024)
par: Beyler, Eliot, et autres
Publié: (2024)
Convexity in Disguise: A Theoretical Framework for Nonconvex Low-Rank Matrix Estimation
par: Cui, Chengyu, et autres
Publié: (2026)
par: Cui, Chengyu, et autres
Publié: (2026)
Linear regression with overparameterized linear neural networks: Tight upper and lower bounds for implicit $\ell^1$-regularization
par: Matt, Hannes, et autres
Publié: (2025)
par: Matt, Hannes, et autres
Publié: (2025)
Recovering Simultaneously Structured Data via Non-Convex Iteratively Reweighted Least Squares
par: Kümmerle, Christian, et autres
Publié: (2023)
par: Kümmerle, Christian, et autres
Publié: (2023)
Generalized Orthogonal Procrustes Problem under Arbitrary Adversaries
par: Ling, Shuyang
Publié: (2021)
par: Ling, Shuyang
Publié: (2021)
A Neural Network Algorithm for KL Divergence Estimation with Quantitative Error Bounds
par: Foss, Mikil, et autres
Publié: (2025)
par: Foss, Mikil, et autres
Publié: (2025)
Stochastic Smoothed Gradient Descent Ascent for Federated Minimax Optimization
par: Shen, Wei, et autres
Publié: (2023)
par: Shen, Wei, et autres
Publié: (2023)
Documents similaires
-
Span-Based Optimal Sample Complexity for Average Reward MDPs
par: Zurek, Matthew, et autres
Publié: (2023) -
Span-Based Optimal Sample Complexity for Weakly Communicating and General Average Reward MDPs
par: Zurek, Matthew, et autres
Publié: (2024) -
Span-Agnostic Optimal Sample Complexity and Oracle Inequalities for Average-Reward RL
par: Zurek, Matthew, et autres
Publié: (2025) -
Optimal Single-Policy Sample Complexity and Transient Coverage for Average-Reward Offline RL
par: Zurek, Matthew, et autres
Publié: (2025) -
Optimal Variance-Dependent Regret Bounds for Infinite-Horizon MDPs
par: Zamir, Guy, et autres
Publié: (2026)