On Value Iteration Convergence in Connected MDPs
Fuente:
arXiv
Salvato in:
| Autori principali: | Mustafin, Arsenii, Olshevsky, Alex, Paschalidis, Ioannis Ch. |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Analysis of Value Iteration Through Absolute Probability Sequences
di: Mustafin, Arsenii, et al.
Pubblicazione: (2025)
di: Mustafin, Arsenii, et al.
Pubblicazione: (2025)
Closing the gap between SVRG and TD-SVRG with Gradient Splitting
di: Mustafin, Arsenii, et al.
Pubblicazione: (2022)
di: Mustafin, Arsenii, et al.
Pubblicazione: (2022)
Geometric Re-Analysis of Classical MDP Solving Algorithms
di: Mustafin, Arsenii, et al.
Pubblicazione: (2025)
di: Mustafin, Arsenii, et al.
Pubblicazione: (2025)
MDP Geometry, Normalization and Reward Balancing Solvers
di: Mustafin, Arsenii, et al.
Pubblicazione: (2024)
di: Mustafin, Arsenii, et al.
Pubblicazione: (2024)
One-Shot Averaging for Distributed TD($λ$) Under Markov Sampling
di: Tian, Haoxing, et al.
Pubblicazione: (2024)
di: Tian, Haoxing, et al.
Pubblicazione: (2024)
Revisiting Value Iteration: Unified Analysis of Discounted and Average-Reward Cases
di: Mustafin, Arsenii, et al.
Pubblicazione: (2025)
di: Mustafin, Arsenii, et al.
Pubblicazione: (2025)
Bridging the Gap Between Average and Discounted TD Learning
di: Tian, Haoxing, et al.
Pubblicazione: (2026)
di: Tian, Haoxing, et al.
Pubblicazione: (2026)
Provably Efficient Off-Policy Adversarial Imitation Learning with Convergence Guarantees
di: Chen, Yilei, et al.
Pubblicazione: (2024)
di: Chen, Yilei, et al.
Pubblicazione: (2024)
Multiple-policy Evaluation via Density Estimation
di: Chen, Yilei, et al.
Pubblicazione: (2024)
di: Chen, Yilei, et al.
Pubblicazione: (2024)
Distributionally Robust Learning in Survival Analysis
di: Jin, Yeping, et al.
Pubblicazione: (2025)
di: Jin, Yeping, et al.
Pubblicazione: (2025)
Distributionally Robust Token Optimization in RLHF
di: Jin, Yeping, et al.
Pubblicazione: (2026)
di: Jin, Yeping, et al.
Pubblicazione: (2026)
Adversarial Imitation Learning from Visual Observations using Latent Information
di: Giammarino, Vittorio, et al.
Pubblicazione: (2023)
di: Giammarino, Vittorio, et al.
Pubblicazione: (2023)
Augmented Lagrangian Method for Last-Iterate Convergence for Constrained MDPs
di: Lu, Michael, et al.
Pubblicazione: (2026)
di: Lu, Michael, et al.
Pubblicazione: (2026)
Visually Robust Adversarial Imitation Learning from Videos with Contrastive Learning
di: Giammarino, Vittorio, et al.
Pubblicazione: (2024)
di: Giammarino, Vittorio, et al.
Pubblicazione: (2024)
DRO-Augment Framework: Robustness by Synergizing Wasserstein Distributionally Robust Optimization and Data Augmentation
di: Hu, Jiaming, et al.
Pubblicazione: (2025)
di: Hu, Jiaming, et al.
Pubblicazione: (2025)
Generalized Policy Improvement Algorithms with Theoretically Supported Sample Reuse
di: Queeney, James, et al.
Pubblicazione: (2022)
di: Queeney, James, et al.
Pubblicazione: (2022)
Improving Adaptive Online Learning Using Refined Discretization
di: Zhang, Zhiyu, et al.
Pubblicazione: (2023)
di: Zhang, Zhiyu, et al.
Pubblicazione: (2023)
Last-Iterate Convergence of General Parameterized Policies in Constrained MDPs
di: Mondal, Washim Uddin, et al.
Pubblicazione: (2024)
di: Mondal, Washim Uddin, et al.
Pubblicazione: (2024)
A Model-Based Approach for Improving Reinforcement Learning Efficiency Leveraging Expert Observations
di: Ozcan, Erhan Can, et al.
Pubblicazione: (2024)
di: Ozcan, Erhan Can, et al.
Pubblicazione: (2024)
Convex SGD: Generalization Without Early Stopping
di: Hendrickx, Julien, et al.
Pubblicazione: (2024)
di: Hendrickx, Julien, et al.
Pubblicazione: (2024)
Network Epidemic Control via Model Predictive Control: Extended Version
di: Talaei, Mahtab, et al.
Pubblicazione: (2026)
di: Talaei, Mahtab, et al.
Pubblicazione: (2026)
Smooth Ranking SVM via Cutting-Plane Method
di: Ozcan, Erhan Can, et al.
Pubblicazione: (2024)
di: Ozcan, Erhan Can, et al.
Pubblicazione: (2024)
Optimal Transport Perturbations for Safe Reinforcement Learning with Robustness Guarantees
di: Queeney, James, et al.
Pubblicazione: (2023)
di: Queeney, James, et al.
Pubblicazione: (2023)
Last-Iterate Convergent Policy Gradient Primal-Dual Methods for Constrained MDPs
di: Ding, Dongsheng, et al.
Pubblicazione: (2023)
di: Ding, Dongsheng, et al.
Pubblicazione: (2023)
Towards General Preference Alignment: Diffusion Models at Nash Equilibrium
di: Hu, Jiaming, et al.
Pubblicazione: (2026)
di: Hu, Jiaming, et al.
Pubblicazione: (2026)
Ergodicity in reinforcement learning
di: Baumann, Dominik, et al.
Pubblicazione: (2026)
di: Baumann, Dominik, et al.
Pubblicazione: (2026)
Policy Gradient in Robust MDPs with Global Convergence Guarantee
di: Wang, Qiuhao, et al.
Pubblicazione: (2022)
di: Wang, Qiuhao, et al.
Pubblicazione: (2022)
Reinforcement Learning for Exponential Utility: Algorithms and Convergence in Discounted MDPs
di: Thoppe, Gugan, et al.
Pubblicazione: (2026)
di: Thoppe, Gugan, et al.
Pubblicazione: (2026)
Network-Based Epidemic Control Through Optimal Travel and Quarantine Management
di: Talaei, Mahtab, et al.
Pubblicazione: (2024)
di: Talaei, Mahtab, et al.
Pubblicazione: (2024)
Data Deletion Can Help in Adaptive RL
di: Budhraja, Param, et al.
Pubblicazione: (2026)
di: Budhraja, Param, et al.
Pubblicazione: (2026)
Sample Complexity of the Linear Quadratic Regulator: A Reinforcement Learning Lens
di: Moghaddam, Amirreza Neshaei, et al.
Pubblicazione: (2024)
di: Moghaddam, Amirreza Neshaei, et al.
Pubblicazione: (2024)
Sample Complexity of Linear Quadratic Regulator Without Initial Stability
di: Moghaddam, Amirreza Neshaei, et al.
Pubblicazione: (2025)
di: Moghaddam, Amirreza Neshaei, et al.
Pubblicazione: (2025)
Q-learning for Quantile MDPs: A Decomposition, Performance, and Convergence Analysis
di: Hau, Jia Lin, et al.
Pubblicazione: (2024)
di: Hau, Jia Lin, et al.
Pubblicazione: (2024)
On the Convergence of Monte Carlo UCB for Random-Length Episodic MDPs
di: Dong, Zixuan, et al.
Pubblicazione: (2022)
di: Dong, Zixuan, et al.
Pubblicazione: (2022)
Convergence of Natural Policy Gradient for a Family of Infinite-State Queueing MDPs
di: Grosof, Isaac, et al.
Pubblicazione: (2024)
di: Grosof, Isaac, et al.
Pubblicazione: (2024)
Last-Iterate Convergence: Zero-Sum Games and Constrained Min-Max Optimization
di: Daskalakis, Constantinos, et al.
Pubblicazione: (2018)
di: Daskalakis, Constantinos, et al.
Pubblicazione: (2018)
Global Convergence of Average Reward Constrained MDPs with Neural Critic and General Policy Parameterization
di: Satheesh, Anirudh, et al.
Pubblicazione: (2026)
di: Satheesh, Anirudh, et al.
Pubblicazione: (2026)
Addressing Finite-Horizon MDPs via Low-Rank Tensor Value Approximation
di: Rozada, Sergio, et al.
Pubblicazione: (2025)
di: Rozada, Sergio, et al.
Pubblicazione: (2025)
Bad Values but Good Behavior: Learning Highly Misspecified Bandits and MDPs
di: Banerjee, Debangshu, et al.
Pubblicazione: (2023)
di: Banerjee, Debangshu, et al.
Pubblicazione: (2023)
Iterate to Accelerate: A Unified Framework for Iterative Reasoning and Feedback Convergence
di: Fein-Ashley, Jacob
Pubblicazione: (2025)
di: Fein-Ashley, Jacob
Pubblicazione: (2025)
Documenti analoghi
-
Analysis of Value Iteration Through Absolute Probability Sequences
di: Mustafin, Arsenii, et al.
Pubblicazione: (2025) -
Closing the gap between SVRG and TD-SVRG with Gradient Splitting
di: Mustafin, Arsenii, et al.
Pubblicazione: (2022) -
Geometric Re-Analysis of Classical MDP Solving Algorithms
di: Mustafin, Arsenii, et al.
Pubblicazione: (2025) -
MDP Geometry, Normalization and Reward Balancing Solvers
di: Mustafin, Arsenii, et al.
Pubblicazione: (2024) -
One-Shot Averaging for Distributed TD($λ$) Under Markov Sampling
di: Tian, Haoxing, et al.
Pubblicazione: (2024)