Near-Constant Strong Violation and Last-Iterate Convergence for Online CMDPs via Decaying Safety Margins
Fuente:
arXiv
Salvato in:
| Autori principali: | Zuo, Qian, Wang, Zhiyong, He, Fengxiang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Ensuring Safety in an Uncertain Environment: Constrained MDPs via Stochastic Thresholds
di: Zuo, Qian, et al.
Pubblicazione: (2025)
di: Zuo, Qian, et al.
Pubblicazione: (2025)
Beyond Slater's Condition in Online CMDPs with Stochastic and Adversarial Constraints
di: Stradi, Francesco Emanuele, et al.
Pubblicazione: (2025)
di: Stradi, Francesco Emanuele, et al.
Pubblicazione: (2025)
Model-Free, Regret-Optimal Best Policy Identification in Online CMDPs
di: Zhou, Zihan, et al.
Pubblicazione: (2023)
di: Zhou, Zihan, et al.
Pubblicazione: (2023)
Near-Optimal Last-Iterate Convergence for Zero-Sum Games with Bandit Feedback and Opponent Actions
di: Hait, Soumita, et al.
Pubblicazione: (2026)
di: Hait, Soumita, et al.
Pubblicazione: (2026)
Learning Weakly Communicating Average-Reward CMDPs: Strong Duality and Improved Regret
di: Yu, Kihyun, et al.
Pubblicazione: (2026)
di: Yu, Kihyun, et al.
Pubblicazione: (2026)
On the Last-Iterate Convergence of Shuffling Gradient Methods
di: Liu, Zijian, et al.
Pubblicazione: (2024)
di: Liu, Zijian, et al.
Pubblicazione: (2024)
Near-Optimal Primal-Dual Algorithm for Learning Linear Mixture CMDPs with Adversarial Rewards
di: Yu, Kihyun, et al.
Pubblicazione: (2026)
di: Yu, Kihyun, et al.
Pubblicazione: (2026)
Augmented Lagrangian Method for Last-Iterate Convergence for Constrained MDPs
di: Lu, Michael, et al.
Pubblicazione: (2026)
di: Lu, Michael, et al.
Pubblicazione: (2026)
Convergence Rate of the Last Iterate of Stochastic Proximal Algorithms
di: Vaidyan, Kevin Kurian Thomas, et al.
Pubblicazione: (2026)
di: Vaidyan, Kevin Kurian Thomas, et al.
Pubblicazione: (2026)
Revisiting the Last-Iterate Convergence of Stochastic Gradient Methods
di: Liu, Zijian, et al.
Pubblicazione: (2023)
di: Liu, Zijian, et al.
Pubblicazione: (2023)
Efficient Last-Iterate Convergence in Regret Minimization via Adaptive Reward Transformation
di: Ren, Hang, et al.
Pubblicazione: (2025)
di: Ren, Hang, et al.
Pubblicazione: (2025)
Last-Iterate Global Convergence of Policy Gradients for Constrained Reinforcement Learning
di: Montenegro, Alessandro, et al.
Pubblicazione: (2024)
di: Montenegro, Alessandro, et al.
Pubblicazione: (2024)
Last-Iterate Convergence of General Parameterized Policies in Constrained MDPs
di: Mondal, Washim Uddin, et al.
Pubblicazione: (2024)
di: Mondal, Washim Uddin, et al.
Pubblicazione: (2024)
Fast Last-Iterate Convergence of SGD in the Smooth Interpolation Regime
di: Attia, Amit, et al.
Pubblicazione: (2025)
di: Attia, Amit, et al.
Pubblicazione: (2025)
Last Iterate Convergence of Incremental Methods and Applications in Continual Learning
di: Cai, Xufeng, et al.
Pubblicazione: (2024)
di: Cai, Xufeng, et al.
Pubblicazione: (2024)
Primal-Dual Policy Optimization for Linear CMDPs with Adversarial Losses
di: Yu, Kihyun, et al.
Pubblicazione: (2026)
di: Yu, Kihyun, et al.
Pubblicazione: (2026)
Best-of-Both-Worlds Policy Optimization for CMDPs with Bandit Feedback
di: Stradi, Francesco Emanuele, et al.
Pubblicazione: (2024)
di: Stradi, Francesco Emanuele, et al.
Pubblicazione: (2024)
On Separation Between Best-Iterate, Random-Iterate, and Last-Iterate Convergence of Learning in Games
di: Cai, Yang, et al.
Pubblicazione: (2025)
di: Cai, Yang, et al.
Pubblicazione: (2025)
Rationality Measurement and Theory for Reinforcement Learning Agents
di: Qian, Kejiang, et al.
Pubblicazione: (2026)
di: Qian, Kejiang, et al.
Pubblicazione: (2026)
Last-Iterate Convergence Properties of Regret-Matching Algorithms in Games
di: Cai, Yang, et al.
Pubblicazione: (2023)
di: Cai, Yang, et al.
Pubblicazione: (2023)
Last-Iterate Convergence of No-Regret Learning for Equilibria in Bargaining Games
di: Kamp, Serafina, et al.
Pubblicazione: (2025)
di: Kamp, Serafina, et al.
Pubblicazione: (2025)
XAI for In-hospital Mortality Prediction via Multimodal ICU Data
di: Li, Xingqiao, et al.
Pubblicazione: (2023)
di: Li, Xingqiao, et al.
Pubblicazione: (2023)
Provable Last-Iterate Convergence for Multi-Objective Safe LLM Alignment via Optimistic Primal-Dual
di: Li, Yining, et al.
Pubblicazione: (2026)
di: Li, Yining, et al.
Pubblicazione: (2026)
Improved Last-Iterate Convergence of Shuffling Gradient Methods for Nonsmooth Convex Optimization
di: Liu, Zijian, et al.
Pubblicazione: (2025)
di: Liu, Zijian, et al.
Pubblicazione: (2025)
The Harder Path: Last Iterate Convergence for Uncoupled Learning in Zero-Sum Games with Bandit Feedback
di: Fiegel, Côme, et al.
Pubblicazione: (2026)
di: Fiegel, Côme, et al.
Pubblicazione: (2026)
Last-Iterate Convergence of Randomized Kaczmarz and SGD with Greedy Step Size
di: Dereziński, Michał, et al.
Pubblicazione: (2026)
di: Dereziński, Michał, et al.
Pubblicazione: (2026)
From Average-Iterate to Last-Iterate Convergence in Games: A Reduction and Its Applications
di: Cai, Yang, et al.
Pubblicazione: (2025)
di: Cai, Yang, et al.
Pubblicazione: (2025)
Iteration and Stochastic First-order Oracle Complexities of Stochastic Gradient Descent using Constant and Decaying Learning Rates
di: Imaizumi, Kento, et al.
Pubblicazione: (2024)
di: Imaizumi, Kento, et al.
Pubblicazione: (2024)
Extragradient Preference Optimization (EGPO): Beyond Last-Iterate Convergence for Nash Learning from Human Feedback
di: Zhou, Runlong, et al.
Pubblicazione: (2025)
di: Zhou, Runlong, et al.
Pubblicazione: (2025)
Learning Zero-Sum Linear Quadratic Games with Improved Sample Complexity and Last-Iterate Convergence
di: Wu, Jiduan, et al.
Pubblicazione: (2023)
di: Wu, Jiduan, et al.
Pubblicazione: (2023)
Last-Iterate Convergent Policy Gradient Primal-Dual Methods for Constrained MDPs
di: Ding, Dongsheng, et al.
Pubblicazione: (2023)
di: Ding, Dongsheng, et al.
Pubblicazione: (2023)
Fast Last-Iterate Convergence of Learning in Games Requires Forgetful Algorithms
di: Cai, Yang, et al.
Pubblicazione: (2024)
di: Cai, Yang, et al.
Pubblicazione: (2024)
Last-Iterate Convergence of Adaptive Riemannian Gradient Descent for Equilibrium Computation
di: Cai, Yang, et al.
Pubblicazione: (2023)
di: Cai, Yang, et al.
Pubblicazione: (2023)
Uniform Last-Iterate Guarantee for Bandits and Reinforcement Learning
di: Liu, Junyan, et al.
Pubblicazione: (2024)
di: Liu, Junyan, et al.
Pubblicazione: (2024)
Last-Iterate Convergence of Payoff-Based Independent Learning in Zero-Sum Stochastic Games
di: Chen, Zaiwei, et al.
Pubblicazione: (2024)
di: Chen, Zaiwei, et al.
Pubblicazione: (2024)
Optimal Strong Regret and Violation in Constrained MDPs via Policy Optimization
di: Stradi, Francesco Emanuele, et al.
Pubblicazione: (2024)
di: Stradi, Francesco Emanuele, et al.
Pubblicazione: (2024)
Structure-Dependent Regret and Constraint Violation Bounds for Online Convex Optimization with Time-Varying Constraints
di: Liu, Xiufeng, et al.
Pubblicazione: (2026)
di: Liu, Xiufeng, et al.
Pubblicazione: (2026)
Closing the Gap: Achieving Global Convergence (Last Iterate) of Actor-Critic under Markovian Sampling with Neural Network Parametrization
di: Gaur, Mudit, et al.
Pubblicazione: (2024)
di: Gaur, Mudit, et al.
Pubblicazione: (2024)
Last-Iterate Convergence: Zero-Sum Games and Constrained Min-Max Optimization
di: Daskalakis, Constantinos, et al.
Pubblicazione: (2018)
di: Daskalakis, Constantinos, et al.
Pubblicazione: (2018)
Safety in the Face of Adversity: Achieving Zero Constraint Violation in Online Learning with Slowly Changing Constraints
di: Hamoud, Bassel, et al.
Pubblicazione: (2025)
di: Hamoud, Bassel, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Ensuring Safety in an Uncertain Environment: Constrained MDPs via Stochastic Thresholds
di: Zuo, Qian, et al.
Pubblicazione: (2025) -
Beyond Slater's Condition in Online CMDPs with Stochastic and Adversarial Constraints
di: Stradi, Francesco Emanuele, et al.
Pubblicazione: (2025) -
Model-Free, Regret-Optimal Best Policy Identification in Online CMDPs
di: Zhou, Zihan, et al.
Pubblicazione: (2023) -
Near-Optimal Last-Iterate Convergence for Zero-Sum Games with Bandit Feedback and Opponent Actions
di: Hait, Soumita, et al.
Pubblicazione: (2026) -
Learning Weakly Communicating Average-Reward CMDPs: Strong Duality and Improved Regret
di: Yu, Kihyun, et al.
Pubblicazione: (2026)