Learning General Parameterized Policies for Infinite Horizon Average Reward Constrained MDPs via Primal-Dual Policy Gradient Algorithm

Fuente: arXiv
Saved in:
Bibliographic Details
Main Authors: Bai, Qinbo, Mondal, Washim Uddin, Aggarwal, Vaneet
Format: Preprint
Published: 2024
Subjects:
Online Access:
Tags: Add Tag
No Tags, Be the first to tag this record!