An Actor-Critic Algorithm with Function Approximation for Risk Sensitive Cost Markov Decision Processes
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Guin, Soumyajit, Borkar, Vivek S., Bhatnagar, Shalabh |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Actor-Critic or Critic-Actor? A Tale of Two Time Scales
par: Bhatnagar, Shalabh, et autres
Publié: (2022)
par: Bhatnagar, Shalabh, et autres
Publié: (2022)
A policy gradient approach for Finite Horizon Constrained Markov Decision Processes
par: Guin, Soumyajit, et autres
Publié: (2022)
par: Guin, Soumyajit, et autres
Publié: (2022)
Convergent Reinforcement Learning Algorithms for Stochastic Shortest Path Problem
par: Guin, Soumyajit, et autres
Publié: (2025)
par: Guin, Soumyajit, et autres
Publié: (2025)
Two-Timescale Critic-Actor for Average Reward MDPs with Function Approximation
par: Panda, Prashansa, et autres
Publié: (2024)
par: Panda, Prashansa, et autres
Publié: (2024)
Finite-Time Analysis of Three-Timescale Constrained Actor-Critic and Constrained Natural Actor-Critic Algorithms
par: Panda, Prashansa, et autres
Publié: (2023)
par: Panda, Prashansa, et autres
Publié: (2023)
Finite Time Analysis of Constrained Natural Critic-Actor Algorithm with Improved Sample Complexity
par: Panda, Prashansa, et autres
Publié: (2025)
par: Panda, Prashansa, et autres
Publié: (2025)
Approximate Linear Programming for Decentralized Policy Iteration in Cooperative Multi-agent Markov Decision Processes
par: Mandal, Lakshmi, et autres
Publié: (2023)
par: Mandal, Lakshmi, et autres
Publié: (2023)
Enabling Off-Policy Imitation Learning with Deep Actor Critic Stabilization
par: Sen, Sayambhu, et autres
Publié: (2025)
par: Sen, Sayambhu, et autres
Publié: (2025)
Finite-time analysis of Multi-timescale Stochastic Optimization Algorithms
par: Kartikey, Kaustubh, et autres
Publié: (2026)
par: Kartikey, Kaustubh, et autres
Publié: (2026)
A Concentration Bound for TD(0) with Function Approximation
par: Chandak, Siddharth, et autres
Publié: (2023)
par: Chandak, Siddharth, et autres
Publié: (2023)
Optimistic Actor-Critic with Parametric Policies for Linear Markov Decision Processes
par: Lin, Max Qiushi, et autres
Publié: (2026)
par: Lin, Max Qiushi, et autres
Publié: (2026)
n-Step Temporal Difference Learning with Optimal n
par: Mandal, Lakshmi, et autres
Publié: (2023)
par: Mandal, Lakshmi, et autres
Publié: (2023)
Risk-Sensitive Exponential Actor Critic
par: Granados, Alonso, et autres
Publié: (2026)
par: Granados, Alonso, et autres
Publié: (2026)
Finite-Time Complexity of Online Primal-Dual Natural Actor-Critic Algorithm for Constrained Markov Decision Processes
par: Zeng, Sihan, et autres
Publié: (2021)
par: Zeng, Sihan, et autres
Publié: (2021)
Compatible Gradient Approximations for Actor-Critic Algorithms
par: Saglam, Baturay, et autres
Publié: (2024)
par: Saglam, Baturay, et autres
Publié: (2024)
Convergence of Multiagent Learning Systems for Traffic control
par: Sen, Sayambhu, et autres
Publié: (2025)
par: Sen, Sayambhu, et autres
Publié: (2025)
Regret and Sample Complexity of Online Q-Learning via Concentration of Stochastic Approximation with Time-Inhomogeneous Markov Chains
par: Singh, Rahul, et autres
Publié: (2026)
par: Singh, Rahul, et autres
Publié: (2026)
On the Convergence of Modified Policy Iteration in Risk Sensitive Exponential Cost Markov Decision Processes
par: Murthy, Yashaswini, et autres
Publié: (2023)
par: Murthy, Yashaswini, et autres
Publié: (2023)
Generalized Random Direction Newton Algorithms for Stochastic Optimization
par: Pachal, Soumen, et autres
Publié: (2026)
par: Pachal, Soumen, et autres
Publié: (2026)
Deep SOR Minimax Q-learning for Two-player Zero-sum Game
par: Gautam, Saksham, et autres
Publié: (2025)
par: Gautam, Saksham, et autres
Publié: (2025)
Initial Distribution Sensitivity of Constrained Markov Decision Processes
par: Tercan, Alperen, et autres
Publié: (2025)
par: Tercan, Alperen, et autres
Publié: (2025)
A theoretical basis for model collapse in recursive training
par: Borkar, Vivek Shripad
Publié: (2025)
par: Borkar, Vivek Shripad
Publié: (2025)
Primal-Only Actor Critic Algorithm for Robust Constrained Average Cost MDPs
par: Satheesh, Anirudh, et autres
Publié: (2025)
par: Satheesh, Anirudh, et autres
Publié: (2025)
Heavy-Ball Momentum Accelerated Actor-Critic With Function Approximation
par: Dong, Yanjie, et autres
Publié: (2024)
par: Dong, Yanjie, et autres
Publié: (2024)
Policy Regularized Distributionally Robust Markov Decision Processes with Linear Function Approximation
par: Gu, Jingwen, et autres
Publié: (2025)
par: Gu, Jingwen, et autres
Publié: (2025)
Stochastic approximation in non-markovian environments revisited
par: Borkar, Vivek Shripad
Publié: (2026)
par: Borkar, Vivek Shripad
Publié: (2026)
DSAC: Distributional Soft Actor-Critic for Risk-Sensitive Reinforcement Learning
par: Ma, Xiaoteng, et autres
Publié: (2020)
par: Ma, Xiaoteng, et autres
Publié: (2020)
Limits of Actor-Critic Algorithms for Decision Tree Policies Learning in IBMDPs
par: Kohler, Hector, et autres
Publié: (2023)
par: Kohler, Hector, et autres
Publié: (2023)
A dynamic view of some anomalous phenomena in SGD
par: Borkar, Vivek Shripad
Publié: (2025)
par: Borkar, Vivek Shripad
Publié: (2025)
Weakly Time-Coupled Approximation of Markov Decision Processes
par: Soheili, Negar, et autres
Publié: (2026)
par: Soheili, Negar, et autres
Publié: (2026)
Risk-sensitive Markov Decision Process and Learning under General Utility Functions
par: Wu, Zhengqi, et autres
Publié: (2023)
par: Wu, Zhengqi, et autres
Publié: (2023)
Asymptotic convexity of wide and shallow neural networks
par: Borkar, Vivek, et autres
Publié: (2025)
par: Borkar, Vivek, et autres
Publié: (2025)
Deep Actor-Critics with Tight Risk Certificates
par: Tasdighi, Bahareh, et autres
Publié: (2025)
par: Tasdighi, Bahareh, et autres
Publié: (2025)
Value Improved Actor Critic Algorithms
par: Oren, Yaniv, et autres
Publié: (2024)
par: Oren, Yaniv, et autres
Publié: (2024)
Risk Estimation in a Markov Cost Process: Lower and Upper Bounds
par: Thoppe, Gugan, et autres
Publié: (2023)
par: Thoppe, Gugan, et autres
Publié: (2023)
Non-Asymptotic Analysis for Single-Loop (Natural) Actor-Critic with Compatible Function Approximation
par: Wang, Yudan, et autres
Publié: (2024)
par: Wang, Yudan, et autres
Publié: (2024)
Reinforcement Learning with Function Approximation for Non-Markov Processes
par: Kara, Ali Devran
Publié: (2026)
par: Kara, Ali Devran
Publié: (2026)
Actor-Critic without Actor
par: Ki, Donghyeon, et autres
Publié: (2025)
par: Ki, Donghyeon, et autres
Publié: (2025)
Risk-Sensitive Soft Actor-Critic for Robust Deep Reinforcement Learning under Distribution Shifts
par: Enders, Tobias, et autres
Publié: (2024)
par: Enders, Tobias, et autres
Publié: (2024)
A Theoretical Justification for Asymmetric Actor-Critic Algorithms
par: Lambrechts, Gaspard, et autres
Publié: (2025)
par: Lambrechts, Gaspard, et autres
Publié: (2025)
Documents similaires
-
Actor-Critic or Critic-Actor? A Tale of Two Time Scales
par: Bhatnagar, Shalabh, et autres
Publié: (2022) -
A policy gradient approach for Finite Horizon Constrained Markov Decision Processes
par: Guin, Soumyajit, et autres
Publié: (2022) -
Convergent Reinforcement Learning Algorithms for Stochastic Shortest Path Problem
par: Guin, Soumyajit, et autres
Publié: (2025) -
Two-Timescale Critic-Actor for Average Reward MDPs with Function Approximation
par: Panda, Prashansa, et autres
Publié: (2024) -
Finite-Time Analysis of Three-Timescale Constrained Actor-Critic and Constrained Natural Actor-Critic Algorithms
par: Panda, Prashansa, et autres
Publié: (2023)