n-Step Temporal Difference Learning with Optimal n
Fuente:
arXiv
Salvato in:
| Autori principali: | Mandal, Lakshmi, Bhatnagar, Shalabh |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Deep SOR Minimax Q-learning for Two-player Zero-sum Game
di: Gautam, Saksham, et al.
Pubblicazione: (2025)
di: Gautam, Saksham, et al.
Pubblicazione: (2025)
Approximate Linear Programming for Decentralized Policy Iteration in Cooperative Multi-agent Markov Decision Processes
di: Mandal, Lakshmi, et al.
Pubblicazione: (2023)
di: Mandal, Lakshmi, et al.
Pubblicazione: (2023)
Convergent Reinforcement Learning Algorithms for Stochastic Shortest Path Problem
di: Guin, Soumyajit, et al.
Pubblicazione: (2025)
di: Guin, Soumyajit, et al.
Pubblicazione: (2025)
Enabling Off-Policy Imitation Learning with Deep Actor Critic Stabilization
di: Sen, Sayambhu, et al.
Pubblicazione: (2025)
di: Sen, Sayambhu, et al.
Pubblicazione: (2025)
Convergence of Multiagent Learning Systems for Traffic control
di: Sen, Sayambhu, et al.
Pubblicazione: (2025)
di: Sen, Sayambhu, et al.
Pubblicazione: (2025)
Finite-Time Analysis of Three-Timescale Constrained Actor-Critic and Constrained Natural Actor-Critic Algorithms
di: Panda, Prashansa, et al.
Pubblicazione: (2023)
di: Panda, Prashansa, et al.
Pubblicazione: (2023)
A policy gradient approach for Finite Horizon Constrained Markov Decision Processes
di: Guin, Soumyajit, et al.
Pubblicazione: (2022)
di: Guin, Soumyajit, et al.
Pubblicazione: (2022)
Two-Timescale Critic-Actor for Average Reward MDPs with Function Approximation
di: Panda, Prashansa, et al.
Pubblicazione: (2024)
di: Panda, Prashansa, et al.
Pubblicazione: (2024)
Finite-time analysis of Multi-timescale Stochastic Optimization Algorithms
di: Kartikey, Kaustubh, et al.
Pubblicazione: (2026)
di: Kartikey, Kaustubh, et al.
Pubblicazione: (2026)
Finite Time Analysis of Constrained Natural Critic-Actor Algorithm with Improved Sample Complexity
di: Panda, Prashansa, et al.
Pubblicazione: (2025)
di: Panda, Prashansa, et al.
Pubblicazione: (2025)
Actor-Critic or Critic-Actor? A Tale of Two Time Scales
di: Bhatnagar, Shalabh, et al.
Pubblicazione: (2022)
di: Bhatnagar, Shalabh, et al.
Pubblicazione: (2022)
An Actor-Critic Algorithm with Function Approximation for Risk Sensitive Cost Markov Decision Processes
di: Guin, Soumyajit, et al.
Pubblicazione: (2025)
di: Guin, Soumyajit, et al.
Pubblicazione: (2025)
Generalized Random Direction Newton Algorithms for Stochastic Optimization
di: Pachal, Soumen, et al.
Pubblicazione: (2026)
di: Pachal, Soumen, et al.
Pubblicazione: (2026)
Policy Gradient Methods for Non-Markovian Reinforcement Learning
di: Kar, Avik, et al.
Pubblicazione: (2026)
di: Kar, Avik, et al.
Pubblicazione: (2026)
High-Probability Bounds for SGD under the Polyak-Lojasiewicz Condition with Markovian Noise
di: Kar, Avik, et al.
Pubblicazione: (2026)
di: Kar, Avik, et al.
Pubblicazione: (2026)
Optimal Transport-Guided Safety in Temporal Difference Reinforcement Learning
di: Shahrooei, Zahra, et al.
Pubblicazione: (2025)
di: Shahrooei, Zahra, et al.
Pubblicazione: (2025)
Analysis of Off-Policy $n$-Step TD-Learning with Linear Function Approximation
di: Lim, Han-Dong, et al.
Pubblicazione: (2025)
di: Lim, Han-Dong, et al.
Pubblicazione: (2025)
O$n$ Learning Deep O($n$)-Equivariant Hyperspheres
di: Melnyk, Pavlo, et al.
Pubblicazione: (2023)
di: Melnyk, Pavlo, et al.
Pubblicazione: (2023)
An Analysis of Quantile Temporal-Difference Learning
di: Rowland, Mark, et al.
Pubblicazione: (2023)
di: Rowland, Mark, et al.
Pubblicazione: (2023)
On the Statistical Benefits of Temporal Difference Learning
di: Cheikhi, David, et al.
Pubblicazione: (2023)
di: Cheikhi, David, et al.
Pubblicazione: (2023)
Simplifying Deep Temporal Difference Learning
di: Gallici, Matteo, et al.
Pubblicazione: (2024)
di: Gallici, Matteo, et al.
Pubblicazione: (2024)
Pareto-Optimal Offline Reinforcement Learning via Smooth Tchebysheff Scalarization
di: Bhatnagar, Aadyot, et al.
Pubblicazione: (2026)
di: Bhatnagar, Aadyot, et al.
Pubblicazione: (2026)
Discerning Temporal Difference Learning
di: Ma, Jianfei
Pubblicazione: (2023)
di: Ma, Jianfei
Pubblicazione: (2023)
Backstepping Temporal Difference Learning
di: Lim, Han-Dong, et al.
Pubblicazione: (2023)
di: Lim, Han-Dong, et al.
Pubblicazione: (2023)
Towards Parameter-Free Temporal Difference Learning
di: Li, Yunxiang, et al.
Pubblicazione: (2026)
di: Li, Yunxiang, et al.
Pubblicazione: (2026)
Temporal Difference Learning with Constrained Initial Representations
di: Lyu, Jiafei, et al.
Pubblicazione: (2026)
di: Lyu, Jiafei, et al.
Pubblicazione: (2026)
Reinforcement Learning From State and Temporal Differences
di: Weaver, Lex, et al.
Pubblicazione: (2025)
di: Weaver, Lex, et al.
Pubblicazione: (2025)
New Versions of Gradient Temporal Difference Learning
di: Lee, Donghwan, et al.
Pubblicazione: (2021)
di: Lee, Donghwan, et al.
Pubblicazione: (2021)
Learning In-context n-grams with Transformers: Sub-n-grams Are Near-stationary Points
di: Varre, Aditya, et al.
Pubblicazione: (2025)
di: Varre, Aditya, et al.
Pubblicazione: (2025)
Implicit Updates for Average-Reward Temporal Difference Learning
di: Kim, Hwanwoo, et al.
Pubblicazione: (2025)
di: Kim, Hwanwoo, et al.
Pubblicazione: (2025)
Temporal-Difference Variational Continual Learning
di: Melo, Luckeciano C., et al.
Pubblicazione: (2024)
di: Melo, Luckeciano C., et al.
Pubblicazione: (2024)
Gradient Iterated Temporal-Difference Learning
di: Vincent, Théo, et al.
Pubblicazione: (2026)
di: Vincent, Théo, et al.
Pubblicazione: (2026)
Optimal Flow Matching: Learning Straight Trajectories in Just One Step
di: Kornilov, Nikita, et al.
Pubblicazione: (2024)
di: Kornilov, Nikita, et al.
Pubblicazione: (2024)
Transformers Can Learn Temporal Difference Methods for In-Context Reinforcement Learning
di: Wang, Jiuqi, et al.
Pubblicazione: (2024)
di: Wang, Jiuqi, et al.
Pubblicazione: (2024)
Revisiting a Design Choice in Gradient Temporal Difference Learning
di: Qian, Xiaochi, et al.
Pubblicazione: (2023)
di: Qian, Xiaochi, et al.
Pubblicazione: (2023)
Statistical Inference for Temporal Difference Learning with Linear Function Approximation
di: Wu, Weichen, et al.
Pubblicazione: (2024)
di: Wu, Weichen, et al.
Pubblicazione: (2024)
Accelerated Distributional Temporal Difference Learning with Linear Function Approximation
di: Jin, Kaicheng, et al.
Pubblicazione: (2025)
di: Jin, Kaicheng, et al.
Pubblicazione: (2025)
On the Divergence of Differential Temporal Difference Learning without Local Clocks
di: Antrobius, David, et al.
Pubblicazione: (2026)
di: Antrobius, David, et al.
Pubblicazione: (2026)
Subliminal Corruption: Mechanisms, Thresholds, and Interpretability
di: Vir, Reya, et al.
Pubblicazione: (2025)
di: Vir, Reya, et al.
Pubblicazione: (2025)
Demystifying the Recency Heuristic in Temporal-Difference Learning
di: Daley, Brett, et al.
Pubblicazione: (2024)
di: Daley, Brett, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Deep SOR Minimax Q-learning for Two-player Zero-sum Game
di: Gautam, Saksham, et al.
Pubblicazione: (2025) -
Approximate Linear Programming for Decentralized Policy Iteration in Cooperative Multi-agent Markov Decision Processes
di: Mandal, Lakshmi, et al.
Pubblicazione: (2023) -
Convergent Reinforcement Learning Algorithms for Stochastic Shortest Path Problem
di: Guin, Soumyajit, et al.
Pubblicazione: (2025) -
Enabling Off-Policy Imitation Learning with Deep Actor Critic Stabilization
di: Sen, Sayambhu, et al.
Pubblicazione: (2025) -
Convergence of Multiagent Learning Systems for Traffic control
di: Sen, Sayambhu, et al.
Pubblicazione: (2025)