On the Convergence of Experience Replay in Policy Optimization: Characterizing Bias, Variance, and Finite-Time Convergence

Fuente: arXiv
Salvato in:
Dettagli Bibliografici
Autori principali: Zheng, Hua, Xie, Wei, Feng, M. Ben
Natura: Preprint
Pubblicazione: 2021
Soggetti:
Accesso online:
Tags: Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!