Revisiting a Design Choice in Gradient Temporal Difference Learning
Fuente:
arXiv
Guardado en:
| Autores principales: | Qian, Xiaochi, Zhang, Shangtong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2023
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Almost Sure Convergence Rates and Concentration of Stochastic Approximation and Reinforcement Learning with Markovian Noise
por: Qian, Xiaochi, et al.
Publicado: (2024)
por: Qian, Xiaochi, et al.
Publicado: (2024)
On the Divergence of Differential Temporal Difference Learning without Local Clocks
por: Antrobius, David, et al.
Publicado: (2026)
por: Antrobius, David, et al.
Publicado: (2026)
Almost Sure Convergence of Linear Temporal Difference Learning with Arbitrary Features
por: Wang, Jiuqi, et al.
Publicado: (2024)
por: Wang, Jiuqi, et al.
Publicado: (2024)
Transformers Can Learn Temporal Difference Methods for In-Context Reinforcement Learning
por: Wang, Jiuqi, et al.
Publicado: (2024)
por: Wang, Jiuqi, et al.
Publicado: (2024)
Almost Sure Convergence of Differential Temporal Difference Learning for Average Reward Markov Decision Processes
por: Blaser, Ethan, et al.
Publicado: (2026)
por: Blaser, Ethan, et al.
Publicado: (2026)
Finite Sample Analysis of Linear Temporal Difference Learning with Arbitrary Features
por: Xie, Zixuan, et al.
Publicado: (2025)
por: Xie, Zixuan, et al.
Publicado: (2025)
Towards Formalizing Reinforcement Learning Theory
por: Zhang, Shangtong
Publicado: (2025)
por: Zhang, Shangtong
Publicado: (2025)
Efficient Policy Evaluation with Offline Data Informed Behavior Policy Design
por: Liu, Shuze, et al.
Publicado: (2023)
por: Liu, Shuze, et al.
Publicado: (2023)
New Versions of Gradient Temporal Difference Learning
por: Lee, Donghwan, et al.
Publicado: (2021)
por: Lee, Donghwan, et al.
Publicado: (2021)
Gradient Iterated Temporal-Difference Learning
por: Vincent, Théo, et al.
Publicado: (2026)
por: Vincent, Théo, et al.
Publicado: (2026)
Towards Provable Emergence of In-Context Reinforcement Learning
por: Wang, Jiuqi, et al.
Publicado: (2025)
por: Wang, Jiuqi, et al.
Publicado: (2025)
Doubly Optimal Policy Evaluation for Reinforcement Learning
por: Liu, Shuze Daniel, et al.
Publicado: (2024)
por: Liu, Shuze Daniel, et al.
Publicado: (2024)
Efficient Multi-Policy Evaluation for Reinforcement Learning
por: Liu, Shuze Daniel, et al.
Publicado: (2024)
por: Liu, Shuze Daniel, et al.
Publicado: (2024)
CRASH: Challenging Reinforcement-Learning Based Adversarial Scenarios For Safety Hardening
por: Kulkarni, Amar, et al.
Publicado: (2024)
por: Kulkarni, Amar, et al.
Publicado: (2024)
Efficient Policy Evaluation with Safety Constraint for Reinforcement Learning
por: Chen, Claire, et al.
Publicado: (2024)
por: Chen, Claire, et al.
Publicado: (2024)
Linear $Q$-Learning Does Not Diverge in $L^2$: Convergence Rates to a Bounded Set
por: Liu, Xinyu, et al.
Publicado: (2025)
por: Liu, Xinyu, et al.
Publicado: (2025)
Almost Sure Convergence Rates of Stochastic Approximation and Reinforcement Learning via a Poisson-Moreau Drift
por: Liu, Xinyu, et al.
Publicado: (2026)
por: Liu, Xinyu, et al.
Publicado: (2026)
Counterfactual Explanations for Continuous Action Reinforcement Learning
por: Dong, Shuyang, et al.
Publicado: (2025)
por: Dong, Shuyang, et al.
Publicado: (2025)
Extensions of Robbins-Siegmund Theorem with Applications in Reinforcement Learning
por: Liu, Xinyu, et al.
Publicado: (2025)
por: Liu, Xinyu, et al.
Publicado: (2025)
Convergence and Emergence of In-Context Reinforcement Learning with Chain of Thought
por: Xie, Zixuan, et al.
Publicado: (2026)
por: Xie, Zixuan, et al.
Publicado: (2026)
The ODE Method for Stochastic Approximation and Reinforcement Learning with Markovian Noise
por: Liu, Shuze Daniel, et al.
Publicado: (2024)
por: Liu, Shuze Daniel, et al.
Publicado: (2024)
Global Optimality and Finite Sample Analysis of Softmax Off-Policy Actor Critic under State Distribution Mismatch
por: Zhang, Shangtong, et al.
Publicado: (2021)
por: Zhang, Shangtong, et al.
Publicado: (2021)
Asymptotic and Finite Sample Analysis of Nonexpansive Stochastic Approximations with Markovian Noise
por: Blaser, Ethan, et al.
Publicado: (2024)
por: Blaser, Ethan, et al.
Publicado: (2024)
Convergence of Two-Timescale Markovian Stochastic Approximations with Applications in Reinforcement Learning
por: Mahadevan, Vagul, et al.
Publicado: (2026)
por: Mahadevan, Vagul, et al.
Publicado: (2026)
Experience Replay Addresses Loss of Plasticity in Continual Learning
por: Wang, Jiuqi, et al.
Publicado: (2025)
por: Wang, Jiuqi, et al.
Publicado: (2025)
Group Fairness in Multi-Task Reinforcement Learning
por: Song, Kefan, et al.
Publicado: (2025)
por: Song, Kefan, et al.
Publicado: (2025)
Learning to Represent Individual Differences for Choice Decision Making
por: Chen, Yan-Ying, et al.
Publicado: (2025)
por: Chen, Yan-Ying, et al.
Publicado: (2025)
In-context Learning and Gradient Descent Revisited
por: Deutch, Gilad, et al.
Publicado: (2023)
por: Deutch, Gilad, et al.
Publicado: (2023)
R-GTD: A Geometric Analysis of Gradient Temporal-Difference Learning in Singular Regimes
por: Na, Hyunjun, et al.
Publicado: (2026)
por: Na, Hyunjun, et al.
Publicado: (2026)
An Analysis of Quantile Temporal-Difference Learning
por: Rowland, Mark, et al.
Publicado: (2023)
por: Rowland, Mark, et al.
Publicado: (2023)
On the Statistical Benefits of Temporal Difference Learning
por: Cheikhi, David, et al.
Publicado: (2023)
por: Cheikhi, David, et al.
Publicado: (2023)
Simplifying Deep Temporal Difference Learning
por: Gallici, Matteo, et al.
Publicado: (2024)
por: Gallici, Matteo, et al.
Publicado: (2024)
Accelerated Distributional Temporal Difference Learning with Linear Function Approximation
por: Jin, Kaicheng, et al.
Publicado: (2025)
por: Jin, Kaicheng, et al.
Publicado: (2025)
Revisiting Gradient Descent: A Dual-Weight Method for Improved Learning
por: Wang, Xi
Publicado: (2025)
por: Wang, Xi
Publicado: (2025)
Learning to Remember: End-to-End Training of Memory Agents for Long-Context Reasoning
por: Zhang, Kehao, et al.
Publicado: (2026)
por: Zhang, Kehao, et al.
Publicado: (2026)
Communication-Efficient Federated Learning by Exploiting Spatio-Temporal Correlations of Gradients
por: Zheng, Shenlong, et al.
Publicado: (2026)
por: Zheng, Shenlong, et al.
Publicado: (2026)
Discerning Temporal Difference Learning
por: Ma, Jianfei
Publicado: (2023)
por: Ma, Jianfei
Publicado: (2023)
Backstepping Temporal Difference Learning
por: Lim, Han-Dong, et al.
Publicado: (2023)
por: Lim, Han-Dong, et al.
Publicado: (2023)
Exploring Design Choices for Autoregressive Deep Learning Climate Models
por: Gallusser, Florian, et al.
Publicado: (2025)
por: Gallusser, Florian, et al.
Publicado: (2025)
Prompt-Driven Domain Adaptation for End-to-End Autonomous Driving via In-Context RL
por: Khurram, Aleesha, et al.
Publicado: (2025)
por: Khurram, Aleesha, et al.
Publicado: (2025)
Ejemplares similares
-
Almost Sure Convergence Rates and Concentration of Stochastic Approximation and Reinforcement Learning with Markovian Noise
por: Qian, Xiaochi, et al.
Publicado: (2024) -
On the Divergence of Differential Temporal Difference Learning without Local Clocks
por: Antrobius, David, et al.
Publicado: (2026) -
Almost Sure Convergence of Linear Temporal Difference Learning with Arbitrary Features
por: Wang, Jiuqi, et al.
Publicado: (2024) -
Transformers Can Learn Temporal Difference Methods for In-Context Reinforcement Learning
por: Wang, Jiuqi, et al.
Publicado: (2024) -
Almost Sure Convergence of Differential Temporal Difference Learning for Average Reward Markov Decision Processes
por: Blaser, Ethan, et al.
Publicado: (2026)