A Variance Minimization Approach to Temporal-Difference Learning
Fuente:
arXiv
Guardado en:
| Autores principales: | Chen, Xingguo, Gong, Yu, Yang, Shangdong, Wang, Wenhao |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Bellman Error Centering
por: Chen, Xingguo, et al.
Publicado: (2025)
por: Chen, Xingguo, et al.
Publicado: (2025)
Behavior-Induced Mirror-Prox Temporal-Difference Learning for Faster Off-Policy Prediction
por: Chen, Xingguo, et al.
Publicado: (2026)
por: Chen, Xingguo, et al.
Publicado: (2026)
Regularized Centered Emphatic Temporal Difference Learning
por: Chen, Xingguo, et al.
Publicado: (2026)
por: Chen, Xingguo, et al.
Publicado: (2026)
Behavior-Aware Auxiliary Corrections for Off-Policy Temporal-Difference Prediction
por: Chen, Xingguo, et al.
Publicado: (2026)
por: Chen, Xingguo, et al.
Publicado: (2026)
Model-Based Offline Reinforcement Learning with Adversarial Data Augmentation
por: Cao, Hongye, et al.
Publicado: (2025)
por: Cao, Hongye, et al.
Publicado: (2025)
Discerning Temporal Difference Learning
por: Ma, Jianfei
Publicado: (2023)
por: Ma, Jianfei
Publicado: (2023)
Backstepping Temporal Difference Learning
por: Lim, Han-Dong, et al.
Publicado: (2023)
por: Lim, Han-Dong, et al.
Publicado: (2023)
A Huber Loss Minimization Approach to Byzantine Robust Federated Learning
por: Zhao, Puning, et al.
Publicado: (2023)
por: Zhao, Puning, et al.
Publicado: (2023)
Temporal-Difference Variational Continual Learning
por: Melo, Luckeciano C., et al.
Publicado: (2024)
por: Melo, Luckeciano C., et al.
Publicado: (2024)
Gradient Iterated Temporal-Difference Learning
por: Vincent, Théo, et al.
Publicado: (2026)
por: Vincent, Théo, et al.
Publicado: (2026)
On Variance Reduction in Learning Mean Flows
por: Lu, Juanwu, et al.
Publicado: (2026)
por: Lu, Juanwu, et al.
Publicado: (2026)
Demystifying the Recency Heuristic in Temporal-Difference Learning
por: Daley, Brett, et al.
Publicado: (2024)
por: Daley, Brett, et al.
Publicado: (2024)
Almost Sure Convergence of Linear Temporal Difference Learning with Arbitrary Features
por: Wang, Jiuqi, et al.
Publicado: (2024)
por: Wang, Jiuqi, et al.
Publicado: (2024)
Is Temporal Difference Learning the Gold Standard for Stitching in RL?
por: Bortkiewicz, Michał, et al.
Publicado: (2025)
por: Bortkiewicz, Michał, et al.
Publicado: (2025)
Temporal Difference Flows
por: Farebrother, Jesse, et al.
Publicado: (2025)
por: Farebrother, Jesse, et al.
Publicado: (2025)
Stock Recommendations for Individual Investors: A Temporal Graph Network Approach with Mean-Variance Efficient Sampling
por: Lee, Youngbin, et al.
Publicado: (2024)
por: Lee, Youngbin, et al.
Publicado: (2024)
An MRP Formulation for Supervised Learning: Generalized Temporal Difference Learning Models
por: Pan, Yangchen, et al.
Publicado: (2024)
por: Pan, Yangchen, et al.
Publicado: (2024)
Get Rid of Isolation: A Continuous Multi-task Spatio-Temporal Learning Framework
por: Yi, Zhongchao, et al.
Publicado: (2024)
por: Yi, Zhongchao, et al.
Publicado: (2024)
DECRL: A Deep Evolutionary Clustering Jointed Temporal Knowledge Graph Representation Learning Approach
por: Chen, Qian, et al.
Publicado: (2024)
por: Chen, Qian, et al.
Publicado: (2024)
Finite-Time Analysis of Temporal Difference Learning with Experience Replay
por: Lim, Han-Dong, et al.
Publicado: (2023)
por: Lim, Han-Dong, et al.
Publicado: (2023)
Deep Reinforcement Learning and The Tale of Two Temporal Difference Errors
por: Rojas, Juan Sebastian, et al.
Publicado: (2026)
por: Rojas, Juan Sebastian, et al.
Publicado: (2026)
Interpretable Hybrid-Rule Temporal Point Processes
por: Cao, Yunyang, et al.
Publicado: (2025)
por: Cao, Yunyang, et al.
Publicado: (2025)
Variance Alignment Score: A Simple But Tough-to-Beat Data Selection Method for Multimodal Contrastive Learning
por: Wang, Yiping, et al.
Publicado: (2024)
por: Wang, Yiping, et al.
Publicado: (2024)
Almost Sure Convergence of Differential Temporal Difference Learning for Average Reward Markov Decision Processes
por: Blaser, Ethan, et al.
Publicado: (2026)
por: Blaser, Ethan, et al.
Publicado: (2026)
An Analysis of Action-Value Temporal-Difference Methods That Learn State Values
por: Daley, Brett, et al.
Publicado: (2025)
por: Daley, Brett, et al.
Publicado: (2025)
Finite Sample Analysis of Linear Temporal Difference Learning with Arbitrary Features
por: Xie, Zixuan, et al.
Publicado: (2025)
por: Xie, Zixuan, et al.
Publicado: (2025)
Cochain Perspectives on Temporal-Difference Signals for Learning Beyond Markov Dynamics
por: Zhang, Zuyuan, et al.
Publicado: (2026)
por: Zhang, Zuyuan, et al.
Publicado: (2026)
A Two-stage Reinforcement Learning-based Approach for Multi-entity Task Allocation
por: Gong, Aicheng, et al.
Publicado: (2024)
por: Gong, Aicheng, et al.
Publicado: (2024)
A New Error Temporal Difference Algorithm for Deep Reinforcement Learning in Microgrid Optimization
por: Yao, Fulong, et al.
Publicado: (2025)
por: Yao, Fulong, et al.
Publicado: (2025)
R-GTD: A Geometric Analysis of Gradient Temporal-Difference Learning in Singular Regimes
por: Na, Hyunjun, et al.
Publicado: (2026)
por: Na, Hyunjun, et al.
Publicado: (2026)
Temporal Pair Consistency for Variance-Reduced Flow Matching
por: Maduabuchi, Chika, et al.
Publicado: (2026)
por: Maduabuchi, Chika, et al.
Publicado: (2026)
A Variance-Reduced Cubic-Regularized Newton for Policy Optimization
por: Sun, Cheng, et al.
Publicado: (2025)
por: Sun, Cheng, et al.
Publicado: (2025)
TCOD: Exploring Temporal Curriculum in On-Policy Distillation for Multi-turn Autonomous Agents
por: Wang, Jiaqi, et al.
Publicado: (2026)
por: Wang, Jiaqi, et al.
Publicado: (2026)
Adaptive Variance-Penalized Continual Learning with Fisher Regularization
por: Sarkar, Krisanu
Publicado: (2025)
por: Sarkar, Krisanu
Publicado: (2025)
A Selective Learning Method for Temporal Graph Continual Learning
por: Liu, Hanmo, et al.
Publicado: (2025)
por: Liu, Hanmo, et al.
Publicado: (2025)
STA-GANN: A Valid and Generalizable Spatio-Temporal Kriging Approach
por: Li, Yujie, et al.
Publicado: (2025)
por: Li, Yujie, et al.
Publicado: (2025)
Variance-Dependent Regret Bounds for Non-stationary Linear Bandits
por: Wang, Zhiyong, et al.
Publicado: (2024)
por: Wang, Zhiyong, et al.
Publicado: (2024)
Guided Self-Evolving LLMs with Minimal Human Supervision
por: Yu, Wenhao, et al.
Publicado: (2025)
por: Yu, Wenhao, et al.
Publicado: (2025)
Learning Robust Spectral Dynamics for Temporal Domain Generalization
por: Yu, En, et al.
Publicado: (2025)
por: Yu, En, et al.
Publicado: (2025)
Unveiling Latent Causal Rules: A Temporal Point Process Approach for Abnormal Event Explanation
por: Kuang, Yiling, et al.
Publicado: (2024)
por: Kuang, Yiling, et al.
Publicado: (2024)
Ejemplares similares
-
Bellman Error Centering
por: Chen, Xingguo, et al.
Publicado: (2025) -
Behavior-Induced Mirror-Prox Temporal-Difference Learning for Faster Off-Policy Prediction
por: Chen, Xingguo, et al.
Publicado: (2026) -
Regularized Centered Emphatic Temporal Difference Learning
por: Chen, Xingguo, et al.
Publicado: (2026) -
Behavior-Aware Auxiliary Corrections for Off-Policy Temporal-Difference Prediction
por: Chen, Xingguo, et al.
Publicado: (2026) -
Model-Based Offline Reinforcement Learning with Adversarial Data Augmentation
por: Cao, Hongye, et al.
Publicado: (2025)