Analysis of Off-Policy $n$-Step TD-Learning with Linear Function Approximation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Lim, Han-Dong, Lee, Donghwan |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Analysis of Off-Policy Multi-Step TD-Learning with Linear Function Approximation
par: Lee, Donghwan
Publié: (2024)
par: Lee, Donghwan
Publié: (2024)
Finite-Time Analysis of Temporal Difference Learning with Experience Replay
par: Lim, Han-Dong, et autres
Publié: (2023)
par: Lim, Han-Dong, et autres
Publié: (2023)
Backstepping Temporal Difference Learning
par: Lim, Han-Dong, et autres
Publié: (2023)
par: Lim, Han-Dong, et autres
Publié: (2023)
Understanding the theoretical properties of projected Bellman equation, linear Q-learning, and approximate value iteration
par: Lim, Han-Dong, et autres
Publié: (2025)
par: Lim, Han-Dong, et autres
Publié: (2025)
A Switching System Theory of Q-Learning with Linear Function Approximation
par: Lee, Donghwan, et autres
Publié: (2026)
par: Lee, Donghwan, et autres
Publié: (2026)
Periodic Regularized Q-Learning
par: Yang, Hyukjun, et autres
Publié: (2026)
par: Yang, Hyukjun, et autres
Publié: (2026)
Learning the Model While Learning Q: Finite-Time Sample Complexity of Online SyncMBQ
par: Lim, Han-Dong, et autres
Publié: (2024)
par: Lim, Han-Dong, et autres
Publié: (2024)
A finite time analysis of distributed Q-learning
par: Lim, Han-Dong, et autres
Publié: (2024)
par: Lim, Han-Dong, et autres
Publié: (2024)
A primal-dual perspective for distributed TD-learning
par: Lim, Han-Dong, et autres
Publié: (2023)
par: Lim, Han-Dong, et autres
Publié: (2023)
Safe-Support Q-Learning: Learning without Unsafe Exploration
par: Lim, Yeeun, et autres
Publié: (2026)
par: Lim, Yeeun, et autres
Publié: (2026)
Adaptive Policy Backbone via Shared Network
par: Park, Bumgeun, et autres
Publié: (2025)
par: Park, Bumgeun, et autres
Publié: (2025)
Taming the Adversary: Stable Minimax Deep Deterministic Policy Gradient via Fractional Objectives
par: Lee, Taeho, et autres
Publié: (2026)
par: Lee, Taeho, et autres
Publié: (2026)
Soft Deterministic Policy Gradient with Gaussian Smoothing
par: Na, Hyunjun, et autres
Publié: (2026)
par: Na, Hyunjun, et autres
Publié: (2026)
R-GTD: A Geometric Analysis of Gradient Temporal-Difference Learning in Singular Regimes
par: Na, Hyunjun, et autres
Publié: (2026)
par: Na, Hyunjun, et autres
Publié: (2026)
Toward a Unified Lyapunov-Certified ODE Convergence Analysis of Smooth Q-Learning with p-Norms
par: Lee, Donghwan, et autres
Publié: (2024)
par: Lee, Donghwan, et autres
Publié: (2024)
Lyapunov-Certified Direct Switching Theory for Q-Learning
par: Lee, Donghwan
Publié: (2026)
par: Lee, Donghwan
Publié: (2026)
Suppressing Overestimation in Q-Learning through Adversarial Behaviors
par: Lee, HyeAnn, et autres
Publié: (2023)
par: Lee, HyeAnn, et autres
Publié: (2023)
Kernel Metric Learning for In-Sample Off-Policy Evaluation of Deterministic RL Policies
par: Lee, Haanvid, et autres
Publié: (2024)
par: Lee, Haanvid, et autres
Publié: (2024)
Policy Regularized Distributionally Robust Markov Decision Processes with Linear Function Approximation
par: Gu, Jingwen, et autres
Publié: (2025)
par: Gu, Jingwen, et autres
Publié: (2025)
Pretraining a Shared Q-Network for Data-Efficient Offline Reinforcement Learning
par: Park, Jongchan, et autres
Publié: (2025)
par: Park, Jongchan, et autres
Publié: (2025)
A Unifying View of Coverage in Linear Off-Policy Evaluation
par: Amortila, Philip, et autres
Publié: (2026)
par: Amortila, Philip, et autres
Publié: (2026)
Functional Critics Are Essential for Actor-Critic: From Off-Policy Stability to Efficient Exploration
par: Bai, Qinxun, et autres
Publié: (2025)
par: Bai, Qinxun, et autres
Publié: (2025)
Misspecified $Q$-Learning with Sparse Linear Function Approximation: Tight Bounds on Approximation Error
par: Du, Ally Yalei, et autres
Publié: (2024)
par: Du, Ally Yalei, et autres
Publié: (2024)
Zero-Shot Off-Policy Learning
par: Asadulaev, Arip, et autres
Publié: (2026)
par: Asadulaev, Arip, et autres
Publié: (2026)
Low-Rank Adaptation for Critic Learning in Off-Policy Reinforcement Learning
par: Zhuang, Yuan, et autres
Publié: (2026)
par: Zhuang, Yuan, et autres
Publié: (2026)
Learning Action Embeddings for Off-Policy Evaluation
par: Cief, Matej, et autres
Publié: (2023)
par: Cief, Matej, et autres
Publié: (2023)
Target Networks and Over-parameterization Stabilize Off-policy Bootstrapping with Function Approximation
par: Che, Fengdi, et autres
Publié: (2024)
par: Che, Fengdi, et autres
Publié: (2024)
The Role of Inherent Bellman Error in Offline Reinforcement Learning with Linear Function Approximation
par: Golowich, Noah, et autres
Publié: (2024)
par: Golowich, Noah, et autres
Publié: (2024)
Bellman Unbiasedness: Toward Provably Efficient Distributional Reinforcement Learning with General Value Function Approximation
par: Cho, Taehyun, et autres
Publié: (2024)
par: Cho, Taehyun, et autres
Publié: (2024)
Towards Off-Policy Reinforcement Learning for Ranking Policies with Human Feedback
par: Xiao, Teng, et autres
Publié: (2024)
par: Xiao, Teng, et autres
Publié: (2024)
Policy Learning for Off-Dynamics RL with Deficient Support
par: Van, Linh Le Pham, et autres
Publié: (2024)
par: Van, Linh Le Pham, et autres
Publié: (2024)
Exploring Adaptive MCTS with TD Learning in miniXCOM
par: Saadat, Kimiya, et autres
Publié: (2022)
par: Saadat, Kimiya, et autres
Publié: (2022)
What Does Flow Matching Bring To TD Learning?
par: Agrawalla, Bhavya, et autres
Publié: (2026)
par: Agrawalla, Bhavya, et autres
Publié: (2026)
Development and Validation of Heparin Dosing Policies Using an Offline Reinforcement Learning Algorithm
par: Lim, Yooseok, et autres
Publié: (2024)
par: Lim, Yooseok, et autres
Publié: (2024)
Off-OAB: Off-Policy Policy Gradient Method with Optimal Action-Dependent Baseline
par: Meng, Wenjia, et autres
Publié: (2024)
par: Meng, Wenjia, et autres
Publié: (2024)
Stable Asynchrony: Variance-Controlled Off-Policy RL for LLMs
par: Huang, Luke J., et autres
Publié: (2026)
par: Huang, Luke J., et autres
Publié: (2026)
OffSim: Offline Simulator for Model-based Offline Inverse Reinforcement Learning
par: Ahn, Woo-Jin, et autres
Publié: (2025)
par: Ahn, Woo-Jin, et autres
Publié: (2025)
Off-Policy Evaluation and Learning for the Future under Non-Stationarity
par: Shimizu, Tatsuhiro, et autres
Publié: (2025)
par: Shimizu, Tatsuhiro, et autres
Publié: (2025)
Scaling Off-Policy Reinforcement Learning with Batch and Weight Normalization
par: Palenicek, Daniel, et autres
Publié: (2025)
par: Palenicek, Daniel, et autres
Publié: (2025)
Effective Off-Policy Evaluation and Learning in Contextual Combinatorial Bandits
par: Shimizu, Tatsuhiro, et autres
Publié: (2024)
par: Shimizu, Tatsuhiro, et autres
Publié: (2024)
Documents similaires
-
Analysis of Off-Policy Multi-Step TD-Learning with Linear Function Approximation
par: Lee, Donghwan
Publié: (2024) -
Finite-Time Analysis of Temporal Difference Learning with Experience Replay
par: Lim, Han-Dong, et autres
Publié: (2023) -
Backstepping Temporal Difference Learning
par: Lim, Han-Dong, et autres
Publié: (2023) -
Understanding the theoretical properties of projected Bellman equation, linear Q-learning, and approximate value iteration
par: Lim, Han-Dong, et autres
Publié: (2025) -
A Switching System Theory of Q-Learning with Linear Function Approximation
par: Lee, Donghwan, et autres
Publié: (2026)