Learning the Model While Learning Q: Finite-Time Sample Complexity of Online SyncMBQ
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Lim, Han-Dong, Lee, HyeAnn, Lee, Donghwan |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Suppressing Overestimation in Q-Learning through Adversarial Behaviors
par: Lee, HyeAnn, et autres
Publié: (2023)
par: Lee, HyeAnn, et autres
Publié: (2023)
Finite-Time Analysis of Temporal Difference Learning with Experience Replay
par: Lim, Han-Dong, et autres
Publié: (2023)
par: Lim, Han-Dong, et autres
Publié: (2023)
Periodic Regularized Q-Learning
par: Yang, Hyukjun, et autres
Publié: (2026)
par: Yang, Hyukjun, et autres
Publié: (2026)
Backstepping Temporal Difference Learning
par: Lim, Han-Dong, et autres
Publié: (2023)
par: Lim, Han-Dong, et autres
Publié: (2023)
Understanding the theoretical properties of projected Bellman equation, linear Q-learning, and approximate value iteration
par: Lim, Han-Dong, et autres
Publié: (2025)
par: Lim, Han-Dong, et autres
Publié: (2025)
A finite time analysis of distributed Q-learning
par: Lim, Han-Dong, et autres
Publié: (2024)
par: Lim, Han-Dong, et autres
Publié: (2024)
Analysis of Off-Policy $n$-Step TD-Learning with Linear Function Approximation
par: Lim, Han-Dong, et autres
Publié: (2025)
par: Lim, Han-Dong, et autres
Publié: (2025)
Safe-Support Q-Learning: Learning without Unsafe Exploration
par: Lim, Yeeun, et autres
Publié: (2026)
par: Lim, Yeeun, et autres
Publié: (2026)
Lyapunov-Certified Direct Switching Theory for Q-Learning
par: Lee, Donghwan
Publié: (2026)
par: Lee, Donghwan
Publié: (2026)
Toward a Unified Lyapunov-Certified ODE Convergence Analysis of Smooth Q-Learning with p-Norms
par: Lee, Donghwan, et autres
Publié: (2024)
par: Lee, Donghwan, et autres
Publié: (2024)
Sign-Separated Finite-Time Error Analysis of Q-Learning
par: Lee, Donghwan
Publié: (2026)
par: Lee, Donghwan
Publié: (2026)
Pretraining a Shared Q-Network for Data-Efficient Offline Reinforcement Learning
par: Park, Jongchan, et autres
Publié: (2025)
par: Park, Jongchan, et autres
Publié: (2025)
A Switching System Theory of Q-Learning with Linear Function Approximation
par: Lee, Donghwan, et autres
Publié: (2026)
par: Lee, Donghwan, et autres
Publié: (2026)
R-GTD: A Geometric Analysis of Gradient Temporal-Difference Learning in Singular Regimes
par: Na, Hyunjun, et autres
Publié: (2026)
par: Na, Hyunjun, et autres
Publié: (2026)
Regularized Q-learning
par: Lim, Han-Dong, et autres
Publié: (2022)
par: Lim, Han-Dong, et autres
Publié: (2022)
Finite-Time Error Analysis of Soft Q-Learning: Switching System Approach
par: Jeong, Narim, et autres
Publié: (2024)
par: Jeong, Narim, et autres
Publié: (2024)
Taming the Adversary: Stable Minimax Deep Deterministic Policy Gradient via Fractional Objectives
par: Lee, Taeho, et autres
Publié: (2026)
par: Lee, Taeho, et autres
Publié: (2026)
SPQR: Controlling Q-ensemble Independence with Spiked Random Model for Reinforcement Learning
par: Lee, Dohyeok, et autres
Publié: (2024)
par: Lee, Dohyeok, et autres
Publié: (2024)
Soft Deterministic Policy Gradient with Gaussian Smoothing
par: Na, Hyunjun, et autres
Publié: (2026)
par: Na, Hyunjun, et autres
Publié: (2026)
Adaptive Policy Backbone via Shared Network
par: Park, Bumgeun, et autres
Publié: (2025)
par: Park, Bumgeun, et autres
Publié: (2025)
Model-based Offline Reinforcement Learning with Lower Expectile Q-Learning
par: Park, Kwanyoung, et autres
Publié: (2024)
par: Park, Kwanyoung, et autres
Publié: (2024)
Frictional Q-Learning
par: Kim, Hyunwoo, et autres
Publié: (2025)
par: Kim, Hyunwoo, et autres
Publié: (2025)
Finite-Time Analysis of Simultaneous Double Q-learning
par: Na, Hyunjun, et autres
Publié: (2024)
par: Na, Hyunjun, et autres
Publié: (2024)
Feature-Enhanced Machine Learning for All-Cause Mortality Prediction in Healthcare Data
par: Lee, HyeYoung, et autres
Publié: (2025)
par: Lee, HyeYoung, et autres
Publié: (2025)
OMG-RL:Offline Model-based Guided Reward Learning for Heparin Treatment
par: Lim, Yooseok, et autres
Publié: (2024)
par: Lim, Yooseok, et autres
Publié: (2024)
Chunk-Guided Q-Learning
par: Song, Gwanwoo, et autres
Publié: (2026)
par: Song, Gwanwoo, et autres
Publié: (2026)
Exclusively Penalized Q-learning for Offline Reinforcement Learning
par: Yeom, Junghyuk, et autres
Publié: (2024)
par: Yeom, Junghyuk, et autres
Publié: (2024)
Finite-Time Analysis of Q-Value Iteration for General-Sum Stackelberg Games
par: Jeong, Narim, et autres
Publié: (2026)
par: Jeong, Narim, et autres
Publié: (2026)
Is Prompt Selection Necessary for Task-Free Online Continual Learning?
par: Park, Seoyoung, et autres
Publié: (2026)
par: Park, Seoyoung, et autres
Publié: (2026)
Q-Learning under Finite Model Uncertainty
par: Sester, Julian, et autres
Publié: (2024)
par: Sester, Julian, et autres
Publié: (2024)
Soft Contrastive Learning for Time Series
par: Lee, Seunghan, et autres
Publié: (2023)
par: Lee, Seunghan, et autres
Publié: (2023)
Continual Reinforcement Learning by Planning with Online World Models
par: Liu, Zichen, et autres
Publié: (2025)
par: Liu, Zichen, et autres
Publié: (2025)
Locality Sensitive Sparse Encoding for Learning World Models Online
par: Liu, Zichen, et autres
Publié: (2024)
par: Liu, Zichen, et autres
Publié: (2024)
Learning to Embed Time Series Patches Independently
par: Lee, Seunghan, et autres
Publié: (2023)
par: Lee, Seunghan, et autres
Publié: (2023)
Finite Time Analysis of Constrained Natural Critic-Actor Algorithm with Improved Sample Complexity
par: Panda, Prashansa, et autres
Publié: (2025)
par: Panda, Prashansa, et autres
Publié: (2025)
Binning as a Pretext Task: Improving Self-Supervised Learning in Tabular Domains
par: Lee, Kyungeun, et autres
Publié: (2024)
par: Lee, Kyungeun, et autres
Publié: (2024)
Sample-efficient Adversarial Imitation Learning
par: Jung, Dahuin, et autres
Publié: (2023)
par: Jung, Dahuin, et autres
Publié: (2023)
Reinforcement Learning for Control with Probabilistic Stability Guarantee: A Finite-Sample Approach
par: Han, Minghao, et autres
Publié: (2026)
par: Han, Minghao, et autres
Publié: (2026)
Sample Complexity of Distributionally Robust Off-Dynamics Reinforcement Learning with Online Interaction
par: He, Yiting, et autres
Publié: (2025)
par: He, Yiting, et autres
Publié: (2025)
Lyapunov-Guided Self-Alignment: Test-Time Adaptation for Offline Safe Reinforcement Learning
par: Han, Seungyub, et autres
Publié: (2026)
par: Han, Seungyub, et autres
Publié: (2026)
Documents similaires
-
Suppressing Overestimation in Q-Learning through Adversarial Behaviors
par: Lee, HyeAnn, et autres
Publié: (2023) -
Finite-Time Analysis of Temporal Difference Learning with Experience Replay
par: Lim, Han-Dong, et autres
Publié: (2023) -
Periodic Regularized Q-Learning
par: Yang, Hyukjun, et autres
Publié: (2026) -
Backstepping Temporal Difference Learning
par: Lim, Han-Dong, et autres
Publié: (2023) -
Understanding the theoretical properties of projected Bellman equation, linear Q-learning, and approximate value iteration
par: Lim, Han-Dong, et autres
Publié: (2025)