Guardado en:
| Autores principales: | Lim, Han-Dong, Lee, Donghwan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2022
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2202.05404 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Periodic Regularized Q-Learning
por: Yang, Hyukjun, et al.
Publicado: (2026)
por: Yang, Hyukjun, et al.
Publicado: (2026)
A finite time analysis of distributed Q-learning
por: Lim, Han-Dong, et al.
Publicado: (2024)
por: Lim, Han-Dong, et al.
Publicado: (2024)
Understanding the theoretical properties of projected Bellman equation, linear Q-learning, and approximate value iteration
por: Lim, Han-Dong, et al.
Publicado: (2025)
por: Lim, Han-Dong, et al.
Publicado: (2025)
A Switching System Theory of Q-Learning with Linear Function Approximation
por: Lee, Donghwan, et al.
Publicado: (2026)
por: Lee, Donghwan, et al.
Publicado: (2026)
A primal-dual perspective for distributed TD-learning
por: Lim, Han-Dong, et al.
Publicado: (2023)
por: Lim, Han-Dong, et al.
Publicado: (2023)
Learning the Model While Learning Q: Finite-Time Sample Complexity of Online SyncMBQ
por: Lim, Han-Dong, et al.
Publicado: (2024)
por: Lim, Han-Dong, et al.
Publicado: (2024)
Analysis of Off-Policy $n$-Step TD-Learning with Linear Function Approximation
por: Lim, Han-Dong, et al.
Publicado: (2025)
por: Lim, Han-Dong, et al.
Publicado: (2025)
Finite-Time Analysis of Temporal Difference Learning with Experience Replay
por: Lim, Han-Dong, et al.
Publicado: (2023)
por: Lim, Han-Dong, et al.
Publicado: (2023)
Backstepping Temporal Difference Learning
por: Lim, Han-Dong, et al.
Publicado: (2023)
por: Lim, Han-Dong, et al.
Publicado: (2023)
Finite-Time Analysis of Simultaneous Double Q-learning
por: Na, Hyunjun, et al.
Publicado: (2024)
por: Na, Hyunjun, et al.
Publicado: (2024)
Safe-Support Q-Learning: Learning without Unsafe Exploration
por: Lim, Yeeun, et al.
Publicado: (2026)
por: Lim, Yeeun, et al.
Publicado: (2026)
Contraction-Aligned Analysis of Soft Bellman Residual Minimization with Weighted Lp-Norm for Markov Decision Problem
por: Yang, Hyukjun, et al.
Publicado: (2026)
por: Yang, Hyukjun, et al.
Publicado: (2026)
Lyapunov-Certified Direct Switching Theory for Q-Learning
por: Lee, Donghwan
Publicado: (2026)
por: Lee, Donghwan
Publicado: (2026)
New Versions of Gradient Temporal Difference Learning
por: Lee, Donghwan, et al.
Publicado: (2021)
por: Lee, Donghwan, et al.
Publicado: (2021)
Finite-Time Error Analysis of Soft Q-Learning: Switching System Approach
por: Jeong, Narim, et al.
Publicado: (2024)
por: Jeong, Narim, et al.
Publicado: (2024)
Suppressing Overestimation in Q-Learning through Adversarial Behaviors
por: Lee, HyeAnn, et al.
Publicado: (2023)
por: Lee, HyeAnn, et al.
Publicado: (2023)
Finite-Time Analysis of Q-Value Iteration for General-Sum Stackelberg Games
por: Jeong, Narim, et al.
Publicado: (2026)
por: Jeong, Narim, et al.
Publicado: (2026)
Toward a Unified Lyapunov-Certified ODE Convergence Analysis of Smooth Q-Learning with p-Norms
por: Lee, Donghwan, et al.
Publicado: (2024)
por: Lee, Donghwan, et al.
Publicado: (2024)
Deep Q-Learning with Gradient Target Tracking
por: Park, Bum Geun, et al.
Publicado: (2025)
por: Park, Bum Geun, et al.
Publicado: (2025)
Pretraining a Shared Q-Network for Data-Efficient Offline Reinforcement Learning
por: Park, Jongchan, et al.
Publicado: (2025)
por: Park, Jongchan, et al.
Publicado: (2025)
Analysis of Off-Policy Multi-Step TD-Learning with Linear Function Approximation
por: Lee, Donghwan
Publicado: (2024)
por: Lee, Donghwan
Publicado: (2024)
Taming the Adversary: Stable Minimax Deep Deterministic Policy Gradient via Fractional Objectives
por: Lee, Taeho, et al.
Publicado: (2026)
por: Lee, Taeho, et al.
Publicado: (2026)
Soft Deterministic Policy Gradient with Gaussian Smoothing
por: Na, Hyunjun, et al.
Publicado: (2026)
por: Na, Hyunjun, et al.
Publicado: (2026)
R-GTD: A Geometric Analysis of Gradient Temporal-Difference Learning in Singular Regimes
por: Na, Hyunjun, et al.
Publicado: (2026)
por: Na, Hyunjun, et al.
Publicado: (2026)
Adaptive Policy Backbone via Shared Network
por: Park, Bumgeun, et al.
Publicado: (2025)
por: Park, Bumgeun, et al.
Publicado: (2025)
Bellman Residual Minimization for Control: Geometry, Stationarity, and Convergence
por: Lee, Donghwan, et al.
Publicado: (2026)
por: Lee, Donghwan, et al.
Publicado: (2026)
Regularized Q-learning through Robust Averaging
por: Schmitt-Förster, Peter, et al.
Publicado: (2024)
por: Schmitt-Förster, Peter, et al.
Publicado: (2024)
Finite-Time Accuracy of Temporal-Difference Learning Under Schur-Stable Recursions
por: Lee, Donghwan, et al.
Publicado: (2022)
por: Lee, Donghwan, et al.
Publicado: (2022)
Studying the Korean Word-Chain Game with RLVR: Mitigating Reward Conflicts via Curriculum Learning
por: Rho, Donghwan
Publicado: (2025)
por: Rho, Donghwan
Publicado: (2025)
Exclusively Penalized Q-learning for Offline Reinforcement Learning
por: Yeom, Junghyuk, et al.
Publicado: (2024)
por: Yeom, Junghyuk, et al.
Publicado: (2024)
A Theory of Non-Linear Feature Learning with One Gradient Step in Two-Layer Neural Networks
por: Moniri, Behrad, et al.
Publicado: (2023)
por: Moniri, Behrad, et al.
Publicado: (2023)
TILDE-Q: A Transformation Invariant Loss Function for Time-Series Forecasting
por: Lee, Hyunwook, et al.
Publicado: (2022)
por: Lee, Hyunwook, et al.
Publicado: (2022)
MahaVar: OOD Detection via Class-wise Mahalanobis Distance Variance under Neural Collapse
por: Kim, Donghwan, et al.
Publicado: (2026)
por: Kim, Donghwan, et al.
Publicado: (2026)
Mitigating the Likelihood Paradox in Flow-based OOD Detection via Entropy Manipulation
por: Kim, Donghwan, et al.
Publicado: (2026)
por: Kim, Donghwan, et al.
Publicado: (2026)
Merge and Bound: Direct Manipulations on Weights for Class Incremental Learning
por: Kim, Taehoon, et al.
Publicado: (2025)
por: Kim, Taehoon, et al.
Publicado: (2025)
Transfer learning via Regularized Linear Discriminant Analysis
por: Zhang, Hongzhe, et al.
Publicado: (2025)
por: Zhang, Hongzhe, et al.
Publicado: (2025)
Q-value Regularized Decision ConvFormer for Offline Reinforcement Learning
por: Yan, Teng, et al.
Publicado: (2024)
por: Yan, Teng, et al.
Publicado: (2024)
HyperQ-Opt: Q-learning for Hyperparameter Optimization
por: Hasan, Md. Tarek
Publicado: (2024)
por: Hasan, Md. Tarek
Publicado: (2024)
Q-value Regularized Transformer for Offline Reinforcement Learning
por: Hu, Shengchao, et al.
Publicado: (2024)
por: Hu, Shengchao, et al.
Publicado: (2024)
Q-Distribution guided Q-learning for offline reinforcement learning: Uncertainty penalized Q-value via consistency model
por: Zhang, Jing, et al.
Publicado: (2024)
por: Zhang, Jing, et al.
Publicado: (2024)
Ejemplares similares
-
Periodic Regularized Q-Learning
por: Yang, Hyukjun, et al.
Publicado: (2026) -
A finite time analysis of distributed Q-learning
por: Lim, Han-Dong, et al.
Publicado: (2024) -
Understanding the theoretical properties of projected Bellman equation, linear Q-learning, and approximate value iteration
por: Lim, Han-Dong, et al.
Publicado: (2025) -
A Switching System Theory of Q-Learning with Linear Function Approximation
por: Lee, Donghwan, et al.
Publicado: (2026) -
A primal-dual perspective for distributed TD-learning
por: Lim, Han-Dong, et al.
Publicado: (2023)