Does DQN Learn?
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Gopalan, Aditya, Thoppe, Gugan |
|---|---|
| Format: | Preprint |
| Publié: |
2022
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Monotone and Conservative Policy Iteration Beyond the Tabular Case
par: Eshwar, S. R., et autres
Publié: (2025)
par: Eshwar, S. R., et autres
Publié: (2025)
Neural Actor-Critic Methods for Hamilton-Jacobi-Bellman PDEs: Asymptotic Analysis and Numerical Studies
par: Cohen, Samuel N., et autres
Publié: (2025)
par: Cohen, Samuel N., et autres
Publié: (2025)
Mean--Variance Portfolio Selection by Continuous-Time Reinforcement Learning: Algorithms, Regret Analysis, and Empirical Study
par: Huang, Yilie, et autres
Publié: (2024)
par: Huang, Yilie, et autres
Publié: (2024)
Convergence of policy gradient methods for finite-horizon exploratory linear-quadratic control problems
par: Giegrich, Michael, et autres
Publié: (2022)
par: Giegrich, Michael, et autres
Publié: (2022)
Optimistic Training and Convergence of Q-Learning -- Extended Version
par: Mehta, Prashant, et autres
Publié: (2026)
par: Mehta, Prashant, et autres
Publié: (2026)
Stability and Sensitivity Analysis of Relative Temporal-Difference Learning: Extended Version
par: Sakha, Masoud S., et autres
Publié: (2026)
par: Sakha, Masoud S., et autres
Publié: (2026)
Optimal control of SDEs with merely measurable drift: an HJB approach
par: Du, Kai, et autres
Publié: (2025)
par: Du, Kai, et autres
Publié: (2025)
Reinforcement Learning in MDPs with Information-Ordered Policies
par: Zhang, Zhongjun, et autres
Publié: (2025)
par: Zhang, Zhongjun, et autres
Publié: (2025)
Which exceptional low-dimensional projections of a Gaussian point cloud can be found in polynomial time?
par: Montanari, Andrea, et autres
Publié: (2024)
par: Montanari, Andrea, et autres
Publié: (2024)
Learning an optimal feedback operator semiglobally stabilizing semilinear parabolic equations
par: Kunisch, Karl, et autres
Publié: (2021)
par: Kunisch, Karl, et autres
Publié: (2021)
Symbolic recovery of PDEs from measurement data
par: Morina, Erion, et autres
Publié: (2026)
par: Morina, Erion, et autres
Publié: (2026)
Generative optimal transport via forward-backward HJB matching
par: Yang, Haiqian, et autres
Publié: (2026)
par: Yang, Haiqian, et autres
Publié: (2026)
Convergence Analysis for Entropy-Regularized Control Problems: A Probabilistic Approach
par: Ma, Jin, et autres
Publié: (2024)
par: Ma, Jin, et autres
Publié: (2024)
Learning to steer with Brownian noise
par: Ankirchner, Stefan, et autres
Publié: (2024)
par: Ankirchner, Stefan, et autres
Publié: (2024)
Deep Learning for Continuous-Time Stochastic Control with Jumps
par: Cheridito, Patrick, et autres
Publié: (2025)
par: Cheridito, Patrick, et autres
Publié: (2025)
Continuous Policy and Value Iteration for Stochastic Control Problems and Its Convergence
par: Feng, Qi, et autres
Publié: (2025)
par: Feng, Qi, et autres
Publié: (2025)
Controllability and Vector Potential
par: Shankar, Shiva
Publié: (2019)
par: Shankar, Shiva
Publié: (2019)
Near Optimality of Lipschitz and Smooth Policies in Controlled Diffusions
par: Pradhan, Somnath, et autres
Publié: (2024)
par: Pradhan, Somnath, et autres
Publié: (2024)
Stabilization via localized controls in nonlocal models of crowd dynamics
par: Pogodaev, Nikolay, et autres
Publié: (2024)
par: Pogodaev, Nikolay, et autres
Publié: (2024)
Reinforcement Learning in Real Option Models
par: Dianetti, Jodi, et autres
Publié: (2026)
par: Dianetti, Jodi, et autres
Publié: (2026)
Physics-informed approach for exploratory Hamilton--Jacobi--Bellman equations via policy iterations
par: Kim, Yeongjong, et autres
Publié: (2025)
par: Kim, Yeongjong, et autres
Publié: (2025)
Exploratory Randomization for Discrete-Time Linear Exponential Quadratic Gaussian (LEQG) Problem
par: Lleo, Sebastien, et autres
Publié: (2025)
par: Lleo, Sebastien, et autres
Publié: (2025)
Fractional-Boundary-Regularized Deep Galerkin Method for Variational Inequalities in Mixed Optimal Stopping and Control
par: Zhao, Yun, et autres
Publié: (2025)
par: Zhao, Yun, et autres
Publié: (2025)
Beyond Bellman: High-Order Generator Regression for Continuous-Time Policy Evaluation
par: Zheng, Yaowei, et autres
Publié: (2026)
par: Zheng, Yaowei, et autres
Publié: (2026)
Ergodic Risk Sensitive Control of Diffusions under a General Structural Hypothesis
par: Anugu, Sumith Reddy, et autres
Publié: (2025)
par: Anugu, Sumith Reddy, et autres
Publié: (2025)
From Score Matching to Diffusion: A Fine-Grained Error Analysis in the Gaussian Setting
par: Hurault, Samuel, et autres
Publié: (2025)
par: Hurault, Samuel, et autres
Publié: (2025)
Control randomisation approach for policy gradient and application to reinforcement learning in optimal switching
par: Denkert, Robert, et autres
Publié: (2024)
par: Denkert, Robert, et autres
Publié: (2024)
Convergence of Proximal Policy Gradient Method for Problems with Control Dependent Diffusion Coefficients
par: Davey, Ashley, et autres
Publié: (2025)
par: Davey, Ashley, et autres
Publié: (2025)
Improving LLM Agent Planning with In-Context Learning via Atomic Fact Augmentation and Lookahead Search
par: Holt, Samuel, et autres
Publié: (2025)
par: Holt, Samuel, et autres
Publié: (2025)
A Moreau Envelope Approach for LQR Meta-Policy Estimation
par: Aravind, Ashwin, et autres
Publié: (2024)
par: Aravind, Ashwin, et autres
Publié: (2024)
OptiTrap: Optimal Trap Trajectories for Acoustic Levitation Displays
par: Paneva, Viktorija, et autres
Publié: (2022)
par: Paneva, Viktorija, et autres
Publié: (2022)
On-Average Stability of Multipass Preconditioned SGD and Effective Dimension
par: Vary, Simon, et autres
Publié: (2026)
par: Vary, Simon, et autres
Publié: (2026)
Entropy annealing for policy mirror descent in continuous time and space
par: Sethi, Deven, et autres
Publié: (2024)
par: Sethi, Deven, et autres
Publié: (2024)
Trajectory stabilization of nonlocal continuity equations by localized controls
par: Pogodaev, Nikolay, et autres
Publié: (2024)
par: Pogodaev, Nikolay, et autres
Publié: (2024)
Continuous-time Risk-sensitive Reinforcement Learning via Quadratic Variation Penalty
par: Jia, Yanwei
Publié: (2024)
par: Jia, Yanwei
Publié: (2024)
Neural solver for Wasserstein Geodesics and optimal transport dynamics
par: Liu, Hailiang, et autres
Publié: (2026)
par: Liu, Hailiang, et autres
Publié: (2026)
Approximate controllability for 2D Euler equations
par: Rodrigues, Sérgio S.
Publié: (2024)
par: Rodrigues, Sérgio S.
Publié: (2024)
The Hard-Constraint PINNs for Interface Optimal Control Problems
par: Lai, Ming-Chih, et autres
Publié: (2023)
par: Lai, Ming-Chih, et autres
Publié: (2023)
A Dynamic-Growing Fuzzy-Neuro Controller, Application to a 3PSP Parallel Robot
par: Jalaeian-Farimani, Mohsen, et autres
Publié: (2026)
par: Jalaeian-Farimani, Mohsen, et autres
Publié: (2026)
Exploratory Randomization for Discrete-Time Risk-Sensitive Benchmarked Investment Management with Reinforcement Learning
par: Lleo, Sebastien, et autres
Publié: (2026)
par: Lleo, Sebastien, et autres
Publié: (2026)
Documents similaires
-
Monotone and Conservative Policy Iteration Beyond the Tabular Case
par: Eshwar, S. R., et autres
Publié: (2025) -
Neural Actor-Critic Methods for Hamilton-Jacobi-Bellman PDEs: Asymptotic Analysis and Numerical Studies
par: Cohen, Samuel N., et autres
Publié: (2025) -
Mean--Variance Portfolio Selection by Continuous-Time Reinforcement Learning: Algorithms, Regret Analysis, and Empirical Study
par: Huang, Yilie, et autres
Publié: (2024) -
Convergence of policy gradient methods for finite-horizon exploratory linear-quadratic control problems
par: Giegrich, Michael, et autres
Publié: (2022) -
Optimistic Training and Convergence of Q-Learning -- Extended Version
par: Mehta, Prashant, et autres
Publié: (2026)