Taming "data-hungry" reinforcement learning? Stability in continuous state-action spaces
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Duan, Yaqi, Wainwright, Martin J. |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
On the optimization dynamics of RLVR: Gradient gap and step size thresholds
par: Suk, Joe, et autres
Publié: (2025)
par: Suk, Joe, et autres
Publié: (2025)
Optimal transport natural gradient for statistical manifolds with continuous sample space
par: Chen, Yifan, et autres
Publié: (2018)
par: Chen, Yifan, et autres
Publié: (2018)
Rate-cost tradeoffs in continuous-time control with a biomolecular application
par: Nakahira, Yorie, et autres
Publié: (2025)
par: Nakahira, Yorie, et autres
Publié: (2025)
Stabilizing reinforcement learning control: A modular framework for optimizing over all stable behavior
par: Lawrence, Nathan P., et autres
Publié: (2023)
par: Lawrence, Nathan P., et autres
Publié: (2023)
Scalable spectral representations for multi-agent reinforcement learning in network MDPs
par: Ren, Zhaolin, et autres
Publié: (2024)
par: Ren, Zhaolin, et autres
Publié: (2024)
Independent policy gradient-based reinforcement learning for economic and reliable energy management of multi-microgrid systems
par: Hu, Junkai, et autres
Publié: (2025)
par: Hu, Junkai, et autres
Publié: (2025)
Stabilizing a linear system using phone calls when time is information
par: Khojasteh, Mohammad Javad, et autres
Publié: (2018)
par: Khojasteh, Mohammad Javad, et autres
Publié: (2018)
Exploiting inter-agent coupling information for efficient reinforcement learning of cooperative LQR
par: Syed, Shahbaz P Qadri, et autres
Publié: (2025)
par: Syed, Shahbaz P Qadri, et autres
Publié: (2025)
Randomized algorithms and PAC bounds for inverse reinforcement learning in continuous spaces
par: Kamoutsi, Angeliki, et autres
Publié: (2024)
par: Kamoutsi, Angeliki, et autres
Publié: (2024)
Effective Communication with Dynamic Feature Compression
par: Talli, Pietro, et autres
Publié: (2024)
par: Talli, Pietro, et autres
Publié: (2024)
Distributed Adaptive Learning Under Communication Constraints
par: Carpentiero, Marco, et autres
Publié: (2021)
par: Carpentiero, Marco, et autres
Publié: (2021)
Learning How to Strategically Disclose Information
par: Velicheti, Raj Kiriti, et autres
Publié: (2024)
par: Velicheti, Raj Kiriti, et autres
Publié: (2024)
A Soft Inducement Framework for Incentive-Aided Steering of No-Regret Players
par: Yorulmaz, Asrin Efe, et autres
Publié: (2025)
par: Yorulmaz, Asrin Efe, et autres
Publié: (2025)
Observability conditions for neural state-space models with eigenvalues and their roots of unity
par: Gracyk, Andrew
Publié: (2025)
par: Gracyk, Andrew
Publié: (2025)
A CLuP algorithm to practically achieve $\sim 0.76$ SK--model ground state free energy
par: Stojnic, Mihailo
Publié: (2025)
par: Stojnic, Mihailo
Publié: (2025)
CLuP practically achieves $\sim 1.77$ positive and $\sim 0.33$ negative Hopfield model ground state free energy
par: Stojnic, Mihailo
Publié: (2025)
par: Stojnic, Mihailo
Publié: (2025)
On Convex Data-Driven Inverse Optimal Control for Nonlinear, Non-stationary and Stochastic Systems
par: Garrabe, Emiland, et autres
Publié: (2023)
par: Garrabe, Emiland, et autres
Publié: (2023)
On Stability in Optimistic Bilevel Optimization
par: Royset, Johannes O.
Publié: (2024)
par: Royset, Johannes O.
Publié: (2024)
Learning a local trading strategy: deep reinforcement learning for grid-scale renewable energy integration
par: Ju, Caleb, et autres
Publié: (2024)
par: Ju, Caleb, et autres
Publié: (2024)
Convergence of linear programming hierarchies for Gibbs states of spin systems
par: Fawzi, Hamza, et autres
Publié: (2025)
par: Fawzi, Hamza, et autres
Publié: (2025)
Semantic Communication in Multi-team Dynamic Games: A Mean Field Perspective
par: Aggarwal, Shubham, et autres
Publié: (2024)
par: Aggarwal, Shubham, et autres
Publié: (2024)
An Information-Theoretic Analysis of Discrete-Time Control and Filtering Limitations by the I-MMSE Relationships
par: Wan, Neng, et autres
Publié: (2023)
par: Wan, Neng, et autres
Publié: (2023)
Communication over LQG Control Systems: A Convex Optimization Approach to Capacity
par: Rips, Aharon, et autres
Publié: (2025)
par: Rips, Aharon, et autres
Publié: (2025)
Rate-Cost Tradeoffs in Nonlinear Control
par: Atay, Eray Unsal, et autres
Publié: (2026)
par: Atay, Eray Unsal, et autres
Publié: (2026)
Geometry of Distance Protection
par: Taylor, Josh A., et autres
Publié: (2025)
par: Taylor, Josh A., et autres
Publié: (2025)
GreenLight-Gym: Reinforcement learning benchmark environment for control of greenhouse production systems
par: van Laatum, Bart, et autres
Publié: (2024)
par: van Laatum, Bart, et autres
Publié: (2024)
Safe exploration in reproducing kernel Hilbert spaces
par: Tokmak, Abdullah, et autres
Publié: (2025)
par: Tokmak, Abdullah, et autres
Publié: (2025)
Formal Entropy-Regularized Control of Stochastic Systems
par: van Zutphen, Menno, et autres
Publié: (2026)
par: van Zutphen, Menno, et autres
Publié: (2026)
Sample Complexity of Linear Quadratic Regulator Without Initial Stability
par: Moghaddam, Amirreza Neshaei, et autres
Publié: (2025)
par: Moghaddam, Amirreza Neshaei, et autres
Publié: (2025)
On the Stability of Nonlinear Receding Horizon Control: A Geometric Perspective
par: Westenbroek, Tyler, et autres
Publié: (2021)
par: Westenbroek, Tyler, et autres
Publié: (2021)
Optimal and instance-dependent guarantees for Markovian linear stochastic approximation
par: Mou, Wenlong, et autres
Publié: (2021)
par: Mou, Wenlong, et autres
Publié: (2021)
Alignment of large language models with constrained learning
par: Zhang, Botong, et autres
Publié: (2025)
par: Zhang, Botong, et autres
Publié: (2025)
Joint Learning of Linear Dynamical Systems under Smoothness Constraints
par: Tyagi, Hemant
Publié: (2024)
par: Tyagi, Hemant
Publié: (2024)
Function Gradient Approximation with Random Shallow ReLU Networks with Control Applications
par: Lamperski, Andrew, et autres
Publié: (2024)
par: Lamperski, Andrew, et autres
Publié: (2024)
Kernel Mean Embedding Topology: Weak and Strong Forms for Stochastic Kernels and Implications for Model Learning
par: Saldi, Naci, et autres
Publié: (2025)
par: Saldi, Naci, et autres
Publié: (2025)
Learning linear dynamical systems under convex constraints
par: Tyagi, Hemant, et autres
Publié: (2023)
par: Tyagi, Hemant, et autres
Publié: (2023)
Model-Free Output Feedback Stabilization via Policy Gradient Methods
par: Zhang, Ankang, et autres
Publié: (2026)
par: Zhang, Ankang, et autres
Publié: (2026)
Dynamic Topic Analysis in Academic Journals using Convex Non-negative Matrix Factorization Method
par: Yang, Yang, et autres
Publié: (2025)
par: Yang, Yang, et autres
Publié: (2025)
Structural Controllability of Large-Scale Hypergraphs
par: Pickard, Joshua, et autres
Publié: (2026)
par: Pickard, Joshua, et autres
Publié: (2026)
Convergence and stability of Q-learning in Hierarchical Reinforcement Learning
par: Manenti, Massimiliano, et autres
Publié: (2025)
par: Manenti, Massimiliano, et autres
Publié: (2025)
Documents similaires
-
On the optimization dynamics of RLVR: Gradient gap and step size thresholds
par: Suk, Joe, et autres
Publié: (2025) -
Optimal transport natural gradient for statistical manifolds with continuous sample space
par: Chen, Yifan, et autres
Publié: (2018) -
Rate-cost tradeoffs in continuous-time control with a biomolecular application
par: Nakahira, Yorie, et autres
Publié: (2025) -
Stabilizing reinforcement learning control: A modular framework for optimizing over all stable behavior
par: Lawrence, Nathan P., et autres
Publié: (2023) -
Scalable spectral representations for multi-agent reinforcement learning in network MDPs
par: Ren, Zhaolin, et autres
Publié: (2024)