Efficient Online Learning with Offline Datasets for Infinite Horizon MDPs: A Bayesian Approach
Fuente:
arXiv
Salvato in:
| Autori principali: | Tang, Dengwang, Jain, Rahul, Hao, Botao, Wen, Zheng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Posterior Sampling-based Online Learning for Episodic POMDPs
di: Tang, Dengwang, et al.
Pubblicazione: (2023)
di: Tang, Dengwang, et al.
Pubblicazione: (2023)
Reinforcement Learning Method for Zero-Sum Linear-Quadratic Stochastic Differential Games in Infinite Horizons
di: Wang, Yiyuan
Pubblicazione: (2026)
di: Wang, Yiyuan
Pubblicazione: (2026)
Multi-agent assignment via state augmented reinforcement learning
di: Agorio, Leopoldo, et al.
Pubblicazione: (2024)
di: Agorio, Leopoldo, et al.
Pubblicazione: (2024)
Object Tracking Incorporating Transfer Learning into Unscented and Cubature Kalman Filters
di: Alotaibi, Omar, et al.
Pubblicazione: (2024)
di: Alotaibi, Omar, et al.
Pubblicazione: (2024)
Nonparametric Sparse Online Learning of the Koopman Operator
di: Hou, Boya, et al.
Pubblicazione: (2024)
di: Hou, Boya, et al.
Pubblicazione: (2024)
Robust Recurrence of Discrete-Time Infinite-Horizon Stochastic Optimal Control with Discounted Cost
di: Moldenhauer, Robert H., et al.
Pubblicazione: (2025)
di: Moldenhauer, Robert H., et al.
Pubblicazione: (2025)
Automatic Link Selection in Multi-Channel Multiple Access with Link Failures
di: Wijewardena, Mevan, et al.
Pubblicazione: (2025)
di: Wijewardena, Mevan, et al.
Pubblicazione: (2025)
Robust Probability Hypothesis Density Filtering: Theory and Algorithms
di: Lei, Ming, et al.
Pubblicazione: (2025)
di: Lei, Ming, et al.
Pubblicazione: (2025)
An Optimal-Control Approach to Infinite-Horizon Restless Bandits: Achieving Asymptotic Optimality with Minimal Assumptions
di: YAN, Chen
Pubblicazione: (2024)
di: YAN, Chen
Pubblicazione: (2024)
Discrete-Time Approximations of Controlled Diffusions with Infinite Horizon Discounted and Average Cost
di: Pradhan, Somnath, et al.
Pubblicazione: (2025)
di: Pradhan, Somnath, et al.
Pubblicazione: (2025)
Controllability and Vector Potential
di: Shankar, Shiva
Pubblicazione: (2019)
di: Shankar, Shiva
Pubblicazione: (2019)
On Robustness of Double Linear Policy with Time-Varying Weights
di: Wang, Xin-Yu, et al.
Pubblicazione: (2023)
di: Wang, Xin-Yu, et al.
Pubblicazione: (2023)
On the continuity and smoothness of the value function in reinforcement learning and optimal control
di: Harder, Hans, et al.
Pubblicazione: (2024)
di: Harder, Hans, et al.
Pubblicazione: (2024)
Continuous-time Risk-sensitive Reinforcement Learning via Quadratic Variation Penalty
di: Jia, Yanwei
Pubblicazione: (2024)
di: Jia, Yanwei
Pubblicazione: (2024)
Optimal control of SDEs with merely measurable drift: an HJB approach
di: Du, Kai, et al.
Pubblicazione: (2025)
di: Du, Kai, et al.
Pubblicazione: (2025)
A Moreau Envelope Approach for LQR Meta-Policy Estimation
di: Aravind, Ashwin, et al.
Pubblicazione: (2024)
di: Aravind, Ashwin, et al.
Pubblicazione: (2024)
Convergence Analysis for Entropy-Regularized Control Problems: A Probabilistic Approach
di: Ma, Jin, et al.
Pubblicazione: (2024)
di: Ma, Jin, et al.
Pubblicazione: (2024)
Finite-Time Analysis of Projected Two-Time-Scale Stochastic Approximation
di: Bai, Yitao, et al.
Pubblicazione: (2026)
di: Bai, Yitao, et al.
Pubblicazione: (2026)
Max-Entropy Moment Filtering for Stochastic Hybrid Systems
di: Iwasaki, Kaito, et al.
Pubblicazione: (2026)
di: Iwasaki, Kaito, et al.
Pubblicazione: (2026)
Continuous time Stochastic optimal control under discrete time partial observations
di: Bayer, Christian, et al.
Pubblicazione: (2024)
di: Bayer, Christian, et al.
Pubblicazione: (2024)
Mean--Variance Portfolio Selection by Continuous-Time Reinforcement Learning: Algorithms, Regret Analysis, and Empirical Study
di: Huang, Yilie, et al.
Pubblicazione: (2024)
di: Huang, Yilie, et al.
Pubblicazione: (2024)
Dynamic Weight Optimization for Double Linear Policy: A Stochastic Model Predictive Control Approach
di: Hong, Tan Chin, et al.
Pubblicazione: (2026)
di: Hong, Tan Chin, et al.
Pubblicazione: (2026)
Pointwise-Sparse Actuator Scheduling for Linear Systems with Controllability Guarantee
di: Ballotta, Luca, et al.
Pubblicazione: (2024)
di: Ballotta, Luca, et al.
Pubblicazione: (2024)
Sample Complexity of Policy Gradient for Log-Growth Control
di: Pan, Qiuhua, et al.
Pubblicazione: (2026)
di: Pan, Qiuhua, et al.
Pubblicazione: (2026)
Continuous Policy and Value Iteration for Stochastic Control Problems and Its Convergence
di: Feng, Qi, et al.
Pubblicazione: (2025)
di: Feng, Qi, et al.
Pubblicazione: (2025)
Markov Decision Processes of the Third Kind: Learning Distributions by Policy Gradient Descent
di: Bäuerle, Nicole, et al.
Pubblicazione: (2026)
di: Bäuerle, Nicole, et al.
Pubblicazione: (2026)
Optimistic Training and Convergence of Q-Learning -- Extended Version
di: Mehta, Prashant, et al.
Pubblicazione: (2026)
di: Mehta, Prashant, et al.
Pubblicazione: (2026)
Stability and Sensitivity Analysis of Relative Temporal-Difference Learning: Extended Version
di: Sakha, Masoud S., et al.
Pubblicazione: (2026)
di: Sakha, Masoud S., et al.
Pubblicazione: (2026)
Formalising the intentional stance 2: a coinductive approach
di: McGregor, Simon, et al.
Pubblicazione: (2025)
di: McGregor, Simon, et al.
Pubblicazione: (2025)
Formalising the intentional stance 1: attributing goals and beliefs to stochastic processes
di: McGregor, Simon, et al.
Pubblicazione: (2024)
di: McGregor, Simon, et al.
Pubblicazione: (2024)
Intermittent Encryption Strategies for Anti-Eavesdropping Estimation
di: Hu, Zhongyao, et al.
Pubblicazione: (2024)
di: Hu, Zhongyao, et al.
Pubblicazione: (2024)
The Quantum Advantage in Binary Teams and the Coordination Dilemma: Supplementary
di: Deshpande, Shashank A., et al.
Pubblicazione: (2023)
di: Deshpande, Shashank A., et al.
Pubblicazione: (2023)
From Semi-Infinite Constraints to Structured Robust Policies: Optimal Gain Selection for Financial Systems
di: Hsieh, Chung-Han
Pubblicazione: (2022)
di: Hsieh, Chung-Han
Pubblicazione: (2022)
The Dynamic Search for the Minimal Dynamic Extension
di: D'Souza, Rollen S.
Pubblicazione: (2026)
di: D'Souza, Rollen S.
Pubblicazione: (2026)
Importance sampling for rare event tracking within the ensemble Kalman filtering framework
di: Rached, Nadhir Ben, et al.
Pubblicazione: (2024)
di: Rached, Nadhir Ben, et al.
Pubblicazione: (2024)
Policy Gradient for Continuous-Time Mean-Field Control
di: Bayraktar, Erhan, et al.
Pubblicazione: (2026)
di: Bayraktar, Erhan, et al.
Pubblicazione: (2026)
Stochastic Model Predictive Control for Sub-Gaussian Noise
di: Ao, Yunke, et al.
Pubblicazione: (2025)
di: Ao, Yunke, et al.
Pubblicazione: (2025)
Beyond Bellman: High-Order Generator Regression for Continuous-Time Policy Evaluation
di: Zheng, Yaowei, et al.
Pubblicazione: (2026)
di: Zheng, Yaowei, et al.
Pubblicazione: (2026)
Dynamic Programming Principle for Stochastic Control Problems on Riemannian Manifolds
di: Gao, Dingqian, et al.
Pubblicazione: (2025)
di: Gao, Dingqian, et al.
Pubblicazione: (2025)
A measure-valued HJB perspective on Bayesian optimal adaptive control
di: Cox, Alexander M. G., et al.
Pubblicazione: (2025)
di: Cox, Alexander M. G., et al.
Pubblicazione: (2025)
Documenti analoghi
-
Posterior Sampling-based Online Learning for Episodic POMDPs
di: Tang, Dengwang, et al.
Pubblicazione: (2023) -
Reinforcement Learning Method for Zero-Sum Linear-Quadratic Stochastic Differential Games in Infinite Horizons
di: Wang, Yiyuan
Pubblicazione: (2026) -
Multi-agent assignment via state augmented reinforcement learning
di: Agorio, Leopoldo, et al.
Pubblicazione: (2024) -
Object Tracking Incorporating Transfer Learning into Unscented and Cubature Kalman Filters
di: Alotaibi, Omar, et al.
Pubblicazione: (2024) -
Nonparametric Sparse Online Learning of the Koopman Operator
di: Hou, Boya, et al.
Pubblicazione: (2024)