Q-Distribution guided Q-learning for offline reinforcement learning: Uncertainty penalized Q-value via consistency model
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Jing, Fang, Linjiajie, Shi, Kexin, Wang, Wenjia, Jing, Bing-Yi |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Diffusion Actor-Critic: Formulating Constrained Policy Iteration as Diffusion Noise Regression for Offline Reinforcement Learning
par: Fang, Linjiajie, et autres
Publié: (2024)
par: Fang, Linjiajie, et autres
Publié: (2024)
Optimistic Q-learning for average reward and episodic reinforcement learning
par: Agrawal, Priyank, et autres
Publié: (2024)
par: Agrawal, Priyank, et autres
Publié: (2024)
Online reinforcement learning via sparse Gaussian mixture model Q-functions
par: Vu, Minh, et autres
Publié: (2025)
par: Vu, Minh, et autres
Publié: (2025)
Causal prompting model-based offline reinforcement learning
par: Yu, Xuehui, et autres
Publié: (2024)
par: Yu, Xuehui, et autres
Publié: (2024)
HyperQ-Opt: Q-learning for Hyperparameter Optimization
par: Hasan, Md. Tarek
Publié: (2024)
par: Hasan, Md. Tarek
Publié: (2024)
Regularized Q-learning
par: Lim, Han-Dong, et autres
Publié: (2022)
par: Lim, Han-Dong, et autres
Publié: (2022)
Transfer Q-learning
par: Chen, Elynn, et autres
Publié: (2022)
par: Chen, Elynn, et autres
Publié: (2022)
Generalisation in Multitask Fitted Q-Iteration and Offline Q-learning
par: Manda, Kausthubh, et autres
Publié: (2025)
par: Manda, Kausthubh, et autres
Publié: (2025)
DIAR: Diffusion-model-guided Implicit Q-learning with Adaptive Revaluation
par: Park, Jaehyun, et autres
Publié: (2024)
par: Park, Jaehyun, et autres
Publié: (2024)
Q-learning with Posterior Sampling
par: Agrawal, Priyank, et autres
Publié: (2025)
par: Agrawal, Priyank, et autres
Publié: (2025)
Constant Stepsize Q-learning: Distributional Convergence, Bias and Extrapolation
par: Zhang, Yixuan, et autres
Publié: (2024)
par: Zhang, Yixuan, et autres
Publié: (2024)
An Index Policy Based on Sarsa and Q-learning for Heterogeneous Smart Target Tracking
par: Hao, Yuhang, et autres
Publié: (2024)
par: Hao, Yuhang, et autres
Publié: (2024)
Deep Double Q-learning
par: Nagarajan, Prabhat, et autres
Publié: (2025)
par: Nagarajan, Prabhat, et autres
Publié: (2025)
A Finite Sample Complexity Bound for Distributionally Robust Q-learning
par: Wang, Shengbo, et autres
Publié: (2023)
par: Wang, Shengbo, et autres
Publié: (2023)
Sample Complexity of Variance-reduced Distributionally Robust Q-learning
par: Wang, Shengbo, et autres
Publié: (2023)
par: Wang, Shengbo, et autres
Publié: (2023)
Gap-Dependent Bounds for Federated $Q$-learning
par: Zhang, Haochen, et autres
Publié: (2025)
par: Zhang, Haochen, et autres
Publié: (2025)
Q-learning as a monotone scheme
par: Yang, Lingyi
Publié: (2024)
par: Yang, Lingyi
Publié: (2024)
Enhanced Bayesian Personalized Ranking for Robust Hard Negative Sampling in Recommender Systems
par: Shi, Kexin, et autres
Publié: (2024)
par: Shi, Kexin, et autres
Publié: (2024)
Deep Q-Network (DQN) multi-agent reinforcement learning (MARL) for Stock Trading
par: Tidwell, John Christopher, et autres
Publié: (2025)
par: Tidwell, John Christopher, et autres
Publié: (2025)
Q-learning with Adjoint Matching
par: Li, Qiyang, et autres
Publié: (2026)
par: Li, Qiyang, et autres
Publié: (2026)
Gaussian Approximation for Asynchronous Q-learning
par: Rubtsov, Artemy, et autres
Publié: (2026)
par: Rubtsov, Artemy, et autres
Publié: (2026)
Experimental evaluation of offline reinforcement learning for HVAC control in buildings
par: Wang, Jun, et autres
Publié: (2024)
par: Wang, Jun, et autres
Publié: (2024)
Expert or not? assessing data quality in offline reinforcement learning
par: Asadulaev, Arip, et autres
Publié: (2025)
par: Asadulaev, Arip, et autres
Publié: (2025)
VA-learning as a more efficient alternative to Q-learning
par: Tang, Yunhao, et autres
Publié: (2023)
par: Tang, Yunhao, et autres
Publié: (2023)
MinMaxMin $Q$-learning
par: Soffair, Nitsan, et autres
Publié: (2024)
par: Soffair, Nitsan, et autres
Publié: (2024)
Is Q-learning an Ill-posed Problem?
par: Wissmann, Philipp, et autres
Publié: (2025)
par: Wissmann, Philipp, et autres
Publié: (2025)
rQdia: Regularizing Q-Value Distributions With Image Augmentation
par: Lerman, Sam, et autres
Publié: (2025)
par: Lerman, Sam, et autres
Publié: (2025)
PyCFRL: A Python library for counterfactually fair offline reinforcement learning via sequential data preprocessing
par: Zhang, Jianhan, et autres
Publié: (2025)
par: Zhang, Jianhan, et autres
Publié: (2025)
Q-learning with temporal memory to navigate turbulence
par: Rando, Marco, et autres
Publié: (2024)
par: Rando, Marco, et autres
Publié: (2024)
Regularized Q-learning through Robust Averaging
par: Schmitt-Förster, Peter, et autres
Publié: (2024)
par: Schmitt-Förster, Peter, et autres
Publié: (2024)
Stabilizing Extreme Q-learning by Maclaurin Expansion
par: Omura, Motoki, et autres
Publié: (2024)
par: Omura, Motoki, et autres
Publié: (2024)
Asymptotic Analysis of Sample-averaged Q-learning
par: Panda, Saunak Kumar, et autres
Publié: (2024)
par: Panda, Saunak Kumar, et autres
Publié: (2024)
Periodic agent-state based Q-learning for POMDPs
par: Sinha, Amit, et autres
Publié: (2024)
par: Sinha, Amit, et autres
Publié: (2024)
Tensor-Efficient High-Dimensional Q-learning
par: Wu, Junyi, et autres
Publié: (2025)
par: Wu, Junyi, et autres
Publié: (2025)
Maximum entropy GFlowNets with soft Q-learning
par: Mohammadpour, Sobhan, et autres
Publié: (2023)
par: Mohammadpour, Sobhan, et autres
Publié: (2023)
Model predictive control-based value estimation for efficient reinforcement learning
par: Wu, Qizhen, et autres
Publié: (2023)
par: Wu, Qizhen, et autres
Publié: (2023)
Towards Optimal Adversarial Robust Q-learning with Bellman Infinity-error
par: Li, Haoran, et autres
Publié: (2024)
par: Li, Haoran, et autres
Publié: (2024)
Deep autoregressive density nets vs neural ensembles for model-based offline reinforcement learning
par: Benechehab, Abdelhakim, et autres
Publié: (2024)
par: Benechehab, Abdelhakim, et autres
Publié: (2024)
Robust $Q$-learning Algorithm for Markov Decision Processes under Wasserstein Uncertainty
par: Neufeld, Ariel, et autres
Publié: (2022)
par: Neufeld, Ariel, et autres
Publié: (2022)
Cost-optimal Sequential Testing via Doubly Robust Q-learning
par: Zhou, Doudou, et autres
Publié: (2026)
par: Zhou, Doudou, et autres
Publié: (2026)
Documents similaires
-
Diffusion Actor-Critic: Formulating Constrained Policy Iteration as Diffusion Noise Regression for Offline Reinforcement Learning
par: Fang, Linjiajie, et autres
Publié: (2024) -
Optimistic Q-learning for average reward and episodic reinforcement learning
par: Agrawal, Priyank, et autres
Publié: (2024) -
Online reinforcement learning via sparse Gaussian mixture model Q-functions
par: Vu, Minh, et autres
Publié: (2025) -
Causal prompting model-based offline reinforcement learning
par: Yu, Xuehui, et autres
Publié: (2024) -
HyperQ-Opt: Q-learning for Hyperparameter Optimization
par: Hasan, Md. Tarek
Publié: (2024)