UDQL: Bridging The Gap between MSE Loss and The Optimal Value Function in Offline Reinforcement Learning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Yu, Yu, Rui, Yao, Zhipeng, Zhang, Wenyuan, Wang, Jun, Zhang, Liming |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Corruption-Robust Offline Reinforcement Learning with General Function Approximation
par: Ye, Chenlu, et autres
Publié: (2023)
par: Ye, Chenlu, et autres
Publié: (2023)
Diverse Randomized Value Functions: A Provably Pessimistic Approach for Offline Reinforcement Learning
par: Yu, Xudong, et autres
Publié: (2024)
par: Yu, Xudong, et autres
Publié: (2024)
Bridging Domain Gaps with Target-Aligned Generation for Offline Reinforcement Learning
par: Kim, Minung, et autres
Publié: (2026)
par: Kim, Minung, et autres
Publié: (2026)
VIPO: Value Function Inconsistency Penalized Offline Reinforcement Learning
par: Chen, Xuyang, et autres
Publié: (2025)
par: Chen, Xuyang, et autres
Publié: (2025)
Gap-Dependent Bounds for Nearly Minimax Optimal Reinforcement Learning with Linear Function Approximation
par: Zhang, Haochen, et autres
Publié: (2026)
par: Zhang, Haochen, et autres
Publié: (2026)
Urban-Focused Multi-Task Offline Reinforcement Learning with Contrastive Data Sharing
par: Zhao, Xinbo, et autres
Publié: (2024)
par: Zhao, Xinbo, et autres
Publié: (2024)
Diffusion Policies with Value-Conditional Optimization for Offline Reinforcement Learning
par: Ma, Yunchang, et autres
Publié: (2025)
par: Ma, Yunchang, et autres
Publié: (2025)
The Generalization Gap in Offline Reinforcement Learning
par: Mediratta, Ishita, et autres
Publié: (2023)
par: Mediratta, Ishita, et autres
Publié: (2023)
Value-Guidance MeanFlow for Offline Multi-Agent Reinforcement Learning
par: Pang, Teng, et autres
Publié: (2026)
par: Pang, Teng, et autres
Publié: (2026)
OASIS: Conditional Distribution Shaping for Offline Safe Reinforcement Learning
par: Yao, Yihang, et autres
Publié: (2024)
par: Yao, Yihang, et autres
Publié: (2024)
Diffusion Policies for Risk-Averse Behavior Modeling in Offline Reinforcement Learning
par: Chen, Xiaocong, et autres
Publié: (2024)
par: Chen, Xiaocong, et autres
Publié: (2024)
Bridging Dynamics Gaps via Diffusion Schrödinger Bridge for Cross-Domain Reinforcement Learning
par: Zhang, Hanping, et autres
Publié: (2026)
par: Zhang, Hanping, et autres
Publié: (2026)
Is Value Functions Estimation with Classification Plug-and-play for Offline Reinforcement Learning?
par: Tarasov, Denis, et autres
Publié: (2024)
par: Tarasov, Denis, et autres
Publié: (2024)
Provably Efficient Offline-to-Online Value Adaptation with General Function Approximation
par: Li, Shangzhe, et autres
Publié: (2026)
par: Li, Shangzhe, et autres
Publié: (2026)
Instrumental Variable Value Iteration for Causal Offline Reinforcement Learning
par: Liao, Luofeng, et autres
Publié: (2021)
par: Liao, Luofeng, et autres
Publié: (2021)
Ensemble Successor Representations for Task Generalization in Offline-to-Online Reinforcement Learning
par: Wang, Changhong, et autres
Publié: (2024)
par: Wang, Changhong, et autres
Publié: (2024)
Horizon Reduction as Information Loss in Offline Reinforcement Learning
par: Nidadala, Uday Kumar, et autres
Publié: (2025)
par: Nidadala, Uday Kumar, et autres
Publié: (2025)
Switching the Loss Reduces the Cost in Batch (Offline) Reinforcement Learning
par: Ayoub, Alex, et autres
Publié: (2024)
par: Ayoub, Alex, et autres
Publié: (2024)
Energy-Weighted Flow Matching for Offline Reinforcement Learning
par: Zhang, Shiyuan, et autres
Publié: (2025)
par: Zhang, Shiyuan, et autres
Publié: (2025)
Dynamic Momentum Recalibration in Online Gradient Learning
par: Yao, Zhipeng, et autres
Publié: (2026)
par: Yao, Zhipeng, et autres
Publié: (2026)
Towards Robust Offline-to-Online Reinforcement Learning via Uncertainty and Smoothness
par: Wen, Xiaoyu, et autres
Publié: (2023)
par: Wen, Xiaoyu, et autres
Publié: (2023)
Rethinking Optimal Transport in Offline Reinforcement Learning
par: Asadulaev, Arip, et autres
Publié: (2024)
par: Asadulaev, Arip, et autres
Publié: (2024)
Federated Offline Reinforcement Learning
par: Zhou, Doudou, et autres
Publié: (2022)
par: Zhou, Doudou, et autres
Publié: (2022)
Hindsight Preference Learning for Offline Preference-based Reinforcement Learning
par: Gao, Chen-Xiao, et autres
Publié: (2024)
par: Gao, Chen-Xiao, et autres
Publié: (2024)
Towards Robust Offline Reinforcement Learning under Diverse Data Corruption
par: Yang, Rui, et autres
Publié: (2023)
par: Yang, Rui, et autres
Publié: (2023)
Policy Constraint by Only Support Constraint for Offline Reinforcement Learning
par: Gao, Yunkai, et autres
Publié: (2025)
par: Gao, Yunkai, et autres
Publié: (2025)
Towards an Information Theoretic Framework of Context-Based Offline Meta-Reinforcement Learning
par: Li, Lanqing, et autres
Publié: (2024)
par: Li, Lanqing, et autres
Publié: (2024)
Bridging the Gap between Learning and Inference for Diffusion-Based Molecule Generation
par: Liu, Peidong, et autres
Publié: (2024)
par: Liu, Peidong, et autres
Publié: (2024)
Constrained Policy Optimization with Explicit Behavior Density for Offline Reinforcement Learning
par: Zhang, Jing, et autres
Publié: (2023)
par: Zhang, Jing, et autres
Publié: (2023)
Any-step Dynamics Model Improves Future Predictions for Online and Offline Reinforcement Learning
par: Lin, Haoxin, et autres
Publié: (2024)
par: Lin, Haoxin, et autres
Publié: (2024)
DiM-TS: Bridge the Gap between Selective State Space Models and Time Series for Generative Modeling
par: Yao, Zihao, et autres
Publié: (2025)
par: Yao, Zihao, et autres
Publié: (2025)
Offline-to-Online Reinforcement Learning with Classifier-Free Diffusion Generation
par: Huang, Xiao, et autres
Publié: (2025)
par: Huang, Xiao, et autres
Publié: (2025)
Efficient Cross-Domain Offline Reinforcement Learning with Dynamics- and Value-Aligned Data Filtering
par: Qiao, Zhongjian, et autres
Publié: (2025)
par: Qiao, Zhongjian, et autres
Publié: (2025)
Augmenting Offline Reinforcement Learning with State-only Interactions
par: Li, Shangzhe, et autres
Publié: (2024)
par: Li, Shangzhe, et autres
Publié: (2024)
Residuals-based Offline Reinforcement Learning
par: Zhu, Qing, et autres
Publié: (2026)
par: Zhu, Qing, et autres
Publié: (2026)
Energy-Guided Diffusion Sampling for Offline-to-Online Reinforcement Learning
par: Liu, Xu-Hui, et autres
Publié: (2024)
par: Liu, Xu-Hui, et autres
Publié: (2024)
From Static Constraints to Dynamic Adaptation: Sample-Level Constraint Relaxation for Offline-to-Online Reinforcement Learning
par: Zu, Lipeng, et autres
Publié: (2025)
par: Zu, Lipeng, et autres
Publié: (2025)
Q-value Regularized Decision ConvFormer for Offline Reinforcement Learning
par: Yan, Teng, et autres
Publié: (2024)
par: Yan, Teng, et autres
Publié: (2024)
Contrastive Representation for Data Filtering in Cross-Domain Offline Reinforcement Learning
par: Wen, Xiaoyu, et autres
Publié: (2024)
par: Wen, Xiaoyu, et autres
Publié: (2024)
Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning
par: Gao, Chen-Xiao, et autres
Publié: (2025)
par: Gao, Chen-Xiao, et autres
Publié: (2025)
Documents similaires
-
Corruption-Robust Offline Reinforcement Learning with General Function Approximation
par: Ye, Chenlu, et autres
Publié: (2023) -
Diverse Randomized Value Functions: A Provably Pessimistic Approach for Offline Reinforcement Learning
par: Yu, Xudong, et autres
Publié: (2024) -
Bridging Domain Gaps with Target-Aligned Generation for Offline Reinforcement Learning
par: Kim, Minung, et autres
Publié: (2026) -
VIPO: Value Function Inconsistency Penalized Offline Reinforcement Learning
par: Chen, Xuyang, et autres
Publié: (2025) -
Gap-Dependent Bounds for Nearly Minimax Optimal Reinforcement Learning with Linear Function Approximation
par: Zhang, Haochen, et autres
Publié: (2026)