Pessimistic Value Iteration for Multi-Task Data Sharing in Offline Reinforcement Learning
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Bai, Chenjia, Wang, Lingxiao, Hao, Jianye, Yang, Zhuoran, Zhao, Bin, Wang, Zhen, Li, Xuelong |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Diverse Randomized Value Functions: A Provably Pessimistic Approach for Offline Reinforcement Learning
von: Yu, Xudong, et al.
Veröffentlicht: (2024)
von: Yu, Xudong, et al.
Veröffentlicht: (2024)
Contrastive Representation for Data Filtering in Cross-Domain Offline Reinforcement Learning
von: Wen, Xiaoyu, et al.
Veröffentlicht: (2024)
von: Wen, Xiaoyu, et al.
Veröffentlicht: (2024)
Ensemble Successor Representations for Task Generalization in Offline-to-Online Reinforcement Learning
von: Wang, Changhong, et al.
Veröffentlicht: (2024)
von: Wang, Changhong, et al.
Veröffentlicht: (2024)
Pessimistic Causal Reinforcement Learning with Mediators for Confounded Offline Data
von: Wang, Danyang, et al.
Veröffentlicht: (2024)
von: Wang, Danyang, et al.
Veröffentlicht: (2024)
SelfBC: Self Behavior Cloning for Offline Reinforcement Learning
von: Liu, Shirong, et al.
Veröffentlicht: (2024)
von: Liu, Shirong, et al.
Veröffentlicht: (2024)
MODULI: Unlocking Preference Generalization via Diffusion Models for Offline Multi-Objective Reinforcement Learning
von: Yuan, Yifu, et al.
Veröffentlicht: (2024)
von: Yuan, Yifu, et al.
Veröffentlicht: (2024)
Beyond Shallow Behavior: Task-Efficient Value-Based Multi-Task Offline MARL via Skill Discovery
von: Wang, Xun, et al.
Veröffentlicht: (2025)
von: Wang, Xun, et al.
Veröffentlicht: (2025)
Decentralized Transformers with Centralized Aggregation are Sample-Efficient Multi-Agent World Models
von: Zhang, Yang, et al.
Veröffentlicht: (2024)
von: Zhang, Yang, et al.
Veröffentlicht: (2024)
Task-Agnostic Pre-training and Task-Guided Fine-tuning for Versatile Diffusion Planner
von: Fan, Chenyou, et al.
Veröffentlicht: (2024)
von: Fan, Chenyou, et al.
Veröffentlicht: (2024)
Offline-to-Online Multi-Agent Reinforcement Learning with Offline Value Function Memory and Sequential Exploration
von: Zhong, Hai, et al.
Veröffentlicht: (2024)
von: Zhong, Hai, et al.
Veröffentlicht: (2024)
ENOTO: Improving Offline-to-Online Reinforcement Learning with Q-Ensembles
von: Zhao, Kai, et al.
Veröffentlicht: (2023)
von: Zhao, Kai, et al.
Veröffentlicht: (2023)
Model-Based Reinforcement Learning with Multi-Task Offline Pretraining
von: Pan, Minting, et al.
Veröffentlicht: (2023)
von: Pan, Minting, et al.
Veröffentlicht: (2023)
Pessimistic Auxiliary Policy for Offline Reinforcement Learning
von: Zhang, Fan, et al.
Veröffentlicht: (2026)
von: Zhang, Fan, et al.
Veröffentlicht: (2026)
Pessimistic Nonlinear Least-Squares Value Iteration for Offline Reinforcement Learning
von: Di, Qiwei, et al.
Veröffentlicht: (2023)
von: Di, Qiwei, et al.
Veröffentlicht: (2023)
Exponential Topology-enabled Scalable Communication in Multi-agent Reinforcement Learning
von: Li, Xinran, et al.
Veröffentlicht: (2025)
von: Li, Xinran, et al.
Veröffentlicht: (2025)
VIPO: Value Function Inconsistency Penalized Offline Reinforcement Learning
von: Chen, Xuyang, et al.
Veröffentlicht: (2025)
von: Chen, Xuyang, et al.
Veröffentlicht: (2025)
Task-Aware Harmony Multi-Task Decision Transformer for Offline Reinforcement Learning
von: Fan, Ziqing, et al.
Veröffentlicht: (2024)
von: Fan, Ziqing, et al.
Veröffentlicht: (2024)
Towards Efficient LLM Grounding for Embodied Multi-Agent Collaboration
von: Zhang, Yang, et al.
Veröffentlicht: (2024)
von: Zhang, Yang, et al.
Veröffentlicht: (2024)
Learning Generalizable Skills from Offline Multi-Task Data for Multi-Agent Cooperation
von: Liu, Sicong, et al.
Veröffentlicht: (2025)
von: Liu, Sicong, et al.
Veröffentlicht: (2025)
Contrastive UCB: Provably Efficient Contrastive Self-Supervised Learning in Online Reinforcement Learning
von: Qiu, Shuang, et al.
Veröffentlicht: (2022)
von: Qiu, Shuang, et al.
Veröffentlicht: (2022)
Pessimistic Iterative Planning with RNNs for Robust POMDPs
von: Galesloot, Maris F. L., et al.
Veröffentlicht: (2024)
von: Galesloot, Maris F. L., et al.
Veröffentlicht: (2024)
Soft Conflict-Resolution Decision Transformer for Offline Multi-Task Reinforcement Learning
von: Wang, Shudong, et al.
Veröffentlicht: (2025)
von: Wang, Shudong, et al.
Veröffentlicht: (2025)
Uncertainty-based Offline Variational Bayesian Reinforcement Learning for Robustness under Diverse Data Corruptions
von: Yang, Rui, et al.
Veröffentlicht: (2024)
von: Yang, Rui, et al.
Veröffentlicht: (2024)
Embed to Control Partially Observed Systems: Representation Learning with Provable Sample Efficiency
von: Wang, Lingxiao, et al.
Veröffentlicht: (2022)
von: Wang, Lingxiao, et al.
Veröffentlicht: (2022)
Pessimism in the Face of Confounders: Provably Efficient Offline Reinforcement Learning in Partially Observable Markov Decision Processes
von: Lu, Miao, et al.
Veröffentlicht: (2022)
von: Lu, Miao, et al.
Veröffentlicht: (2022)
Pretraining a Shared Q-Network for Data-Efficient Offline Reinforcement Learning
von: Park, Jongchan, et al.
Veröffentlicht: (2025)
von: Park, Jongchan, et al.
Veröffentlicht: (2025)
Offline Reinforcement Learning for LLM Multi-Step Reasoning
von: Wang, Huaijie, et al.
Veröffentlicht: (2024)
von: Wang, Huaijie, et al.
Veröffentlicht: (2024)
Goal-Oriented Skill Abstraction for Offline Multi-Task Reinforcement Learning
von: He, Jinmin, et al.
Veröffentlicht: (2025)
von: He, Jinmin, et al.
Veröffentlicht: (2025)
Instrumental Variable Value Iteration for Causal Offline Reinforcement Learning
von: Liao, Luofeng, et al.
Veröffentlicht: (2021)
von: Liao, Luofeng, et al.
Veröffentlicht: (2021)
Pre-training with Synthetic Data Helps Offline Reinforcement Learning
von: Wang, Zecheng, et al.
Veröffentlicht: (2023)
von: Wang, Zecheng, et al.
Veröffentlicht: (2023)
Preferred-Action-Optimized Diffusion Policies for Offline Reinforcement Learning
von: Zhang, Tianle, et al.
Veröffentlicht: (2024)
von: Zhang, Tianle, et al.
Veröffentlicht: (2024)
Offline Trajectory Optimization for Offline Reinforcement Learning
von: Zhao, Ziqi, et al.
Veröffentlicht: (2024)
von: Zhao, Ziqi, et al.
Veröffentlicht: (2024)
Policy-Based Trajectory Clustering in Offline Reinforcement Learning
von: Hu, Hao, et al.
Veröffentlicht: (2025)
von: Hu, Hao, et al.
Veröffentlicht: (2025)
GOPlan: Goal-conditioned Offline Reinforcement Learning by Planning with Learned Models
von: Wang, Mianchu, et al.
Veröffentlicht: (2023)
von: Wang, Mianchu, et al.
Veröffentlicht: (2023)
ED2: Environment Dynamics Decomposition World Models for Continuous Control
von: Hao, Jianye, et al.
Veröffentlicht: (2021)
von: Hao, Jianye, et al.
Veröffentlicht: (2021)
Tackling Data Corruption in Offline Reinforcement Learning via Sequence Modeling
von: Xu, Jiawei, et al.
Veröffentlicht: (2024)
von: Xu, Jiawei, et al.
Veröffentlicht: (2024)
Offline Policy Evaluation for Reinforcement Learning with Adaptively Collected Data
von: Madhow, Sunil, et al.
Veröffentlicht: (2023)
von: Madhow, Sunil, et al.
Veröffentlicht: (2023)
Model-Based Offline Reinforcement Learning with Adversarial Data Augmentation
von: Cao, Hongye, et al.
Veröffentlicht: (2025)
von: Cao, Hongye, et al.
Veröffentlicht: (2025)
Advancing Autonomous VLM Agents via Variational Subgoal-Conditioned Reinforcement Learning
von: Wu, Qingyuan, et al.
Veröffentlicht: (2025)
von: Wu, Qingyuan, et al.
Veröffentlicht: (2025)
OM2P: Offline Multi-Agent Mean-Flow Policy
von: Li, Zhuoran, et al.
Veröffentlicht: (2025)
von: Li, Zhuoran, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Diverse Randomized Value Functions: A Provably Pessimistic Approach for Offline Reinforcement Learning
von: Yu, Xudong, et al.
Veröffentlicht: (2024) -
Contrastive Representation for Data Filtering in Cross-Domain Offline Reinforcement Learning
von: Wen, Xiaoyu, et al.
Veröffentlicht: (2024) -
Ensemble Successor Representations for Task Generalization in Offline-to-Online Reinforcement Learning
von: Wang, Changhong, et al.
Veröffentlicht: (2024) -
Pessimistic Causal Reinforcement Learning with Mediators for Confounded Offline Data
von: Wang, Danyang, et al.
Veröffentlicht: (2024) -
SelfBC: Self Behavior Cloning for Offline Reinforcement Learning
von: Liu, Shirong, et al.
Veröffentlicht: (2024)