MODULI: Unlocking Preference Generalization via Diffusion Models for Offline Multi-Objective Reinforcement Learning
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Yuan, Yifu, Zheng, Zhenrui, Dong, Zibin, Hao, Jianye |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
CleanDiffuser: An Easy-to-use Modularized Library for Diffusion Models in Decision Making
von: Dong, Zibin, et al.
Veröffentlicht: (2024)
von: Dong, Zibin, et al.
Veröffentlicht: (2024)
Preference-Guided Diffusion for Multi-Objective Offline Optimization
von: Annadani, Yashas, et al.
Veröffentlicht: (2025)
von: Annadani, Yashas, et al.
Veröffentlicht: (2025)
Embodied-R1: Reinforced Embodied Reasoning for General Robotic Manipulation
von: Yuan, Yifu, et al.
Veröffentlicht: (2025)
von: Yuan, Yifu, et al.
Veröffentlicht: (2025)
Uni-RLHF: Universal Platform and Benchmark Suite for Reinforcement Learning with Diverse Human Feedback
von: Yuan, Yifu, et al.
Veröffentlicht: (2024)
von: Yuan, Yifu, et al.
Veröffentlicht: (2024)
MENTOR: Guiding Hierarchical Reinforcement Learning with Human Feedback and Dynamic Distance Constraint
von: Zhou, Xinglin, et al.
Veröffentlicht: (2024)
von: Zhou, Xinglin, et al.
Veröffentlicht: (2024)
ENOTO: Improving Offline-to-Online Reinforcement Learning with Q-Ensembles
von: Zhao, Kai, et al.
Veröffentlicht: (2023)
von: Zhao, Kai, et al.
Veröffentlicht: (2023)
ED2: Environment Dynamics Decomposition World Models for Continuous Control
von: Hao, Jianye, et al.
Veröffentlicht: (2021)
von: Hao, Jianye, et al.
Veröffentlicht: (2021)
Pessimistic Value Iteration for Multi-Task Data Sharing in Offline Reinforcement Learning
von: Bai, Chenjia, et al.
Veröffentlicht: (2024)
von: Bai, Chenjia, et al.
Veröffentlicht: (2024)
AhaRobot: A Low-Cost Open-Source Bimanual Mobile Manipulator for Embodied AI
von: Cui, Haiqin, et al.
Veröffentlicht: (2025)
von: Cui, Haiqin, et al.
Veröffentlicht: (2025)
Preferred-Action-Optimized Diffusion Policies for Offline Reinforcement Learning
von: Zhang, Tianle, et al.
Veröffentlicht: (2024)
von: Zhang, Tianle, et al.
Veröffentlicht: (2024)
An Offline Adaptation Framework for Constrained Multi-Objective Reinforcement Learning
von: Lin, Qian, et al.
Veröffentlicht: (2024)
von: Lin, Qian, et al.
Veröffentlicht: (2024)
Pareto-Conditioned Diffusion Models for Offline Multi-Objective Optimization
von: Shrestha, Jatan, et al.
Veröffentlicht: (2026)
von: Shrestha, Jatan, et al.
Veröffentlicht: (2026)
OPRIDE: Offline Preference-based Reinforcement Learning via In-Dataset Exploration
von: Yang, Yiqin, et al.
Veröffentlicht: (2026)
von: Yang, Yiqin, et al.
Veröffentlicht: (2026)
Preference Elicitation for Offline Reinforcement Learning
von: Pace, Alizée, et al.
Veröffentlicht: (2024)
von: Pace, Alizée, et al.
Veröffentlicht: (2024)
FairDICE: Fairness-Driven Offline Multi-Objective Reinforcement Learning
von: Kim, Woosung, et al.
Veröffentlicht: (2025)
von: Kim, Woosung, et al.
Veröffentlicht: (2025)
Hindsight Preference Learning for Offline Preference-based Reinforcement Learning
von: Gao, Chen-Xiao, et al.
Veröffentlicht: (2024)
von: Gao, Chen-Xiao, et al.
Veröffentlicht: (2024)
Should We Ever Prefer Decision Transformer for Offline Reinforcement Learning?
von: Omori, Yumi, et al.
Veröffentlicht: (2025)
von: Omori, Yumi, et al.
Veröffentlicht: (2025)
Hindsight Preference Replay Improves Preference-Conditioned Multi-Objective Reinforcement Learning
von: Shianifar, Jonaid, et al.
Veröffentlicht: (2026)
von: Shianifar, Jonaid, et al.
Veröffentlicht: (2026)
Behavior Preference Regression for Offline Reinforcement Learning
von: Srinivasan, Padmanaba, et al.
Veröffentlicht: (2025)
von: Srinivasan, Padmanaba, et al.
Veröffentlicht: (2025)
From Seeing to Doing: Bridging Reasoning and Decision for Robotic Manipulation
von: Yuan, Yifu, et al.
Veröffentlicht: (2025)
von: Yuan, Yifu, et al.
Veröffentlicht: (2025)
AlignDiff: Aligning Diverse Human Preferences via Behavior-Customisable Diffusion Model
von: Dong, Zibin, et al.
Veröffentlicht: (2023)
von: Dong, Zibin, et al.
Veröffentlicht: (2023)
Continual Offline Reinforcement Learning via Diffusion-based Dual Generative Replay
von: Liu, Jinmei, et al.
Veröffentlicht: (2024)
von: Liu, Jinmei, et al.
Veröffentlicht: (2024)
Adaptive Alignment: Dynamic Preference Adjustments via Multi-Objective Reinforcement Learning for Pluralistic AI
von: Harland, Hadassah, et al.
Veröffentlicht: (2024)
von: Harland, Hadassah, et al.
Veröffentlicht: (2024)
Diffusion Models for Offline Multi-agent Reinforcement Learning with Safety Constraints
von: Huang, Jianuo
Veröffentlicht: (2024)
von: Huang, Jianuo
Veröffentlicht: (2024)
Safe Offline Reinforcement Learning with Feasibility-Guided Diffusion Model
von: Zheng, Yinan, et al.
Veröffentlicht: (2024)
von: Zheng, Yinan, et al.
Veröffentlicht: (2024)
Offline-to-Online Reinforcement Learning with Classifier-Free Diffusion Generation
von: Huang, Xiao, et al.
Veröffentlicht: (2025)
von: Huang, Xiao, et al.
Veröffentlicht: (2025)
SheetAgent: Towards A Generalist Agent for Spreadsheet Reasoning and Manipulation via Large Language Models
von: Chen, Yibin, et al.
Veröffentlicht: (2024)
von: Chen, Yibin, et al.
Veröffentlicht: (2024)
Model-Based Reinforcement Learning with Multi-Task Offline Pretraining
von: Pan, Minting, et al.
Veröffentlicht: (2023)
von: Pan, Minting, et al.
Veröffentlicht: (2023)
Diffusion World Model: Future Modeling Beyond Step-by-Step Rollout for Offline Reinforcement Learning
von: Ding, Zihan, et al.
Veröffentlicht: (2024)
von: Ding, Zihan, et al.
Veröffentlicht: (2024)
Enhancing Robotic Manipulation with AI Feedback from Multimodal Large Language Models
von: Liu, Jinyi, et al.
Veröffentlicht: (2024)
von: Liu, Jinyi, et al.
Veröffentlicht: (2024)
Wavelet Fourier Diffuser: Frequency-Aware Diffusion Model for Reinforcement Learning
von: Luo, Yifu, et al.
Veröffentlicht: (2025)
von: Luo, Yifu, et al.
Veröffentlicht: (2025)
Listwise Reward Estimation for Offline Preference-based Reinforcement Learning
von: Choi, Heewoong, et al.
Veröffentlicht: (2024)
von: Choi, Heewoong, et al.
Veröffentlicht: (2024)
Adversarial Policy Optimization for Offline Preference-based Reinforcement Learning
von: Kang, Hyungkyu, et al.
Veröffentlicht: (2025)
von: Kang, Hyungkyu, et al.
Veröffentlicht: (2025)
Multi-Objective Large Language Model Unlearning
von: Pan, Zibin, et al.
Veröffentlicht: (2024)
von: Pan, Zibin, et al.
Veröffentlicht: (2024)
Offline Reinforcement Learning for LLM Multi-Step Reasoning
von: Wang, Huaijie, et al.
Veröffentlicht: (2024)
von: Wang, Huaijie, et al.
Veröffentlicht: (2024)
DiffuserLite: Towards Real-time Diffusion Planning
von: Dong, Zibin, et al.
Veröffentlicht: (2024)
von: Dong, Zibin, et al.
Veröffentlicht: (2024)
LLM-Driven Policy Diffusion: Enhancing Generalization in Offline Reinforcement Learning
von: Zhang, Hanping, et al.
Veröffentlicht: (2025)
von: Zhang, Hanping, et al.
Veröffentlicht: (2025)
Preference Conditioned Multi-Objective Reinforcement Learning: Decomposed, Diversity-Driven Policy Optimization
von: Ambadkar, Tanmay, et al.
Veröffentlicht: (2026)
von: Ambadkar, Tanmay, et al.
Veröffentlicht: (2026)
EmbodiedMAE: A Unified 3D Multi-Modal Representation for Robot Manipulation
von: Dong, Zibin, et al.
Veröffentlicht: (2025)
von: Dong, Zibin, et al.
Veröffentlicht: (2025)
Offline Trajectory Optimization for Offline Reinforcement Learning
von: Zhao, Ziqi, et al.
Veröffentlicht: (2024)
von: Zhao, Ziqi, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
CleanDiffuser: An Easy-to-use Modularized Library for Diffusion Models in Decision Making
von: Dong, Zibin, et al.
Veröffentlicht: (2024) -
Preference-Guided Diffusion for Multi-Objective Offline Optimization
von: Annadani, Yashas, et al.
Veröffentlicht: (2025) -
Embodied-R1: Reinforced Embodied Reasoning for General Robotic Manipulation
von: Yuan, Yifu, et al.
Veröffentlicht: (2025) -
Uni-RLHF: Universal Platform and Benchmark Suite for Reinforcement Learning with Diverse Human Feedback
von: Yuan, Yifu, et al.
Veröffentlicht: (2024) -
MENTOR: Guiding Hierarchical Reinforcement Learning with Human Feedback and Dynamic Distance Constraint
von: Zhou, Xinglin, et al.
Veröffentlicht: (2024)