Diffusion-based Reinforcement Learning via Q-weighted Variational Policy Optimization
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Ding, Shutong, Hu, Ke, Zhang, Zhenhao, Ren, Kan, Zhang, Weinan, Yu, Jingyi, Wang, Jingya, Shi, Ye |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
GenPO: Generative Diffusion Models Meet On-Policy Reinforcement Learning
von: Ding, Shutong, et al.
Veröffentlicht: (2025)
von: Ding, Shutong, et al.
Veröffentlicht: (2025)
Sample-Efficient Diffusion-based Reinforcement Learning with Critic Guidance
von: Ding, Shutong, et al.
Veröffentlicht: (2026)
von: Ding, Shutong, et al.
Veröffentlicht: (2026)
Distributional Reinforcement Learning with Diffusion Bridge Critics
von: Ding, Shutong, et al.
Veröffentlicht: (2026)
von: Ding, Shutong, et al.
Veröffentlicht: (2026)
Guidance with Spherical Gaussian Constraint for Conditional Diffusion
von: Yang, Lingxiao, et al.
Veröffentlicht: (2024)
von: Yang, Lingxiao, et al.
Veröffentlicht: (2024)
DreamPolicy: A Unified World-model Policy for Scalable Humanoid Locomotion
von: Fan, Yahao, et al.
Veröffentlicht: (2025)
von: Fan, Yahao, et al.
Veröffentlicht: (2025)
Score-Based Diffusion Policy Compatible with Reinforcement Learning via Optimal Transport
von: Sun, Mingyang, et al.
Veröffentlicht: (2025)
von: Sun, Mingyang, et al.
Veröffentlicht: (2025)
Diffusion-based learning framework for Constrained Nonconvex Optimization with Weighted Bootstrapped Refinement
von: Ding, Shutong, et al.
Veröffentlicht: (2025)
von: Ding, Shutong, et al.
Veröffentlicht: (2025)
Iterative Refinement of Flow Policies in Probability Space for Online Reinforcement Learning
von: Sun, Mingyang, et al.
Veröffentlicht: (2025)
von: Sun, Mingyang, et al.
Veröffentlicht: (2025)
Reinforcing Language Agents via Policy Optimization with Action Decomposition
von: Wen, Muning, et al.
Veröffentlicht: (2024)
von: Wen, Muning, et al.
Veröffentlicht: (2024)
Is Risk-Sensitive Reinforcement Learning Properly Resolved?
von: Zhou, Ruiwen, et al.
Veröffentlicht: (2023)
von: Zhou, Ruiwen, et al.
Veröffentlicht: (2023)
SCRIPT: Scalable Diffusion Policy with Multi-stage Training for Language-driven Physics-based Humanoid Control
von: Zhang, Jingyan, et al.
Veröffentlicht: (2026)
von: Zhang, Jingyan, et al.
Veröffentlicht: (2026)
A Unified and Fast-Sampling Diffusion Bridge Framework via Stochastic Optimal Control
von: Pan, Mokai, et al.
Veröffentlicht: (2025)
von: Pan, Mokai, et al.
Veröffentlicht: (2025)
Sample from What You See: Visuomotor Policy Learning via Diffusion Bridge with Observation-Embedded Stochastic Differential Equation
von: Liu, Zhaoyang, et al.
Veröffentlicht: (2025)
von: Liu, Zhaoyang, et al.
Veröffentlicht: (2025)
Diffusion-DICE: In-Sample Diffusion Guidance for Offline Reinforcement Learning
von: Mao, Liyuan, et al.
Veröffentlicht: (2024)
von: Mao, Liyuan, et al.
Veröffentlicht: (2024)
Entropy-regularized Diffusion Policy with Q-Ensembles for Offline Reinforcement Learning
von: Zhang, Ruoqi, et al.
Veröffentlicht: (2024)
von: Zhang, Ruoqi, et al.
Veröffentlicht: (2024)
Path-Space Mirror Descent for On-Policy Reinforcement Learning under the Generalized Schrödinger Bridge
von: Gong, Yuehu, et al.
Veröffentlicht: (2026)
von: Gong, Yuehu, et al.
Veröffentlicht: (2026)
Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning
von: Gao, Chen-Xiao, et al.
Veröffentlicht: (2025)
von: Gao, Chen-Xiao, et al.
Veröffentlicht: (2025)
DiffStitch: Boosting Offline Reinforcement Learning with Diffusion-based Trajectory Stitching
von: Li, Guanghe, et al.
Veröffentlicht: (2024)
von: Li, Guanghe, et al.
Veröffentlicht: (2024)
A Review of Online Diffusion Policy RL Algorithms for Scalable Robotic Control
von: Choi, Wonhyeok, et al.
Veröffentlicht: (2026)
von: Choi, Wonhyeok, et al.
Veröffentlicht: (2026)
DyDiff: Long-Horizon Rollout via Dynamics Diffusion for Offline Reinforcement Learning
von: Zhao, Hanye, et al.
Veröffentlicht: (2024)
von: Zhao, Hanye, et al.
Veröffentlicht: (2024)
Model-based Multi-agent Reinforcement Learning: Recent Progress and Prospects
von: Wang, Xihuai, et al.
Veröffentlicht: (2022)
von: Wang, Xihuai, et al.
Veröffentlicht: (2022)
Diffusion Policies with Value-Conditional Optimization for Offline Reinforcement Learning
von: Ma, Yunchang, et al.
Veröffentlicht: (2025)
von: Ma, Yunchang, et al.
Veröffentlicht: (2025)
CausalGDP: Causality-Guided Diffusion Policies for Reinforcement Learning
von: Xiao, Xiaofeng, et al.
Veröffentlicht: (2026)
von: Xiao, Xiaofeng, et al.
Veröffentlicht: (2026)
Entropy-Regularized Token-Level Policy Optimization for Language Agent Reinforcement
von: Wen, Muning, et al.
Veröffentlicht: (2024)
von: Wen, Muning, et al.
Veröffentlicht: (2024)
Constraint-Conditioned Policy Optimization for Versatile Safe Reinforcement Learning
von: Yao, Yihang, et al.
Veröffentlicht: (2023)
von: Yao, Yihang, et al.
Veröffentlicht: (2023)
Free Draft-and-Verification: Toward Lossless Parallel Decoding for Diffusion Large Language Models
von: Wu, Shutong, et al.
Veröffentlicht: (2025)
von: Wu, Shutong, et al.
Veröffentlicht: (2025)
Dissecting and Mitigating Diffusion Bias via Mechanistic Interpretability
von: Shi, Yingdong, et al.
Veröffentlicht: (2025)
von: Shi, Yingdong, et al.
Veröffentlicht: (2025)
Diffusion Models for Reinforcement Learning: A Survey
von: Zhu, Zhengbang, et al.
Veröffentlicht: (2023)
von: Zhu, Zhengbang, et al.
Veröffentlicht: (2023)
Preferred-Action-Optimized Diffusion Policies for Offline Reinforcement Learning
von: Zhang, Tianle, et al.
Veröffentlicht: (2024)
von: Zhang, Tianle, et al.
Veröffentlicht: (2024)
Stable Continual Reinforcement Learning via Diffusion-based Trajectory Replay
von: Chen, Feng, et al.
Veröffentlicht: (2024)
von: Chen, Feng, et al.
Veröffentlicht: (2024)
UniHM: Unified Dexterous Hand Manipulation with Vision Language Model
von: Zhang, Zhenhao, et al.
Veröffentlicht: (2026)
von: Zhang, Zhenhao, et al.
Veröffentlicht: (2026)
Offline Multi-Agent Reinforcement Learning via In-Sample Sequential Policy Optimization
von: Liu, Zongkai, et al.
Veröffentlicht: (2024)
von: Liu, Zongkai, et al.
Veröffentlicht: (2024)
Learning an Actionable Discrete Diffusion Policy via Large-Scale Actionless Video Pre-Training
von: He, Haoran, et al.
Veröffentlicht: (2024)
von: He, Haoran, et al.
Veröffentlicht: (2024)
One-Step Flow Q-Learning: Addressing the Diffusion Policy Bottleneck in Offline Reinforcement Learning
von: Nguyen, Thanh, et al.
Veröffentlicht: (2025)
von: Nguyen, Thanh, et al.
Veröffentlicht: (2025)
PADiff: Predictive and Adaptive Diffusion Policies for Ad Hoc Teamwork
von: Chan, Hohei, et al.
Veröffentlicht: (2025)
von: Chan, Hohei, et al.
Veröffentlicht: (2025)
Q-Flow: Stable and Expressive Reinforcement Learning with Flow-Based Policy
von: Doo, JaeHyeok, et al.
Veröffentlicht: (2026)
von: Doo, JaeHyeok, et al.
Veröffentlicht: (2026)
Fairness Aware Reinforcement Learning via Proximal Policy Optimization
von: La Malfa, Gabriele, et al.
Veröffentlicht: (2025)
von: La Malfa, Gabriele, et al.
Veröffentlicht: (2025)
Flow-based Policy With Distributional Reinforcement Learning in Trajectory Optimization
von: Hao, Ruijie, et al.
Veröffentlicht: (2026)
von: Hao, Ruijie, et al.
Veröffentlicht: (2026)
Global and Local Prompts Cooperation via Optimal Transport for Federated Learning
von: Li, Hongxia, et al.
Veröffentlicht: (2024)
von: Li, Hongxia, et al.
Veröffentlicht: (2024)
Maximum Entropy Reinforcement Learning with Diffusion Policy
von: Dong, Xiaoyi, et al.
Veröffentlicht: (2025)
von: Dong, Xiaoyi, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
GenPO: Generative Diffusion Models Meet On-Policy Reinforcement Learning
von: Ding, Shutong, et al.
Veröffentlicht: (2025) -
Sample-Efficient Diffusion-based Reinforcement Learning with Critic Guidance
von: Ding, Shutong, et al.
Veröffentlicht: (2026) -
Distributional Reinforcement Learning with Diffusion Bridge Critics
von: Ding, Shutong, et al.
Veröffentlicht: (2026) -
Guidance with Spherical Gaussian Constraint for Conditional Diffusion
von: Yang, Lingxiao, et al.
Veröffentlicht: (2024) -
DreamPolicy: A Unified World-model Policy for Scalable Humanoid Locomotion
von: Fan, Yahao, et al.
Veröffentlicht: (2025)