GenPO: Generative Diffusion Models Meet On-Policy Reinforcement Learning
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Ding, Shutong, Hu, Ke, Zhong, Shan, Luo, Haoyang, Zhang, Weinan, Wang, Jingya, Wang, Jun, Shi, Ye |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Diffusion-based Reinforcement Learning via Q-weighted Variational Policy Optimization
von: Ding, Shutong, et al.
Veröffentlicht: (2024)
von: Ding, Shutong, et al.
Veröffentlicht: (2024)
Distributional Reinforcement Learning with Diffusion Bridge Critics
von: Ding, Shutong, et al.
Veröffentlicht: (2026)
von: Ding, Shutong, et al.
Veröffentlicht: (2026)
Sample-Efficient Diffusion-based Reinforcement Learning with Critic Guidance
von: Ding, Shutong, et al.
Veröffentlicht: (2026)
von: Ding, Shutong, et al.
Veröffentlicht: (2026)
Guidance with Spherical Gaussian Constraint for Conditional Diffusion
von: Yang, Lingxiao, et al.
Veröffentlicht: (2024)
von: Yang, Lingxiao, et al.
Veröffentlicht: (2024)
Score-Based Diffusion Policy Compatible with Reinforcement Learning via Optimal Transport
von: Sun, Mingyang, et al.
Veröffentlicht: (2025)
von: Sun, Mingyang, et al.
Veröffentlicht: (2025)
DreamPolicy: A Unified World-model Policy for Scalable Humanoid Locomotion
von: Fan, Yahao, et al.
Veröffentlicht: (2025)
von: Fan, Yahao, et al.
Veröffentlicht: (2025)
Path-Space Mirror Descent for On-Policy Reinforcement Learning under the Generalized Schrödinger Bridge
von: Gong, Yuehu, et al.
Veröffentlicht: (2026)
von: Gong, Yuehu, et al.
Veröffentlicht: (2026)
FlowCritic: Bridging Value Estimation with Flow Matching in Reinforcement Learning
von: Zhong, Shan, et al.
Veröffentlicht: (2025)
von: Zhong, Shan, et al.
Veröffentlicht: (2025)
Iterative Refinement of Flow Policies in Probability Space for Online Reinforcement Learning
von: Sun, Mingyang, et al.
Veröffentlicht: (2025)
von: Sun, Mingyang, et al.
Veröffentlicht: (2025)
Diffusion-based learning framework for Constrained Nonconvex Optimization with Weighted Bootstrapped Refinement
von: Ding, Shutong, et al.
Veröffentlicht: (2025)
von: Ding, Shutong, et al.
Veröffentlicht: (2025)
Harmonizing Generalization and Personalization in Federated Prompt Learning
von: Cui, Tianyu, et al.
Veröffentlicht: (2024)
von: Cui, Tianyu, et al.
Veröffentlicht: (2024)
Diffusion Models for Reinforcement Learning: A Survey
von: Zhu, Zhengbang, et al.
Veröffentlicht: (2023)
von: Zhu, Zhengbang, et al.
Veröffentlicht: (2023)
Sample from What You See: Visuomotor Policy Learning via Diffusion Bridge with Observation-Embedded Stochastic Differential Equation
von: Liu, Zhaoyang, et al.
Veröffentlicht: (2025)
von: Liu, Zhaoyang, et al.
Veröffentlicht: (2025)
A Review of Online Diffusion Policy RL Algorithms for Scalable Robotic Control
von: Choi, Wonhyeok, et al.
Veröffentlicht: (2026)
von: Choi, Wonhyeok, et al.
Veröffentlicht: (2026)
Stabilizing Reinforcement Learning for Diffusion Language Models
von: Zhong, Jianyuan, et al.
Veröffentlicht: (2026)
von: Zhong, Jianyuan, et al.
Veröffentlicht: (2026)
DiffStitch: Boosting Offline Reinforcement Learning with Diffusion-based Trajectory Stitching
von: Li, Guanghe, et al.
Veröffentlicht: (2024)
von: Li, Guanghe, et al.
Veröffentlicht: (2024)
Reinforcing Language Agents via Policy Optimization with Action Decomposition
von: Wen, Muning, et al.
Veröffentlicht: (2024)
von: Wen, Muning, et al.
Veröffentlicht: (2024)
CausalGDP: Causality-Guided Diffusion Policies for Reinforcement Learning
von: Xiao, Xiaofeng, et al.
Veröffentlicht: (2026)
von: Xiao, Xiaofeng, et al.
Veröffentlicht: (2026)
ReinforceGen: Hybrid Skill Policies with Automated Data Generation and Reinforcement Learning
von: Zhou, Zihan, et al.
Veröffentlicht: (2025)
von: Zhou, Zihan, et al.
Veröffentlicht: (2025)
Bringing Value Models Back: Generative Critics for Value Modeling in LLM Reinforcement Learning
von: Shan, Zikang, et al.
Veröffentlicht: (2026)
von: Shan, Zikang, et al.
Veröffentlicht: (2026)
RIDER: 3D RNA Inverse Design with Reinforcement Learning-Guided Diffusion
von: Hu, Tianmeng, et al.
Veröffentlicht: (2026)
von: Hu, Tianmeng, et al.
Veröffentlicht: (2026)
Entropy-Regularized Token-Level Policy Optimization for Language Agent Reinforcement
von: Wen, Muning, et al.
Veröffentlicht: (2024)
von: Wen, Muning, et al.
Veröffentlicht: (2024)
Model-based Multi-agent Reinforcement Learning: Recent Progress and Prospects
von: Wang, Xihuai, et al.
Veröffentlicht: (2022)
von: Wang, Xihuai, et al.
Veröffentlicht: (2022)
Invariant Graph Learning Meets Information Bottleneck for Out-of-Distribution Generalization
von: Mao, Wenyu, et al.
Veröffentlicht: (2024)
von: Mao, Wenyu, et al.
Veröffentlicht: (2024)
Diffusion Policies for Risk-Averse Behavior Modeling in Offline Reinforcement Learning
von: Chen, Xiaocong, et al.
Veröffentlicht: (2024)
von: Chen, Xiaocong, et al.
Veröffentlicht: (2024)
Diffusion-DICE: In-Sample Diffusion Guidance for Offline Reinforcement Learning
von: Mao, Liyuan, et al.
Veröffentlicht: (2024)
von: Mao, Liyuan, et al.
Veröffentlicht: (2024)
Global and Local Prompts Cooperation via Optimal Transport for Federated Learning
von: Li, Hongxia, et al.
Veröffentlicht: (2024)
von: Li, Hongxia, et al.
Veröffentlicht: (2024)
On-Policy RL Meets Off-Policy Experts: Harmonizing Supervised Fine-Tuning and Reinforcement Learning via Dynamic Weighting
von: Zhang, Wenhao, et al.
Veröffentlicht: (2025)
von: Zhang, Wenhao, et al.
Veröffentlicht: (2025)
Efficient Online Reinforcement Learning for Diffusion Policy
von: Ma, Haitong, et al.
Veröffentlicht: (2025)
von: Ma, Haitong, et al.
Veröffentlicht: (2025)
One-Shot Federated Learning with Classifier-Free Diffusion Models
von: Zaland, Obaidullah, et al.
Veröffentlicht: (2025)
von: Zaland, Obaidullah, et al.
Veröffentlicht: (2025)
DriveGen: Towards Infinite Diverse Traffic Scenarios with Large Models
von: Zhang, Shenyu, et al.
Veröffentlicht: (2025)
von: Zhang, Shenyu, et al.
Veröffentlicht: (2025)
Wavelet Fourier Diffuser: Frequency-Aware Diffusion Model for Reinforcement Learning
von: Luo, Yifu, et al.
Veröffentlicht: (2025)
von: Luo, Yifu, et al.
Veröffentlicht: (2025)
Free Draft-and-Verification: Toward Lossless Parallel Decoding for Diffusion Large Language Models
von: Wu, Shutong, et al.
Veröffentlicht: (2025)
von: Wu, Shutong, et al.
Veröffentlicht: (2025)
DiffPoGAN: Diffusion Policies with Generative Adversarial Networks for Offline Reinforcement Learning
von: Hu, Xuemin, et al.
Veröffentlicht: (2024)
von: Hu, Xuemin, et al.
Veröffentlicht: (2024)
Extreme Value Policy Optimization for Safe Reinforcement Learning
von: Gao, Shiqing, et al.
Veröffentlicht: (2026)
von: Gao, Shiqing, et al.
Veröffentlicht: (2026)
EvolveGen: Algorithmic Level Hardware Model Checking Benchmark Generation through Reinforcement Learning
von: Hu, Guangyu, et al.
Veröffentlicht: (2026)
von: Hu, Guangyu, et al.
Veröffentlicht: (2026)
Mixture-of-Experts Meets In-Context Reinforcement Learning
von: Wu, Wenhao, et al.
Veröffentlicht: (2025)
von: Wu, Wenhao, et al.
Veröffentlicht: (2025)
Query-Policy Misalignment in Preference-Based Reinforcement Learning
von: Hu, Xiao, et al.
Veröffentlicht: (2023)
von: Hu, Xiao, et al.
Veröffentlicht: (2023)
RePO: Bridging On-Policy Learning and Off-Policy Knowledge through Rephrasing Policy Optimization
von: Xia, Linxuan, et al.
Veröffentlicht: (2026)
von: Xia, Linxuan, et al.
Veröffentlicht: (2026)
DiffCPS: Diffusion Model based Constrained Policy Search for Offline Reinforcement Learning
von: He, Longxiang, et al.
Veröffentlicht: (2023)
von: He, Longxiang, et al.
Veröffentlicht: (2023)
Ähnliche Einträge
-
Diffusion-based Reinforcement Learning via Q-weighted Variational Policy Optimization
von: Ding, Shutong, et al.
Veröffentlicht: (2024) -
Distributional Reinforcement Learning with Diffusion Bridge Critics
von: Ding, Shutong, et al.
Veröffentlicht: (2026) -
Sample-Efficient Diffusion-based Reinforcement Learning with Critic Guidance
von: Ding, Shutong, et al.
Veröffentlicht: (2026) -
Guidance with Spherical Gaussian Constraint for Conditional Diffusion
von: Yang, Lingxiao, et al.
Veröffentlicht: (2024) -
Score-Based Diffusion Policy Compatible with Reinforcement Learning via Optimal Transport
von: Sun, Mingyang, et al.
Veröffentlicht: (2025)