UniRL-Zero: Reinforcement Learning on Unified Models with Joint Language Model and Diffusion Model Experts
Fuente:
arXiv
Saved in:
| Main Authors: | Wang, Fu-Yun, Zhang, Han, Gharbi, Michael, Li, Hongsheng, Park, Taesung |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
PromptRL: Prompt Matters in RL for Flow-Based Image Generation
by: Wang, Fu-Yun, et al.
Published: (2026)
by: Wang, Fu-Yun, et al.
Published: (2026)
Vision-Language Models are Zero-Shot Reward Models for Reinforcement Learning
by: Rocamonde, Juan, et al.
Published: (2023)
by: Rocamonde, Juan, et al.
Published: (2023)
FuRL: Visual-Language Models as Fuzzy Rewards for Reinforcement Learning
by: Fu, Yuwei, et al.
Published: (2024)
by: Fu, Yuwei, et al.
Published: (2024)
UniCA: Unified Covariate Adaptation for Time Series Foundation Model
by: Han, Lu, et al.
Published: (2025)
by: Han, Lu, et al.
Published: (2025)
Stabilizing Reinforcement Learning for Diffusion Language Models
by: Zhong, Jianyuan, et al.
Published: (2026)
by: Zhong, Jianyuan, et al.
Published: (2026)
EPIC: Effective Prompting for Imbalanced-Class Data Synthesis in Tabular Data Classification via Large Language Models
by: Kim, Jinhee, et al.
Published: (2024)
by: Kim, Jinhee, et al.
Published: (2024)
Accelerating Video Inverse Problem Solvers with Autoregressive Diffusion Models
by: Kwon, Taesung, et al.
Published: (2026)
by: Kwon, Taesung, et al.
Published: (2026)
Solving Video Inverse Problems Using Image Diffusion Models
by: Kwon, Taesung, et al.
Published: (2024)
by: Kwon, Taesung, et al.
Published: (2024)
Guided Trajectory Generation with Diffusion Models for Offline Model-based Optimization
by: Yun, Taeyoung, et al.
Published: (2024)
by: Yun, Taeyoung, et al.
Published: (2024)
Not All Experts are Equal: Efficient Expert Pruning and Skipping for Mixture-of-Experts Large Language Models
by: Lu, Xudong, et al.
Published: (2024)
by: Lu, Xudong, et al.
Published: (2024)
Joint Modeling of Search and Recommendations Via an Unified Contextual Recommender (UniCoRn)
by: Bhattacharya, Moumita, et al.
Published: (2024)
by: Bhattacharya, Moumita, et al.
Published: (2024)
UniMate: A Unified Model for Mechanical Metamaterial Generation, Property Prediction, and Condition Confirmation
by: Zhan, Wangzhi, et al.
Published: (2025)
by: Zhan, Wangzhi, et al.
Published: (2025)
Maximum Entropy Inverse Reinforcement Learning of Diffusion Models with Energy-Based Models
by: Yoon, Sangwoong, et al.
Published: (2024)
by: Yoon, Sangwoong, et al.
Published: (2024)
RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback
by: Wang, Yufei, et al.
Published: (2024)
by: Wang, Yufei, et al.
Published: (2024)
UniSD: Towards a Unified Self-Distillation Framework for Large Language Models
by: Jin, Yiqiao, et al.
Published: (2026)
by: Jin, Yiqiao, et al.
Published: (2026)
SimpleRL-Zoo: Investigating and Taming Zero Reinforcement Learning for Open Base Models in the Wild
by: Zeng, Weihao, et al.
Published: (2025)
by: Zeng, Weihao, et al.
Published: (2025)
Diffusion Models for Reinforcement Learning: A Survey
by: Zhu, Zhengbang, et al.
Published: (2023)
by: Zhu, Zhengbang, et al.
Published: (2023)
DiRL: An Efficient Post-Training Framework for Diffusion Language Models
by: Zhu, Ying, et al.
Published: (2025)
by: Zhu, Ying, et al.
Published: (2025)
UniTS: A Unified Multi-Task Time Series Model
by: Gao, Shanghua, et al.
Published: (2024)
by: Gao, Shanghua, et al.
Published: (2024)
Uni-NTFM: A Unified Foundation Model for EEG Signal Representation Learning
by: Chen, Zhisheng, et al.
Published: (2025)
by: Chen, Zhisheng, et al.
Published: (2025)
VISION-XL: High Definition Video Inverse Problem Solver using Latent Image Diffusion Models
by: Kwon, Taesung, et al.
Published: (2024)
by: Kwon, Taesung, et al.
Published: (2024)
Scalable Offline Model-Based RL with Action Chunks
by: Park, Kwanyoung, et al.
Published: (2025)
by: Park, Kwanyoung, et al.
Published: (2025)
GeoUni: A Unified Model for Generating Geometry Diagrams, Problems and Problem Solutions
by: Cheng, Jo-Ku, et al.
Published: (2025)
by: Cheng, Jo-Ku, et al.
Published: (2025)
UniMoT: Unified Molecule-Text Language Model with Discrete Token Representation
by: Guo, Shuhan, et al.
Published: (2024)
by: Guo, Shuhan, et al.
Published: (2024)
Behavior Injection: Preparing Language Models for Reinforcement Learning
by: Cen, Zhepeng, et al.
Published: (2025)
by: Cen, Zhepeng, et al.
Published: (2025)
UniPool: A Globally Shared Expert Pool for Mixture-of-Experts
by: Huang, Minbin, et al.
Published: (2026)
by: Huang, Minbin, et al.
Published: (2026)
Knowledge Retention for Continual Model-Based Reinforcement Learning
by: Sun, Yixiang, et al.
Published: (2025)
by: Sun, Yixiang, et al.
Published: (2025)
Expert Divergence Learning for MoE-based Language Models
by: Li, Jiaang, et al.
Published: (2026)
by: Li, Jiaang, et al.
Published: (2026)
Scaling Offline Model-Based RL via Jointly-Optimized World-Action Model Pretraining
by: Cheng, Jie, et al.
Published: (2024)
by: Cheng, Jie, et al.
Published: (2024)
Exploratory Diffusion Model for Unsupervised Reinforcement Learning
by: Ying, Chengyang, et al.
Published: (2025)
by: Ying, Chengyang, et al.
Published: (2025)
Mixture of Experts in Large Language Models
by: Zhang, Danyang, et al.
Published: (2025)
by: Zhang, Danyang, et al.
Published: (2025)
dUltra: Ultra-Fast Diffusion Language Models via Reinforcement Learning
by: Chen, Shirui, et al.
Published: (2025)
by: Chen, Shirui, et al.
Published: (2025)
GDSD: Reinforcement Learning as Guided Denoiser Self-Distillation for Diffusion Language Models
by: Tang, Xiaohang, et al.
Published: (2026)
by: Tang, Xiaohang, et al.
Published: (2026)
UniMamba: A Unified Spatial-Temporal Modeling Framework with State-Space and Attention Integration
by: Chen, Xingsheng, et al.
Published: (2026)
by: Chen, Xingsheng, et al.
Published: (2026)
UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning
by: Mao, Weijia, et al.
Published: (2025)
by: Mao, Weijia, et al.
Published: (2025)
Lookahead Unmasking Elicits Accurate Decoding in Diffusion Language Models
by: Lee, Sanghyun, et al.
Published: (2025)
by: Lee, Sanghyun, et al.
Published: (2025)
Model-based Reinforcement Learning for Parameterized Action Spaces
by: Zhang, Renhao, et al.
Published: (2024)
by: Zhang, Renhao, et al.
Published: (2024)
Composition of Memory Experts for Diffusion World Models
by: Stapf, Sebastian, et al.
Published: (2026)
by: Stapf, Sebastian, et al.
Published: (2026)
TFG: Unified Training-Free Guidance for Diffusion Models
by: Ye, Haotian, et al.
Published: (2024)
by: Ye, Haotian, et al.
Published: (2024)
Temporal Alignment Guidance: On-Manifold Sampling in Diffusion Models
by: Park, Youngrok, et al.
Published: (2025)
by: Park, Youngrok, et al.
Published: (2025)
Similar Items
-
PromptRL: Prompt Matters in RL for Flow-Based Image Generation
by: Wang, Fu-Yun, et al.
Published: (2026) -
Vision-Language Models are Zero-Shot Reward Models for Reinforcement Learning
by: Rocamonde, Juan, et al.
Published: (2023) -
FuRL: Visual-Language Models as Fuzzy Rewards for Reinforcement Learning
by: Fu, Yuwei, et al.
Published: (2024) -
UniCA: Unified Covariate Adaptation for Time Series Foundation Model
by: Han, Lu, et al.
Published: (2025) -
Stabilizing Reinforcement Learning for Diffusion Language Models
by: Zhong, Jianyuan, et al.
Published: (2026)