MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Junzhe, Cui, Yutao, Huang, Tao, Ma, Yinping, Fan, Chun, Cheng, Yiming, Yang, Miles, Zhong, Zhao, Bo, Liefeng |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
TempFlow-GRPO: When Timing Matters for GRPO in Flow Models
par: He, Xiaoxuan, et autres
Publié: (2025)
par: He, Xiaoxuan, et autres
Publié: (2025)
Neighbor GRPO: Contrastive ODE Policy Optimization Aligns Flow Models
par: He, Dailan, et autres
Publié: (2025)
par: He, Dailan, et autres
Publié: (2025)
Precise: SDE-Consistent Stochastic Sampling for RL Post-Training of Flow-Matching Models
par: Zou, Jade, et autres
Publié: (2026)
par: Zou, Jade, et autres
Publié: (2026)
OP-GRPO: Efficient Off-Policy GRPO for Flow-Matching Models
par: Zhang, Liyu, et autres
Publié: (2026)
par: Zhang, Liyu, et autres
Publié: (2026)
MAR-GRPO: Stabilized GRPO for AR-diffusion Hybrid Image Generation
par: Ma, Xiaoxiao, et autres
Publié: (2026)
par: Ma, Xiaoxiao, et autres
Publié: (2026)
DanceGRPO: Unleashing GRPO on Visual Generation
par: Xue, Zeyue, et autres
Publié: (2025)
par: Xue, Zeyue, et autres
Publié: (2025)
$λ$-GRPO: Unifying the GRPO Frameworks with Learnable Token Preferences
par: Wang, Yining, et autres
Publié: (2025)
par: Wang, Yining, et autres
Publié: (2025)
LithoGRPO: Fast Inverse Lithography via GRPO Reinforced Flow Matching
par: Lai, Yao, et autres
Publié: (2026)
par: Lai, Yao, et autres
Publié: (2026)
KVPO: ODE-Native GRPO for Autoregressive Video Alignment via KV Semantic Exploration
par: Zhang, Ruicheng, et autres
Publié: (2026)
par: Zhang, Ruicheng, et autres
Publié: (2026)
MiGrATe: Mixed-Policy GRPO for Adaptation at Test-Time
par: Phan, Peter, et autres
Publié: (2025)
par: Phan, Peter, et autres
Publié: (2025)
Pref-GRPO: Pairwise Preference Reward-based GRPO for Stable Text-to-Image Reinforcement Learning
par: Wang, Yibin, et autres
Publié: (2025)
par: Wang, Yibin, et autres
Publié: (2025)
Symbiotic-MoE: Unlocking the Synergy between Generation and Understanding
par: Liu, Xiangyue, et autres
Publié: (2026)
par: Liu, Xiangyue, et autres
Publié: (2026)
BranchGRPO: Stable and Efficient GRPO with Structured Branching in Diffusion Models
par: Li, Yuming, et autres
Publié: (2025)
par: Li, Yuming, et autres
Publié: (2025)
AMIR-GRPO: Inducing Implicit Preference Signals into GRPO
par: Yari, Amir Hossein, et autres
Publié: (2026)
par: Yari, Amir Hossein, et autres
Publié: (2026)
EDGE-GRPO: Entropy-Driven GRPO with Guided Error Correction for Advantage Diversity
par: Zhang, Xingjian, et autres
Publié: (2025)
par: Zhang, Xingjian, et autres
Publié: (2025)
Can GRPO Boost Complex Multimodal Table Understanding?
par: Kang, Xiaoqiang, et autres
Publié: (2025)
par: Kang, Xiaoqiang, et autres
Publié: (2025)
MMR-GRPO: Accelerating GRPO-Style Training through Diversity-Aware Reward Reweighting
par: Wei, Kangda, et autres
Publié: (2026)
par: Wei, Kangda, et autres
Publié: (2026)
Graph-GRPO: Training Graph Flow Models with Reinforcement Learning
par: Zhu, Baoheng, et autres
Publié: (2026)
par: Zhu, Baoheng, et autres
Publié: (2026)
DEVIS-GRPO: Unleashing GRPO on Dynamic Extreme View Synthesis
par: Zuo, Yi, et autres
Publié: (2026)
par: Zuo, Yi, et autres
Publié: (2026)
AlphaGRPO: Unlocking Self-Reflective Multimodal Generation in UMMs via Decompositional Verifiable Reward
par: Huang, Runhui, et autres
Publié: (2026)
par: Huang, Runhui, et autres
Publié: (2026)
DiverseGRPO: Mitigating Mode Collapse in Image Generation via Diversity-Aware GRPO
par: Liu, Henglin, et autres
Publié: (2025)
par: Liu, Henglin, et autres
Publié: (2025)
Smart-GRPO: Smartly Sampling Noise for Efficient RL of Flow-Matching Models
par: Yu, Benjamin, et autres
Publié: (2025)
par: Yu, Benjamin, et autres
Publié: (2025)
SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization
par: Chen, Minghan, et autres
Publié: (2025)
par: Chen, Minghan, et autres
Publié: (2025)
Stepwise Credit Assignment for GRPO on Flow-Matching Models
par: Savani, Yash, et autres
Publié: (2026)
par: Savani, Yash, et autres
Publié: (2026)
STAGE: Stable and Generalizable GRPO for Autoregressive Image Generation
par: Ma, Xiaoxiao, et autres
Publié: (2025)
par: Ma, Xiaoxiao, et autres
Publié: (2025)
LaF-GRPO: In-Situ Navigation Instruction Generation for the Visually Impaired via GRPO with LLM-as-Follower Reward
par: Zhao, Yi, et autres
Publié: (2025)
par: Zhao, Yi, et autres
Publié: (2025)
FlowSE-GRPO: Training Flow Matching Speech Enhancement via Online Reinforcement Learning
par: Wang, Haoxu, et autres
Publié: (2026)
par: Wang, Haoxu, et autres
Publié: (2026)
GRPO-RM: Fine-Tuning Representation Models via GRPO-Driven Reinforcement Learning
par: Xu, Yanchen, et autres
Publié: (2025)
par: Xu, Yanchen, et autres
Publié: (2025)
DRA-GRPO: Your GRPO Needs to Know Diverse Reasoning Paths for Mathematical Reasoning
par: Chen, Xiwen, et autres
Publié: (2025)
par: Chen, Xiwen, et autres
Publié: (2025)
How Off-Policy Can GRPO Be? Mu-GRPO for Efficient LLM Reinforcement Learning
par: Tian, Minghao, et autres
Publié: (2026)
par: Tian, Minghao, et autres
Publié: (2026)
TreeGRPO: Tree-Advantage GRPO for Online RL Post-Training of Diffusion Models
par: Ding, Zheng, et autres
Publié: (2025)
par: Ding, Zheng, et autres
Publié: (2025)
Video-as-Answer: Predict and Generate Next Video Event with Joint-GRPO
par: Cheng, Junhao, et autres
Publié: (2025)
par: Cheng, Junhao, et autres
Publié: (2025)
Flow-GRPO: Training Flow Matching Models via Online RL
par: Liu, Jie, et autres
Publié: (2025)
par: Liu, Jie, et autres
Publié: (2025)
It Takes Two: Your GRPO Is Secretly DPO
par: Wu, Yihong, et autres
Publié: (2025)
par: Wu, Yihong, et autres
Publié: (2025)
What is the Alignment Objective of GRPO?
par: Vojnovic, Milan, et autres
Publié: (2025)
par: Vojnovic, Milan, et autres
Publié: (2025)
Fine-Grained GRPO for Precise Preference Alignment in Flow Models
par: Zhou, Yujie, et autres
Publié: (2025)
par: Zhou, Yujie, et autres
Publié: (2025)
GRPO-$λ$: Credit Assignment improves LLM Reasoning
par: Parthasarathi, Prasanna, et autres
Publié: (2025)
par: Parthasarathi, Prasanna, et autres
Publié: (2025)
MotionGRPO: Overcoming Low Intra-Group Diversity in GRPO-Based Egocentric Motion Recovery
par: Yao, Nanjie, et autres
Publié: (2026)
par: Yao, Nanjie, et autres
Publié: (2026)
Expand and Prune: Maximizing Trajectory Diversity for Effective GRPO in Generative Models
par: Ge, Shiran, et autres
Publié: (2025)
par: Ge, Shiran, et autres
Publié: (2025)
dFlowGRPO: Rate-Aware Policy Optimization for Discrete Flow Models
par: Wan, Zhengyan, et autres
Publié: (2026)
par: Wan, Zhengyan, et autres
Publié: (2026)
Documents similaires
-
TempFlow-GRPO: When Timing Matters for GRPO in Flow Models
par: He, Xiaoxuan, et autres
Publié: (2025) -
Neighbor GRPO: Contrastive ODE Policy Optimization Aligns Flow Models
par: He, Dailan, et autres
Publié: (2025) -
Precise: SDE-Consistent Stochastic Sampling for RL Post-Training of Flow-Matching Models
par: Zou, Jade, et autres
Publié: (2026) -
OP-GRPO: Efficient Off-Policy GRPO for Flow-Matching Models
par: Zhang, Liyu, et autres
Publié: (2026) -
MAR-GRPO: Stabilized GRPO for AR-diffusion Hybrid Image Generation
par: Ma, Xiaoxiao, et autres
Publié: (2026)