Stepwise Credit Assignment for GRPO on Flow-Matching Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Savani, Yash, Kveton, Branislav, Liu, Yuchen, Wang, Yilin, Shi, Jing, Mukherjee, Subhojyoti, Vlassis, Nikos, Singh, Krishna Kumar |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
AdvantageFlow: Advantage-Weighted Least Squares for RL in Flow Models
par: Kveton, Branislav, et autres
Publié: (2026)
par: Kveton, Branislav, et autres
Publié: (2026)
OP-GRPO: Efficient Off-Policy GRPO for Flow-Matching Models
par: Zhang, Liyu, et autres
Publié: (2026)
par: Zhang, Liyu, et autres
Publié: (2026)
TempFlow-GRPO: When Timing Matters for GRPO in Flow Models
par: He, Xiaoxuan, et autres
Publié: (2025)
par: He, Xiaoxuan, et autres
Publié: (2025)
Flow-GRPO: Training Flow Matching Models via Online RL
par: Liu, Jie, et autres
Publié: (2025)
par: Liu, Jie, et autres
Publié: (2025)
DenseGRPO: From Sparse to Dense Reward for Flow Matching Model Alignment
par: Deng, Haoyou, et autres
Publié: (2026)
par: Deng, Haoyou, et autres
Publié: (2026)
Smart-GRPO: Smartly Sampling Noise for Efficient RL of Flow-Matching Models
par: Yu, Benjamin, et autres
Publié: (2025)
par: Yu, Benjamin, et autres
Publié: (2025)
StreamGaze: Gaze-Guided Temporal Reasoning and Proactive Understanding in Streaming Videos
par: Lee, Daeun, et autres
Publié: (2025)
par: Lee, Daeun, et autres
Publié: (2025)
Diffusing Differentiable Representations
par: Savani, Yash, et autres
Publié: (2024)
par: Savani, Yash, et autres
Publié: (2024)
TIGFlow-GRPO: Trajectory Forecasting via Interaction-Aware Flow Matching and Reward-Guided Optimization
par: Jing, Xuepeng, et autres
Publié: (2026)
par: Jing, Xuepeng, et autres
Publié: (2026)
GRPO-Guard: Mitigating Implicit Over-Optimization in Flow Matching via Regulated Clipping
par: Wang, Jing, et autres
Publié: (2025)
par: Wang, Jing, et autres
Publié: (2025)
Efficient and Interpretable Bandit Algorithms
par: Mukherjee, Subhojyoti, et autres
Publié: (2023)
par: Mukherjee, Subhojyoti, et autres
Publié: (2023)
Guidance Contrastive Token Credit Assignment for Discrete Policy Optimization
par: Li, Shufan, et autres
Publié: (2026)
par: Li, Shufan, et autres
Publié: (2026)
Contrastive Flow Matching
par: Stoica, George, et autres
Publié: (2025)
par: Stoica, George, et autres
Publié: (2025)
MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE
par: Li, Junzhe, et autres
Publié: (2025)
par: Li, Junzhe, et autres
Publié: (2025)
DanceGRPO: Unleashing GRPO on Visual Generation
par: Xue, Zeyue, et autres
Publié: (2025)
par: Xue, Zeyue, et autres
Publié: (2025)
Fine-Grained GRPO for Precise Preference Alignment in Flow Models
par: Zhou, Yujie, et autres
Publié: (2025)
par: Zhou, Yujie, et autres
Publié: (2025)
Posterior Augmented Flow Matching
par: Stoica, George, et autres
Publié: (2026)
par: Stoica, George, et autres
Publié: (2026)
Ensemble Quadratic Assignment Network for Graph Matching
par: Tan, Haoru, et autres
Publié: (2024)
par: Tan, Haoru, et autres
Publié: (2024)
Reinforcing 3D Understanding in Point-VLMs via Geometric Reward Credit Assignment
par: Chen, Jingkun, et autres
Publié: (2026)
par: Chen, Jingkun, et autres
Publié: (2026)
From Sparse to Dense: Multi-View GRPO for Flow Models via Augmented Condition Space
par: Bu, Jiazi, et autres
Publié: (2026)
par: Bu, Jiazi, et autres
Publié: (2026)
FastFlow: Accelerating The Generative Flow Matching Models with Bandit Inference
par: Bajpai, Divya Jyoti, et autres
Publié: (2026)
par: Bajpai, Divya Jyoti, et autres
Publié: (2026)
SketchVL: Policy Optimization via Fine-Grained Credit Assignment for Chart Understanding and More
par: Huang, Muye, et autres
Publié: (2026)
par: Huang, Muye, et autres
Publié: (2026)
DEVIS-GRPO: Unleashing GRPO on Dynamic Extreme View Synthesis
par: Zuo, Yi, et autres
Publié: (2026)
par: Zuo, Yi, et autres
Publié: (2026)
Riemannian Patch Assignment Gradient Flows
par: Gonzalez-Alvarado, Daniel, et autres
Publié: (2025)
par: Gonzalez-Alvarado, Daniel, et autres
Publié: (2025)
UniHuman: A Unified Model for Editing Human Images in the Wild
par: Li, Nannan, et autres
Publié: (2023)
par: Li, Nannan, et autres
Publié: (2023)
SR-Stereo & DAPE: Stepwise Regression and Pre-trained Edges for Practical Stereo Matching
par: Xiao, Weiqing, et autres
Publié: (2024)
par: Xiao, Weiqing, et autres
Publié: (2024)
Alleviating Sparse Rewards by Modeling Step-Wise and Long-Term Sampling Effects in Flow-Based GRPO
par: Tong, Yunze, et autres
Publié: (2026)
par: Tong, Yunze, et autres
Publié: (2026)
MAR-GRPO: Stabilized GRPO for AR-diffusion Hybrid Image Generation
par: Ma, Xiaoxiao, et autres
Publié: (2026)
par: Ma, Xiaoxiao, et autres
Publié: (2026)
DiverseGRPO: Mitigating Mode Collapse in Image Generation via Diversity-Aware GRPO
par: Liu, Henglin, et autres
Publié: (2025)
par: Liu, Henglin, et autres
Publié: (2025)
CAVE: A Structured Credit Assignment Approach for Fragmented Visual Evidence Reasoning
par: Guo, Tengda, et autres
Publié: (2026)
par: Guo, Tengda, et autres
Publié: (2026)
Blockwise Flow Matching: Improving Flow Matching Models For Efficient High-Quality Generation
par: Park, Dogyun, et autres
Publié: (2025)
par: Park, Dogyun, et autres
Publié: (2025)
Video-as-Answer: Predict and Generate Next Video Event with Joint-GRPO
par: Cheng, Junhao, et autres
Publié: (2025)
par: Cheng, Junhao, et autres
Publié: (2025)
Rethinking Test Time Scaling for Flow-Matching Generative Models
par: Yu, Qingtao, et autres
Publié: (2025)
par: Yu, Qingtao, et autres
Publié: (2025)
Multimodal LLMs as Customized Reward Models for Text-to-Image Generation
par: Zhou, Shijie, et autres
Publié: (2025)
par: Zhou, Shijie, et autres
Publié: (2025)
GRPO-RM: Fine-Tuning Representation Models via GRPO-Driven Reinforcement Learning
par: Xu, Yanchen, et autres
Publié: (2025)
par: Xu, Yanchen, et autres
Publié: (2025)
MotionGRPO: Overcoming Low Intra-Group Diversity in GRPO-Based Egocentric Motion Recovery
par: Yao, Nanjie, et autres
Publié: (2026)
par: Yao, Nanjie, et autres
Publié: (2026)
Pref-GRPO: Pairwise Preference Reward-based GRPO for Stable Text-to-Image Reinforcement Learning
par: Wang, Yibin, et autres
Publié: (2025)
par: Wang, Yibin, et autres
Publié: (2025)
SuperFlow: Training Flow Matching Models with RL on the Fly
par: Chen, Kaijie, et autres
Publié: (2025)
par: Chen, Kaijie, et autres
Publié: (2025)
FlowCast: Trajectory Forecasting for Scalable Zero-Cost Speculative Flow Matching
par: Bajpai, Divya Jyoti, et autres
Publié: (2026)
par: Bajpai, Divya Jyoti, et autres
Publié: (2026)
FlowID : Enhancing Forensic Identification with Latent Flow-Matching Models
par: Ripoll, Jules, et autres
Publié: (2026)
par: Ripoll, Jules, et autres
Publié: (2026)
Documents similaires
-
AdvantageFlow: Advantage-Weighted Least Squares for RL in Flow Models
par: Kveton, Branislav, et autres
Publié: (2026) -
OP-GRPO: Efficient Off-Policy GRPO for Flow-Matching Models
par: Zhang, Liyu, et autres
Publié: (2026) -
TempFlow-GRPO: When Timing Matters for GRPO in Flow Models
par: He, Xiaoxuan, et autres
Publié: (2025) -
Flow-GRPO: Training Flow Matching Models via Online RL
par: Liu, Jie, et autres
Publié: (2025) -
DenseGRPO: From Sparse to Dense Reward for Flow Matching Model Alignment
par: Deng, Haoyou, et autres
Publié: (2026)