Fine-Grained GRPO for Precise Preference Alignment in Flow Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhou, Yujie, Ling, Pengyang, Bu, Jiazi, Wang, Yibin, Zang, Yuhang, Wang, Jiaqi, Niu, Li, Zhai, Guangtao |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Pref-GRPO: Pairwise Preference Reward-based GRPO for Stable Text-to-Image Reinforcement Learning
par: Wang, Yibin, et autres
Publié: (2025)
par: Wang, Yibin, et autres
Publié: (2025)
DiCache: Let Diffusion Model Determine Its Own Cache
par: Bu, Jiazi, et autres
Publié: (2025)
par: Bu, Jiazi, et autres
Publié: (2025)
From Sparse to Dense: Multi-View GRPO for Flow Models via Augmented Condition Space
par: Bu, Jiazi, et autres
Publié: (2026)
par: Bu, Jiazi, et autres
Publié: (2026)
Pave-GRPO: Beyond Instantaneous Guidance through Principled Average Velocity Decomposition
par: Ling, Pengyang, et autres
Publié: (2026)
par: Ling, Pengyang, et autres
Publié: (2026)
Unified Personalized Reward Model for Vision Generation
par: Wang, Yibin, et autres
Publié: (2026)
par: Wang, Yibin, et autres
Publié: (2026)
HiFlow: Training-free High-Resolution Image Generation with Flow-Aligned Guidance
par: Bu, Jiazi, et autres
Publié: (2025)
par: Bu, Jiazi, et autres
Publié: (2025)
Uni-Classifier: Leveraging Video Diffusion Priors for Universal Guidance Classifier
par: Zhou, Yujie, et autres
Publié: (2026)
par: Zhou, Yujie, et autres
Publié: (2026)
ByTheWay: Boost Your Text-to-Video Generation Model to Higher Quality in a Training-free Way
par: Bu, Jiazi, et autres
Publié: (2024)
par: Bu, Jiazi, et autres
Publié: (2024)
Light-A-Video: Training-free Video Relighting via Progressive Light Fusion
par: Zhou, Yujie, et autres
Publié: (2025)
par: Zhou, Yujie, et autres
Publié: (2025)
MotionClone: Training-Free Motion Cloning for Controllable Video Generation
par: Ling, Pengyang, et autres
Publié: (2024)
par: Ling, Pengyang, et autres
Publié: (2024)
UniGenBench++: A Unified Semantic Evaluation Benchmark for Text-to-Image Generation
par: Wang, Yibin, et autres
Publié: (2025)
par: Wang, Yibin, et autres
Publié: (2025)
Unified Multimodal Chain-of-Thought Reward Model through Reinforcement Fine-Tuning
par: Wang, Yibin, et autres
Publié: (2025)
par: Wang, Yibin, et autres
Publié: (2025)
Unified Reward Model for Multimodal Understanding and Generation
par: Wang, Yibin, et autres
Publié: (2025)
par: Wang, Yibin, et autres
Publié: (2025)
BeautyGRPO: Aesthetic Alignment for Face Retouching via Dynamic Path Guidance and Fine-Grained Preference Modeling
par: Yang, Jiachen, et autres
Publié: (2026)
par: Yang, Jiachen, et autres
Publié: (2026)
EndoCoT: Scaling Endogenous Chain-of-Thought Reasoning in Diffusion Models
par: Dai, Xuanlang, et autres
Publié: (2026)
par: Dai, Xuanlang, et autres
Publié: (2026)
OmniAlign-V: Towards Enhanced Alignment of MLLMs with Human Preference
par: Zhao, Xiangyu, et autres
Publié: (2025)
par: Zhao, Xiangyu, et autres
Publié: (2025)
DenseGRPO: From Sparse to Dense Reward for Flow Matching Model Alignment
par: Deng, Haoyou, et autres
Publié: (2026)
par: Deng, Haoyou, et autres
Publié: (2026)
Visual-RFT: Visual Reinforcement Fine-Tuning
par: Liu, Ziyu, et autres
Publié: (2025)
par: Liu, Ziyu, et autres
Publié: (2025)
TempFlow-GRPO: When Timing Matters for GRPO in Flow Models
par: He, Xiaoxuan, et autres
Publié: (2025)
par: He, Xiaoxuan, et autres
Publié: (2025)
Fine-Grained Verifiers: Preference Modeling as Next-token Prediction in Vision-Language Alignment
par: Cui, Chenhang, et autres
Publié: (2024)
par: Cui, Chenhang, et autres
Publié: (2024)
OP-GRPO: Efficient Off-Policy GRPO for Flow-Matching Models
par: Zhang, Liyu, et autres
Publié: (2026)
par: Zhang, Liyu, et autres
Publié: (2026)
Beyond Global Alignment: Fine-Grained Motion-Language Retrieval via Pyramidal Shapley-Taylor Learning
par: Chen, Hanmo, et autres
Publié: (2026)
par: Chen, Hanmo, et autres
Publié: (2026)
ViTree: Single-path Neural Tree for Step-wise Interpretable Fine-grained Visual Categorization
par: Lao, Danning, et autres
Publié: (2024)
par: Lao, Danning, et autres
Publié: (2024)
Deciphering Cross-Modal Alignment in Large Vision-Language Models with Modality Integration Rate
par: Huang, Qidong, et autres
Publié: (2024)
par: Huang, Qidong, et autres
Publié: (2024)
SetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept Prediction
par: Zhang, Zhixiong, et autres
Publié: (2026)
par: Zhang, Zhixiong, et autres
Publié: (2026)
MIA-DPO: Multi-Image Augmented Direct Preference Optimization For Large Vision-Language Models
par: Liu, Ziyu, et autres
Publié: (2024)
par: Liu, Ziyu, et autres
Publié: (2024)
Visual Agentic Reinforcement Fine-Tuning
par: Liu, Ziyu, et autres
Publié: (2025)
par: Liu, Ziyu, et autres
Publié: (2025)
Visual Self-Refine: A Pixel-Guided Paradigm for Accurate Chart Parsing
par: Li, Jinsong, et autres
Publié: (2026)
par: Li, Jinsong, et autres
Publié: (2026)
2nd Place Report of MOSEv2 Challenge 2025: Concept Guided Video Object Segmentation via SeC
par: Zhang, Zhixiong, et autres
Publié: (2025)
par: Zhang, Zhixiong, et autres
Publié: (2025)
Beyond Pairwise Preferences: Listwise Reward-Aware Alignment for Diffusion Models
par: Wang, Austin, et autres
Publié: (2026)
par: Wang, Austin, et autres
Publié: (2026)
ReasonPix2Pix: Instruction Reasoning Dataset for Advanced Image Editing
par: Jin, Ying, et autres
Publié: (2024)
par: Jin, Ying, et autres
Publié: (2024)
Unified Scene Representation and Reconstruction for 3D Large Language Models
par: Chu, Tao, et autres
Publié: (2024)
par: Chu, Tao, et autres
Publié: (2024)
TIT-Score: Evaluating Long-Prompt Based Text-to-Image Alignment via Text-to-Image-to-Text Consistency
par: Wang, Juntong, et autres
Publié: (2025)
par: Wang, Juntong, et autres
Publié: (2025)
Long-CLIP: Unlocking the Long-Text Capability of CLIP
par: Zhang, Beichen, et autres
Publié: (2024)
par: Zhang, Beichen, et autres
Publié: (2024)
Preference-Guided Debiasing for No-Reference Enhancement Image Quality Assessment
par: Gao, Shiqi, et autres
Publié: (2026)
par: Gao, Shiqi, et autres
Publié: (2026)
GRPO-RM: Fine-Tuning Representation Models via GRPO-Driven Reinforcement Learning
par: Xu, Yanchen, et autres
Publié: (2025)
par: Xu, Yanchen, et autres
Publié: (2025)
Advancing Fine-Grained Visual Understanding with Multi-Scale Alignment in Multi-Modal Models
par: Wang, Wei, et autres
Publié: (2024)
par: Wang, Wei, et autres
Publié: (2024)
Flow-GRPO: Training Flow Matching Models via Online RL
par: Liu, Jie, et autres
Publié: (2025)
par: Liu, Jie, et autres
Publié: (2025)
MJ-VIDEO: Fine-Grained Benchmarking and Rewarding Video Preferences in Video Generation
par: Tong, Haibo, et autres
Publié: (2025)
par: Tong, Haibo, et autres
Publié: (2025)
Streaming Long Video Understanding with Large Language Models
par: Qian, Rui, et autres
Publié: (2024)
par: Qian, Rui, et autres
Publié: (2024)
Documents similaires
-
Pref-GRPO: Pairwise Preference Reward-based GRPO for Stable Text-to-Image Reinforcement Learning
par: Wang, Yibin, et autres
Publié: (2025) -
DiCache: Let Diffusion Model Determine Its Own Cache
par: Bu, Jiazi, et autres
Publié: (2025) -
From Sparse to Dense: Multi-View GRPO for Flow Models via Augmented Condition Space
par: Bu, Jiazi, et autres
Publié: (2026) -
Pave-GRPO: Beyond Instantaneous Guidance through Principled Average Velocity Decomposition
par: Ling, Pengyang, et autres
Publié: (2026) -
Unified Personalized Reward Model for Vision Generation
par: Wang, Yibin, et autres
Publié: (2026)