GRPO-Guard: Mitigating Implicit Over-Optimization in Flow Matching via Regulated Clipping
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Jing, Liang, Jiajun, Liu, Jie, Liu, Henglin, Liu, Gongye, Zheng, Jun, Pang, Wanyuan, Ma, Ao, Xie, Zhenyu, Wang, Xintao, Wang, Meng, Wan, Pengfei, Liang, Xiaodan |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Flow-GRPO: Training Flow Matching Models via Online RL
par: Liu, Jie, et autres
Publié: (2025)
par: Liu, Jie, et autres
Publié: (2025)
DiverseGRPO: Mitigating Mode Collapse in Image Generation via Diversity-Aware GRPO
par: Liu, Henglin, et autres
Publié: (2025)
par: Liu, Henglin, et autres
Publié: (2025)
LithoGRPO: Fast Inverse Lithography via GRPO Reinforced Flow Matching
par: Lai, Yao, et autres
Publié: (2026)
par: Lai, Yao, et autres
Publié: (2026)
VR-Thinker: Boosting Video Reward Models through Thinking-with-Image Reasoning
par: Wang, Qunzhong, et autres
Publié: (2025)
par: Wang, Qunzhong, et autres
Publié: (2025)
Stepwise Credit Assignment for GRPO on Flow-Matching Models
par: Savani, Yash, et autres
Publié: (2026)
par: Savani, Yash, et autres
Publié: (2026)
Improving Video Generation with Human Feedback
par: Liu, Jie, et autres
Publié: (2025)
par: Liu, Jie, et autres
Publié: (2025)
GARDO: Reinforcing Diffusion Models without Reward Hacking
par: He, Haoran, et autres
Publié: (2025)
par: He, Haoran, et autres
Publié: (2025)
Think, then Score: Decoupled Reasoning and Scoring for Video Reward Modeling
par: Wang, Yuan, et autres
Publié: (2026)
par: Wang, Yuan, et autres
Publié: (2026)
Adaptive-Boundary-Clipping GRPO: Ensuring Bounded Ratios for Stable and Generalizable Training
par: Liu, Chi, et autres
Publié: (2026)
par: Liu, Chi, et autres
Publié: (2026)
DenseGRPO: From Sparse to Dense Reward for Flow Matching Model Alignment
par: Deng, Haoyou, et autres
Publié: (2026)
par: Deng, Haoyou, et autres
Publié: (2026)
Scaling Image and Video Generation via Test-Time Evolutionary Search
par: He, Haoran, et autres
Publié: (2025)
par: He, Haoran, et autres
Publié: (2025)
InjecGuard: Benchmarking and Mitigating Over-defense in Prompt Injection Guardrail Models
par: Li, Hao, et autres
Publié: (2024)
par: Li, Hao, et autres
Publié: (2024)
AdaViewPlanner: Adapting Video Diffusion Models for Viewpoint Planning in 4D Scenes
par: Li, Yu, et autres
Publié: (2025)
par: Li, Yu, et autres
Publié: (2025)
AlignMiF: Geometry-Aligned Multimodal Implicit Field for LiDAR-Camera Joint Synthesis
par: Tang, Tao, et autres
Publié: (2024)
par: Tang, Tao, et autres
Publié: (2024)
Smart-GRPO: Smartly Sampling Noise for Efficient RL of Flow-Matching Models
par: Yu, Benjamin, et autres
Publié: (2025)
par: Yu, Benjamin, et autres
Publié: (2025)
OP-GRPO: Efficient Off-Policy GRPO for Flow-Matching Models
par: Zhang, Liyu, et autres
Publié: (2026)
par: Zhang, Liyu, et autres
Publié: (2026)
Implicit Hierarchical GRPO: Decoupling Tool Invocation from Execution for Tool-Integrated Mathematical Reasoning
par: Wang, Li, et autres
Publié: (2026)
par: Wang, Li, et autres
Publié: (2026)
Endoscopic Mucosal Resection Using an Over‐the‐Scope Clip for Duodenal Neuroendocrine Tumors: A Promising Method
par: Yi‐Heng Yao, et autres
Publié: (2025)
par: Yi‐Heng Yao, et autres
Publié: (2025)
DIVA-GRPO: Enhancing Multimodal Reasoning through Difficulty-Adaptive Variant Advantage
par: Gao, Haowen, et autres
Publié: (2026)
par: Gao, Haowen, et autres
Publié: (2026)
Online Reward-Weighted Fine-Tuning of Flow Matching with Wasserstein Regularization
par: Fan, Jiajun, et autres
Publié: (2025)
par: Fan, Jiajun, et autres
Publié: (2025)
CineScene: Implicit 3D as Effective Scene Representation for Cinematic Video Generation
par: Huang, Kaiyi, et autres
Publié: (2026)
par: Huang, Kaiyi, et autres
Publié: (2026)
AMIR-GRPO: Inducing Implicit Preference Signals into GRPO
par: Yari, Amir Hossein, et autres
Publié: (2026)
par: Yari, Amir Hossein, et autres
Publié: (2026)
FlowSE-GRPO: Training Flow Matching Speech Enhancement via Online Reinforcement Learning
par: Wang, Haoxu, et autres
Publié: (2026)
par: Wang, Haoxu, et autres
Publié: (2026)
GIFT: Group-Relative Implicit Fine-Tuning Integrates GRPO with DPO and UNA
par: Wang, Zhichao
Publié: (2025)
par: Wang, Zhichao
Publié: (2025)
CycleFlow: Leveraging Cycle Consistency in Flow Matching for Speaker Style Adaptation
par: Liang, Ziqi, et autres
Publié: (2025)
par: Liang, Ziqi, et autres
Publié: (2025)
ClipGStream: Clip-Stream Gaussian Splatting for Any Length and Any Motion Multi-View Dynamic Scene Reconstruction
par: Liang, Jie, et autres
Publié: (2026)
par: Liang, Jie, et autres
Publié: (2026)
VOILA: Complexity-Aware Universal Segmentation of CT images by Voxel Interacting with Language
par: Wan, Zishuo, et autres
Publié: (2025)
par: Wan, Zishuo, et autres
Publié: (2025)
Simulating the Visual World with Artificial Intelligence: A Roadmap
par: Yue, Jingtong, et autres
Publié: (2025)
par: Yue, Jingtong, et autres
Publié: (2025)
GameFactory: Creating New Games with Generative Interactive Videos
par: Yu, Jiwen, et autres
Publié: (2025)
par: Yu, Jiwen, et autres
Publié: (2025)
UniMMVSR: A Unified Multi-Modal Framework for Cascaded Video Super-Resolution
par: Du, Shian, et autres
Publié: (2025)
par: Du, Shian, et autres
Publié: (2025)
StyleCrafter: Enhancing Stylized Text-to-Video Generation with Style Adapter
par: Liu, Gongye, et autres
Publié: (2023)
par: Liu, Gongye, et autres
Publié: (2023)
To Clip or not to Clip: the Dynamics of SGD with Gradient Clipping in High-Dimensions
par: Marshall, Noah, et autres
Publié: (2024)
par: Marshall, Noah, et autres
Publié: (2024)
DanceGRPO: Unleashing GRPO on Visual Generation
par: Xue, Zeyue, et autres
Publié: (2025)
par: Xue, Zeyue, et autres
Publié: (2025)
MENTOR: A Metacognition-Driven Self-Evolution Framework for Uncovering and Mitigating Implicit Domain Risks in LLMs
par: Shan, Liang, et autres
Publié: (2025)
par: Shan, Liang, et autres
Publié: (2025)
Design and Optimization of a Radial Magnetic Flux Array‐Type Wireless Charging Coupler
par: Dan Chen, et autres
Publié: (2026)
par: Dan Chen, et autres
Publié: (2026)
OmniX: From Unified Panoramic Generation and Perception to Graphics-Ready 3D Scenes
par: Huang, Yukun, et autres
Publié: (2025)
par: Huang, Yukun, et autres
Publié: (2025)
$λ$-GRPO: Unifying the GRPO Frameworks with Learnable Token Preferences
par: Wang, Yining, et autres
Publié: (2025)
par: Wang, Yining, et autres
Publié: (2025)
TIGFlow-GRPO: Trajectory Forecasting via Interaction-Aware Flow Matching and Reward-Guided Optimization
par: Jing, Xuepeng, et autres
Publié: (2026)
par: Jing, Xuepeng, et autres
Publié: (2026)
DRAGON: Guard LLM Unlearning in Context via Negative Detection and Reasoning
par: Wang, Yaxuan, et autres
Publié: (2025)
par: Wang, Yaxuan, et autres
Publié: (2025)
Geometry-Aware Implicit Memory for Video World Models
par: Wei, Zhengxuan, et autres
Publié: (2026)
par: Wei, Zhengxuan, et autres
Publié: (2026)
Documents similaires
-
Flow-GRPO: Training Flow Matching Models via Online RL
par: Liu, Jie, et autres
Publié: (2025) -
DiverseGRPO: Mitigating Mode Collapse in Image Generation via Diversity-Aware GRPO
par: Liu, Henglin, et autres
Publié: (2025) -
LithoGRPO: Fast Inverse Lithography via GRPO Reinforced Flow Matching
par: Lai, Yao, et autres
Publié: (2026) -
VR-Thinker: Boosting Video Reward Models through Thinking-with-Image Reasoning
par: Wang, Qunzhong, et autres
Publié: (2025) -
Stepwise Credit Assignment for GRPO on Flow-Matching Models
par: Savani, Yash, et autres
Publié: (2026)