Flash-GRPO: Efficient Alignment for Video Diffusion via One-Step Policy Optimization
Fuente:
arXiv
Salvato in:
| Autori principali: | He, Xiaoxuan, Fu, Siming, Xue, Zeyue, Wang, Weijie, He, Ruizhe, Li, Yuming, Yin, Dacheng, Dong, Shuai, Huang, Haoyang, Wang, Hongfa, Duan, Nan, Zhuang, Bohan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
A Systematic Post-Train Framework for Video Generation
di: Xue, Zeyue, et al.
Pubblicazione: (2026)
di: Xue, Zeyue, et al.
Pubblicazione: (2026)
TempFlow-GRPO: When Timing Matters for GRPO in Flow Models
di: He, Xiaoxuan, et al.
Pubblicazione: (2025)
di: He, Xiaoxuan, et al.
Pubblicazione: (2025)
FlashAR: Efficient Post-Training Acceleration for Autoregressive Image Generation
di: Zhou, Junkang, et al.
Pubblicazione: (2026)
di: Zhou, Junkang, et al.
Pubblicazione: (2026)
Astrolabe: Steering Forward-Process Reinforcement Learning for Distilled Autoregressive Video Models
di: Zhang, Songchun, et al.
Pubblicazione: (2026)
di: Zhang, Songchun, et al.
Pubblicazione: (2026)
OmniForcing: Unleashing Real-time Joint Audio-Visual Generation
di: Su, Yaofeng, et al.
Pubblicazione: (2026)
di: Su, Yaofeng, et al.
Pubblicazione: (2026)
OmniNFT: Modality-wise Omni Diffusion Reinforcement for Joint Audio-Video Generation
di: Zhang, Guohui, et al.
Pubblicazione: (2026)
di: Zhang, Guohui, et al.
Pubblicazione: (2026)
SAIL: Self-Amplified Iterative Learning for Diffusion Model Alignment with Minimal Human Feedback
di: He, Xiaoxuan, et al.
Pubblicazione: (2026)
di: He, Xiaoxuan, et al.
Pubblicazione: (2026)
LithoGRPO: Fast Inverse Lithography via GRPO Reinforced Flow Matching
di: Lai, Yao, et al.
Pubblicazione: (2026)
di: Lai, Yao, et al.
Pubblicazione: (2026)
World-R1: Reinforcing 3D Constraints for Text-to-Video Generation
di: Wang, Weijie, et al.
Pubblicazione: (2026)
di: Wang, Weijie, et al.
Pubblicazione: (2026)
DanceGRPO: Unleashing GRPO on Visual Generation
di: Xue, Zeyue, et al.
Pubblicazione: (2025)
di: Xue, Zeyue, et al.
Pubblicazione: (2025)
Less Detail, Better Answers: Degradation-Driven Prompting for VQA
di: Han, Haoxuan, et al.
Pubblicazione: (2026)
di: Han, Haoxuan, et al.
Pubblicazione: (2026)
RAE-AR: Taming Autoregressive Models with Representation Autoencoders
di: Yu, Hu, et al.
Pubblicazione: (2026)
di: Yu, Hu, et al.
Pubblicazione: (2026)
Video-Language Alignment via Spatio-Temporal Graph Transformer
di: Zhang, Shi-Xue, et al.
Pubblicazione: (2024)
di: Zhang, Shi-Xue, et al.
Pubblicazione: (2024)
PSA: Pyramid Sparse Attention for Efficient Video Understanding and Generation
di: Li, Xiaolong, et al.
Pubblicazione: (2025)
di: Li, Xiaolong, et al.
Pubblicazione: (2025)
FlashBlock: Attention Caching for Efficient Long-Context Block Diffusion
di: Chen, Zhuokun, et al.
Pubblicazione: (2026)
di: Chen, Zhuokun, et al.
Pubblicazione: (2026)
OP-GRPO: Efficient Off-Policy GRPO for Flow-Matching Models
di: Zhang, Liyu, et al.
Pubblicazione: (2026)
di: Zhang, Liyu, et al.
Pubblicazione: (2026)
AEGPO: Adaptive Entropy-Guided Policy Optimization for Diffusion Models
di: Li, Yuming, et al.
Pubblicazione: (2026)
di: Li, Yuming, et al.
Pubblicazione: (2026)
BranchGRPO: Stable and Efficient GRPO with Structured Branching in Diffusion Models
di: Li, Yuming, et al.
Pubblicazione: (2025)
di: Li, Yuming, et al.
Pubblicazione: (2025)
Teacher-Feature Drifting: One-Step Diffusion Distillation with Pretrained Diffusion Representations
di: Zhang, Yuan, et al.
Pubblicazione: (2026)
di: Zhang, Yuan, et al.
Pubblicazione: (2026)
VideoScene: Distilling Video Diffusion Model to Generate 3D Scenes in One Step
di: Wang, Hanyang, et al.
Pubblicazione: (2025)
di: Wang, Hanyang, et al.
Pubblicazione: (2025)
FlashMotion: Few-Step Controllable Video Generation with Trajectory Guidance
di: Li, Quanhao, et al.
Pubblicazione: (2026)
di: Li, Quanhao, et al.
Pubblicazione: (2026)
UltraVideo: High-Quality UHD Video Dataset with Comprehensive Captions
di: Xue, Zhucun, et al.
Pubblicazione: (2025)
di: Xue, Zhucun, et al.
Pubblicazione: (2025)
Time-dependent Flows and Their Applications in Parabolic-parabolic Patlak-Keller-Segel Systems Part II: Shear Flows
di: He, Siming
Pubblicazione: (2024)
di: He, Siming
Pubblicazione: (2024)
Time-dependent Flows and Their Applications in Parabolic-parabolic Patlak-Keller-Segel Systems Part I: Alternating Flows
di: He, Siming
Pubblicazione: (2024)
di: He, Siming
Pubblicazione: (2024)
Localized Enhanced Dissipation: A Hypocoercivity Approach
di: He, Siming
Pubblicazione: (2026)
di: He, Siming
Pubblicazione: (2026)
BLADE: Block-Sparse Attention Meets Step Distillation for Efficient Video Generation
di: Gu, Youping, et al.
Pubblicazione: (2025)
di: Gu, Youping, et al.
Pubblicazione: (2025)
FlashMask: Efficient and Rich Mask Extension of FlashAttention
di: Wang, Guoxia, et al.
Pubblicazione: (2024)
di: Wang, Guoxia, et al.
Pubblicazione: (2024)
SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization
di: Chen, Minghan, et al.
Pubblicazione: (2025)
di: Chen, Minghan, et al.
Pubblicazione: (2025)
DaGRPO: Rectifying Gradient Conflict in Reasoning via Distinctiveness-Aware Group Relative Policy Optimization
di: Xie, Xuan, et al.
Pubblicazione: (2025)
di: Xie, Xuan, et al.
Pubblicazione: (2025)
MAR-GRPO: Stabilized GRPO for AR-diffusion Hybrid Image Generation
di: Ma, Xiaoxiao, et al.
Pubblicazione: (2026)
di: Ma, Xiaoxiao, et al.
Pubblicazione: (2026)
VideoChat-Flash: Hierarchical Compression for Long-Context Video Modeling
di: Li, Xinhao, et al.
Pubblicazione: (2024)
di: Li, Xinhao, et al.
Pubblicazione: (2024)
VCapsBench: A Large-scale Fine-grained Benchmark for Video Caption Quality Evaluation
di: Zhang, Shi-Xue, et al.
Pubblicazione: (2025)
di: Zhang, Shi-Xue, et al.
Pubblicazione: (2025)
SafeGRPO: Self-Rewarded Multimodal Safety Alignment via Rule-Governed Policy Optimization
di: Rong, Xuankun, et al.
Pubblicazione: (2025)
di: Rong, Xuankun, et al.
Pubblicazione: (2025)
What is the Alignment Objective of GRPO?
di: Vojnovic, Milan, et al.
Pubblicazione: (2025)
di: Vojnovic, Milan, et al.
Pubblicazione: (2025)
E-GRPO: High Entropy Steps Drive Effective Reinforcement Learning for Flow Models
di: Zhang, Shengjun, et al.
Pubblicazione: (2026)
di: Zhang, Shengjun, et al.
Pubblicazione: (2026)
ReCA: Multi-Shot Long Video Extrapolation via Recursive Context Allocation
di: Liu, Akide, et al.
Pubblicazione: (2026)
di: Liu, Akide, et al.
Pubblicazione: (2026)
LongVLM: Efficient Long Video Understanding via Large Language Models
di: Weng, Yuetian, et al.
Pubblicazione: (2024)
di: Weng, Yuetian, et al.
Pubblicazione: (2024)
Step-GRPO: Internalizing Dynamic Early Exit for Efficient Reasoning
di: Chen, Benteng, et al.
Pubblicazione: (2026)
di: Chen, Benteng, et al.
Pubblicazione: (2026)
An Empirical Study on How Video-LLMs Answer Video Questions
di: Gou, Chenhui, et al.
Pubblicazione: (2025)
di: Gou, Chenhui, et al.
Pubblicazione: (2025)
The second Hochschild cohomology and deformations of Brauer graph algebras
di: Liu, Yuming, et al.
Pubblicazione: (2026)
di: Liu, Yuming, et al.
Pubblicazione: (2026)
Documenti analoghi
-
A Systematic Post-Train Framework for Video Generation
di: Xue, Zeyue, et al.
Pubblicazione: (2026) -
TempFlow-GRPO: When Timing Matters for GRPO in Flow Models
di: He, Xiaoxuan, et al.
Pubblicazione: (2025) -
FlashAR: Efficient Post-Training Acceleration for Autoregressive Image Generation
di: Zhou, Junkang, et al.
Pubblicazione: (2026) -
Astrolabe: Steering Forward-Process Reinforcement Learning for Distilled Autoregressive Video Models
di: Zhang, Songchun, et al.
Pubblicazione: (2026) -
OmniForcing: Unleashing Real-time Joint Audio-Visual Generation
di: Su, Yaofeng, et al.
Pubblicazione: (2026)