GARDO: Reinforcing Diffusion Models without Reward Hacking
Fuente:
arXiv
Salvato in:
| Autori principali: | He, Haoran, Ye, Yuxiao, Liu, Jie, Liang, Jiajun, Wang, Zhiyong, Yuan, Ziyang, Wang, Xintao, Mao, Hangyu, Wan, Pengfei, Pan, Ling |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Scaling Image and Video Generation via Test-Time Evolutionary Search
di: He, Haoran, et al.
Pubblicazione: (2025)
di: He, Haoran, et al.
Pubblicazione: (2025)
Latent Diffusion Model without Variational Autoencoder
di: Shi, Minglei, et al.
Pubblicazione: (2025)
di: Shi, Minglei, et al.
Pubblicazione: (2025)
VR-Thinker: Boosting Video Reward Models through Thinking-with-Image Reasoning
di: Wang, Qunzhong, et al.
Pubblicazione: (2025)
di: Wang, Qunzhong, et al.
Pubblicazione: (2025)
Think, then Score: Decoupled Reasoning and Scoring for Video Reward Modeling
di: Wang, Yuan, et al.
Pubblicazione: (2026)
di: Wang, Yuan, et al.
Pubblicazione: (2026)
ConceptMaster: Multi-Concept Video Customization on Diffusion Transformer Models Without Test-Time Tuning
di: Huang, Yuzhou, et al.
Pubblicazione: (2025)
di: Huang, Yuzhou, et al.
Pubblicazione: (2025)
Understanding Reward Hacking in Text-to-Image Reinforcement Learning
di: Hong, Yunqi, et al.
Pubblicazione: (2026)
di: Hong, Yunqi, et al.
Pubblicazione: (2026)
FullDiT2: Efficient In-Context Conditioning for Video Diffusion Transformers
di: He, Xuanhua, et al.
Pubblicazione: (2025)
di: He, Xuanhua, et al.
Pubblicazione: (2025)
Flow-GRPO: Training Flow Matching Models via Online RL
di: Liu, Jie, et al.
Pubblicazione: (2025)
di: Liu, Jie, et al.
Pubblicazione: (2025)
SVG-T2I: Scaling Up Text-to-Image Latent Diffusion Model Without Variational Autoencoder
di: Shi, Minglei, et al.
Pubblicazione: (2025)
di: Shi, Minglei, et al.
Pubblicazione: (2025)
DiffMoE: Dynamic Token Selection for Scalable Diffusion Transformers
di: Shi, Minglei, et al.
Pubblicazione: (2025)
di: Shi, Minglei, et al.
Pubblicazione: (2025)
SoliReward: Mitigating Susceptibility to Reward Hacking and Annotation Noise in Video Generation Reward Models
di: Lian, Jiesong, et al.
Pubblicazione: (2025)
di: Lian, Jiesong, et al.
Pubblicazione: (2025)
StyleMaster: Stylize Your Video with Artistic Generation and Translation
di: Ye, Zixuan, et al.
Pubblicazione: (2024)
di: Ye, Zixuan, et al.
Pubblicazione: (2024)
SynCamMaster: Synchronizing Multi-Camera Video Generation from Diverse Viewpoints
di: Bai, Jianhong, et al.
Pubblicazione: (2024)
di: Bai, Jianhong, et al.
Pubblicazione: (2024)
Consistent Human Image and Video Generation with Spatially Conditioned Diffusion
di: Cao, Mingdeng, et al.
Pubblicazione: (2024)
di: Cao, Mingdeng, et al.
Pubblicazione: (2024)
UniCustom: Unified Visual Conditioning for Multi-Reference Image Generation
di: Xu, Yiyan, et al.
Pubblicazione: (2026)
di: Xu, Yiyan, et al.
Pubblicazione: (2026)
PatchVSR: Breaking Video Diffusion Resolution Limits with Patch-wise Video Super-Resolution
di: Du, Shian, et al.
Pubblicazione: (2025)
di: Du, Shian, et al.
Pubblicazione: (2025)
Reward Hacking in Rubric-Based Reinforcement Learning
di: Mahmoud, Anas, et al.
Pubblicazione: (2026)
di: Mahmoud, Anas, et al.
Pubblicazione: (2026)
GRPO-Guard: Mitigating Implicit Over-Optimization in Flow Matching via Regulated Clipping
di: Wang, Jing, et al.
Pubblicazione: (2025)
di: Wang, Jing, et al.
Pubblicazione: (2025)
3DTrajMaster: Mastering 3D Trajectory for Multi-Entity Motion in Video Generation
di: Fu, Xiao, et al.
Pubblicazione: (2024)
di: Fu, Xiao, et al.
Pubblicazione: (2024)
Breaking Free: How to Hack Safety Guardrails in Black-Box Diffusion Models!
di: Kotyan, Shashank, et al.
Pubblicazione: (2024)
di: Kotyan, Shashank, et al.
Pubblicazione: (2024)
Geometric Autoencoder for Diffusion Models
di: Liu, Hangyu, et al.
Pubblicazione: (2026)
di: Liu, Hangyu, et al.
Pubblicazione: (2026)
UniVideo: Unified Understanding, Generation, and Editing for Videos
di: Wei, Cong, et al.
Pubblicazione: (2025)
di: Wei, Cong, et al.
Pubblicazione: (2025)
MVReward: Better Aligning and Evaluating Multi-View Diffusion Models with Human Preferences
di: Wang, Weitao, et al.
Pubblicazione: (2024)
di: Wang, Weitao, et al.
Pubblicazione: (2024)
SVQA-R1: Reinforcing Spatial Reasoning in MLLMs via View-Consistent Reward Optimization
di: Wang, Peiyao, et al.
Pubblicazione: (2025)
di: Wang, Peiyao, et al.
Pubblicazione: (2025)
Random Policy Valuation is Enough for LLM Reasoning with Verifiable Rewards
di: He, Haoran, et al.
Pubblicazione: (2025)
di: He, Haoran, et al.
Pubblicazione: (2025)
GameFactory: Creating New Games with Generative Interactive Videos
di: Yu, Jiwen, et al.
Pubblicazione: (2025)
di: Yu, Jiwen, et al.
Pubblicazione: (2025)
SketchVideo: Sketch-based Video Generation and Editing
di: Liu, Feng-Lin, et al.
Pubblicazione: (2025)
di: Liu, Feng-Lin, et al.
Pubblicazione: (2025)
UNIC: Unified In-Context Video Editing
di: Ye, Zixuan, et al.
Pubblicazione: (2025)
di: Ye, Zixuan, et al.
Pubblicazione: (2025)
Improving Video Generation with Human Feedback
di: Liu, Jie, et al.
Pubblicazione: (2025)
di: Liu, Jie, et al.
Pubblicazione: (2025)
Visual-Aware CoT: Achieving High-Fidelity Visual Consistency in Unified Models
di: Ye, Zixuan, et al.
Pubblicazione: (2025)
di: Ye, Zixuan, et al.
Pubblicazione: (2025)
Spontaneous Reward Hacking in Iterative Self-Refinement
di: Pan, Jane, et al.
Pubblicazione: (2024)
di: Pan, Jane, et al.
Pubblicazione: (2024)
VideoCanvas: Unified Video Completion from Arbitrary Spatiotemporal Patches via In-Context Conditioning
di: Cai, Minghong, et al.
Pubblicazione: (2025)
di: Cai, Minghong, et al.
Pubblicazione: (2025)
Diffusion Reinforcement Learning via Centered Reward Distillation
di: Zhu, Yuanzhi, et al.
Pubblicazione: (2026)
di: Zhu, Yuanzhi, et al.
Pubblicazione: (2026)
Reinforcement Learning with Inverse Rewards for World Model Post-training
di: Ye, Yang, et al.
Pubblicazione: (2025)
di: Ye, Yang, et al.
Pubblicazione: (2025)
VideoTetris: Towards Compositional Text-to-Video Generation
di: Tian, Ye, et al.
Pubblicazione: (2024)
di: Tian, Ye, et al.
Pubblicazione: (2024)
FullDiT: Multi-Task Video Generative Foundation Model with Full Attention
di: Ju, Xuan, et al.
Pubblicazione: (2025)
di: Ju, Xuan, et al.
Pubblicazione: (2025)
Simulating the Visual World with Artificial Intelligence: A Roadmap
di: Yue, Jingtong, et al.
Pubblicazione: (2025)
di: Yue, Jingtong, et al.
Pubblicazione: (2025)
In-Context Audio Control of Video Diffusion Transformers
di: Liu, Wenze, et al.
Pubblicazione: (2025)
di: Liu, Wenze, et al.
Pubblicazione: (2025)
A-SDM: Accelerating Stable Diffusion through Redundancy Removal and Performance Optimization
di: Zhu, Jinchao, et al.
Pubblicazione: (2023)
di: Zhu, Jinchao, et al.
Pubblicazione: (2023)
AdaViewPlanner: Adapting Video Diffusion Models for Viewpoint Planning in 4D Scenes
di: Li, Yu, et al.
Pubblicazione: (2025)
di: Li, Yu, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Scaling Image and Video Generation via Test-Time Evolutionary Search
di: He, Haoran, et al.
Pubblicazione: (2025) -
Latent Diffusion Model without Variational Autoencoder
di: Shi, Minglei, et al.
Pubblicazione: (2025) -
VR-Thinker: Boosting Video Reward Models through Thinking-with-Image Reasoning
di: Wang, Qunzhong, et al.
Pubblicazione: (2025) -
Think, then Score: Decoupled Reasoning and Scoring for Video Reward Modeling
di: Wang, Yuan, et al.
Pubblicazione: (2026) -
ConceptMaster: Multi-Concept Video Customization on Diffusion Transformer Models Without Test-Time Tuning
di: Huang, Yuzhou, et al.
Pubblicazione: (2025)