RewardDance: Reward Scaling in Visual Generation
Fuente:
arXiv
Guardado en:
| Autores principales: | Wu, Jie, Gao, Yu, Ye, Zilyu, Li, Ming, Li, Liang, Guo, Hanzhong, Liu, Jie, Xue, Zeyue, Hou, Xiaoxia, Liu, Wei, Zeng, Yan, Huang, Weilin |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
DanceGRPO: Unleashing GRPO on Visual Generation
por: Xue, Zeyue, et al.
Publicado: (2025)
por: Xue, Zeyue, et al.
Publicado: (2025)
Leveraging Verifier-Based Reinforcement Learning in Image Editing
por: Guo, Hanzhong, et al.
Publicado: (2026)
por: Guo, Hanzhong, et al.
Publicado: (2026)
UniGRPO: Unified Policy Optimization for Reasoning-Driven Visual Generation
por: Liu, Jie, et al.
Publicado: (2026)
por: Liu, Jie, et al.
Publicado: (2026)
Reward-Aware Trajectory Shaping for Few-step Visual Generation
por: Li, Rui, et al.
Publicado: (2026)
por: Li, Rui, et al.
Publicado: (2026)
RationalRewards: Reasoning Rewards Scale Visual Generation Both Training and Test Time
por: Wang, Haozhe, et al.
Publicado: (2026)
por: Wang, Haozhe, et al.
Publicado: (2026)
Skywork-Reward: Bag of Tricks for Reward Modeling in LLMs
por: Liu, Chris Yuhao, et al.
Publicado: (2024)
por: Liu, Chris Yuhao, et al.
Publicado: (2024)
Video2Reward: Generating Reward Function from Videos for Legged Robot Behavior Learning
por: Zeng, Runhao, et al.
Publicado: (2024)
por: Zeng, Runhao, et al.
Publicado: (2024)
A study on the relationship between online gaming behavior and suicidal ideation among college students
por: Shouting Lu, et al.
Publicado: (2026)
por: Shouting Lu, et al.
Publicado: (2026)
RewardAnything: Generalizable Principle-Following Reward Models
por: Yu, Zhuohao, et al.
Publicado: (2025)
por: Yu, Zhuohao, et al.
Publicado: (2025)
Learning to Generate Secure Code via Token-Level Rewards
por: Quan, Jiazheng, et al.
Publicado: (2026)
por: Quan, Jiazheng, et al.
Publicado: (2026)
InfiniteDance: Scalable 3D Dance Generation Towards in-the-wild Generalization
por: Li, Ronghui, et al.
Publicado: (2026)
por: Li, Ronghui, et al.
Publicado: (2026)
Rewarding Creativity: A Human-Aligned Generative Reward Model for Reinforcement Learning in Storytelling
por: Li, Zhaoyan, et al.
Publicado: (2026)
por: Li, Zhaoyan, et al.
Publicado: (2026)
InterDance:Reactive 3D Dance Generation with Realistic Duet Interactions
por: Li, Ronghui, et al.
Publicado: (2024)
por: Li, Ronghui, et al.
Publicado: (2024)
Lodge: A Coarse to Fine Diffusion Network for Long Dance Generation Guided by the Characteristic Dance Primitives
por: Li, Ronghui, et al.
Publicado: (2024)
por: Li, Ronghui, et al.
Publicado: (2024)
On Designing Effective RL Reward at Training Time for LLM Reasoning
por: Gao, Jiaxuan, et al.
Publicado: (2024)
por: Gao, Jiaxuan, et al.
Publicado: (2024)
PRDP: Proximal Reward Difference Prediction for Large-Scale Reward Finetuning of Diffusion Models
por: Deng, Fei, et al.
Publicado: (2024)
por: Deng, Fei, et al.
Publicado: (2024)
Contextual Bandits with Non-Stationary Correlated Rewards for User Association in MmWave Vehicular Networks
por: He, Xiaoyang, et al.
Publicado: (2024)
por: He, Xiaoyang, et al.
Publicado: (2024)
Joint Reward Modeling: Internalizing Chain-of-Thought for Efficient Visual Reward Models
por: Yang, Yankai, et al.
Publicado: (2026)
por: Yang, Yankai, et al.
Publicado: (2026)
Exploring Pass-Rate Reward in Reinforcement Learning for Code Generation
por: Li, Xin-Ye, et al.
Publicado: (2026)
por: Li, Xin-Ye, et al.
Publicado: (2026)
Scaling Multiagent Systems with Process Rewards
por: Li, Ed, et al.
Publicado: (2026)
por: Li, Ed, et al.
Publicado: (2026)
OmniForcing: Unleashing Real-time Joint Audio-Visual Generation
por: Su, Yaofeng, et al.
Publicado: (2026)
por: Su, Yaofeng, et al.
Publicado: (2026)
Beyond Scalar Reward Model: Learning Generative Judge from Preference Data
por: Ye, Ziyi, et al.
Publicado: (2024)
por: Ye, Ziyi, et al.
Publicado: (2024)
PrismAudio: Decomposed Chain-of-Thoughts and Multi-dimensional Rewards for Video-to-Audio Generation
por: Liu, Huadai, et al.
Publicado: (2025)
por: Liu, Huadai, et al.
Publicado: (2025)
Scaling Law for Quantization-Aware Training
por: Chen, Mengzhao, et al.
Publicado: (2025)
por: Chen, Mengzhao, et al.
Publicado: (2025)
Auto MC-Reward: Automated Dense Reward Design with Large Language Models for Minecraft
por: Li, Hao, et al.
Publicado: (2023)
por: Li, Hao, et al.
Publicado: (2023)
RRM: Robust Reward Model Training Mitigates Reward Hacking
por: Liu, Tianqi, et al.
Publicado: (2024)
por: Liu, Tianqi, et al.
Publicado: (2024)
Inference-time Scaling for Diffusion-based Audio Super-resolution
por: Jin, Yizhu, et al.
Publicado: (2025)
por: Jin, Yizhu, et al.
Publicado: (2025)
SemiReward: A General Reward Model for Semi-supervised Learning
por: Li, Siyuan, et al.
Publicado: (2023)
por: Li, Siyuan, et al.
Publicado: (2023)
Long-form RewardBench: Evaluating Reward Models for Long-form Generation
por: Huang, Hui, et al.
Publicado: (2026)
por: Huang, Hui, et al.
Publicado: (2026)
VL-RewardBench: A Challenging Benchmark for Vision-Language Generative Reward Models
por: Li, Lei, et al.
Publicado: (2024)
por: Li, Lei, et al.
Publicado: (2024)
Auxiliary Reward Generation with Transition Distance Representation Learning
por: Li, Siyuan, et al.
Publicado: (2024)
por: Li, Siyuan, et al.
Publicado: (2024)
Teaching LLM to be Persuasive: Reward-Enhanced Policy Optimization for Alignment from Heterogeneous Rewards
por: Zeng, Xia, et al.
Publicado: (2025)
por: Zeng, Xia, et al.
Publicado: (2025)
Lodge++: High-quality and Long Dance Generation with Vivid Choreography Patterns
por: Li, Ronghui, et al.
Publicado: (2024)
por: Li, Ronghui, et al.
Publicado: (2024)
QEAN: Quaternion-Enhanced Attention Network for Visual Dance Generation
por: Zhou, Zhizhen, et al.
Publicado: (2024)
por: Zhou, Zhizhen, et al.
Publicado: (2024)
AlphaGRPO: Unlocking Self-Reflective Multimodal Generation in UMMs via Decompositional Verifiable Reward
por: Huang, Runhui, et al.
Publicado: (2026)
por: Huang, Runhui, et al.
Publicado: (2026)
GRAM: A Generative Foundation Reward Model for Reward Generalization
por: Wang, Chenglong, et al.
Publicado: (2025)
por: Wang, Chenglong, et al.
Publicado: (2025)
Schedule On the Fly: Diffusion Time Prediction for Faster and Better Image Generation
por: Ye, Zilyu, et al.
Publicado: (2024)
por: Ye, Zilyu, et al.
Publicado: (2024)
The Dark Side of Rich Rewards: Understanding and Mitigating Noise in VLM Rewards
por: Huang, Sukai, et al.
Publicado: (2024)
por: Huang, Sukai, et al.
Publicado: (2024)
Reward Reasoning Model
por: Guo, Jiaxin, et al.
Publicado: (2025)
por: Guo, Jiaxin, et al.
Publicado: (2025)
Skywork-Reward-V2: Scaling Preference Data Curation via Human-AI Synergy
por: Liu, Chris Yuhao, et al.
Publicado: (2025)
por: Liu, Chris Yuhao, et al.
Publicado: (2025)
Ejemplares similares
-
DanceGRPO: Unleashing GRPO on Visual Generation
por: Xue, Zeyue, et al.
Publicado: (2025) -
Leveraging Verifier-Based Reinforcement Learning in Image Editing
por: Guo, Hanzhong, et al.
Publicado: (2026) -
UniGRPO: Unified Policy Optimization for Reasoning-Driven Visual Generation
por: Liu, Jie, et al.
Publicado: (2026) -
Reward-Aware Trajectory Shaping for Few-step Visual Generation
por: Li, Rui, et al.
Publicado: (2026) -
RationalRewards: Reasoning Rewards Scale Visual Generation Both Training and Test Time
por: Wang, Haozhe, et al.
Publicado: (2026)