R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Zhang, Yi-Fan, Lu, Xingyu, Hu, Xiao, Fu, Chaoyou, Wen, Bin, Zhang, Tianke, Liu, Changyi, Jiang, Kaiyu, Chen, Kaibing, Tang, Kaiyu, Ding, Haojie, Chen, Jiankang, Yang, Fan, Zhang, Zhang, Gao, Tingting, Wang, Liang |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Thyme: Think Beyond Images
von: Zhang, Yi-Fan, et al.
Veröffentlicht: (2025)
von: Zhang, Yi-Fan, et al.
Veröffentlicht: (2025)
SpatialReward: Bridging the Perception Gap in Online RL for Image Editing via Explicit Spatial Reasoning
von: Long, Yancheng, et al.
Veröffentlicht: (2026)
von: Long, Yancheng, et al.
Veröffentlicht: (2026)
VCap: Hypergeometric Rewards for Weak-to-Strong Visual Captioning
von: Lu, Xingyu, et al.
Veröffentlicht: (2026)
von: Lu, Xingyu, et al.
Veröffentlicht: (2026)
Joint Reward Modeling: Internalizing Chain-of-Thought for Efficient Visual Reward Models
von: Yang, Yankai, et al.
Veröffentlicht: (2026)
von: Yang, Yankai, et al.
Veröffentlicht: (2026)
VLM as Policy: Common-Law Content Moderation Framework for Short Video Platform
von: Lu, Xingyu, et al.
Veröffentlicht: (2025)
von: Lu, Xingyu, et al.
Veröffentlicht: (2025)
InstructEngine: Instruction-driven Text-to-Image Alignment
von: Lu, Xingyu, et al.
Veröffentlicht: (2025)
von: Lu, Xingyu, et al.
Veröffentlicht: (2025)
TaskGalaxy: Scaling Multi-modal Instruction Fine-tuning with Tens of Thousands Vision Task Types
von: Chen, Jiankang, et al.
Veröffentlicht: (2025)
von: Chen, Jiankang, et al.
Veröffentlicht: (2025)
ContextRL: Enhancing MLLM's Knowledge Discovery Efficiency with Context-Augmented RL
von: Lu, Xingyu, et al.
Veröffentlicht: (2026)
von: Lu, Xingyu, et al.
Veröffentlicht: (2026)
Kwai-STaR: Transform LLMs into State-Transition Reasoners
von: Lu, Xingyu, et al.
Veröffentlicht: (2024)
von: Lu, Xingyu, et al.
Veröffentlicht: (2024)
VideoTemp-o3: Harmonizing Temporal Grounding and Video Understanding in Agentic Thinking-with-Videos
von: Liu, Wenqi, et al.
Veröffentlicht: (2026)
von: Liu, Wenqi, et al.
Veröffentlicht: (2026)
BaseReward: A Strong Baseline for Multimodal Reward Model
von: Zhang, Yi-Fan, et al.
Veröffentlicht: (2025)
von: Zhang, Yi-Fan, et al.
Veröffentlicht: (2025)
UniRef-Image-Edit: Towards Scalable and Consistent Multi-Reference Image Editing
von: Wei, Hongyang, et al.
Veröffentlicht: (2026)
von: Wei, Hongyang, et al.
Veröffentlicht: (2026)
Weather-R1: Logically Consistent Reinforcement Fine-Tuning for Multimodal Reasoning in Meteorology
von: Wu, Kaiyu, et al.
Veröffentlicht: (2026)
von: Wu, Kaiyu, et al.
Veröffentlicht: (2026)
PEER: Unified Process-Outcome Reinforcement Learning for Structured Empathetic Reasoning
von: Wang, Yunxiao, et al.
Veröffentlicht: (2025)
von: Wang, Yunxiao, et al.
Veröffentlicht: (2025)
Reinforcement Learning with Conditional Expectation Reward
von: Xiao, Changyi, et al.
Veröffentlicht: (2026)
von: Xiao, Changyi, et al.
Veröffentlicht: (2026)
HiPRAG: Hierarchical Process Rewards for Efficient Agentic Retrieval Augmented Generation
von: Wu, Peilin, et al.
Veröffentlicht: (2025)
von: Wu, Peilin, et al.
Veröffentlicht: (2025)
ReCode: Reinforcing Code Generation with Reasoning-Process Rewards
von: Fan, Lishui, et al.
Veröffentlicht: (2025)
von: Fan, Lishui, et al.
Veröffentlicht: (2025)
ConfClip: Confidence-Weighted and Clipped Reward for Reinforcement Learning in LLMs
von: Zhang, Bonan, et al.
Veröffentlicht: (2025)
von: Zhang, Bonan, et al.
Veröffentlicht: (2025)
Data-adaptive Safety Rules for Training Reward Models
von: Li, Xiaomin, et al.
Veröffentlicht: (2025)
von: Li, Xiaomin, et al.
Veröffentlicht: (2025)
Beyond LLaVA-HD: Diving into High-Resolution Large Multimodal Models
von: Zhang, Yi-Fan, et al.
Veröffentlicht: (2024)
von: Zhang, Yi-Fan, et al.
Veröffentlicht: (2024)
EVLM: An Efficient Vision-Language Model for Visual Understanding
von: Chen, Kaibing, et al.
Veröffentlicht: (2024)
von: Chen, Kaibing, et al.
Veröffentlicht: (2024)
Rethinking Sample Polarity in Reinforcement Learning with Verifiable Rewards
von: Tang, Xinyu, et al.
Veröffentlicht: (2025)
von: Tang, Xinyu, et al.
Veröffentlicht: (2025)
Towards High Data Efficiency in Reinforcement Learning with Verifiable Reward
von: Tang, Xinyu, et al.
Veröffentlicht: (2025)
von: Tang, Xinyu, et al.
Veröffentlicht: (2025)
Med-RewardBench: Benchmarking Reward Models and Judges for Medical Multimodal Large Language Models
von: Ding, Meidan, et al.
Veröffentlicht: (2025)
von: Ding, Meidan, et al.
Veröffentlicht: (2025)
AgentV-RL: Scaling Reward Modeling with Agentic Verifier
von: Zhang, Jiazheng, et al.
Veröffentlicht: (2026)
von: Zhang, Jiazheng, et al.
Veröffentlicht: (2026)
Process Reinforcement through Implicit Rewards
von: Cui, Ganqu, et al.
Veröffentlicht: (2025)
von: Cui, Ganqu, et al.
Veröffentlicht: (2025)
Reward-SQL: Boosting Text-to-SQL via Stepwise Reasoning and Process-Supervised Rewards
von: Zhang, Yuxin, et al.
Veröffentlicht: (2025)
von: Zhang, Yuxin, et al.
Veröffentlicht: (2025)
Multi-Reward as Condition for Instruction-based Image Editing
von: Gu, Xin, et al.
Veröffentlicht: (2024)
von: Gu, Xin, et al.
Veröffentlicht: (2024)
Improving Training-free Conditional Diffusion Model via Fisher Information
von: Song, Kaiyu, et al.
Veröffentlicht: (2024)
von: Song, Kaiyu, et al.
Veröffentlicht: (2024)
Leveraging Previous Steps: A Training-free Fast Solver for Flow Diffusion
von: Song, Kaiyu, et al.
Veröffentlicht: (2024)
von: Song, Kaiyu, et al.
Veröffentlicht: (2024)
From Reasoning to Learning: A Survey on Hypothesis Discovery and Rule Learning with Large Language Models
von: He, Kaiyu, et al.
Veröffentlicht: (2025)
von: He, Kaiyu, et al.
Veröffentlicht: (2025)
Training Data Efficiency in Multimodal Process Reward Models
von: Li, Jinyuan, et al.
Veröffentlicht: (2026)
von: Li, Jinyuan, et al.
Veröffentlicht: (2026)
MM-RLHF: The Next Step Forward in Multimodal LLM Alignment
von: Zhang, Yi-Fan, et al.
Veröffentlicht: (2025)
von: Zhang, Yi-Fan, et al.
Veröffentlicht: (2025)
VideoRewardBench: Comprehensive Evaluation of Multimodal Reward Models for Video Understanding
von: Zhang, Zhihong, et al.
Veröffentlicht: (2025)
von: Zhang, Zhihong, et al.
Veröffentlicht: (2025)
SophiaVL-R1: Reinforcing MLLMs Reasoning with Thinking Reward
von: Fan, Kaixuan, et al.
Veröffentlicht: (2025)
von: Fan, Kaixuan, et al.
Veröffentlicht: (2025)
GRAM-R$^2$: Self-Training Generative Foundation Reward Models for Reward Reasoning
von: Wang, Chenglong, et al.
Veröffentlicht: (2025)
von: Wang, Chenglong, et al.
Veröffentlicht: (2025)
MME-Unify: A Comprehensive Benchmark for Unified Multimodal Understanding and Generation Models
von: Xie, Wulin, et al.
Veröffentlicht: (2025)
von: Xie, Wulin, et al.
Veröffentlicht: (2025)
Multimodal LLMs as Customized Reward Models for Text-to-Image Generation
von: Zhou, Shijie, et al.
Veröffentlicht: (2025)
von: Zhou, Shijie, et al.
Veröffentlicht: (2025)
AffectGPT-R1: Leveraging Reinforcement Learning for Open-Vocabulary Multimodal Emotion Recognition
von: Lian, Zheng, et al.
Veröffentlicht: (2025)
von: Lian, Zheng, et al.
Veröffentlicht: (2025)
PARM: Pipeline-Adapted Reward Model
von: Fan, Xingyu, et al.
Veröffentlicht: (2026)
von: Fan, Xingyu, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
Thyme: Think Beyond Images
von: Zhang, Yi-Fan, et al.
Veröffentlicht: (2025) -
SpatialReward: Bridging the Perception Gap in Online RL for Image Editing via Explicit Spatial Reasoning
von: Long, Yancheng, et al.
Veröffentlicht: (2026) -
VCap: Hypergeometric Rewards for Weak-to-Strong Visual Captioning
von: Lu, Xingyu, et al.
Veröffentlicht: (2026) -
Joint Reward Modeling: Internalizing Chain-of-Thought for Efficient Visual Reward Models
von: Yang, Yankai, et al.
Veröffentlicht: (2026) -
VLM as Policy: Common-Law Content Moderation Framework for Short Video Platform
von: Lu, Xingyu, et al.
Veröffentlicht: (2025)