Joint Reward Modeling: Internalizing Chain-of-Thought for Efficient Visual Reward Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Yang, Yankai, Long, Yancheng, Wei, Hongyang, Chen, Wei, Zhang, Tianke, Jiang, Kaiyu, Fan, Haonan, Liu, Changyi, Chen, Jiankang, Tang, Kaiyu, Wen, Bin, Yang, Fan, Gao, Tingting, Li, Han, Yang, Shuo |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
SpatialReward: Bridging the Perception Gap in Online RL for Image Editing via Explicit Spatial Reasoning
por: Long, Yancheng, et al.
Publicado: (2026)
por: Long, Yancheng, et al.
Publicado: (2026)
VCap: Hypergeometric Rewards for Weak-to-Strong Visual Captioning
por: Lu, Xingyu, et al.
Publicado: (2026)
por: Lu, Xingyu, et al.
Publicado: (2026)
R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning
por: Zhang, Yi-Fan, et al.
Publicado: (2025)
por: Zhang, Yi-Fan, et al.
Publicado: (2025)
Spatial Chain-of-Thought: Bridging Understanding and Generation Models for Spatial Reasoning Generation
por: Chen, Wei, et al.
Publicado: (2026)
por: Chen, Wei, et al.
Publicado: (2026)
UniRef-Image-Edit: Towards Scalable and Consistent Multi-Reference Image Editing
por: Wei, Hongyang, et al.
Publicado: (2026)
por: Wei, Hongyang, et al.
Publicado: (2026)
VideoTemp-o3: Harmonizing Temporal Grounding and Video Understanding in Agentic Thinking-with-Videos
por: Liu, Wenqi, et al.
Publicado: (2026)
por: Liu, Wenqi, et al.
Publicado: (2026)
Thyme: Think Beyond Images
por: Zhang, Yi-Fan, et al.
Publicado: (2025)
por: Zhang, Yi-Fan, et al.
Publicado: (2025)
ContextRL: Enhancing MLLM's Knowledge Discovery Efficiency with Context-Augmented RL
por: Lu, Xingyu, et al.
Publicado: (2026)
por: Lu, Xingyu, et al.
Publicado: (2026)
InstructEngine: Instruction-driven Text-to-Image Alignment
por: Lu, Xingyu, et al.
Publicado: (2025)
por: Lu, Xingyu, et al.
Publicado: (2025)
VLM as Policy: Common-Law Content Moderation Framework for Short Video Platform
por: Lu, Xingyu, et al.
Publicado: (2025)
por: Lu, Xingyu, et al.
Publicado: (2025)
TaskGalaxy: Scaling Multi-modal Instruction Fine-tuning with Tens of Thousands Vision Task Types
por: Chen, Jiankang, et al.
Publicado: (2025)
por: Chen, Jiankang, et al.
Publicado: (2025)
Long-form RewardBench: Evaluating Reward Models for Long-form Generation
por: Huang, Hui, et al.
Publicado: (2026)
por: Huang, Hui, et al.
Publicado: (2026)
Kwai-STaR: Transform LLMs into State-Transition Reasoners
por: Lu, Xingyu, et al.
Publicado: (2024)
por: Lu, Xingyu, et al.
Publicado: (2024)
PEER: Unified Process-Outcome Reinforcement Learning for Structured Empathetic Reasoning
por: Wang, Yunxiao, et al.
Publicado: (2025)
por: Wang, Yunxiao, et al.
Publicado: (2025)
Demystifying Multilingual Chain-of-Thought in Process Reward Modeling
por: Wang, Weixuan, et al.
Publicado: (2025)
por: Wang, Weixuan, et al.
Publicado: (2025)
EVLM: An Efficient Vision-Language Model for Visual Understanding
por: Chen, Kaibing, et al.
Publicado: (2024)
por: Chen, Kaibing, et al.
Publicado: (2024)
Decoupling Contrastive Decoding: Robust Hallucination Mitigation in Multimodal Large Language Models
por: Chen, Wei, et al.
Publicado: (2025)
por: Chen, Wei, et al.
Publicado: (2025)
Render-of-Thought: Rendering Textual Chain-of-Thought as Images for Visual Latent Reasoning
por: Wang, Yifan, et al.
Publicado: (2026)
por: Wang, Yifan, et al.
Publicado: (2026)
From Reasoning to Learning: A Survey on Hypothesis Discovery and Rule Learning with Large Language Models
por: He, Kaiyu, et al.
Publicado: (2025)
por: He, Kaiyu, et al.
Publicado: (2025)
PrismAudio: Decomposed Chain-of-Thoughts and Multi-dimensional Rewards for Video-to-Audio Generation
por: Liu, Huadai, et al.
Publicado: (2025)
por: Liu, Huadai, et al.
Publicado: (2025)
ETR: Entropy Trend Reward for Efficient Chain-of-Thought Reasoning
por: Xiong, Xuan, et al.
Publicado: (2026)
por: Xiong, Xuan, et al.
Publicado: (2026)
Markov Chain of Thought for Efficient Mathematical Reasoning
por: Yang, Wen, et al.
Publicado: (2024)
por: Yang, Wen, et al.
Publicado: (2024)
Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning
por: Turpin, Miles, et al.
Publicado: (2025)
por: Turpin, Miles, et al.
Publicado: (2025)
Lean Copilot: Large Language Models as Copilots for Theorem Proving in Lean
por: Song, Peiyang, et al.
Publicado: (2024)
por: Song, Peiyang, et al.
Publicado: (2024)
CaC: Advancing Video Reward Models via Hierarchical Spatiotemporal Concentrating
por: Wang, Jiyuan, et al.
Publicado: (2026)
por: Wang, Jiyuan, et al.
Publicado: (2026)
Reinforcement Learning with Inverse Rewards for World Model Post-training
por: Ye, Yang, et al.
Publicado: (2025)
por: Ye, Yang, et al.
Publicado: (2025)
Visual-ERM: Reward Modeling for Visual Equivalence
por: Liu, Ziyu, et al.
Publicado: (2026)
por: Liu, Ziyu, et al.
Publicado: (2026)
BaseReward: A Strong Baseline for Multimodal Reward Model
por: Zhang, Yi-Fan, et al.
Publicado: (2025)
por: Zhang, Yi-Fan, et al.
Publicado: (2025)
StreamingCoT: A Dataset for Temporal Dynamics and Multimodal Chain-of-Thought Reasoning in Streaming VideoQA
por: Hu, Yuhang, et al.
Publicado: (2025)
por: Hu, Yuhang, et al.
Publicado: (2025)
AgentRM: Enhancing Agent Generalization with Reward Modeling
por: Xia, Yu, et al.
Publicado: (2025)
por: Xia, Yu, et al.
Publicado: (2025)
Accelerating RLHF Training with Reward Variance Increase
por: Yang, Zonglin, et al.
Publicado: (2025)
por: Yang, Zonglin, et al.
Publicado: (2025)
Re-FORC: Adaptive Reward Prediction for Efficient Chain-of-Thought Reasoning
por: Zabounidis, Renos, et al.
Publicado: (2025)
por: Zabounidis, Renos, et al.
Publicado: (2025)
PARM: Pipeline-Adapted Reward Model
por: Fan, Xingyu, et al.
Publicado: (2026)
por: Fan, Xingyu, et al.
Publicado: (2026)
Learning beyond Teacher: Generalized On-Policy Distillation with Reward Extrapolation
por: Yang, Wenkai, et al.
Publicado: (2026)
por: Yang, Wenkai, et al.
Publicado: (2026)
HiPRAG: Hierarchical Process Rewards for Efficient Agentic Retrieval Augmented Generation
por: Wu, Peilin, et al.
Publicado: (2025)
por: Wu, Peilin, et al.
Publicado: (2025)
SDiaReward: Modeling and Benchmarking Spoken Dialogue Rewards with Modality and Colloquialness
por: Lu, Jingyu, et al.
Publicado: (2026)
por: Lu, Jingyu, et al.
Publicado: (2026)
FedCoT: Federated Chain-of-Thought Distillation for Large Language Models
por: Fan, Tao, et al.
Publicado: (2024)
por: Fan, Tao, et al.
Publicado: (2024)
ENCORE: Entropy-guided Reward Composition for Multi-head Safety Reward Models
por: Li, Xiaomin, et al.
Publicado: (2025)
por: Li, Xiaomin, et al.
Publicado: (2025)
Self-Consistency of the Internal Reward Models Improves Self-Rewarding Language Models
por: Zhou, Xin, et al.
Publicado: (2025)
por: Zhou, Xin, et al.
Publicado: (2025)
Reinforcement Learning with Conditional Expectation Reward
por: Xiao, Changyi, et al.
Publicado: (2026)
por: Xiao, Changyi, et al.
Publicado: (2026)
Ejemplares similares
-
SpatialReward: Bridging the Perception Gap in Online RL for Image Editing via Explicit Spatial Reasoning
por: Long, Yancheng, et al.
Publicado: (2026) -
VCap: Hypergeometric Rewards for Weak-to-Strong Visual Captioning
por: Lu, Xingyu, et al.
Publicado: (2026) -
R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning
por: Zhang, Yi-Fan, et al.
Publicado: (2025) -
Spatial Chain-of-Thought: Bridging Understanding and Generation Models for Spatial Reasoning Generation
por: Chen, Wei, et al.
Publicado: (2026) -
UniRef-Image-Edit: Towards Scalable and Consistent Multi-Reference Image Editing
por: Wei, Hongyang, et al.
Publicado: (2026)