Video Understanding Reward Modeling: A Robust Benchmark and Performant Reward Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Wei, Yuancheng, Yao, Linli, Li, Lei, Zhang, Haojie, Zhou, Hao, Meng, Fandong, Sun, Xu |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
VideoRewardBench: Comprehensive Evaluation of Multimodal Reward Models for Video Understanding
von: Zhang, Zhihong, et al.
Veröffentlicht: (2025)
von: Zhang, Zhihong, et al.
Veröffentlicht: (2025)
DiffCap-Bench: A Comprehensive, Challenging, Robust Benchmark for Image Difference Captioning
von: Wei, Yuancheng, et al.
Veröffentlicht: (2026)
von: Wei, Yuancheng, et al.
Veröffentlicht: (2026)
TimeChat: A Time-sensitive Multimodal Large Language Model for Long Video Understanding
von: Ren, Shuhuai, et al.
Veröffentlicht: (2023)
von: Ren, Shuhuai, et al.
Veröffentlicht: (2023)
Direct Preference Optimization of Video Large Multimodal Models from Language Model Reward
von: Zhang, Ruohong, et al.
Veröffentlicht: (2024)
von: Zhang, Ruohong, et al.
Veröffentlicht: (2024)
Med-RewardBench: Benchmarking Reward Models and Judges for Medical Multimodal Large Language Models
von: Ding, Meidan, et al.
Veröffentlicht: (2025)
von: Ding, Meidan, et al.
Veröffentlicht: (2025)
Beyond VLM-Based Rewards: Diffusion-Native Latent Reward Modeling
von: Liu, Gongye, et al.
Veröffentlicht: (2026)
von: Liu, Gongye, et al.
Veröffentlicht: (2026)
Reinforcement Learning with Robust Rubric Rewards
von: Yu, Ya-Qi, et al.
Veröffentlicht: (2026)
von: Yu, Ya-Qi, et al.
Veröffentlicht: (2026)
PunchBench: Benchmarking MLLMs in Multimodal Punchline Comprehension
von: Ouyang, Kun, et al.
Veröffentlicht: (2024)
von: Ouyang, Kun, et al.
Veröffentlicht: (2024)
SpatialReward: Verifiable Spatial Reward Modeling for Fine-Grained Spatial Consistency in Text-to-Image Generation
von: Zhou, Sashuai, et al.
Veröffentlicht: (2026)
von: Zhou, Sashuai, et al.
Veröffentlicht: (2026)
Deep Reward Supervisions for Tuning Text-to-Image Diffusion Models
von: Wu, Xiaoshi, et al.
Veröffentlicht: (2024)
von: Wu, Xiaoshi, et al.
Veröffentlicht: (2024)
DiffusionReward: Enhancing Blind Face Restoration through Reward Feedback Learning
von: Wu, Bin, et al.
Veröffentlicht: (2025)
von: Wu, Bin, et al.
Veröffentlicht: (2025)
DocReward: A Document Reward Model for Structuring and Stylizing
von: Liu, Junpeng, et al.
Veröffentlicht: (2025)
von: Liu, Junpeng, et al.
Veröffentlicht: (2025)
Multimodal RewardBench: Holistic Evaluation of Reward Models for Vision Language Models
von: Yasunaga, Michihiro, et al.
Veröffentlicht: (2025)
von: Yasunaga, Michihiro, et al.
Veröffentlicht: (2025)
CaC: Advancing Video Reward Models via Hierarchical Spatiotemporal Concentrating
von: Wang, Jiyuan, et al.
Veröffentlicht: (2026)
von: Wang, Jiyuan, et al.
Veröffentlicht: (2026)
From Captions to Rewards (CAREVL): Leveraging Large Language Model Experts for Enhanced Reward Modeling in Large Vision-Language Models
von: Dai, Muzhi, et al.
Veröffentlicht: (2025)
von: Dai, Muzhi, et al.
Veröffentlicht: (2025)
AdPO: Enhancing the Adversarial Robustness of Large Vision-Language Models with Preference Optimization
von: Liu, Chaohu, et al.
Veröffentlicht: (2025)
von: Liu, Chaohu, et al.
Veröffentlicht: (2025)
APB-V: Accelerating Long-Video Understanding via Sequence-Parallelism-aware Approximate Attention
von: Huang, Yuxiang, et al.
Veröffentlicht: (2026)
von: Huang, Yuxiang, et al.
Veröffentlicht: (2026)
Uncovering What, Why and How: A Comprehensive Benchmark for Causation Understanding of Video Anomaly
von: Du, Hang, et al.
Veröffentlicht: (2024)
von: Du, Hang, et al.
Veröffentlicht: (2024)
TIGFlow-GRPO: Trajectory Forecasting via Interaction-Aware Flow Matching and Reward-Guided Optimization
von: Jing, Xuepeng, et al.
Veröffentlicht: (2026)
von: Jing, Xuepeng, et al.
Veröffentlicht: (2026)
FuRL: Visual-Language Models as Fuzzy Rewards for Reinforcement Learning
von: Fu, Yuwei, et al.
Veröffentlicht: (2024)
von: Fu, Yuwei, et al.
Veröffentlicht: (2024)
Visual-ERM: Reward Modeling for Visual Equivalence
von: Liu, Ziyu, et al.
Veröffentlicht: (2026)
von: Liu, Ziyu, et al.
Veröffentlicht: (2026)
Personalized Reward Modeling for Text-to-Image Generation
von: Lee, Jeongeun, et al.
Veröffentlicht: (2025)
von: Lee, Jeongeun, et al.
Veröffentlicht: (2025)
UBiSS: A Unified Framework for Bimodal Semantic Summarization of Videos
von: Mei, Yuting, et al.
Veröffentlicht: (2024)
von: Mei, Yuting, et al.
Veröffentlicht: (2024)
IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model
von: Jiang, Anqing, et al.
Veröffentlicht: (2025)
von: Jiang, Anqing, et al.
Veröffentlicht: (2025)
Investigating Cross-Modal Skill Injection: Scenarios, Methods, and Hyperparameters
von: Xu, Zhiyu, et al.
Veröffentlicht: (2026)
von: Xu, Zhiyu, et al.
Veröffentlicht: (2026)
Multimodal LLMs as Customized Reward Models for Text-to-Image Generation
von: Zhou, Shijie, et al.
Veröffentlicht: (2025)
von: Zhou, Shijie, et al.
Veröffentlicht: (2025)
Visual Preference Optimization with Rubric Rewards
von: Yu, Ya-Qi, et al.
Veröffentlicht: (2026)
von: Yu, Ya-Qi, et al.
Veröffentlicht: (2026)
PromptEcho: Annotation-Free Reward from Vision-Language Models for Text-to-Image Reinforcement Learning
von: Liu, Jinlong, et al.
Veröffentlicht: (2026)
von: Liu, Jinlong, et al.
Veröffentlicht: (2026)
RewardFlow: Generate Images by Optimizing What You Reward
von: Susladkar, Onkar, et al.
Veröffentlicht: (2026)
von: Susladkar, Onkar, et al.
Veröffentlicht: (2026)
Auto MC-Reward: Automated Dense Reward Design with Large Language Models for Minecraft
von: Li, Hao, et al.
Veröffentlicht: (2023)
von: Li, Hao, et al.
Veröffentlicht: (2023)
MVR: Multi-view Video Reward Shaping for Reinforcement Learning
von: Luo, Lirui, et al.
Veröffentlicht: (2026)
von: Luo, Lirui, et al.
Veröffentlicht: (2026)
RS-HyRe-R1: A Hybrid Reward Mechanism to Overcome Perceptual Inertia for Remote Sensing Images Understanding
von: Zhou, Gaozhi, et al.
Veröffentlicht: (2026)
von: Zhou, Gaozhi, et al.
Veröffentlicht: (2026)
DiG: Differential Grounding for Enhancing Fine-Grained Perception in Multimodal Large Language Model
von: Tao, Zhou, et al.
Veröffentlicht: (2025)
von: Tao, Zhou, et al.
Veröffentlicht: (2025)
SUDER: Self-Improving Unified Large Multimodal Models for Understanding and Generation with Dual Self-Rewards
von: Hong, Jixiang, et al.
Veröffentlicht: (2025)
von: Hong, Jixiang, et al.
Veröffentlicht: (2025)
Omni-Reward: Towards Generalist Omni-Modal Reward Modeling with Free-Form Preferences
von: Jin, Zhuoran, et al.
Veröffentlicht: (2025)
von: Jin, Zhuoran, et al.
Veröffentlicht: (2025)
Reward Score Matching: Unifying Reward-based Fine-tuning for Flow and Diffusion Models
von: Lee, Jeongjae, et al.
Veröffentlicht: (2026)
von: Lee, Jeongjae, et al.
Veröffentlicht: (2026)
EditReward: A Human-Aligned Reward Model for Instruction-Guided Image Editing
von: Wu, Keming, et al.
Veröffentlicht: (2025)
von: Wu, Keming, et al.
Veröffentlicht: (2025)
RL for Consistency Models: Faster Reward Guided Text-to-Image Generation
von: Oertell, Owen, et al.
Veröffentlicht: (2024)
von: Oertell, Owen, et al.
Veröffentlicht: (2024)
Audio-centric Video Understanding Benchmark without Text Shortcut
von: Yang, Yudong, et al.
Veröffentlicht: (2025)
von: Yang, Yudong, et al.
Veröffentlicht: (2025)
Towards Multimodal Video Paragraph Captioning Models Robust to Missing Modality
von: Chen, Sishuo, et al.
Veröffentlicht: (2024)
von: Chen, Sishuo, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
VideoRewardBench: Comprehensive Evaluation of Multimodal Reward Models for Video Understanding
von: Zhang, Zhihong, et al.
Veröffentlicht: (2025) -
DiffCap-Bench: A Comprehensive, Challenging, Robust Benchmark for Image Difference Captioning
von: Wei, Yuancheng, et al.
Veröffentlicht: (2026) -
TimeChat: A Time-sensitive Multimodal Large Language Model for Long Video Understanding
von: Ren, Shuhuai, et al.
Veröffentlicht: (2023) -
Direct Preference Optimization of Video Large Multimodal Models from Language Model Reward
von: Zhang, Ruohong, et al.
Veröffentlicht: (2024) -
Med-RewardBench: Benchmarking Reward Models and Judges for Medical Multimodal Large Language Models
von: Ding, Meidan, et al.
Veröffentlicht: (2025)