VideoRewardBench: Comprehensive Evaluation of Multimodal Reward Models for Video Understanding
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Zhang, Zhihong, Huang, Xiaojian, Xu, Jin, Luo, Zhuodong, Wang, Xinzhi, Wei, Jiansheng, Chen, Xuejin |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
DT2IT-MRM: Debiased Preference Construction and Iterative Training for Multimodal Reward Modeling
von: Zhang, Zhihong, et al.
Veröffentlicht: (2026)
von: Zhang, Zhihong, et al.
Veröffentlicht: (2026)
Video Understanding Reward Modeling: A Robust Benchmark and Performant Reward Models
von: Wei, Yuancheng, et al.
Veröffentlicht: (2026)
von: Wei, Yuancheng, et al.
Veröffentlicht: (2026)
Multimodal RewardBench: Holistic Evaluation of Reward Models for Vision Language Models
von: Yasunaga, Michihiro, et al.
Veröffentlicht: (2025)
von: Yasunaga, Michihiro, et al.
Veröffentlicht: (2025)
Med-RewardBench: Benchmarking Reward Models and Judges for Medical Multimodal Large Language Models
von: Ding, Meidan, et al.
Veröffentlicht: (2025)
von: Ding, Meidan, et al.
Veröffentlicht: (2025)
Direct Preference Optimization of Video Large Multimodal Models from Language Model Reward
von: Zhang, Ruohong, et al.
Veröffentlicht: (2024)
von: Zhang, Ruohong, et al.
Veröffentlicht: (2024)
Long Video Understanding with Learnable Retrieval in Video-Language Models
von: Xu, Jiaqi, et al.
Veröffentlicht: (2023)
von: Xu, Jiaqi, et al.
Veröffentlicht: (2023)
FAVOR-Bench: A Comprehensive Benchmark for Fine-Grained Video Motion Understanding
von: Tu, Chongjun, et al.
Veröffentlicht: (2025)
von: Tu, Chongjun, et al.
Veröffentlicht: (2025)
KFS-Bench: Comprehensive Evaluation of Key Frame Sampling in Long Video Understanding
von: Li, Zongyao, et al.
Veröffentlicht: (2025)
von: Li, Zongyao, et al.
Veröffentlicht: (2025)
VEU-Bench: Towards Comprehensive Understanding of Video Editing
von: Li, Bozheng, et al.
Veröffentlicht: (2025)
von: Li, Bozheng, et al.
Veröffentlicht: (2025)
MT-Video-Bench: A Holistic Video Understanding Benchmark for Evaluating Multimodal LLMs in Multi-Turn Dialogues
von: Pan, Yaning, et al.
Veröffentlicht: (2025)
von: Pan, Yaning, et al.
Veröffentlicht: (2025)
SciVideoBench: Benchmarking Scientific Video Reasoning in Large Multimodal Models
von: Deng, Andong, et al.
Veröffentlicht: (2025)
von: Deng, Andong, et al.
Veröffentlicht: (2025)
MVR: Multi-view Video Reward Shaping for Reinforcement Learning
von: Luo, Lirui, et al.
Veröffentlicht: (2026)
von: Luo, Lirui, et al.
Veröffentlicht: (2026)
Personalized Video Summarization by Multimodal Video Understanding
von: Chen, Brian, et al.
Veröffentlicht: (2024)
von: Chen, Brian, et al.
Veröffentlicht: (2024)
Unified Reward Model for Multimodal Understanding and Generation
von: Wang, Yibin, et al.
Veröffentlicht: (2025)
von: Wang, Yibin, et al.
Veröffentlicht: (2025)
Multimodal RewardBench 2: Evaluating Omni Reward Models for Interleaved Text and Image
von: Hu, Yushi, et al.
Veröffentlicht: (2025)
von: Hu, Yushi, et al.
Veröffentlicht: (2025)
Skywork-VL Reward: An Effective Reward Model for Multimodal Understanding and Reasoning
von: Wang, Xiaokun, et al.
Veröffentlicht: (2025)
von: Wang, Xiaokun, et al.
Veröffentlicht: (2025)
"PhyWorldBench": A Comprehensive Evaluation of Physical Realism in Text-to-Video Models
von: Gu, Jing, et al.
Veröffentlicht: (2025)
von: Gu, Jing, et al.
Veröffentlicht: (2025)
VideoITG: Multimodal Video Understanding with Instructed Temporal Grounding
von: Wang, Shihao, et al.
Veröffentlicht: (2025)
von: Wang, Shihao, et al.
Veröffentlicht: (2025)
VCR-Bench: A Comprehensive Evaluation Framework for Video Chain-of-Thought Reasoning
von: Qi, Yukun, et al.
Veröffentlicht: (2025)
von: Qi, Yukun, et al.
Veröffentlicht: (2025)
Benchmarking Scientific Understanding and Reasoning for Video Generation using VideoScience-Bench
von: Hu, Lanxiang, et al.
Veröffentlicht: (2025)
von: Hu, Lanxiang, et al.
Veröffentlicht: (2025)
Video Models Can Reason with Verifiable Rewards
von: Zhu, Tinghui, et al.
Veröffentlicht: (2026)
von: Zhu, Tinghui, et al.
Veröffentlicht: (2026)
StreamingBench: Assessing the Gap for MLLMs to Achieve Streaming Video Understanding
von: Lin, Junming, et al.
Veröffentlicht: (2024)
von: Lin, Junming, et al.
Veröffentlicht: (2024)
Beyond VLM-Based Rewards: Diffusion-Native Latent Reward Modeling
von: Liu, Gongye, et al.
Veröffentlicht: (2026)
von: Liu, Gongye, et al.
Veröffentlicht: (2026)
CaC: Advancing Video Reward Models via Hierarchical Spatiotemporal Concentrating
von: Wang, Jiyuan, et al.
Veröffentlicht: (2026)
von: Wang, Jiyuan, et al.
Veröffentlicht: (2026)
MVU-Eval: Towards Multi-Video Understanding Evaluation for Multimodal LLMs
von: Peng, Tianhao, et al.
Veröffentlicht: (2025)
von: Peng, Tianhao, et al.
Veröffentlicht: (2025)
Diffusion Reward: Learning Rewards via Conditional Video Diffusion
von: Huang, Tao, et al.
Veröffentlicht: (2023)
von: Huang, Tao, et al.
Veröffentlicht: (2023)
Apollo: An Exploration of Video Understanding in Large Multimodal Models
von: Zohar, Orr, et al.
Veröffentlicht: (2024)
von: Zohar, Orr, et al.
Veröffentlicht: (2024)
VGA-Bench: A Unified Benchmark and Multi-Model Framework for Video Aesthetics and Generation Quality Evaluation
von: Jiang, Longteng, et al.
Veröffentlicht: (2026)
von: Jiang, Longteng, et al.
Veröffentlicht: (2026)
VideoWebArena: Evaluating Long Context Multimodal Agents with Video Understanding Web Tasks
von: Jang, Lawrence, et al.
Veröffentlicht: (2024)
von: Jang, Lawrence, et al.
Veröffentlicht: (2024)
Video Diffusion Alignment via Reward Gradients
von: Prabhudesai, Mihir, et al.
Veröffentlicht: (2024)
von: Prabhudesai, Mihir, et al.
Veröffentlicht: (2024)
VideoAgent: A Memory-augmented Multimodal Agent for Video Understanding
von: Fan, Yue, et al.
Veröffentlicht: (2024)
von: Fan, Yue, et al.
Veröffentlicht: (2024)
Thinking with Frames: Generative Video Distortion Evaluation via Frame Reward Model
von: Wang, Yuan, et al.
Veröffentlicht: (2026)
von: Wang, Yuan, et al.
Veröffentlicht: (2026)
Video Generation Models Are Good Latent Reward Models
von: Mi, Xiaoyue, et al.
Veröffentlicht: (2025)
von: Mi, Xiaoyue, et al.
Veröffentlicht: (2025)
VideoGameQA-Bench: Evaluating Vision-Language Models for Video Game Quality Assurance
von: Taesiri, Mohammad Reza, et al.
Veröffentlicht: (2025)
von: Taesiri, Mohammad Reza, et al.
Veröffentlicht: (2025)
Control-A-Video: Controllable Text-to-Video Diffusion Models with Motion Prior and Reward Feedback Learning
von: Chen, Weifeng, et al.
Veröffentlicht: (2023)
von: Chen, Weifeng, et al.
Veröffentlicht: (2023)
SIV-Bench: A Video Benchmark for Social Interaction Understanding and Reasoning
von: Kong, Fanqi, et al.
Veröffentlicht: (2025)
von: Kong, Fanqi, et al.
Veröffentlicht: (2025)
PhyMotion: Structured 3D Motion Reward for Physics-Grounded Human Video Generation
von: Huang, Yidong, et al.
Veröffentlicht: (2026)
von: Huang, Yidong, et al.
Veröffentlicht: (2026)
TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models
von: Cai, Mu, et al.
Veröffentlicht: (2024)
von: Cai, Mu, et al.
Veröffentlicht: (2024)
DocReward: A Document Reward Model for Structuring and Stylizing
von: Liu, Junpeng, et al.
Veröffentlicht: (2025)
von: Liu, Junpeng, et al.
Veröffentlicht: (2025)
AIGCBench: Comprehensive Evaluation of Image-to-Video Content Generated by AI
von: Fan, Fanda, et al.
Veröffentlicht: (2024)
von: Fan, Fanda, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
DT2IT-MRM: Debiased Preference Construction and Iterative Training for Multimodal Reward Modeling
von: Zhang, Zhihong, et al.
Veröffentlicht: (2026) -
Video Understanding Reward Modeling: A Robust Benchmark and Performant Reward Models
von: Wei, Yuancheng, et al.
Veröffentlicht: (2026) -
Multimodal RewardBench: Holistic Evaluation of Reward Models for Vision Language Models
von: Yasunaga, Michihiro, et al.
Veröffentlicht: (2025) -
Med-RewardBench: Benchmarking Reward Models and Judges for Medical Multimodal Large Language Models
von: Ding, Meidan, et al.
Veröffentlicht: (2025) -
Direct Preference Optimization of Video Large Multimodal Models from Language Model Reward
von: Zhang, Ruohong, et al.
Veröffentlicht: (2024)