VLRMBench: A Comprehensive and Challenging Benchmark for Vision-Language Reward Models
Fuente:
arXiv
Saved in:
| Main Authors: | Ruan, Jiacheng, Yuan, Wenzhen, Gao, Xian, Guo, Ye, Zhang, Daoxin, Xu, Zhe, Hu, Yao, Liu, Ting, Fu, Yuzhuo |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
MME-SCI: A Comprehensive and Challenging Science Benchmark for Multimodal Large Language Models
by: Ruan, Jiacheng, et al.
Published: (2025)
by: Ruan, Jiacheng, et al.
Published: (2025)
MM-CamObj: A Comprehensive Multimodal Dataset for Camouflaged Object Scenarios
by: Ruan, Jiacheng, et al.
Published: (2024)
by: Ruan, Jiacheng, et al.
Published: (2024)
Understanding Robustness of Parameter-Efficient Tuning for Image Classification
by: Ruan, Jiacheng, et al.
Published: (2024)
by: Ruan, Jiacheng, et al.
Published: (2024)
BasketHAR: A Multimodal Dataset for Human Activity Recognition and Sport Analysis in Basketball Training Scenarios
by: Gao, Xian, et al.
Published: (2026)
by: Gao, Xian, et al.
Published: (2026)
iDAT: inverse Distillation Adapter-Tuning
by: Ruan, Jiacheng, et al.
Published: (2024)
by: Ruan, Jiacheng, et al.
Published: (2024)
Oceanship: A Large-Scale Dataset for Underwater Audio Target Recognition
by: Li, Zeyu, et al.
Published: (2024)
by: Li, Zeyu, et al.
Published: (2024)
Bidirectional Prototype-Reward co-Evolution for Test-Time Adaptation of Vision-Language Models
by: Qiao, Xiaozhen, et al.
Published: (2025)
by: Qiao, Xiaozhen, et al.
Published: (2025)
VL-RewardBench: A Challenging Benchmark for Vision-Language Generative Reward Models
by: Li, Lei, et al.
Published: (2024)
by: Li, Lei, et al.
Published: (2024)
ExFusion: Efficient Transformer Training via Multi-Experts Fusion
by: Ruan, Jiacheng, et al.
Published: (2026)
by: Ruan, Jiacheng, et al.
Published: (2026)
Forensics-Bench: A Comprehensive Forgery Detection Benchmark Suite for Large Vision Language Models
by: Wang, Jin, et al.
Published: (2025)
by: Wang, Jin, et al.
Published: (2025)
UWBench: A Comprehensive Vision-Language Benchmark for Underwater Understanding
by: Zhang, Da, et al.
Published: (2025)
by: Zhang, Da, et al.
Published: (2025)
FTII-Bench: A Comprehensive Multimodal Benchmark for Flow Text with Image Insertion
by: Ruan, Jiacheng, et al.
Published: (2024)
by: Ruan, Jiacheng, et al.
Published: (2024)
VLBiasBench: A Comprehensive Benchmark for Evaluating Bias in Large Vision-Language Model
by: Wang, Sibo, et al.
Published: (2024)
by: Wang, Sibo, et al.
Published: (2024)
FinChart-Bench: Benchmarking Financial Chart Comprehension in Vision-Language Models
by: Shu, Dong, et al.
Published: (2025)
by: Shu, Dong, et al.
Published: (2025)
EIAD: Explainable Industrial Anomaly Detection Via Multi-Modal Large Language Models
by: Zhang, Zongyun, et al.
Published: (2025)
by: Zhang, Zongyun, et al.
Published: (2025)
MMReview: A Multidisciplinary and Multimodal Benchmark for LLM-Based Peer Review Automation
by: Gao, Xian, et al.
Published: (2025)
by: Gao, Xian, et al.
Published: (2025)
GelBelt: A Vision-based Tactile Sensor for Continuous Sensing of Large Surfaces
by: Mirzaee, Mohammad Amin, et al.
Published: (2025)
by: Mirzaee, Mohammad Amin, et al.
Published: (2025)
NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation
by: Liu, Youzhi, et al.
Published: (2024)
by: Liu, Youzhi, et al.
Published: (2024)
FTibSuite: A Comprehensive Resource Suite for Tibetan Vision-Language Modeling
by: Xu, Guixian, et al.
Published: (2026)
by: Xu, Guixian, et al.
Published: (2026)
VM-UNet: Vision Mamba UNet for Medical Image Segmentation
by: Ruan, Jiacheng, et al.
Published: (2024)
by: Ruan, Jiacheng, et al.
Published: (2024)
Resampling Benchmark for Efficient Comprehensive Evaluation of Large Vision-Language Models
by: Suzuki, Teppei, et al.
Published: (2025)
by: Suzuki, Teppei, et al.
Published: (2025)
Can MLLMs Reason Beyond Language? VisReason: A Comprehensive Benchmark for Vision-Centric Reasoning
by: Guo, Longteng, et al.
Published: (2026)
by: Guo, Longteng, et al.
Published: (2026)
Challenging Vision-Language Models with Physically Deployable Multimodal Semantic Lighting Attacks
by: Zhao, Yingying, et al.
Published: (2026)
by: Zhao, Yingying, et al.
Published: (2026)
Benchmarking and Mitigating Sycophancy in Medical Vision Language Models
by: Xu, Juangui, et al.
Published: (2025)
by: Xu, Juangui, et al.
Published: (2025)
Fast-Slow Test-Time Adaptation for Online Vision-and-Language Navigation
by: Gao, Junyu, et al.
Published: (2023)
by: Gao, Junyu, et al.
Published: (2023)
HUGE-Bench: A Benchmark for High-Level UAV Vision-Language-Action Tasks
by: Guo, Jingyu, et al.
Published: (2026)
by: Guo, Jingyu, et al.
Published: (2026)
Multimodal Fusion and Vision-Language Models: A Survey for Robot Vision
by: Han, Xiaofeng, et al.
Published: (2025)
by: Han, Xiaofeng, et al.
Published: (2025)
Dream-VL & Dream-VLA: Open Vision-Language and Vision-Language-Action Models with Diffusion Language Model Backbone
by: Ye, Jiacheng, et al.
Published: (2025)
by: Ye, Jiacheng, et al.
Published: (2025)
Evaluating Image Editing with LLMs: A Comprehensive Benchmark and Intermediate-Layer Probing Approach
by: Gao, Shiqi, et al.
Published: (2026)
by: Gao, Shiqi, et al.
Published: (2026)
Benchmarking PhD-Level Coding in 3D Geometric Computer Vision
by: Li, Wenyi, et al.
Published: (2026)
by: Li, Wenyi, et al.
Published: (2026)
MMT-Bench: A Comprehensive Multimodal Benchmark for Evaluating Large Vision-Language Models Towards Multitask AGI
by: Ying, Kaining, et al.
Published: (2024)
by: Ying, Kaining, et al.
Published: (2024)
Video Understanding Reward Modeling: A Robust Benchmark and Performant Reward Models
by: Wei, Yuancheng, et al.
Published: (2026)
by: Wei, Yuancheng, et al.
Published: (2026)
HomeSafeBench: A Benchmark for Embodied Vision-Language Models in Free-Exploration Home Safety Inspection
by: Gao, Siyuan, et al.
Published: (2025)
by: Gao, Siyuan, et al.
Published: (2025)
Towards Comprehensive Multimodal Perception: Introducing the Touch-Language-Vision Dataset
by: Cheng, Ning, et al.
Published: (2024)
by: Cheng, Ning, et al.
Published: (2024)
NavMorph: A Self-Evolving World Model for Vision-and-Language Navigation in Continuous Environments
by: Yao, Xuan, et al.
Published: (2025)
by: Yao, Xuan, et al.
Published: (2025)
Benchmarking Zero-Shot Recognition with Vision-Language Models: Challenges on Granularity and Specificity
by: Xu, Zhenlin, et al.
Published: (2023)
by: Xu, Zhenlin, et al.
Published: (2023)
REVAL: A Comprehension Evaluation on Reliability and Values of Large Vision-Language Models
by: Zhang, Jie, et al.
Published: (2025)
by: Zhang, Jie, et al.
Published: (2025)
Bridging Visual Representation and Reinforcement Learning from Verifiable Rewards in Large Vision-Language Models
by: Han, Yuhang, et al.
Published: (2026)
by: Han, Yuhang, et al.
Published: (2026)
Deep Learning for Event-based Vision: A Comprehensive Survey and Benchmarks
by: Zheng, Xu, et al.
Published: (2023)
by: Zheng, Xu, et al.
Published: (2023)
Out of the box age estimation through facial imagery: A Comprehensive Benchmark of Vision-Language Models vs. out-of-the-box Traditional Architectures
by: Ren, Simiao, et al.
Published: (2026)
by: Ren, Simiao, et al.
Published: (2026)
Similar Items
-
MME-SCI: A Comprehensive and Challenging Science Benchmark for Multimodal Large Language Models
by: Ruan, Jiacheng, et al.
Published: (2025) -
MM-CamObj: A Comprehensive Multimodal Dataset for Camouflaged Object Scenarios
by: Ruan, Jiacheng, et al.
Published: (2024) -
Understanding Robustness of Parameter-Efficient Tuning for Image Classification
by: Ruan, Jiacheng, et al.
Published: (2024) -
BasketHAR: A Multimodal Dataset for Human Activity Recognition and Sport Analysis in Basketball Training Scenarios
by: Gao, Xian, et al.
Published: (2026) -
iDAT: inverse Distillation Adapter-Tuning
by: Ruan, Jiacheng, et al.
Published: (2024)