MVP-Bench: Can Large Vision--Language Models Conduct Multi-level Visual Perception Like Humans?
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Guanzhen, Xie, Yuxi, Kan, Min-Yen |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
V-DPO: Mitigating Hallucination in Large Vision Language Models via Vision-Guided Direct Preference Optimization
par: Xie, Yuxi, et autres
Publié: (2024)
par: Xie, Yuxi, et autres
Publié: (2024)
AutoBench-V: Can Large Vision-Language Models Benchmark Themselves?
par: Bao, Han, et autres
Publié: (2024)
par: Bao, Han, et autres
Publié: (2024)
SenseBench: A Benchmark for Remote Sensing Low-Level Visual Perception and Description in Large Vision-Language Models
par: Zhong, Chen, et autres
Publié: (2026)
par: Zhong, Chen, et autres
Publié: (2026)
MMDocBench: Benchmarking Large Vision-Language Models for Fine-Grained Visual Document Understanding
par: Zhu, Fengbin, et autres
Publié: (2024)
par: Zhu, Fengbin, et autres
Publié: (2024)
Explaining Multi-modal Large Language Models by Analyzing their Vision Perception
par: Giulivi, Loris, et autres
Publié: (2024)
par: Giulivi, Loris, et autres
Publié: (2024)
VLAgeBench: Benchmarking Large Vision-Language Models for Zero-Shot Human Age Estimation
par: Sajib, Rakib Hossain, et autres
Publié: (2026)
par: Sajib, Rakib Hossain, et autres
Publié: (2026)
Advancing Visual Large Language Model for Multi-granular Versatile Perception
par: Xiang, Wentao, et autres
Publié: (2025)
par: Xiang, Wentao, et autres
Publié: (2025)
MultiEmo-Bench: Multi-label Visual Emotion Analysis for Multi-modal Large Language Models
par: Chen, Tianwei, et autres
Publié: (2026)
par: Chen, Tianwei, et autres
Publié: (2026)
Medical Large Vision Language Models with Multi-Image Visual Ability
par: Yang, Xikai, et autres
Publié: (2025)
par: Yang, Xikai, et autres
Publié: (2025)
MVP-CBM:Multi-layer Visual Preference-enhanced Concept Bottleneck Model for Explainable Medical Image Classification
par: Wang, Chunjiang, et autres
Publié: (2025)
par: Wang, Chunjiang, et autres
Publié: (2025)
CompareBench: A Benchmark for Visual Comparison Reasoning in Vision-Language Models
par: Cai, Jie, et autres
Publié: (2025)
par: Cai, Jie, et autres
Publié: (2025)
QAVA: Query-Agnostic Visual Attack to Large Vision-Language Models
par: Zhang, Yudong, et autres
Publié: (2025)
par: Zhang, Yudong, et autres
Publié: (2025)
EchoBench: Benchmarking Sycophancy in Medical Large Vision-Language Models
par: Yuan, Botai, et autres
Publié: (2025)
par: Yuan, Botai, et autres
Publié: (2025)
MM-MoralBench: A MultiModal Moral Evaluation Benchmark for Large Vision-Language Models
par: Yan, Bei, et autres
Publié: (2024)
par: Yan, Bei, et autres
Publié: (2024)
Vision Inference Former: Sustaining Visual Consistency in Multimodal Large Language Models
par: Dong, Xinpeng, et autres
Publié: (2026)
par: Dong, Xinpeng, et autres
Publié: (2026)
MoHoBench: Assessing Honesty of Multimodal Large Language Models via Unanswerable Visual Questions
par: Zhu, Yanxu, et autres
Publié: (2025)
par: Zhu, Yanxu, et autres
Publié: (2025)
A Large Vision-Language Model based Environment Perception System for Visually Impaired People
par: Chen, Zezhou, et autres
Publié: (2025)
par: Chen, Zezhou, et autres
Publié: (2025)
MHPR: Multidimensional Human Perception and Reasoning Benchmark for Large Vision-Languate Models
par: Wang, Kangkang, et autres
Publié: (2026)
par: Wang, Kangkang, et autres
Publié: (2026)
TopoPerception: A Shortcut-Free Evaluation of Global Visual Perception in Large Vision-Language Models
par: Zhou, Wenhao, et autres
Publié: (2025)
par: Zhou, Wenhao, et autres
Publié: (2025)
Human-Like Coarse Object Representations in Vision Models
par: Gizdov, Andrey, et autres
Publié: (2026)
par: Gizdov, Andrey, et autres
Publié: (2026)
Do Vision-Language Models Measure Up? Benchmarking Visual Measurement Reading with MeasureBench
par: Lin, Fenfen, et autres
Publié: (2025)
par: Lin, Fenfen, et autres
Publié: (2025)
VLBiasBench: A Comprehensive Benchmark for Evaluating Bias in Large Vision-Language Model
par: Wang, Sibo, et autres
Publié: (2024)
par: Wang, Sibo, et autres
Publié: (2024)
Break the Visual Perception: Adversarial Attacks Targeting Encoded Visual Tokens of Large Vision-Language Models
par: Wang, Yubo, et autres
Publié: (2024)
par: Wang, Yubo, et autres
Publié: (2024)
FineBench: Benchmarking and Enhancing Vision-Language Models for Fine-grained Human Activity Understanding
par: Faure, Gueter Josmy, et autres
Publié: (2026)
par: Faure, Gueter Josmy, et autres
Publié: (2026)
PATIMT-Bench: A Multi-Scenario Benchmark for Position-Aware Text Image Machine Translation in Large Vision-Language Models
par: Zhuang, Wanru, et autres
Publié: (2025)
par: Zhuang, Wanru, et autres
Publié: (2025)
VLind-Bench: Measuring Language Priors in Large Vision-Language Models
par: Lee, Kang-il, et autres
Publié: (2024)
par: Lee, Kang-il, et autres
Publié: (2024)
ViGoR: Improving Visual Grounding of Large Vision Language Models with Fine-Grained Reward Modeling
par: Yan, Siming, et autres
Publié: (2024)
par: Yan, Siming, et autres
Publié: (2024)
Retrieval Visual Contrastive Decoding to Mitigate Object Hallucinations in Large Vision-Language Models
par: Lee, Jihoon, et autres
Publié: (2025)
par: Lee, Jihoon, et autres
Publié: (2025)
Perception Before Reasoning: Two-Stage Reinforcement Learning for Visual Reasoning in Vision-Language Models
par: Chen, Yan, et autres
Publié: (2025)
par: Chen, Yan, et autres
Publié: (2025)
Understanding Graphical Perception in Data Visualization through Zero-shot Prompting of Vision-Language Models
par: Guo, Grace, et autres
Publié: (2024)
par: Guo, Grace, et autres
Publié: (2024)
VideoGameBench: Can Vision-Language Models complete popular video games?
par: Zhang, Alex L., et autres
Publié: (2025)
par: Zhang, Alex L., et autres
Publié: (2025)
Visual Graph Arena: Evaluating Visual Conceptualization of Vision and Multimodal Large Language Models
par: Babaiee, Zahra, et autres
Publié: (2025)
par: Babaiee, Zahra, et autres
Publié: (2025)
LocateBench: Evaluating the Locating Ability of Vision Language Models
par: Chiang, Ting-Rui, et autres
Publié: (2024)
par: Chiang, Ting-Rui, et autres
Publié: (2024)
Unveiling the Response of Large Vision-Language Models to Visually Absent Tokens
par: Kim, Sohee, et autres
Publié: (2025)
par: Kim, Sohee, et autres
Publié: (2025)
Can Vision-Language Models Solve Visual Math Equations?
par: Choudhury, Monjoy Narayan, et autres
Publié: (2025)
par: Choudhury, Monjoy Narayan, et autres
Publié: (2025)
FCoT-VL:Advancing Text-oriented Large Vision-Language Models with Efficient Visual Token Compression
par: Li, Jianjian, et autres
Publié: (2025)
par: Li, Jianjian, et autres
Publié: (2025)
EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents
par: Yang, Rui, et autres
Publié: (2025)
par: Yang, Rui, et autres
Publié: (2025)
Are Large Vision-Language Models Ready to Guide Blind and Low-Vision Individuals?
par: Kim, Eunki, et autres
Publié: (2025)
par: Kim, Eunki, et autres
Publié: (2025)
LangXAI: Integrating Large Vision Models for Generating Textual Explanations to Enhance Explainability in Visual Perception Tasks
par: Nguyen, Truong Thanh Hung, et autres
Publié: (2024)
par: Nguyen, Truong Thanh Hung, et autres
Publié: (2024)
PaveBench: A Versatile Benchmark for Pavement Distress Perception and Interactive Vision-Language Analysis
par: Li, Dexiang, et autres
Publié: (2026)
par: Li, Dexiang, et autres
Publié: (2026)
Documents similaires
-
V-DPO: Mitigating Hallucination in Large Vision Language Models via Vision-Guided Direct Preference Optimization
par: Xie, Yuxi, et autres
Publié: (2024) -
AutoBench-V: Can Large Vision-Language Models Benchmark Themselves?
par: Bao, Han, et autres
Publié: (2024) -
SenseBench: A Benchmark for Remote Sensing Low-Level Visual Perception and Description in Large Vision-Language Models
par: Zhong, Chen, et autres
Publié: (2026) -
MMDocBench: Benchmarking Large Vision-Language Models for Fine-Grained Visual Document Understanding
par: Zhu, Fengbin, et autres
Publié: (2024) -
Explaining Multi-modal Large Language Models by Analyzing their Vision Perception
par: Giulivi, Loris, et autres
Publié: (2024)