VisNumBench: Evaluating Number Sense of Multimodal Large Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Weng, Tengjin, Wang, Jingyi, Jiang, Wenhao, Ming, Zhong |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
OddGridBench: Exposing the Lack of Fine-Grained Visual Discrepancy Sensitivity in Multimodal Large Language Models
von: Weng, Tengjin, et al.
Veröffentlicht: (2026)
von: Weng, Tengjin, et al.
Veröffentlicht: (2026)
LlamaSeg: Image Segmentation via Autoregressive Mask Generation
von: Deng, Jiru, et al.
Veröffentlicht: (2025)
von: Deng, Jiru, et al.
Veröffentlicht: (2025)
A Survey on Evaluation of Multimodal Large Language Models
von: Huang, Jiaxing, et al.
Veröffentlicht: (2024)
von: Huang, Jiaxing, et al.
Veröffentlicht: (2024)
Accurate Segmentation of Optic Disc And Cup from Multiple Pseudo-labels by Noise-aware Learning
von: Weng, Tengjin, et al.
Veröffentlicht: (2023)
von: Weng, Tengjin, et al.
Veröffentlicht: (2023)
VisCRA: A Visual Chain Reasoning Attack for Jailbreaking Multimodal Large Language Models
von: Sima, Bingrui, et al.
Veröffentlicht: (2025)
von: Sima, Bingrui, et al.
Veröffentlicht: (2025)
VisRes Bench: On Evaluating the Visual Reasoning Capabilities of VLMs
von: Törtei, Brigitta Malagurski, et al.
Veröffentlicht: (2025)
von: Törtei, Brigitta Malagurski, et al.
Veröffentlicht: (2025)
SmokeBench: Evaluating Multimodal Large Language Models for Wildfire Smoke Detection
von: Qi, Tianye, et al.
Veröffentlicht: (2025)
von: Qi, Tianye, et al.
Veröffentlicht: (2025)
MM-SafetyBench: A Benchmark for Safety Evaluation of Multimodal Large Language Models
von: Liu, Xin, et al.
Veröffentlicht: (2023)
von: Liu, Xin, et al.
Veröffentlicht: (2023)
NavBench: Probing Multimodal Large Language Models for Embodied Navigation
von: Qiao, Yanyuan, et al.
Veröffentlicht: (2025)
von: Qiao, Yanyuan, et al.
Veröffentlicht: (2025)
ProactiveBench: Benchmarking Proactiveness in Multimodal Large Language Models
von: De Min, Thomas, et al.
Veröffentlicht: (2026)
von: De Min, Thomas, et al.
Veröffentlicht: (2026)
KidVis: Do Multimodal Large Language Models Possess the Visual Perceptual Capabilities of a 6-Year-Old?
von: Wang, Xianfeng, et al.
Veröffentlicht: (2026)
von: Wang, Xianfeng, et al.
Veröffentlicht: (2026)
M-ErasureBench: A Comprehensive Multimodal Evaluation Benchmark for Concept Erasure in Diffusion Models
von: Weng, Ju-Hsuan, et al.
Veröffentlicht: (2025)
von: Weng, Ju-Hsuan, et al.
Veröffentlicht: (2025)
MMT-Bench: A Comprehensive Multimodal Benchmark for Evaluating Large Vision-Language Models Towards Multitask AGI
von: Ying, Kaining, et al.
Veröffentlicht: (2024)
von: Ying, Kaining, et al.
Veröffentlicht: (2024)
ENC-Bench: A Benchmark for Evaluating Multimodal Large Language Models in Electronic Navigational Chart Understanding
von: Cheng, Ao, et al.
Veröffentlicht: (2026)
von: Cheng, Ao, et al.
Veröffentlicht: (2026)
LithoBench: Benchmarking Large Multimodal Models for Remote-Sensing Lithology Interpretation
von: Wang, Jun, et al.
Veröffentlicht: (2026)
von: Wang, Jun, et al.
Veröffentlicht: (2026)
HM-Bench: A Comprehensive Benchmark for Multimodal Large Language Models in Hyperspectral Remote Sensing
von: Zhang, Xinyu, et al.
Veröffentlicht: (2026)
von: Zhang, Xinyu, et al.
Veröffentlicht: (2026)
MIBench: Evaluating Multimodal Large Language Models over Multiple Images
von: Liu, Haowei, et al.
Veröffentlicht: (2024)
von: Liu, Haowei, et al.
Veröffentlicht: (2024)
PCA-Bench: Evaluating Multimodal Large Language Models in Perception-Cognition-Action Chain
von: Chen, Liang, et al.
Veröffentlicht: (2024)
von: Chen, Liang, et al.
Veröffentlicht: (2024)
EmoTrans: A Benchmark for Understanding, Reasoning, and Predicting Emotion Transitions in Multimodal LLMs
von: Hu, He, et al.
Veröffentlicht: (2026)
von: Hu, He, et al.
Veröffentlicht: (2026)
VisBrowse-Bench: Benchmarking Visual-Native Search for Multimodal Browsing Agents
von: Zhang, Zhengbo, et al.
Veröffentlicht: (2026)
von: Zhang, Zhengbo, et al.
Veröffentlicht: (2026)
MDK12-Bench: A Multi-Discipline Benchmark for Evaluating Reasoning in Multimodal Large Language Models
von: Zhou, Pengfei, et al.
Veröffentlicht: (2025)
von: Zhou, Pengfei, et al.
Veröffentlicht: (2025)
SenseBench: A Benchmark for Remote Sensing Low-Level Visual Perception and Description in Large Vision-Language Models
von: Zhong, Chen, et al.
Veröffentlicht: (2026)
von: Zhong, Chen, et al.
Veröffentlicht: (2026)
RotBench: Evaluating Multimodal Large Language Models on Identifying Image Rotation
von: Niu, Tianyi, et al.
Veröffentlicht: (2025)
von: Niu, Tianyi, et al.
Veröffentlicht: (2025)
MFC-Bench: Benchmarking Multimodal Fact-Checking with Large Vision-Language Models
von: Wang, Shengkang, et al.
Veröffentlicht: (2024)
von: Wang, Shengkang, et al.
Veröffentlicht: (2024)
VisR-Bench: An Empirical Study on Visual Retrieval-Augmented Generation for Multilingual Long Document Understanding
von: Chen, Jian, et al.
Veröffentlicht: (2025)
von: Chen, Jian, et al.
Veröffentlicht: (2025)
Res-Bench: Benchmarking the Robustness of Multimodal Large Language Models to Dynamic Resolution Input
von: Li, Chenxu, et al.
Veröffentlicht: (2025)
von: Li, Chenxu, et al.
Veröffentlicht: (2025)
BLEnD-Vis: Benchmarking Multimodal Cultural Understanding in Vision Language Models
von: Tan, Bryan Chen Zhengyu, et al.
Veröffentlicht: (2025)
von: Tan, Bryan Chen Zhengyu, et al.
Veröffentlicht: (2025)
EEE-Bench: A Comprehensive Multimodal Electrical And Electronics Engineering Benchmark
von: Li, Ming, et al.
Veröffentlicht: (2024)
von: Li, Ming, et al.
Veröffentlicht: (2024)
ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal Models
von: Roberts, Jonathan, et al.
Veröffentlicht: (2025)
von: Roberts, Jonathan, et al.
Veröffentlicht: (2025)
VP-Bench: A Comprehensive Benchmark for Visual Prompting in Multimodal Large Language Models
von: Xu, Mingjie, et al.
Veröffentlicht: (2025)
von: Xu, Mingjie, et al.
Veröffentlicht: (2025)
Med-RewardBench: Benchmarking Reward Models and Judges for Medical Multimodal Large Language Models
von: Ding, Meidan, et al.
Veröffentlicht: (2025)
von: Ding, Meidan, et al.
Veröffentlicht: (2025)
II-Bench: An Image Implication Understanding Benchmark for Multimodal Large Language Models
von: Liu, Ziqiang, et al.
Veröffentlicht: (2024)
von: Liu, Ziqiang, et al.
Veröffentlicht: (2024)
SDEval: Safety Dynamic Evaluation for Multimodal Large Language Models
von: Wang, Hanqing, et al.
Veröffentlicht: (2025)
von: Wang, Hanqing, et al.
Veröffentlicht: (2025)
Survey of Adversarial Robustness in Multimodal Large Language Models
von: Jiang, Chengze, et al.
Veröffentlicht: (2025)
von: Jiang, Chengze, et al.
Veröffentlicht: (2025)
XLRS-Bench: Could Your Multimodal LLMs Understand Extremely Large Ultra-High-Resolution Remote Sensing Imagery?
von: Wang, Fengxiang, et al.
Veröffentlicht: (2025)
von: Wang, Fengxiang, et al.
Veröffentlicht: (2025)
AlignMMBench: Evaluating Chinese Multimodal Alignment in Large Vision-Language Models
von: Wu, Yuhang, et al.
Veröffentlicht: (2024)
von: Wu, Yuhang, et al.
Veröffentlicht: (2024)
MEGA-Bench: Scaling Multimodal Evaluation to over 500 Real-World Tasks
von: Chen, Jiacheng, et al.
Veröffentlicht: (2024)
von: Chen, Jiacheng, et al.
Veröffentlicht: (2024)
SAP-Bench: Benchmarking Multimodal Large Language Models in Surgical Action Planning
von: Xu, Mengya, et al.
Veröffentlicht: (2025)
von: Xu, Mengya, et al.
Veröffentlicht: (2025)
Q-Bench-Portrait: Benchmarking Multimodal Large Language Models on Portrait Image Quality Perception
von: Wu, Sijing, et al.
Veröffentlicht: (2026)
von: Wu, Sijing, et al.
Veröffentlicht: (2026)
DynamicVis: Dynamic Visual Perception for Efficient Remote Sensing Foundation Models
von: Chen, Keyan, et al.
Veröffentlicht: (2025)
von: Chen, Keyan, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
OddGridBench: Exposing the Lack of Fine-Grained Visual Discrepancy Sensitivity in Multimodal Large Language Models
von: Weng, Tengjin, et al.
Veröffentlicht: (2026) -
LlamaSeg: Image Segmentation via Autoregressive Mask Generation
von: Deng, Jiru, et al.
Veröffentlicht: (2025) -
A Survey on Evaluation of Multimodal Large Language Models
von: Huang, Jiaxing, et al.
Veröffentlicht: (2024) -
Accurate Segmentation of Optic Disc And Cup from Multiple Pseudo-labels by Noise-aware Learning
von: Weng, Tengjin, et al.
Veröffentlicht: (2023) -
VisCRA: A Visual Chain Reasoning Attack for Jailbreaking Multimodal Large Language Models
von: Sima, Bingrui, et al.
Veröffentlicht: (2025)