Tangram: Benchmark for Evaluating Geometric Element Recognition in Large Multimodal Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Zhang, Chao, Tang, Jiamin, Xiao, Jing |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
TangramPuzzle: Evaluating Multimodal Large Language Models with Compositional Spatial Reasoning
von: Liu, Daixian, et al.
Veröffentlicht: (2026)
von: Liu, Daixian, et al.
Veröffentlicht: (2026)
Benchmarking Multimodal Large Language Models for Face Recognition
von: Shahreza, Hatef Otroshi, et al.
Veröffentlicht: (2025)
von: Shahreza, Hatef Otroshi, et al.
Veröffentlicht: (2025)
MMR-AD: A Large-Scale Multimodal Dataset for Benchmarking General Anomaly Detection with Multimodal Large Language Models
von: Yao, Xincheng, et al.
Veröffentlicht: (2026)
von: Yao, Xincheng, et al.
Veröffentlicht: (2026)
PsOCR: Benchmarking Large Multimodal Models for Optical Character Recognition in Low-resource Pashto Language
von: Haq, Ijazul, et al.
Veröffentlicht: (2025)
von: Haq, Ijazul, et al.
Veröffentlicht: (2025)
OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning
von: Fu, Ling, et al.
Veröffentlicht: (2024)
von: Fu, Ling, et al.
Veröffentlicht: (2024)
ViBe: A Text-to-Video Benchmark for Evaluating Hallucination in Large Multimodal Models
von: Rawte, Vipula, et al.
Veröffentlicht: (2024)
von: Rawte, Vipula, et al.
Veröffentlicht: (2024)
Benchmarking Large Vision-Language Models on CFMME: A Comprehensive Chinese Financial Multimodal Evaluation Dataset
von: Chen, Qian, et al.
Veröffentlicht: (2026)
von: Chen, Qian, et al.
Veröffentlicht: (2026)
MME-Emotion: A Holistic Evaluation Benchmark for Emotional Intelligence in Multimodal Large Language Models
von: Zhang, Fan, et al.
Veröffentlicht: (2025)
von: Zhang, Fan, et al.
Veröffentlicht: (2025)
MDK12-Bench: A Multi-Discipline Benchmark for Evaluating Reasoning in Multimodal Large Language Models
von: Zhou, Pengfei, et al.
Veröffentlicht: (2025)
von: Zhou, Pengfei, et al.
Veröffentlicht: (2025)
UrBench: A Comprehensive Benchmark for Evaluating Large Multimodal Models in Multi-View Urban Scenarios
von: Zhou, Baichuan, et al.
Veröffentlicht: (2024)
von: Zhou, Baichuan, et al.
Veröffentlicht: (2024)
TRIP-Evaluate: An Open Multimodal Benchmark for Evaluating Large Models in Transportation
von: Gong, Han, et al.
Veröffentlicht: (2026)
von: Gong, Han, et al.
Veröffentlicht: (2026)
Multimodal Prototype-Enhanced Network for Few-Shot Action Recognition
von: Ni, Xinzhe, et al.
Veröffentlicht: (2022)
von: Ni, Xinzhe, et al.
Veröffentlicht: (2022)
GeoX-Bench: Benchmarking Cross-View Geo-Localization and Pose Estimation Capabilities of Large Multimodal Models
von: Zheng, Yushuo, et al.
Veröffentlicht: (2025)
von: Zheng, Yushuo, et al.
Veröffentlicht: (2025)
Can Large Multimodal Models Understand Agricultural Scenes? Benchmarking with AgroMind
von: Li, Qingmei, et al.
Veröffentlicht: (2025)
von: Li, Qingmei, et al.
Veröffentlicht: (2025)
CrossVid: A Comprehensive Benchmark for Evaluating Cross-Video Reasoning in Multimodal Large Language Models
von: Li, Jingyao, et al.
Veröffentlicht: (2025)
von: Li, Jingyao, et al.
Veröffentlicht: (2025)
RxnBench: A Multimodal Benchmark for Evaluating Large Language Models on Chemical Reaction Understanding from Scientific Literature
von: Li, Hanzheng, et al.
Veröffentlicht: (2025)
von: Li, Hanzheng, et al.
Veröffentlicht: (2025)
Divide-and-Conquer Inference for Large-Scale Visual Recognition with Multimodal Large Language Models
von: Ye, Zhipeng, et al.
Veröffentlicht: (2026)
von: Ye, Zhipeng, et al.
Veröffentlicht: (2026)
MOSABench: Multi-Object Sentiment Analysis Benchmark for Evaluating Multimodal Large Language Models Understanding of Complex Image
von: Song, Shezheng, et al.
Veröffentlicht: (2024)
von: Song, Shezheng, et al.
Veröffentlicht: (2024)
Scaling the Long Video Understanding of Multimodal Large Language Models via Visual Memory Mechanism
von: Chen, Tao, et al.
Veröffentlicht: (2026)
von: Chen, Tao, et al.
Veröffentlicht: (2026)
Taxonomy-Aware Representation Alignment for Hierarchical Visual Recognition with Large Multimodal Models
von: He, Hulingxiao, et al.
Veröffentlicht: (2026)
von: He, Hulingxiao, et al.
Veröffentlicht: (2026)
EmoMM: Benchmarking and Steering MLLM for Multimodal Emotion Recognition under Conflict and Missingness
von: Sun, Yueru, et al.
Veröffentlicht: (2026)
von: Sun, Yueru, et al.
Veröffentlicht: (2026)
DialBench: Towards Accurate Reading Recognition of Pointer Meter using Large Foundation Models
von: Wang, Futian, et al.
Veröffentlicht: (2025)
von: Wang, Futian, et al.
Veröffentlicht: (2025)
SONIC-O1: A Real-World Benchmark for Evaluating Multimodal Large Language Models on Audio-Video Understanding
von: Radwan, Ahmed Y., et al.
Veröffentlicht: (2026)
von: Radwan, Ahmed Y., et al.
Veröffentlicht: (2026)
COUNTS: Benchmarking Object Detectors and Multimodal Large Language Models under Distribution Shifts
von: Li, Jiansheng, et al.
Veröffentlicht: (2025)
von: Li, Jiansheng, et al.
Veröffentlicht: (2025)
A Survey on Evaluation of Multimodal Large Language Models
von: Huang, Jiaxing, et al.
Veröffentlicht: (2024)
von: Huang, Jiaxing, et al.
Veröffentlicht: (2024)
USAD: End-to-End Human Activity Recognition via Diffusion Model with Spatiotemporal Attention
von: Xiao, Hang, et al.
Veröffentlicht: (2025)
von: Xiao, Hang, et al.
Veröffentlicht: (2025)
Benchmarking Large Multimodal Models for Ophthalmic Visual Question Answering with OphthalWeChat
von: Xu, Pusheng, et al.
Veröffentlicht: (2025)
von: Xu, Pusheng, et al.
Veröffentlicht: (2025)
Spatial457: A Diagnostic Benchmark for 6D Spatial Reasoning of Large Multimodal Models
von: Wang, Xingrui, et al.
Veröffentlicht: (2025)
von: Wang, Xingrui, et al.
Veröffentlicht: (2025)
Multimodal Emotion Recognition with Vision-language Prompting and Modality Dropout
von: QI, Anbin, et al.
Veröffentlicht: (2024)
von: QI, Anbin, et al.
Veröffentlicht: (2024)
Towards Fine-Grained Recognition with Large Visual Language Models: Benchmark and Optimization Strategies
von: Pang, Cong, et al.
Veröffentlicht: (2025)
von: Pang, Cong, et al.
Veröffentlicht: (2025)
First Multi-Dimensional Evaluation of Flowchart Comprehension for Multimodal Large Language Models
von: Zhang, Enming, et al.
Veröffentlicht: (2024)
von: Zhang, Enming, et al.
Veröffentlicht: (2024)
Measuring the Measurers: Quality Evaluation of Hallucination Benchmarks for Large Vision-Language Models
von: Yan, Bei, et al.
Veröffentlicht: (2024)
von: Yan, Bei, et al.
Veröffentlicht: (2024)
Pedestrian Attribute Recognition: A New Benchmark Dataset and A Large Language Model Augmented Framework
von: Jin, Jiandong, et al.
Veröffentlicht: (2024)
von: Jin, Jiandong, et al.
Veröffentlicht: (2024)
AgriBench: A Hierarchical Agriculture Benchmark for Multimodal Large Language Models
von: Zhou, Yutong, et al.
Veröffentlicht: (2024)
von: Zhou, Yutong, et al.
Veröffentlicht: (2024)
LithoBench: Benchmarking Large Multimodal Models for Remote-Sensing Lithology Interpretation
von: Wang, Jun, et al.
Veröffentlicht: (2026)
von: Wang, Jun, et al.
Veröffentlicht: (2026)
SciVideoBench: Benchmarking Scientific Video Reasoning in Large Multimodal Models
von: Deng, Andong, et al.
Veröffentlicht: (2025)
von: Deng, Andong, et al.
Veröffentlicht: (2025)
A Survey on Benchmarks of Multimodal Large Language Models
von: Li, Jian, et al.
Veröffentlicht: (2024)
von: Li, Jian, et al.
Veröffentlicht: (2024)
MoHoBench: Assessing Honesty of Multimodal Large Language Models via Unanswerable Visual Questions
von: Zhu, Yanxu, et al.
Veröffentlicht: (2025)
von: Zhu, Yanxu, et al.
Veröffentlicht: (2025)
MM-Vet v2: A Challenging Benchmark to Evaluate Large Multimodal Models for Integrated Capabilities
von: Yu, Weihao, et al.
Veröffentlicht: (2024)
von: Yu, Weihao, et al.
Veröffentlicht: (2024)
Quantitative Video World Model Evaluation for Geometric-Consistency
von: Wu, Jiaxin, et al.
Veröffentlicht: (2026)
von: Wu, Jiaxin, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
TangramPuzzle: Evaluating Multimodal Large Language Models with Compositional Spatial Reasoning
von: Liu, Daixian, et al.
Veröffentlicht: (2026) -
Benchmarking Multimodal Large Language Models for Face Recognition
von: Shahreza, Hatef Otroshi, et al.
Veröffentlicht: (2025) -
MMR-AD: A Large-Scale Multimodal Dataset for Benchmarking General Anomaly Detection with Multimodal Large Language Models
von: Yao, Xincheng, et al.
Veröffentlicht: (2026) -
PsOCR: Benchmarking Large Multimodal Models for Optical Character Recognition in Low-resource Pashto Language
von: Haq, Ijazul, et al.
Veröffentlicht: (2025) -
OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning
von: Fu, Ling, et al.
Veröffentlicht: (2024)