MET-Bench: Multimodal Entity Tracking for Evaluating the Limitations of Vision-Language and Reasoning Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Cohen, Vanya, Mooney, Raymond |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
CaT-BENCH: Benchmarking Language Model Understanding of Causal and Temporal Dependencies in Plans
von: Lal, Yash Kumar, et al.
Veröffentlicht: (2024)
von: Lal, Yash Kumar, et al.
Veröffentlicht: (2024)
A Survey of Robotic Language Grounding: Tradeoffs between Symbols and Embeddings
von: Cohen, Vanya, et al.
Veröffentlicht: (2024)
von: Cohen, Vanya, et al.
Veröffentlicht: (2024)
AlgoSimBench: Identifying Algorithmically Similar Problems for Competitive Programming
von: Li, Jierui, et al.
Veröffentlicht: (2025)
von: Li, Jierui, et al.
Veröffentlicht: (2025)
Compositional Instruction Following with Language Models and Reinforcement Learning
von: Cohen, Vanya, et al.
Veröffentlicht: (2025)
von: Cohen, Vanya, et al.
Veröffentlicht: (2025)
Distilling Algorithmic Reasoning from LLMs via Explaining Solution Programs
von: Li, Jierui, et al.
Veröffentlicht: (2024)
von: Li, Jierui, et al.
Veröffentlicht: (2024)
Performance Gap in Entity Knowledge Extraction Across Modalities in Vision Language Models
von: Cohen, Ido, et al.
Veröffentlicht: (2024)
von: Cohen, Ido, et al.
Veröffentlicht: (2024)
Coherent Multimodal Reasoning with Iterative Self-Evaluation for Vision-Language Models
von: Luo, Wenjie, et al.
Veröffentlicht: (2025)
von: Luo, Wenjie, et al.
Veröffentlicht: (2025)
TemMed-Bench: Evaluating Temporal Medical Image Reasoning in Vision-Language Models
von: Zhang, Junyi, et al.
Veröffentlicht: (2025)
von: Zhang, Junyi, et al.
Veröffentlicht: (2025)
Reasoning Beyond Literal: Cross-style Multimodal Reasoning for Figurative Language Understanding
von: Cheshmi, Seyyed Saeid, et al.
Veröffentlicht: (2026)
von: Cheshmi, Seyyed Saeid, et al.
Veröffentlicht: (2026)
Evaluating Reasoning Faithfulness in Medical Vision-Language Models using Multimodal Perturbations
von: Moll, Johannes, et al.
Veröffentlicht: (2025)
von: Moll, Johannes, et al.
Veröffentlicht: (2025)
CounterBench: Evaluating and Improving Counterfactual Reasoning in Large Language Models
von: Chen, Yuefei, et al.
Veröffentlicht: (2025)
von: Chen, Yuefei, et al.
Veröffentlicht: (2025)
MRAG-Bench: Vision-Centric Evaluation for Retrieval-Augmented Multimodal Models
von: Hu, Wenbo, et al.
Veröffentlicht: (2024)
von: Hu, Wenbo, et al.
Veröffentlicht: (2024)
MSA at ImageCLEF 2025 Multimodal Reasoning: Multilingual Multimodal Reasoning With Ensemble Vision Language Models
von: Ahmed, Seif, et al.
Veröffentlicht: (2025)
von: Ahmed, Seif, et al.
Veröffentlicht: (2025)
MFC-Bench: Benchmarking Multimodal Fact-Checking with Large Vision-Language Models
von: Wang, Shengkang, et al.
Veröffentlicht: (2024)
von: Wang, Shengkang, et al.
Veröffentlicht: (2024)
mmJEE-Eval: A Bilingual Multimodal Benchmark for Evaluating Scientific Reasoning in Vision-Language Models
von: Mukherjee, Arka, et al.
Veröffentlicht: (2025)
von: Mukherjee, Arka, et al.
Veröffentlicht: (2025)
M3Kang: Evaluating Multilingual Multimodal Mathematical Reasoning in Vision-Language Models
von: Torres-Camps, Aleix, et al.
Veröffentlicht: (2026)
von: Torres-Camps, Aleix, et al.
Veröffentlicht: (2026)
ISO-Bench: Benchmarking Multimodal Causal Reasoning in Visual-Language Models through Procedural Plans
von: Sadana, Ananya, et al.
Veröffentlicht: (2025)
von: Sadana, Ananya, et al.
Veröffentlicht: (2025)
Multimodal Contextualized Semantic Parsing from Speech
von: Voas, Jordan, et al.
Veröffentlicht: (2024)
von: Voas, Jordan, et al.
Veröffentlicht: (2024)
EffiReason-Bench: A Unified Benchmark for Evaluating and Advancing Efficient Reasoning in Large Language Models
von: Huang, Junquan, et al.
Veröffentlicht: (2025)
von: Huang, Junquan, et al.
Veröffentlicht: (2025)
Vision-Language Models Struggle to Align Entities across Modalities
von: Alonso, Iñigo, et al.
Veröffentlicht: (2025)
von: Alonso, Iñigo, et al.
Veröffentlicht: (2025)
NaturalBench: Evaluating Vision-Language Models on Natural Adversarial Samples
von: Li, Baiqi, et al.
Veröffentlicht: (2024)
von: Li, Baiqi, et al.
Veröffentlicht: (2024)
Heron-Bench: A Benchmark for Evaluating Vision Language Models in Japanese
von: Inoue, Yuichi, et al.
Veröffentlicht: (2024)
von: Inoue, Yuichi, et al.
Veröffentlicht: (2024)
Do Language Models Track Entities Across State Changes?
von: Tang, Zilu, et al.
Veröffentlicht: (2026)
von: Tang, Zilu, et al.
Veröffentlicht: (2026)
Code Pretraining Improves Entity Tracking Abilities of Language Models
von: Kim, Najoung, et al.
Veröffentlicht: (2024)
von: Kim, Najoung, et al.
Veröffentlicht: (2024)
CArtBench: Evaluating Vision-Language Models on Chinese Art Understanding, Interpretation, and Authenticity
von: Wei, Xuefeng, et al.
Veröffentlicht: (2026)
von: Wei, Xuefeng, et al.
Veröffentlicht: (2026)
CommonWhy: A Dataset for Evaluating Entity-Based Causal Commonsense Reasoning in Large Language Models
von: Toroghi, Armin, et al.
Veröffentlicht: (2026)
von: Toroghi, Armin, et al.
Veröffentlicht: (2026)
L0-Reasoning Bench: Evaluating Procedural Correctness in Language Models via Simple Program Execution
von: Sun, Simeng, et al.
Veröffentlicht: (2025)
von: Sun, Simeng, et al.
Veröffentlicht: (2025)
Mitigating Hallucinations in Large Vision-Language Models via Entity-Centric Multimodal Preference Optimization
von: Wu, Jiulong, et al.
Veröffentlicht: (2025)
von: Wu, Jiulong, et al.
Veröffentlicht: (2025)
BeyondBench: Contamination-Resistant Evaluation of Reasoning in Language Models
von: Srivastava, Gaurav, et al.
Veröffentlicht: (2025)
von: Srivastava, Gaurav, et al.
Veröffentlicht: (2025)
OralMLLM-Bench: Evaluating Cognitive Capabilities of Multimodal Large Language Models in Dental Practice
von: Wang, Rongyang, et al.
Veröffentlicht: (2026)
von: Wang, Rongyang, et al.
Veröffentlicht: (2026)
Multi-Perspective Evidence Synthesis and Reasoning for Unsupervised Multimodal Entity Linking
von: Zhou, Mo, et al.
Veröffentlicht: (2026)
von: Zhou, Mo, et al.
Veröffentlicht: (2026)
ShredBench: Evaluating the Semantic Reasoning Capabilities of Multimodal LLMs in Document Reconstruction
von: Guo, Zichun, et al.
Veröffentlicht: (2026)
von: Guo, Zichun, et al.
Veröffentlicht: (2026)
CAPE: Corrective Actions from Precondition Errors using Large Language Models
von: Raman, Shreyas Sundara, et al.
Veröffentlicht: (2022)
von: Raman, Shreyas Sundara, et al.
Veröffentlicht: (2022)
Evolutionary Prompt Optimization Discovers Emergent Multimodal Reasoning Strategies in Vision-Language Models
von: Bharthulwar, Sid, et al.
Veröffentlicht: (2025)
von: Bharthulwar, Sid, et al.
Veröffentlicht: (2025)
AesBiasBench: Evaluating Bias and Alignment in Multimodal Language Models for Personalized Image Aesthetic Assessment
von: Li, Kun, et al.
Veröffentlicht: (2025)
von: Li, Kun, et al.
Veröffentlicht: (2025)
RotBench: Evaluating Multimodal Large Language Models on Identifying Image Rotation
von: Niu, Tianyi, et al.
Veröffentlicht: (2025)
von: Niu, Tianyi, et al.
Veröffentlicht: (2025)
Exploring and Evaluating Multimodal Knowledge Reasoning Consistency of Multimodal Large Language Models
von: Jia, Boyu, et al.
Veröffentlicht: (2025)
von: Jia, Boyu, et al.
Veröffentlicht: (2025)
LogicBench: Towards Systematic Evaluation of Logical Reasoning Ability of Large Language Models
von: Parmar, Mihir, et al.
Veröffentlicht: (2024)
von: Parmar, Mihir, et al.
Veröffentlicht: (2024)
TimeBench: A Comprehensive Evaluation of Temporal Reasoning Abilities in Large Language Models
von: Chu, Zheng, et al.
Veröffentlicht: (2023)
von: Chu, Zheng, et al.
Veröffentlicht: (2023)
DistortBench: Benchmarking Vision Language Models on Image Distortion Identification
von: Goyal, Divyanshu, et al.
Veröffentlicht: (2026)
von: Goyal, Divyanshu, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
CaT-BENCH: Benchmarking Language Model Understanding of Causal and Temporal Dependencies in Plans
von: Lal, Yash Kumar, et al.
Veröffentlicht: (2024) -
A Survey of Robotic Language Grounding: Tradeoffs between Symbols and Embeddings
von: Cohen, Vanya, et al.
Veröffentlicht: (2024) -
AlgoSimBench: Identifying Algorithmically Similar Problems for Competitive Programming
von: Li, Jierui, et al.
Veröffentlicht: (2025) -
Compositional Instruction Following with Language Models and Reinforcement Learning
von: Cohen, Vanya, et al.
Veröffentlicht: (2025) -
Distilling Algorithmic Reasoning from LLMs via Explaining Solution Programs
von: Li, Jierui, et al.
Veröffentlicht: (2024)