OddGridBench: Exposing the Lack of Fine-Grained Visual Discrepancy Sensitivity in Multimodal Large Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Weng, Tengjin, Jiang, Wenhao, Wang, Jingyi, Li, Ming, Ma, Lin, Ming, Zhong |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
VisNumBench: Evaluating Number Sense of Multimodal Large Language Models
von: Weng, Tengjin, et al.
Veröffentlicht: (2025)
von: Weng, Tengjin, et al.
Veröffentlicht: (2025)
LlamaSeg: Image Segmentation via Autoregressive Mask Generation
von: Deng, Jiru, et al.
Veröffentlicht: (2025)
von: Deng, Jiru, et al.
Veröffentlicht: (2025)
Learning from Fine-Grained Visual Discrepancies: Mitigating Multimodal Hallucinations via In-Context Visual Contrastive Optimization
von: Deng, Haolin, et al.
Veröffentlicht: (2026)
von: Deng, Haolin, et al.
Veröffentlicht: (2026)
MMDocBench: Benchmarking Large Vision-Language Models for Fine-Grained Visual Document Understanding
von: Zhu, Fengbin, et al.
Veröffentlicht: (2024)
von: Zhu, Fengbin, et al.
Veröffentlicht: (2024)
ActionArt: Advancing Multimodal Large Models for Fine-Grained Human-Centric Video Understanding
von: Peng, Yi-Xing, et al.
Veröffentlicht: (2025)
von: Peng, Yi-Xing, et al.
Veröffentlicht: (2025)
VGRP-Bench: Visual Grid Reasoning Puzzle Benchmark for Large Vision-Language Models
von: Ren, Yufan, et al.
Veröffentlicht: (2025)
von: Ren, Yufan, et al.
Veröffentlicht: (2025)
VER-Bench: Evaluating MLLMs on Reasoning with Fine-Grained Visual Evidence
von: Qiang, Chenhui, et al.
Veröffentlicht: (2025)
von: Qiang, Chenhui, et al.
Veröffentlicht: (2025)
EEE-Bench: A Comprehensive Multimodal Electrical And Electronics Engineering Benchmark
von: Li, Ming, et al.
Veröffentlicht: (2024)
von: Li, Ming, et al.
Veröffentlicht: (2024)
VP-Bench: A Comprehensive Benchmark for Visual Prompting in Multimodal Large Language Models
von: Xu, Mingjie, et al.
Veröffentlicht: (2025)
von: Xu, Mingjie, et al.
Veröffentlicht: (2025)
Accurate Segmentation of Optic Disc And Cup from Multiple Pseudo-labels by Noise-aware Learning
von: Weng, Tengjin, et al.
Veröffentlicht: (2023)
von: Weng, Tengjin, et al.
Veröffentlicht: (2023)
AD-FM: Multimodal LLMs for Anomaly Detection via Multi-Stage Reasoning and Fine-Grained Reward Optimization
von: Liao, Jingyi, et al.
Veröffentlicht: (2025)
von: Liao, Jingyi, et al.
Veröffentlicht: (2025)
ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal Models
von: Roberts, Jonathan, et al.
Veröffentlicht: (2025)
von: Roberts, Jonathan, et al.
Veröffentlicht: (2025)
Attention-driven GUI Grounding: Leveraging Pretrained Multimodal Large Language Models without Fine-Tuning
von: Xu, Hai-Ming, et al.
Veröffentlicht: (2024)
von: Xu, Hai-Ming, et al.
Veröffentlicht: (2024)
Parameter-Efficient Fine-Tuning Medical Multimodal Large Language Models for Medical Visual Grounding
von: He, Jinlong, et al.
Veröffentlicht: (2024)
von: He, Jinlong, et al.
Veröffentlicht: (2024)
EPIC-Bench: A Perception-Centric Benchmark for Fine-Grained Embodied Visual Grounding in Vision-Language Models
von: Shan, Haozhe, et al.
Veröffentlicht: (2026)
von: Shan, Haozhe, et al.
Veröffentlicht: (2026)
Predictive Regularization Against Visual Representation Degradation in Multimodal Large Language Models
von: Wang, Enguang, et al.
Veröffentlicht: (2026)
von: Wang, Enguang, et al.
Veröffentlicht: (2026)
MusiXQA: Advancing Visual Music Understanding in Multimodal Large Language Models
von: Chen, Jian, et al.
Veröffentlicht: (2025)
von: Chen, Jian, et al.
Veröffentlicht: (2025)
LookWise: Knowing When and Where to Look for Fine-Grained Visual Reasoning in Multimodal Large Language Models
von: Shen, Yuxiang, et al.
Veröffentlicht: (2026)
von: Shen, Yuxiang, et al.
Veröffentlicht: (2026)
MFC-Bench: Benchmarking Multimodal Fact-Checking with Large Vision-Language Models
von: Wang, Shengkang, et al.
Veröffentlicht: (2024)
von: Wang, Shengkang, et al.
Veröffentlicht: (2024)
Democratizing Fine-grained Visual Recognition with Large Language Models
von: Liu, Mingxuan, et al.
Veröffentlicht: (2024)
von: Liu, Mingxuan, et al.
Veröffentlicht: (2024)
Improving Visual Storytelling with Multimodal Large Language Models
von: Lin, Xiaochuan, et al.
Veröffentlicht: (2024)
von: Lin, Xiaochuan, et al.
Veröffentlicht: (2024)
Skeleton-Guided Instance Separation for Fine-Grained Segmentation in Microscopy
von: Wang, Jun, et al.
Veröffentlicht: (2024)
von: Wang, Jun, et al.
Veröffentlicht: (2024)
EmoTrans: A Benchmark for Understanding, Reasoning, and Predicting Emotion Transitions in Multimodal LLMs
von: Hu, He, et al.
Veröffentlicht: (2026)
von: Hu, He, et al.
Veröffentlicht: (2026)
FineState-Bench: A Comprehensive Benchmark for Fine-Grained State Control in GUI Agents
von: Ji, Fengxian, et al.
Veröffentlicht: (2025)
von: Ji, Fengxian, et al.
Veröffentlicht: (2025)
Combining Discrepancy-Confusion Uncertainty and Calibration Diversity for Active Fine-Grained Image Classification
von: Jin, Yinghao, et al.
Veröffentlicht: (2025)
von: Jin, Yinghao, et al.
Veröffentlicht: (2025)
VideoPerceiver: Enhancing Fine-Grained Temporal Perception in Video Multimodal Large Language Models
von: Zhao, Fufangchen, et al.
Veröffentlicht: (2025)
von: Zhao, Fufangchen, et al.
Veröffentlicht: (2025)
A Glimpse to Compress: Dynamic Visual Token Pruning for Large Vision-Language Models
von: Zeng, Quan-Sheng, et al.
Veröffentlicht: (2025)
von: Zeng, Quan-Sheng, et al.
Veröffentlicht: (2025)
VisualAgentBench: Towards Large Multimodal Models as Visual Foundation Agents
von: Liu, Xiao, et al.
Veröffentlicht: (2024)
von: Liu, Xiao, et al.
Veröffentlicht: (2024)
Multimodal UNcommonsense: From Odd to Ordinary and Ordinary to Odd
von: Son, Yejin, et al.
Veröffentlicht: (2026)
von: Son, Yejin, et al.
Veröffentlicht: (2026)
ST$^3$: Accelerating Multimodal Large Language Model by Spatial-Temporal Visual Token Trimming
von: Zhuang, Jiedong, et al.
Veröffentlicht: (2024)
von: Zhuang, Jiedong, et al.
Veröffentlicht: (2024)
SEED-Bench-2-Plus: Benchmarking Multimodal Large Language Models with Text-Rich Visual Comprehension
von: Li, Bohao, et al.
Veröffentlicht: (2024)
von: Li, Bohao, et al.
Veröffentlicht: (2024)
CoVFT: Context-aware Visual Fine-tuning for Multimodal Large Language Models
von: Zhou, Nan, et al.
Veröffentlicht: (2026)
von: Zhou, Nan, et al.
Veröffentlicht: (2026)
You May Speak Freely: Improving the Fine-Grained Visual Recognition Capabilities of Multimodal Large Language Models with Answer Extraction
von: Lawrence, Logan, et al.
Veröffentlicht: (2025)
von: Lawrence, Logan, et al.
Veröffentlicht: (2025)
Test-Time Computing for Referring Multimodal Large Language Models
von: Wu, Mingrui, et al.
Veröffentlicht: (2026)
von: Wu, Mingrui, et al.
Veröffentlicht: (2026)
MCFNet: A Multimodal Collaborative Fusion Network for Fine-Grained Semantic Classification
von: Qiao, Yang, et al.
Veröffentlicht: (2025)
von: Qiao, Yang, et al.
Veröffentlicht: (2025)
LLaVA-ST: A Multimodal Large Language Model for Fine-Grained Spatial-Temporal Understanding
von: Li, Hongyu, et al.
Veröffentlicht: (2025)
von: Li, Hongyu, et al.
Veröffentlicht: (2025)
TextHawk: Exploring Efficient Fine-Grained Perception of Multimodal Large Language Models
von: Yu, Ya-Qi, et al.
Veröffentlicht: (2024)
von: Yu, Ya-Qi, et al.
Veröffentlicht: (2024)
Unveiling Fine-Grained Visual Traces: Evaluating Multimodal Interleaved Reasoning Chains in Multimodal STEM Tasks
von: Jin, Jing, et al.
Veröffentlicht: (2026)
von: Jin, Jing, et al.
Veröffentlicht: (2026)
PhysVLM-AVR: Active Visual Reasoning for Multimodal Large Language Models in Physical Environments
von: Zhou, Weijie, et al.
Veröffentlicht: (2025)
von: Zhou, Weijie, et al.
Veröffentlicht: (2025)
GazeXplain: Learning to Predict Natural Language Explanations of Visual Scanpaths
von: Chen, Xianyu, et al.
Veröffentlicht: (2024)
von: Chen, Xianyu, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
VisNumBench: Evaluating Number Sense of Multimodal Large Language Models
von: Weng, Tengjin, et al.
Veröffentlicht: (2025) -
LlamaSeg: Image Segmentation via Autoregressive Mask Generation
von: Deng, Jiru, et al.
Veröffentlicht: (2025) -
Learning from Fine-Grained Visual Discrepancies: Mitigating Multimodal Hallucinations via In-Context Visual Contrastive Optimization
von: Deng, Haolin, et al.
Veröffentlicht: (2026) -
MMDocBench: Benchmarking Large Vision-Language Models for Fine-Grained Visual Document Understanding
von: Zhu, Fengbin, et al.
Veröffentlicht: (2024) -
ActionArt: Advancing Multimodal Large Models for Fine-Grained Human-Centric Video Understanding
von: Peng, Yi-Xing, et al.
Veröffentlicht: (2025)