I Spy With My Model's Eye: Visual Search as a Behavioural Test for MLLMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Burden, John, Prunty, Jonathan, Slater, Ben, Tehenan, Matthieu, Davis, Greg, Cheke, Lucy |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
I Spy With My Little Eye: A Minimum Cost Multicut Investigation of Dataset Frames
par: Prasse, Katharina, et autres
Publié: (2024)
par: Prasse, Katharina, et autres
Publié: (2024)
Open Eyes, Then Reason: Fine-grained Visual Mathematical Understanding in MLLMs
par: Zhang, Shan, et autres
Publié: (2025)
par: Zhang, Shan, et autres
Publié: (2025)
When Eyes and Ears Disagree: Can MLLMs Discern Audio-Visual Confusion?
par: Ye, Qilang, et autres
Publié: (2025)
par: Ye, Qilang, et autres
Publié: (2025)
I Dream My Painting: Connecting MLLMs and Diffusion Models via Prompt Generation for Text-Guided Multi-Mask Inpainting
par: Fanelli, Nicola, et autres
Publié: (2024)
par: Fanelli, Nicola, et autres
Publié: (2024)
Visual Search Patterns in 3D Pancreatic Imaging: An Eye Tracking Study
par: Anikina, Anna, et autres
Publié: (2026)
par: Anikina, Anna, et autres
Publié: (2026)
VisualQuest: A Benchmark for Abstract Visual Reasoning in MLLMs
par: Xiao, Kelaiti, et autres
Publié: (2025)
par: Xiao, Kelaiti, et autres
Publié: (2025)
Visual Jigsaw Post-Training Improves MLLMs
par: Wu, Penghao, et autres
Publié: (2025)
par: Wu, Penghao, et autres
Publié: (2025)
Cognitive Science-Inspired Evaluation of Core Capabilities for Object Understanding in AI
par: Rutar, Danaja, et autres
Publié: (2025)
par: Rutar, Danaja, et autres
Publié: (2025)
Spy-Watermark: Robust Invisible Watermarking for Backdoor Attack
par: Wang, Ruofei, et autres
Publié: (2024)
par: Wang, Ruofei, et autres
Publié: (2024)
LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs
par: Lou, Haoran, et autres
Publié: (2025)
par: Lou, Haoran, et autres
Publié: (2025)
By My Eyes: Grounding Multimodal Large Language Models with Sensor Data via Visual Prompting
par: Yoon, Hyungjun, et autres
Publié: (2024)
par: Yoon, Hyungjun, et autres
Publié: (2024)
Neuromorphic visual attention for Sign-language recognition on SpiNNaker
par: Liskova, Sarka, et autres
Publié: (2026)
par: Liskova, Sarka, et autres
Publié: (2026)
Training-free Uncertainty Guidance for Complex Visual Tasks with MLLMs
par: Kim, Sanghwan, et autres
Publié: (2025)
par: Kim, Sanghwan, et autres
Publié: (2025)
AbductiveMLLM: Boosting Visual Abductive Reasoning Within MLLMs
par: Chang, Boyu, et autres
Publié: (2026)
par: Chang, Boyu, et autres
Publié: (2026)
POINTS-Long: Adaptive Dual-Mode Visual Reasoning in MLLMs
par: Wang, Haicheng, et autres
Publié: (2026)
par: Wang, Haicheng, et autres
Publié: (2026)
CodePercept: Code-Grounded Visual STEM Perception for MLLMs
par: Guan, Tongkun, et autres
Publié: (2026)
par: Guan, Tongkun, et autres
Publié: (2026)
Foundation Models for Remote Sensing: An Analysis of MLLMs for Object Localization
par: Hannan, Darryl, et autres
Publié: (2025)
par: Hannan, Darryl, et autres
Publié: (2025)
SpY: A Context-Based Approach to Spacecraft Component Detection
par: Mahendrakar, Trupti, et autres
Publié: (2024)
par: Mahendrakar, Trupti, et autres
Publié: (2024)
VER-Bench: Evaluating MLLMs on Reasoning with Fine-Grained Visual Evidence
par: Qiang, Chenhui, et autres
Publié: (2025)
par: Qiang, Chenhui, et autres
Publié: (2025)
IF-Bench: Benchmarking and Enhancing MLLMs for Infrared Images with Generative Visual Prompting
par: Zhang, Tao, et autres
Publié: (2025)
par: Zhang, Tao, et autres
Publié: (2025)
DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs
par: Zhao, Jiahe, et autres
Publié: (2025)
par: Zhao, Jiahe, et autres
Publié: (2025)
MathFlow: Enhancing the Perceptual Flow of MLLMs for Visual Mathematical Problems
par: Chen, Shuhang, et autres
Publié: (2025)
par: Chen, Shuhang, et autres
Publié: (2025)
Visual Semantic Description Generation with MLLMs for Image-Text Matching
par: Chen, Junyu, et autres
Publié: (2025)
par: Chen, Junyu, et autres
Publié: (2025)
SparseMM: Head Sparsity Emerges from Visual Concept Responses in MLLMs
par: Wang, Jiahui, et autres
Publié: (2025)
par: Wang, Jiahui, et autres
Publié: (2025)
Harmonious Parameter Adaptation in Continual Visual Instruction Tuning for Safety-Aligned MLLMs
par: Wang, Ziqi, et autres
Publié: (2025)
par: Wang, Ziqi, et autres
Publié: (2025)
Does Visual Token Pruning Improve Calibration? An Empirical Study on Confidence in MLLMs
par: Tan, Kaizhen
Publié: (2026)
par: Tan, Kaizhen
Publié: (2026)
Seek-and-Solve: Benchmarking MLLMs for Visual Clue-Driven Reasoning in Daily Scenarios
par: Li, Xiaomin, et autres
Publié: (2026)
par: Li, Xiaomin, et autres
Publié: (2026)
QG-VTC: Question-Guided Visual Token Compression in MLLMs for Efficient VQA
par: Li, Shuai, et autres
Publié: (2025)
par: Li, Shuai, et autres
Publié: (2025)
MC-Bench: A Benchmark for Multi-Context Visual Grounding in the Era of MLLMs
par: Xu, Yunqiu, et autres
Publié: (2024)
par: Xu, Yunqiu, et autres
Publié: (2024)
Can Textual Reasoning Improve the Performance of MLLMs on Fine-grained Visual Classification?
par: Zhu, Jie, et autres
Publié: (2026)
par: Zhu, Jie, et autres
Publié: (2026)
AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs
par: Lu, Lidong, et autres
Publié: (2025)
par: Lu, Lidong, et autres
Publié: (2025)
SEA: Supervised Embedding Alignment for Token-Level Visual-Textual Integration in MLLMs
par: Yin, Yuanyang, et autres
Publié: (2024)
par: Yin, Yuanyang, et autres
Publié: (2024)
Customizing Visual Emotion Evaluation for MLLMs: An Open-vocabulary, Multifaceted, and Scalable Approach
par: Wu, Daiqing, et autres
Publié: (2025)
par: Wu, Daiqing, et autres
Publié: (2025)
STORM: Benchmarking Visual Rating of MLLMs with a Comprehensive Ordinal Regression Dataset
par: Wang, Jinhong, et autres
Publié: (2025)
par: Wang, Jinhong, et autres
Publié: (2025)
Can MLLMs Reason About Visual Persuasion? Evaluating the Efficacy and Faithfulness of Reasoning
par: Lee, Naeun, et autres
Publié: (2026)
par: Lee, Naeun, et autres
Publié: (2026)
CrystaL: Spontaneous Emergence of Visual Latents in MLLMs
par: Zhang, Yang, et autres
Publié: (2026)
par: Zhang, Yang, et autres
Publié: (2026)
Growing Visual Generative Capacity for Pre-Trained MLLMs
par: Wang, Hanyu, et autres
Publié: (2025)
par: Wang, Hanyu, et autres
Publié: (2025)
Why and When Visual Token Pruning Fails? A Study on Relevant Visual Information Shift in MLLMs Decoding
par: Kim, Jiwan, et autres
Publié: (2026)
par: Kim, Jiwan, et autres
Publié: (2026)
AstroSpy: On detecting Fake Images in Astronomy via Joint Image-Spectral Representations
par: Alam, Mohammed Talha, et autres
Publié: (2024)
par: Alam, Mohammed Talha, et autres
Publié: (2024)
A little less conversation, a little more action, please: Investigating the physical common-sense of LLMs in a 3D embodied environment
par: Mecattaf, Matteo G., et autres
Publié: (2024)
par: Mecattaf, Matteo G., et autres
Publié: (2024)
Documents similaires
-
I Spy With My Little Eye: A Minimum Cost Multicut Investigation of Dataset Frames
par: Prasse, Katharina, et autres
Publié: (2024) -
Open Eyes, Then Reason: Fine-grained Visual Mathematical Understanding in MLLMs
par: Zhang, Shan, et autres
Publié: (2025) -
When Eyes and Ears Disagree: Can MLLMs Discern Audio-Visual Confusion?
par: Ye, Qilang, et autres
Publié: (2025) -
I Dream My Painting: Connecting MLLMs and Diffusion Models via Prompt Generation for Text-Guided Multi-Mask Inpainting
par: Fanelli, Nicola, et autres
Publié: (2024) -
Visual Search Patterns in 3D Pancreatic Imaging: An Eye Tracking Study
par: Anikina, Anna, et autres
Publié: (2026)