Evaluating Compositional Generalisation in VLMs and Diffusion Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Pearson, Beth, Boulbarss, Bilal, Wray, Michael, Lewis, Martha |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
VLMs have Tunnel Vision: Evaluating Nonlocal Visual Reasoning in Leading VLMs
par: Berman, Shmuel, et autres
Publié: (2025)
par: Berman, Shmuel, et autres
Publié: (2025)
Evaluating Vision Language Models (VLMs) for Radiology: A Comprehensive Analysis
par: Li, Frank, et autres
Publié: (2025)
par: Li, Frank, et autres
Publié: (2025)
Your Vision-Language Model Can't Even Count to 20: Exposing the Failures of VLMs in Compositional Counting
par: Guo, Xuyang, et autres
Publié: (2025)
par: Guo, Xuyang, et autres
Publié: (2025)
Successes and Limitations of Object-centric Models at Compositional Generalisation
par: Montero, Milton L., et autres
Publié: (2024)
par: Montero, Milton L., et autres
Publié: (2024)
See and Fix the Flaws: Enabling VLMs and Diffusion Models to Comprehend Visual Artifacts via Agentic Data Synthesis
par: Park, Jaehyun, et autres
Publié: (2026)
par: Park, Jaehyun, et autres
Publié: (2026)
VLM-SlideEval: Evaluating VLMs on Structured Comprehension and Perturbation Sensitivity in PPT
par: Kang, Hyeonsu, et autres
Publié: (2025)
par: Kang, Hyeonsu, et autres
Publié: (2025)
CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs
par: Jian, Ai, et autres
Publié: (2025)
par: Jian, Ai, et autres
Publié: (2025)
MedObvious: Exposing the Medical Moravec's Paradox in VLMs via Clinical Triage
par: Khan, Ufaq, et autres
Publié: (2026)
par: Khan, Ufaq, et autres
Publié: (2026)
Does CLIP Bind Concepts? Probing Compositionality in Large Image Models
par: Lewis, Martha, et autres
Publié: (2022)
par: Lewis, Martha, et autres
Publié: (2022)
Caption This, Reason That: VLMs Caught in the Middle
par: Weng, Zihan, et autres
Publié: (2025)
par: Weng, Zihan, et autres
Publié: (2025)
Preserving Multi-Modal Capabilities of Pre-trained VLMs for Improving Vision-Linguistic Compositionality
par: Oh, Youngtaek, et autres
Publié: (2024)
par: Oh, Youngtaek, et autres
Publié: (2024)
Trust the Model: Compact VLMs as In-Context Judges for Image-Text Data Quality
par: Toibazar, Daulet, et autres
Publié: (2025)
par: Toibazar, Daulet, et autres
Publié: (2025)
VACoT: Rethinking Visual Data Augmentation with VLMs
par: Xu, Zhengzhuo, et autres
Publié: (2025)
par: Xu, Zhengzhuo, et autres
Publié: (2025)
Listener-Rewarded Thinking in VLMs for Image Preferences
par: Gambashidze, Alexander, et autres
Publié: (2025)
par: Gambashidze, Alexander, et autres
Publié: (2025)
EAGT: Echocardiography Augmentation for Generalisability and Transferability
par: Elyasi, Soroush, et autres
Publié: (2026)
par: Elyasi, Soroush, et autres
Publié: (2026)
Focusing by Contrastive Attention: Enhancing VLMs' Visual Reasoning
par: Ge, Yuyao, et autres
Publié: (2025)
par: Ge, Yuyao, et autres
Publié: (2025)
Towards Lossless Ultimate Vision Token Compression for VLMs
par: Zheng, Dehua, et autres
Publié: (2025)
par: Zheng, Dehua, et autres
Publié: (2025)
Treble Counterfactual VLMs: A Causal Approach to Hallucination
par: Li, Shawn, et autres
Publié: (2025)
par: Li, Shawn, et autres
Publié: (2025)
Same Answer, Different Representations: Hidden instability in VLMs
par: Wani, Farooq Ahmad, et autres
Publié: (2026)
par: Wani, Farooq Ahmad, et autres
Publié: (2026)
Stateful Token Reduction for Long-Video Hybrid VLMs
par: Jiang, Jindong, et autres
Publié: (2026)
par: Jiang, Jindong, et autres
Publié: (2026)
MolmoPoint: Better Pointing for VLMs with Grounding Tokens
par: Clark, Christopher, et autres
Publié: (2026)
par: Clark, Christopher, et autres
Publié: (2026)
Can Vision-Language Models be a Good Guesser? Exploring VLMs for Times and Location Reasoning
par: Zhang, Gengyuan, et autres
Publié: (2023)
par: Zhang, Gengyuan, et autres
Publié: (2023)
Evaluating Compositional Scene Understanding in Multimodal Generative Models
par: Fu, Shuhao, et autres
Publié: (2025)
par: Fu, Shuhao, et autres
Publié: (2025)
Separate-and-Enhance: Compositional Finetuning for Text2Image Diffusion Models
par: Bao, Zhipeng, et autres
Publié: (2023)
par: Bao, Zhipeng, et autres
Publié: (2023)
Latent Guidance in Diffusion Models for Perceptual Evaluations
par: Saini, Shreshth, et autres
Publié: (2025)
par: Saini, Shreshth, et autres
Publié: (2025)
TAPS : Frustratingly Simple Test Time Active Learning for VLMs
par: Sarkar, Dhruv, et autres
Publié: (2025)
par: Sarkar, Dhruv, et autres
Publié: (2025)
DyMU: Dynamic Merging and Virtual Unmerging for Efficient VLMs
par: Wang, Zhenhailong, et autres
Publié: (2025)
par: Wang, Zhenhailong, et autres
Publié: (2025)
To See or To Please: Uncovering Visual Sycophancy and Split Beliefs in VLMs
par: Hong, Rui, et autres
Publié: (2026)
par: Hong, Rui, et autres
Publié: (2026)
Decoding the Pulse of Reasoning VLMs in Multi-Image Understanding Tasks
par: Li, Chenjun
Publié: (2026)
par: Li, Chenjun
Publié: (2026)
Drive-KD: Multi-Teacher Distillation for VLMs in Autonomous Driving
par: Lian, Weitong, et autres
Publié: (2026)
par: Lian, Weitong, et autres
Publié: (2026)
NanoVLMs: How small can we go and still make coherent Vision Language Models?
par: Agarwalla, Mukund, et autres
Publié: (2025)
par: Agarwalla, Mukund, et autres
Publié: (2025)
PhysicsMind: Sim and Real Mechanics Benchmarking for Physical Reasoning and Prediction in Foundational VLMs and World Models
par: Mak, Chak-Wing, et autres
Publié: (2026)
par: Mak, Chak-Wing, et autres
Publié: (2026)
Perivascular space Identification Nnunet for Generalised Usage (PINGU)
par: Sinclair, Benjamin, et autres
Publié: (2024)
par: Sinclair, Benjamin, et autres
Publié: (2024)
Robust Polyp Detection and Diagnosis through Compositional Prompt-Guided Diffusion Models
par: Yu, Jia, et autres
Publié: (2025)
par: Yu, Jia, et autres
Publié: (2025)
DeepTumorVQA: A Hierarchical 3D CT Benchmark for Stage-Wise Evaluation of Medical VLMs and Tool-Augmented Agents
par: Chen, Yixiong, et autres
Publié: (2026)
par: Chen, Yixiong, et autres
Publié: (2026)
A Cognitive Paradigm Approach to Probe the Perception-Reasoning Interface in VLMs
par: Vaishnav, Mohit, et autres
Publié: (2025)
par: Vaishnav, Mohit, et autres
Publié: (2025)
MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders
par: Cao, Jiajun, et autres
Publié: (2025)
par: Cao, Jiajun, et autres
Publié: (2025)
MetaSpatial: Reinforcing 3D Spatial Reasoning in VLMs for the Metaverse
par: Pan, Zhenyu, et autres
Publié: (2025)
par: Pan, Zhenyu, et autres
Publié: (2025)
Activating Visual Context and Commonsense Reasoning through Masked Prediction in VLMs
par: Yu, Jiaao, et autres
Publié: (2025)
par: Yu, Jiaao, et autres
Publié: (2025)
In-Context Adaptation of VLMs for Few-Shot Cell Detection in Optical Microscopy
par: Ganguly, Shreyan, et autres
Publié: (2025)
par: Ganguly, Shreyan, et autres
Publié: (2025)
Documents similaires
-
VLMs have Tunnel Vision: Evaluating Nonlocal Visual Reasoning in Leading VLMs
par: Berman, Shmuel, et autres
Publié: (2025) -
Evaluating Vision Language Models (VLMs) for Radiology: A Comprehensive Analysis
par: Li, Frank, et autres
Publié: (2025) -
Your Vision-Language Model Can't Even Count to 20: Exposing the Failures of VLMs in Compositional Counting
par: Guo, Xuyang, et autres
Publié: (2025) -
Successes and Limitations of Object-centric Models at Compositional Generalisation
par: Montero, Milton L., et autres
Publié: (2024) -
See and Fix the Flaws: Enabling VLMs and Diffusion Models to Comprehend Visual Artifacts via Agentic Data Synthesis
par: Park, Jaehyun, et autres
Publié: (2026)