Visual Language Models show widespread visual deficits on neuropsychological tests
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Tangtartharakul, Gene, Storrs, Katherine R. |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Beyond Routing: Characterising Expert Tuning and Representation in Vision Mixture-of-Experts
par: Tangtartharakul, Gene, et autres
Publié: (2026)
par: Tangtartharakul, Gene, et autres
Publié: (2026)
Mechanisms of Prompt-Induced Hallucination in Vision-Language Models
par: Rudman, William, et autres
Publié: (2026)
par: Rudman, William, et autres
Publié: (2026)
Adapting Multimodal Foundation Models for Few-Shot Learning: A Comprehensive Study on Contrastive Captioners
par: Narasinghe, N. K. B. M. P. K. B., et autres
Publié: (2025)
par: Narasinghe, N. K. B. M. P. K. B., et autres
Publié: (2025)
Scalable Face Security Vision Foundation Model for Deepfake, Diffusion, and Spoofing Detection
par: Wang, Gaojian, et autres
Publié: (2025)
par: Wang, Gaojian, et autres
Publié: (2025)
Beyond Visual Understanding: Introducing PARROT-360V for Vision Language Model Benchmarking
par: Khurdula, Harsha Vardhan, et autres
Publié: (2024)
par: Khurdula, Harsha Vardhan, et autres
Publié: (2024)
Object-centric proto-symbolic behavioural reasoning from pixels
par: van Bergen, Ruben, et autres
Publié: (2024)
par: van Bergen, Ruben, et autres
Publié: (2024)
Statistical Analysis of the Impact of Quaternion Components in Convolutional Neural Networks
par: Altamirano-Gómez, Gerardo, et autres
Publié: (2024)
par: Altamirano-Gómez, Gerardo, et autres
Publié: (2024)
Vectra: A New Metric, Dataset, and Model for Visual Quality Assessment in E-Commerce In-Image Machine Translation
par: Wu, Qingyu, et autres
Publié: (2026)
par: Wu, Qingyu, et autres
Publié: (2026)
Sample as You Infer: Predictive Coding With Langevin Dynamics
par: Zahid, Umais, et autres
Publié: (2023)
par: Zahid, Umais, et autres
Publié: (2023)
Conscious Gaze: Adaptive Attention Mechanisms for Hallucination Mitigation in Vision-Language Models
par: Bu, Weijue, et autres
Publié: (2025)
par: Bu, Weijue, et autres
Publié: (2025)
Block Expanded DINORET: Adapting Natural Domain Foundation Models for Retinal Imaging Without Catastrophic Forgetting
par: Zoellin, Jay, et autres
Publié: (2024)
par: Zoellin, Jay, et autres
Publié: (2024)
Mechanistically Interpretable Neural Encoding Reveals Fine-Grained Functional Selectivity in Human Visual Cortex
par: Grosbard, Idan Daniel, et autres
Publié: (2026)
par: Grosbard, Idan Daniel, et autres
Publié: (2026)
Story Generation from Visual Inputs: Techniques, Related Tasks, and Challenges
par: Oliveira, Daniel A. P., et autres
Publié: (2024)
par: Oliveira, Daniel A. P., et autres
Publié: (2024)
EvoPrune: Early-Stage Visual Token Pruning for Efficient MLLMs
par: Chen, Yuhao, et autres
Publié: (2026)
par: Chen, Yuhao, et autres
Publié: (2026)
RSTeller: Scaling Up Visual Language Modeling in Remote Sensing with Rich Linguistic Semantics from Openly Available Data and Large Language Models
par: Ge, Junyao, et autres
Publié: (2024)
par: Ge, Junyao, et autres
Publié: (2024)
CoT4AD: A Vision-Language-Action Model with Explicit Chain-of-Thought Reasoning for Autonomous Driving
par: Wang, Zhaohui, et autres
Publié: (2025)
par: Wang, Zhaohui, et autres
Publié: (2025)
Genflow Ad Studio: A Compound AI Architecture for Brand-Aligned, Self-Correcting Video Generation
par: Das, Debanshu, et autres
Publié: (2026)
par: Das, Debanshu, et autres
Publié: (2026)
KGTN-ens: Few-Shot Image Classification with Knowledge Graph Ensembles
par: Filipiak, Dominik, et autres
Publié: (2022)
par: Filipiak, Dominik, et autres
Publié: (2022)
VITA: Zero-Shot Value Functions via Test-Time Adaptation of Vision-Language Models
par: Ziakas, Christos, et autres
Publié: (2025)
par: Ziakas, Christos, et autres
Publié: (2025)
CrossVLA: Cross-Paradigm Post-Training and Inference Optimization for Vision-Language-Action Models
par: Liu, Zhi
Publié: (2026)
par: Liu, Zhi
Publié: (2026)
OmniVideo-R1: Reinforcing Audio-visual Reasoning with Query Intention and Modality Attention
par: Chen, Zhangquan, et autres
Publié: (2026)
par: Chen, Zhangquan, et autres
Publié: (2026)
BlanketGen2-Fit3D: Synthetic Blanket Augmentation Towards Improving Real-World In-Bed Blanket Occluded Human Pose Estimation
par: Karácsony, Tamás, et autres
Publié: (2025)
par: Karácsony, Tamás, et autres
Publié: (2025)
Don't Forget your Inverse DDIM for Image Editing
par: Gomez-Trenado, Guillermo, et autres
Publié: (2025)
par: Gomez-Trenado, Guillermo, et autres
Publié: (2025)
Unsupervised Decomposition and Recombination with Discriminator-Driven Diffusion Models
par: Wang, Archer, et autres
Publié: (2026)
par: Wang, Archer, et autres
Publié: (2026)
Multi-modal Loop Closure Detection with Foundation Models in Severely Unstructured Environments
par: Gonzalez, Laura Alejandra Encinar, et autres
Publié: (2025)
par: Gonzalez, Laura Alejandra Encinar, et autres
Publié: (2025)
SIFThinker: Spatially-Aware Image Focus for Visual Reasoning
par: Chen, Zhangquan, et autres
Publié: (2025)
par: Chen, Zhangquan, et autres
Publié: (2025)
Once-For-All: A Train-Once and Select-Anytime Framework for Multimodal Instruction Tuning
par: Dong, Mingkang, et autres
Publié: (2026)
par: Dong, Mingkang, et autres
Publié: (2026)
Robust Visual Question Answering: Datasets, Methods, and Future Challenges
par: Ma, Jie, et autres
Publié: (2023)
par: Ma, Jie, et autres
Publié: (2023)
Perceptual Flow Network for Visually Grounded Reasoning
par: Li, Yangfu, et autres
Publié: (2026)
par: Li, Yangfu, et autres
Publié: (2026)
VSI: Visual Subtitle Integration for Keyframe Selection to enhance Long Video Understanding
par: He, Jianxiang, et autres
Publié: (2025)
par: He, Jianxiang, et autres
Publié: (2025)
AsgardBench -- Evaluating Visually Grounded Interactive Planning Under Minimal Feedback
par: Tupini, Andrea, et autres
Publié: (2026)
par: Tupini, Andrea, et autres
Publié: (2026)
Learnings from Scaling Visual Tokenizers for Reconstruction and Generation
par: Hansen-Estruch, Philippe, et autres
Publié: (2025)
par: Hansen-Estruch, Philippe, et autres
Publié: (2025)
3DCity-LLM: Empowering Multi-modality Large Language Models for 3D City-scale Perception and Understanding
par: Chen, Yiping, et autres
Publié: (2026)
par: Chen, Yiping, et autres
Publié: (2026)
From Deception to Perception: The Surprising Benefits of Deepfakes for Detecting, Measuring, and Mitigating Bias
par: Liu, Yizhi, et autres
Publié: (2025)
par: Liu, Yizhi, et autres
Publié: (2025)
An Active Inference Model of Covert and Overt Visual Attention
par: Mišić, Tin, et autres
Publié: (2025)
par: Mišić, Tin, et autres
Publié: (2025)
Analyzing Quality, Bias, and Performance in Text-to-Image Generative Models
par: Masrourisaadat, Nila, et autres
Publié: (2024)
par: Masrourisaadat, Nila, et autres
Publié: (2024)
StoryMovie: A Dataset for Semantic Alignment of Visual Stories with Movie Scripts and Subtitles
par: Oliveira, Daniel, et autres
Publié: (2026)
par: Oliveira, Daniel, et autres
Publié: (2026)
GeoPos: A Minimal Positional Encoding for Enhanced Fine-Grained Details in Image Synthesis Using Convolutional Neural Networks
par: Hosseini, Mehran, et autres
Publié: (2024)
par: Hosseini, Mehran, et autres
Publié: (2024)
CLIP-Joint-Detect: End-to-End Joint Training of Object Detectors with Contrastive Vision-Language Supervision
par: Raoufi, Behnam, et autres
Publié: (2025)
par: Raoufi, Behnam, et autres
Publié: (2025)
Invariant Representation via Decoupling Style and Spurious Features from Images
par: Li, Ruimeng, et autres
Publié: (2023)
par: Li, Ruimeng, et autres
Publié: (2023)
Documents similaires
-
Beyond Routing: Characterising Expert Tuning and Representation in Vision Mixture-of-Experts
par: Tangtartharakul, Gene, et autres
Publié: (2026) -
Mechanisms of Prompt-Induced Hallucination in Vision-Language Models
par: Rudman, William, et autres
Publié: (2026) -
Adapting Multimodal Foundation Models for Few-Shot Learning: A Comprehensive Study on Contrastive Captioners
par: Narasinghe, N. K. B. M. P. K. B., et autres
Publié: (2025) -
Scalable Face Security Vision Foundation Model for Deepfake, Diffusion, and Spoofing Detection
par: Wang, Gaojian, et autres
Publié: (2025) -
Beyond Visual Understanding: Introducing PARROT-360V for Vision Language Model Benchmarking
par: Khurdula, Harsha Vardhan, et autres
Publié: (2024)