Seeing Syntax: Uncovering Syntactic Learning Limitations in Vision-Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Dumpala, Sri Harsha, Arps, David, Oore, Sageev, Kallmeyer, Laura, Sajjad, Hassan |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Sensitivity of Generative VLMs to Semantically and Lexically Altered Prompts
par: Dumpala, Sri Harsha, et autres
Publié: (2024)
par: Dumpala, Sri Harsha, et autres
Publié: (2024)
SUGARCREPE++ Dataset: Vision-Language Model Sensitivity to Semantic and Lexical Alterations
par: Dumpala, Sri Harsha, et autres
Publié: (2024)
par: Dumpala, Sri Harsha, et autres
Publié: (2024)
DiffAug: A Diffuse-and-Denoise Augmentation for Training Robust Classifiers
par: Sastry, Chandramouli, et autres
Publié: (2023)
par: Sastry, Chandramouli, et autres
Publié: (2023)
Understanding Syntactic Generalization in Structure-inducing Language Models
par: Arps, David, et autres
Publié: (2025)
par: Arps, David, et autres
Publié: (2025)
VISLA Benchmark: Evaluating Embedding Sensitivity to Semantic and Lexical Alterations
par: Dumpala, Sri Harsha, et autres
Publié: (2024)
par: Dumpala, Sri Harsha, et autres
Publié: (2024)
Seeing Isn't Believing: Uncovering Blind Spots in Evaluator Vision-Language Models
par: Khan, Mohammed Safi Ur Rahman, et autres
Publié: (2026)
par: Khan, Mohammed Safi Ur Rahman, et autres
Publié: (2026)
Multilingual Nonce Dependency Treebanks: Understanding how Language Models represent and process syntactic structure
par: Arps, David, et autres
Publié: (2023)
par: Arps, David, et autres
Publié: (2023)
Seeing Through Deception: Uncovering Misleading Creator Intent in Multimodal News with Vision-Language Models
par: Wu, Jiaying, et autres
Publié: (2025)
par: Wu, Jiaying, et autres
Publié: (2025)
BiomedCoOp: Learning to Prompt for Biomedical Vision-Language Models
par: Koleilat, Taha, et autres
Publié: (2024)
par: Koleilat, Taha, et autres
Publié: (2024)
Are VLMs Seeing or Just Saying? Uncovering the Illusion of Visual Re-examination
par: Shi, Chufan, et autres
Publié: (2026)
par: Shi, Chufan, et autres
Publié: (2026)
Evi-Steer: Learning to Steer Biomedical Vision-Language Models through Efficient and Generalizable Evidential Tuning
par: Koleilat, Taha, et autres
Publié: (2026)
par: Koleilat, Taha, et autres
Publié: (2026)
"See the World, Discover Knowledge": A Chinese Factuality Evaluation for Large Vision Language Models
par: Gu, Jihao, et autres
Publié: (2025)
par: Gu, Jihao, et autres
Publié: (2025)
From Seeing to Thinking: Decoupling Perception and Reasoning Improves Post-Training of Vision-Language Models
par: Wu, Juncheng, et autres
Publié: (2026)
par: Wu, Juncheng, et autres
Publié: (2026)
Self-Distillation of Hidden Layers for Self-Supervised Representation Learning
par: Lowe, Scott C., et autres
Publié: (2026)
par: Lowe, Scott C., et autres
Publié: (2026)
Seeing No Evil: Blinding Large Vision-Language Models to Safety Instructions via Adversarial Attention Hijacking
par: Li, Jingru, et autres
Publié: (2026)
par: Li, Jingru, et autres
Publié: (2026)
Increasing The Performance of Cognitively Inspired Data-Efficient Language Models via Implicit Structure Building
par: Momen, Omar, et autres
Publié: (2023)
par: Momen, Omar, et autres
Publié: (2023)
The Illusion-Illusion: Vision Language Models See Illusions Where There are None
par: Ullman, Tomer
Publié: (2024)
par: Ullman, Tomer
Publié: (2024)
Seeing Through Their Eyes: Evaluating Visual Perspective Taking in Vision Language Models
par: Góral, Gracjan, et autres
Publié: (2024)
par: Góral, Gracjan, et autres
Publié: (2024)
Does Acceleration Cause Hidden Instability in Vision Language Models? Uncovering Instance-Level Divergence Through a Large-Scale Empirical Study
par: Sun, Yizheng, et autres
Publié: (2025)
par: Sun, Yizheng, et autres
Publié: (2025)
EMOVA: Empowering Language Models to See, Hear and Speak with Vivid Emotions
par: Chen, Kai, et autres
Publié: (2024)
par: Chen, Kai, et autres
Publié: (2024)
CLIP-SVD: Efficient and Interpretable Vision-Language Adaptation via Singular Values
par: Koleilat, Taha, et autres
Publié: (2025)
par: Koleilat, Taha, et autres
Publié: (2025)
Visual In-Context Learning for Large Vision-Language Models
par: Zhou, Yucheng, et autres
Publié: (2024)
par: Zhou, Yucheng, et autres
Publié: (2024)
Seeing Symbols, Missing Cultures: Probing Vision-Language Models' Reasoning on Fire Imagery and Cultural Meaning
par: Yu, Haorui, et autres
Publié: (2025)
par: Yu, Haorui, et autres
Publié: (2025)
Seeing Through Words, Speaking Through Pixels: Deep Representational Alignment Between Vision and Language Models
par: He, Zoe Wanying, et autres
Publié: (2025)
par: He, Zoe Wanying, et autres
Publié: (2025)
Show and Guide: Instructional-Plan Grounded Vision and Language Model
par: Glória-Silva, Diogo, et autres
Publié: (2024)
par: Glória-Silva, Diogo, et autres
Publié: (2024)
MIRL: Mutual Information-Guided Reinforcement Learning for Vision-Language Models
par: Zhang, Yin, et autres
Publié: (2026)
par: Zhang, Yin, et autres
Publié: (2026)
Medical Context Distorts Decisions in Clinical Vision Language Models
par: Restrepo, David, et autres
Publié: (2026)
par: Restrepo, David, et autres
Publié: (2026)
How Does Vision-Language Adaptation Impact the Safety of Vision Language Models?
par: Lee, Seongyun, et autres
Publié: (2024)
par: Lee, Seongyun, et autres
Publié: (2024)
ICSVR: Investigating Compositional and Syntactic Understanding in Video Retrieval Models
par: Madasu, Avinash, et autres
Publié: (2023)
par: Madasu, Avinash, et autres
Publié: (2023)
Dream-VL & Dream-VLA: Open Vision-Language and Vision-Language-Action Models with Diffusion Language Model Backbone
par: Ye, Jiacheng, et autres
Publié: (2025)
par: Ye, Jiacheng, et autres
Publié: (2025)
Logical Closed Loop: Uncovering Object Hallucinations in Large Vision-Language Models
par: Wu, Junfei, et autres
Publié: (2024)
par: Wu, Junfei, et autres
Publié: (2024)
Conflict Adaptation in Vision-Language Models
par: Hu, Xiaoyang
Publié: (2025)
par: Hu, Xiaoyang
Publié: (2025)
Vision Language Models are Confused Tourists
par: Irawan, Patrick Amadeus, et autres
Publié: (2025)
par: Irawan, Patrick Amadeus, et autres
Publié: (2025)
FlightGPT: Towards Generalizable and Interpretable UAV Vision-and-Language Navigation with Vision-Language Models
par: Cai, Hengxing, et autres
Publié: (2025)
par: Cai, Hengxing, et autres
Publié: (2025)
See, Think, Learn: A Self-Taught Multimodal Reasoner
par: Sharma, Sourabh, et autres
Publié: (2025)
par: Sharma, Sourabh, et autres
Publié: (2025)
TTL: Test-time Textual Learning for OOD Detection with Pretrained Vision-Language Models
par: Ye, Jinlun, et autres
Publié: (2026)
par: Ye, Jinlun, et autres
Publié: (2026)
Can Vision Language Models Learn from Visual Demonstrations of Ambiguous Spatial Reasoning?
par: Zhao, Bowen, et autres
Publié: (2024)
par: Zhao, Bowen, et autres
Publié: (2024)
MedCLIPSeg: Probabilistic Vision-Language Adaptation for Data-Efficient and Generalizable Medical Image Segmentation
par: Koleilat, Taha, et autres
Publié: (2026)
par: Koleilat, Taha, et autres
Publié: (2026)
Natural Language Inference Improves Compositionality in Vision-Language Models
par: Cascante-Bonilla, Paola, et autres
Publié: (2024)
par: Cascante-Bonilla, Paola, et autres
Publié: (2024)
Do Vision-Language Models Really Understand Visual Language?
par: Hou, Yifan, et autres
Publié: (2024)
par: Hou, Yifan, et autres
Publié: (2024)
Documents similaires
-
Sensitivity of Generative VLMs to Semantically and Lexically Altered Prompts
par: Dumpala, Sri Harsha, et autres
Publié: (2024) -
SUGARCREPE++ Dataset: Vision-Language Model Sensitivity to Semantic and Lexical Alterations
par: Dumpala, Sri Harsha, et autres
Publié: (2024) -
DiffAug: A Diffuse-and-Denoise Augmentation for Training Robust Classifiers
par: Sastry, Chandramouli, et autres
Publié: (2023) -
Understanding Syntactic Generalization in Structure-inducing Language Models
par: Arps, David, et autres
Publié: (2025) -
VISLA Benchmark: Evaluating Embedding Sensitivity to Semantic and Lexical Alterations
par: Dumpala, Sri Harsha, et autres
Publié: (2024)