Do Vision and Language Models Share Concepts? A Vector Space Alignment Study
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Li, Jiaang, Kementchedjhieva, Yova, Fierro, Constanza, Søgaard, Anders |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2023
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
LLMs Can Compensate for Deficiencies in Visual Representations
von: Takishita, Sho, et al.
Veröffentlicht: (2025)
von: Takishita, Sho, et al.
Veröffentlicht: (2025)
The Devil is in the EOS: Sequence Training for Detailed Image Captioning
von: Mohamed, Abdelrahman, et al.
Veröffentlicht: (2025)
von: Mohamed, Abdelrahman, et al.
Veröffentlicht: (2025)
MuLan: A Study of Fact Mutability in Language Models
von: Fierro, Constanza, et al.
Veröffentlicht: (2024)
von: Fierro, Constanza, et al.
Veröffentlicht: (2024)
Unified Vision-Language Modeling via Concept Space Alignment
von: Qiu, Yifu, et al.
Veröffentlicht: (2026)
von: Qiu, Yifu, et al.
Veröffentlicht: (2026)
SPECS: Specificity-Enhanced CLIP-Score for Long Image Caption Evaluation
von: Chen, Xiaofu, et al.
Veröffentlicht: (2025)
von: Chen, Xiaofu, et al.
Veröffentlicht: (2025)
Vision-Language Models under Cultural and Inclusive Considerations
von: Karamolegkou, Antonia, et al.
Veröffentlicht: (2024)
von: Karamolegkou, Antonia, et al.
Veröffentlicht: (2024)
LinguDistill: Recovering Linguistic Ability in Vision-Language Models via Selective Cross-Modal Distillation
von: Irawan, Patrick Amadeus, et al.
Veröffentlicht: (2026)
von: Irawan, Patrick Amadeus, et al.
Veröffentlicht: (2026)
VLMs Need Words: Vision Language Models Ignore Visual Detail In Favor of Semantic Anchors
von: Shahgir, Haz Sameen, et al.
Veröffentlicht: (2026)
von: Shahgir, Haz Sameen, et al.
Veröffentlicht: (2026)
A Simple Data Augmentation Strategy for Text-in-Image Scientific VQA
von: Shoer, Belal, et al.
Veröffentlicht: (2025)
von: Shoer, Belal, et al.
Veröffentlicht: (2025)
EFSA: Episodic Few-Shot Adaptation for Text-to-Image Retrieval
von: Huzaifa, Muhammad, et al.
Veröffentlicht: (2024)
von: Huzaifa, Muhammad, et al.
Veröffentlicht: (2024)
From Local Concepts to Universals: Evaluating the Multicultural Understanding of Vision-Language Models
von: Bhatia, Mehar, et al.
Veröffentlicht: (2024)
von: Bhatia, Mehar, et al.
Veröffentlicht: (2024)
Do Vision-Language Models Have Internal World Models? Towards an Atomic Evaluation
von: Gao, Qiyue, et al.
Veröffentlicht: (2025)
von: Gao, Qiyue, et al.
Veröffentlicht: (2025)
SPA-VL: A Comprehensive Safety Preference Alignment Dataset for Vision Language Model
von: Zhang, Yongting, et al.
Veröffentlicht: (2024)
von: Zhang, Yongting, et al.
Veröffentlicht: (2024)
Safe-CLIP: Removing NSFW Concepts from Vision-and-Language Models
von: Poppi, Samuele, et al.
Veröffentlicht: (2023)
von: Poppi, Samuele, et al.
Veröffentlicht: (2023)
Does Instruction Tuning Make LLMs More Consistent?
von: Fierro, Constanza, et al.
Veröffentlicht: (2024)
von: Fierro, Constanza, et al.
Veröffentlicht: (2024)
CBVLM: Training-free Explainable Concept-based Large Vision Language Models for Medical Image Classification
von: Patrício, Cristiano, et al.
Veröffentlicht: (2025)
von: Patrício, Cristiano, et al.
Veröffentlicht: (2025)
Lost in Space? Vision-Language Models Struggle with Relative Camera Pose Estimation
von: Deng, Ken, et al.
Veröffentlicht: (2026)
von: Deng, Ken, et al.
Veröffentlicht: (2026)
Topological Alignment of Shared Vision-Language Embedding Space
von: You, Junwon, et al.
Veröffentlicht: (2025)
von: You, Junwon, et al.
Veröffentlicht: (2025)
Seeing Through Words, Speaking Through Pixels: Deep Representational Alignment Between Vision and Language Models
von: He, Zoe Wanying, et al.
Veröffentlicht: (2025)
von: He, Zoe Wanying, et al.
Veröffentlicht: (2025)
Nemesis: Normalizing the Soft-prompt Vectors of Vision-Language Models
von: Fu, Shuai, et al.
Veröffentlicht: (2024)
von: Fu, Shuai, et al.
Veröffentlicht: (2024)
GaussianVision: Vision-Language Alignment from Compressed Image Representations using 2D Gaussian Splatting
von: Omri, Yasmine, et al.
Veröffentlicht: (2025)
von: Omri, Yasmine, et al.
Veröffentlicht: (2025)
Visually Descriptive Language Model for Vector Graphics Reasoning
von: Wang, Zhenhailong, et al.
Veröffentlicht: (2024)
von: Wang, Zhenhailong, et al.
Veröffentlicht: (2024)
Multimodal Large Language Models to Support Real-World Fact-Checking
von: Geng, Jiahui, et al.
Veröffentlicht: (2024)
von: Geng, Jiahui, et al.
Veröffentlicht: (2024)
Long Story Short: Disentangling Compositionality and Long-Caption Understanding in Contrastive VLMs
von: Salazar, Israfel, et al.
Veröffentlicht: (2025)
von: Salazar, Israfel, et al.
Veröffentlicht: (2025)
Large Language Models can Share Images, Too!
von: Lee, Young-Jun, et al.
Veröffentlicht: (2023)
von: Lee, Young-Jun, et al.
Veröffentlicht: (2023)
Analyzing Diffusion and Autoregressive Vision Language Models in Multimodal Embedding Space
von: Wang, Zihang, et al.
Veröffentlicht: (2026)
von: Wang, Zihang, et al.
Veröffentlicht: (2026)
Pre-trained Vision-Language Models Learn Discoverable Visual Concepts
von: Zang, Yuan, et al.
Veröffentlicht: (2024)
von: Zang, Yuan, et al.
Veröffentlicht: (2024)
VolDoGer: LLM-assisted Datasets for Domain Generalization in Vision-Language Tasks
von: Choi, Juhwan, et al.
Veröffentlicht: (2024)
von: Choi, Juhwan, et al.
Veröffentlicht: (2024)
R1-ShareVL: Incentivizing Reasoning Capability of Multimodal Large Language Models via Share-GRPO
von: Yao, Huanjin, et al.
Veröffentlicht: (2025)
von: Yao, Huanjin, et al.
Veröffentlicht: (2025)
Lost in Embeddings: Information Loss in Vision-Language Models
von: Li, Wenyan, et al.
Veröffentlicht: (2025)
von: Li, Wenyan, et al.
Veröffentlicht: (2025)
Noise is an Efficient Learner for Zero-Shot Vision-Language Models
von: Imam, Raza, et al.
Veröffentlicht: (2025)
von: Imam, Raza, et al.
Veröffentlicht: (2025)
Better Language Models Exhibit Higher Visual Alignment
von: Ruthardt, Jona, et al.
Veröffentlicht: (2024)
von: Ruthardt, Jona, et al.
Veröffentlicht: (2024)
Do Visual Imaginations Improve Vision-and-Language Navigation Agents?
von: Perincherry, Akhil, et al.
Veröffentlicht: (2025)
von: Perincherry, Akhil, et al.
Veröffentlicht: (2025)
VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning
von: Luo, Run, et al.
Veröffentlicht: (2025)
von: Luo, Run, et al.
Veröffentlicht: (2025)
Revisiting the Role of Language Priors in Vision-Language Models
von: Lin, Zhiqiu, et al.
Veröffentlicht: (2023)
von: Lin, Zhiqiu, et al.
Veröffentlicht: (2023)
Survey on Vision-Language-Action Models
von: Adilkhanov, Adilzhan, et al.
Veröffentlicht: (2025)
von: Adilkhanov, Adilzhan, et al.
Veröffentlicht: (2025)
Using Images to Find Context-Independent Word Representations in Vector Space
von: Kumar, Harsh
Veröffentlicht: (2024)
von: Kumar, Harsh
Veröffentlicht: (2024)
Vision Enhancing LLMs: Empowering Multimodal Knowledge Storage and Sharing in LLMs
von: Li, Yunxin, et al.
Veröffentlicht: (2023)
von: Li, Yunxin, et al.
Veröffentlicht: (2023)
WildVision: Evaluating Vision-Language Models in the Wild with Human Preferences
von: Lu, Yujie, et al.
Veröffentlicht: (2024)
von: Lu, Yujie, et al.
Veröffentlicht: (2024)
EmbodiedMidtrain: Bridging the Gap between Vision-Language Models and Vision-Language-Action Models via Mid-training
von: Du, Yiyang, et al.
Veröffentlicht: (2026)
von: Du, Yiyang, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
LLMs Can Compensate for Deficiencies in Visual Representations
von: Takishita, Sho, et al.
Veröffentlicht: (2025) -
The Devil is in the EOS: Sequence Training for Detailed Image Captioning
von: Mohamed, Abdelrahman, et al.
Veröffentlicht: (2025) -
MuLan: A Study of Fact Mutability in Language Models
von: Fierro, Constanza, et al.
Veröffentlicht: (2024) -
Unified Vision-Language Modeling via Concept Space Alignment
von: Qiu, Yifu, et al.
Veröffentlicht: (2026) -
SPECS: Specificity-Enhanced CLIP-Score for Long Image Caption Evaluation
von: Chen, Xiaofu, et al.
Veröffentlicht: (2025)