Seeing Through Words, Speaking Through Pixels: Deep Representational Alignment Between Vision and Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | He, Zoe Wanying, Trott, Sean, Khosla, Meenakshi |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Beyond Words: Multimodal LLM Knows When to Speak
por: Liao, Zikai, et al.
Publicado: (2025)
por: Liao, Zikai, et al.
Publicado: (2025)
Pixels, Patterns, but No Poetry: To See The World like Humans
por: Gao, Hongcheng, et al.
Publicado: (2025)
por: Gao, Hongcheng, et al.
Publicado: (2025)
Comparing and Integrating Different Notions of Representational Correspondence in Neural Systems
por: Wu, Jialin, et al.
Publicado: (2025)
por: Wu, Jialin, et al.
Publicado: (2025)
Seeing Through Their Eyes: Evaluating Visual Perspective Taking in Vision Language Models
por: Góral, Gracjan, et al.
Publicado: (2024)
por: Góral, Gracjan, et al.
Publicado: (2024)
Large Vision-Language Model Alignment and Misalignment: A Survey Through the Lens of Explainability
por: Shu, Dong, et al.
Publicado: (2025)
por: Shu, Dong, et al.
Publicado: (2025)
Seeing Through Deception: Uncovering Misleading Creator Intent in Multimodal News with Vision-Language Models
por: Wu, Jiaying, et al.
Publicado: (2025)
por: Wu, Jiaying, et al.
Publicado: (2025)
Geometry-Aware CLIP Retrieval via Local Cross-Modal Alignment and Steering
por: Prakash, Nirmalendu, et al.
Publicado: (2026)
por: Prakash, Nirmalendu, et al.
Publicado: (2026)
Seeing Beyond Words: Self-Supervised Visual Learning for Multimodal Large Language Models
por: Caffagni, Davide, et al.
Publicado: (2025)
por: Caffagni, Davide, et al.
Publicado: (2025)
EMOVA: Empowering Language Models to See, Hear and Speak with Vivid Emotions
por: Chen, Kai, et al.
Publicado: (2024)
por: Chen, Kai, et al.
Publicado: (2024)
Eliciting In-Context Learning in Vision-Language Models for Videos Through Curated Data Distributional Properties
por: Yu, Keunwoo Peter, et al.
Publicado: (2023)
por: Yu, Keunwoo Peter, et al.
Publicado: (2023)
GaussianVision: Vision-Language Alignment from Compressed Image Representations using 2D Gaussian Splatting
por: Omri, Yasmine, et al.
Publicado: (2025)
por: Omri, Yasmine, et al.
Publicado: (2025)
Images Speak Louder than Words: Understanding and Mitigating Bias in Vision-Language Model from a Causal Mediation Perspective
por: Weng, Zhaotian, et al.
Publicado: (2024)
por: Weng, Zhaotian, et al.
Publicado: (2024)
Seeing Symbols, Missing Cultures: Probing Vision-Language Models' Reasoning on Fire Imagery and Cultural Meaning
por: Yu, Haorui, et al.
Publicado: (2025)
por: Yu, Haorui, et al.
Publicado: (2025)
World-to-Words: Grounded Open Vocabulary Acquisition through Fast Mapping in Vision-Language Models
por: Ma, Ziqiao, et al.
Publicado: (2023)
por: Ma, Ziqiao, et al.
Publicado: (2023)
Seeing the Image: Prioritizing Visual Correlation by Contrastive Alignment
por: Xiao, Xin, et al.
Publicado: (2024)
por: Xiao, Xin, et al.
Publicado: (2024)
Evaluating Representational Similarity Measures from the Lens of Functional Correspondence
por: Bo, Yiqing, et al.
Publicado: (2024)
por: Bo, Yiqing, et al.
Publicado: (2024)
Seeing Through Words: Controlling Visual Retrieval Quality with Language Models
por: Lu, Jianglin, et al.
Publicado: (2026)
por: Lu, Jianglin, et al.
Publicado: (2026)
HAWAII: Hierarchical Visual Knowledge Transfer for Efficient Vision-Language Models
por: Wang, Yimu, et al.
Publicado: (2025)
por: Wang, Yimu, et al.
Publicado: (2025)
SPA-VL: A Comprehensive Safety Preference Alignment Dataset for Vision Language Model
por: Zhang, Yongting, et al.
Publicado: (2024)
por: Zhang, Yongting, et al.
Publicado: (2024)
BLINK: Multimodal Large Language Models Can See but Not Perceive
por: Fu, Xingyu, et al.
Publicado: (2024)
por: Fu, Xingyu, et al.
Publicado: (2024)
From Pixels to Words -- Towards Native Vision-Language Primitives at Scale
por: Diao, Haiwen, et al.
Publicado: (2025)
por: Diao, Haiwen, et al.
Publicado: (2025)
Unified Lexical Representation for Interpretable Visual-Language Alignment
por: Li, Yifan, et al.
Publicado: (2024)
por: Li, Yifan, et al.
Publicado: (2024)
Exploring Spatial Language Grounding Through Referring Expressions
por: Tumu, Akshar, et al.
Publicado: (2025)
por: Tumu, Akshar, et al.
Publicado: (2025)
GSM8K-V: Can Vision Language Models Solve Grade School Math Word Problems in Visual Contexts
por: Yuan, Fan, et al.
Publicado: (2025)
por: Yuan, Fan, et al.
Publicado: (2025)
Words or Vision: Do Vision-Language Models Have Blind Faith in Text?
por: Deng, Ailin, et al.
Publicado: (2025)
por: Deng, Ailin, et al.
Publicado: (2025)
Seeing Justice Clearly: Handwritten Legal Document Translation with OCR and Vision-Language Models
por: Nigam, Shubham Kumar, et al.
Publicado: (2025)
por: Nigam, Shubham Kumar, et al.
Publicado: (2025)
If CLIP Could Talk: Understanding Vision-Language Model Representations Through Their Preferred Concept Descriptions
por: Esfandiarpoor, Reza, et al.
Publicado: (2024)
por: Esfandiarpoor, Reza, et al.
Publicado: (2024)
Seeing Eye to AI: Human Alignment via Gaze-Based Response Rewards for Large Language Models
por: Lopez-Cardona, Angela, et al.
Publicado: (2024)
por: Lopez-Cardona, Angela, et al.
Publicado: (2024)
Superpixel Semantics Representation and Pre-training for Vision-Language Task
por: Zhang, Siyu, et al.
Publicado: (2023)
por: Zhang, Siyu, et al.
Publicado: (2023)
Unified Vision-Language Modeling via Concept Space Alignment
por: Qiu, Yifu, et al.
Publicado: (2026)
por: Qiu, Yifu, et al.
Publicado: (2026)
Text as Images: Can Multimodal Large Language Models Follow Printed Instructions in Pixels?
por: Li, Xiujun, et al.
Publicado: (2023)
por: Li, Xiujun, et al.
Publicado: (2023)
Using Images to Find Context-Independent Word Representations in Vector Space
por: Kumar, Harsh
Publicado: (2024)
por: Kumar, Harsh
Publicado: (2024)
From Pixels to Tokens: Revisiting Object Hallucinations in Large Vision-Language Models
por: Shang, Yuying, et al.
Publicado: (2024)
por: Shang, Yuying, et al.
Publicado: (2024)
Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models
por: Lian, Chenyu, et al.
Publicado: (2025)
por: Lian, Chenyu, et al.
Publicado: (2025)
OmniSpatial: Towards Comprehensive Spatial Reasoning Benchmark for Vision Language Models
por: Jia, Mengdi, et al.
Publicado: (2025)
por: Jia, Mengdi, et al.
Publicado: (2025)
PatientVLM Meets DocVLM: Pre-Consultation Dialogue Between Vision-Language Models for Efficient Diagnosis
por: Lokesh, K, et al.
Publicado: (2026)
por: Lokesh, K, et al.
Publicado: (2026)
Seeing Isn't Believing: Uncovering Blind Spots in Evaluator Vision-Language Models
por: Khan, Mohammed Safi Ur Rahman, et al.
Publicado: (2026)
por: Khan, Mohammed Safi Ur Rahman, et al.
Publicado: (2026)
DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding
por: Wu, Zhiyu, et al.
Publicado: (2024)
por: Wu, Zhiyu, et al.
Publicado: (2024)
"See the World, Discover Knowledge": A Chinese Factuality Evaluation for Large Vision Language Models
por: Gu, Jihao, et al.
Publicado: (2025)
por: Gu, Jihao, et al.
Publicado: (2025)
Attention, Please! PixelSHAP Reveals What Vision-Language Models Actually Focus On
por: Goldshmidt, Roni
Publicado: (2025)
por: Goldshmidt, Roni
Publicado: (2025)
Ejemplares similares
-
Beyond Words: Multimodal LLM Knows When to Speak
por: Liao, Zikai, et al.
Publicado: (2025) -
Pixels, Patterns, but No Poetry: To See The World like Humans
por: Gao, Hongcheng, et al.
Publicado: (2025) -
Comparing and Integrating Different Notions of Representational Correspondence in Neural Systems
por: Wu, Jialin, et al.
Publicado: (2025) -
Seeing Through Their Eyes: Evaluating Visual Perspective Taking in Vision Language Models
por: Góral, Gracjan, et al.
Publicado: (2024) -
Large Vision-Language Model Alignment and Misalignment: A Survey Through the Lens of Explainability
por: Shu, Dong, et al.
Publicado: (2025)