CAST: Cross-modal Alignment Similarity Test for Vision Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Dagan, Gautier, Loginova, Olga, Batra, Anil |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times
di: Loginova, Olga, et al.
Pubblicazione: (2025)
di: Loginova, Olga, et al.
Pubblicazione: (2025)
Cross-modal Associations in Vision and Language Models: Revisiting the Bouba-Kiki Effect
di: Kouwenhoven, Tom, et al.
Pubblicazione: (2025)
di: Kouwenhoven, Tom, et al.
Pubblicazione: (2025)
Multi-modal Semantic Understanding with Contrastive Cross-modal Feature Alignment
di: Zhang, Ming, et al.
Pubblicazione: (2024)
di: Zhang, Ming, et al.
Pubblicazione: (2024)
Deciphering Cross-Modal Alignment in Large Vision-Language Models with Modality Integration Rate
di: Huang, Qidong, et al.
Pubblicazione: (2024)
di: Huang, Qidong, et al.
Pubblicazione: (2024)
Predicting Implicit Arguments in Procedural Video Instructions
di: Batra, Anil, et al.
Pubblicazione: (2025)
di: Batra, Anil, et al.
Pubblicazione: (2025)
Expanding the Boundaries of Vision Prior Knowledge in Multi-modal Large Language Models
di: Liang, Qiao, et al.
Pubblicazione: (2025)
di: Liang, Qiao, et al.
Pubblicazione: (2025)
e5-omni: Explicit Cross-modal Alignment for Omni-modal Embeddings
di: Chen, Haonan, et al.
Pubblicazione: (2026)
di: Chen, Haonan, et al.
Pubblicazione: (2026)
RadZero: Similarity-Based Cross-Attention for Explainable Vision-Language Alignment in Chest X-ray with Zero-Shot Multi-Task Capability
di: Park, Jonggwon, et al.
Pubblicazione: (2025)
di: Park, Jonggwon, et al.
Pubblicazione: (2025)
Layer-wise Alignment: Examining Safety Alignment Across Image Encoder Layers in Vision Language Models
di: Bachu, Saketh, et al.
Pubblicazione: (2024)
di: Bachu, Saketh, et al.
Pubblicazione: (2024)
Cross-modal Causal Relation Alignment for Video Question Grounding
di: Chen, Weixing, et al.
Pubblicazione: (2025)
di: Chen, Weixing, et al.
Pubblicazione: (2025)
AlignMMBench: Evaluating Chinese Multimodal Alignment in Large Vision-Language Models
di: Wu, Yuhang, et al.
Pubblicazione: (2024)
di: Wu, Yuhang, et al.
Pubblicazione: (2024)
MAGIC: Multimodal Alignment & Grounding-aware Instruction Coreset for Vision-Language Models
di: Biswas, Shristi Das, et al.
Pubblicazione: (2026)
di: Biswas, Shristi Das, et al.
Pubblicazione: (2026)
HiMo-CLIP: Modeling Semantic Hierarchy and Monotonicity in Vision-Language Alignment
di: Wu, Ruijia, et al.
Pubblicazione: (2025)
di: Wu, Ruijia, et al.
Pubblicazione: (2025)
HEED: Density-Weighted Residual Alignment for Hybrid Vision-Language Model Distillation
di: Liang, Yihao, et al.
Pubblicazione: (2026)
di: Liang, Yihao, et al.
Pubblicazione: (2026)
ColPali: Efficient Document Retrieval with Vision Language Models
di: Faysse, Manuel, et al.
Pubblicazione: (2024)
di: Faysse, Manuel, et al.
Pubblicazione: (2024)
Cross-modal Information Flow in Multimodal Large Language Models
di: Zhang, Zhi, et al.
Pubblicazione: (2024)
di: Zhang, Zhi, et al.
Pubblicazione: (2024)
Fine-Grained Verifiers: Preference Modeling as Next-token Prediction in Vision-Language Alignment
di: Cui, Chenhang, et al.
Pubblicazione: (2024)
di: Cui, Chenhang, et al.
Pubblicazione: (2024)
Large Vision-Language Model Alignment and Misalignment: A Survey Through the Lens of Explainability
di: Shu, Dong, et al.
Pubblicazione: (2025)
di: Shu, Dong, et al.
Pubblicazione: (2025)
AlignGPT: Multi-modal Large Language Models with Adaptive Alignment Capability
di: Zhao, Fei, et al.
Pubblicazione: (2024)
di: Zhao, Fei, et al.
Pubblicazione: (2024)
Unraveling Cross-Modality Knowledge Conflicts in Large Vision-Language Models
di: Zhu, Tinghui, et al.
Pubblicazione: (2024)
di: Zhu, Tinghui, et al.
Pubblicazione: (2024)
MuDPT: Multi-modal Deep-symphysis Prompt Tuning for Large Pre-trained Vision-Language Models
di: Miao, Yongzhu, et al.
Pubblicazione: (2023)
di: Miao, Yongzhu, et al.
Pubblicazione: (2023)
Cross-Modal Obfuscation for Jailbreak Attacks on Large Vision-Language Models
di: Jiang, Lei, et al.
Pubblicazione: (2025)
di: Jiang, Lei, et al.
Pubblicazione: (2025)
Multimodal LLM Enhanced Cross-lingual Cross-modal Retrieval
di: Wang, Yabing, et al.
Pubblicazione: (2024)
di: Wang, Yabing, et al.
Pubblicazione: (2024)
VLFeedback: A Large-Scale AI Feedback Dataset for Large Vision-Language Models Alignment
di: Li, Lei, et al.
Pubblicazione: (2024)
di: Li, Lei, et al.
Pubblicazione: (2024)
MSR-Align: Policy-Grounded Multimodal Alignment for Safety-Aware Reasoning in Vision-Language Models
di: Xia, Yinan, et al.
Pubblicazione: (2025)
di: Xia, Yinan, et al.
Pubblicazione: (2025)
Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models
di: Li, Yanwei, et al.
Pubblicazione: (2024)
di: Li, Yanwei, et al.
Pubblicazione: (2024)
ChartMuseum: Testing Visual Reasoning Capabilities of Large Vision-Language Models
di: Tang, Liyan, et al.
Pubblicazione: (2025)
di: Tang, Liyan, et al.
Pubblicazione: (2025)
DELAN: Dual-Level Alignment for Vision-and-Language Navigation by Cross-Modal Contrastive Learning
di: Du, Mengfei, et al.
Pubblicazione: (2024)
di: Du, Mengfei, et al.
Pubblicazione: (2024)
DetectiumFire: A Comprehensive Multi-modal Dataset Bridging Vision and Language for Fire Understanding
di: Liu, Zixuan, et al.
Pubblicazione: (2025)
di: Liu, Zixuan, et al.
Pubblicazione: (2025)
Dynamic Adapter with Semantics Disentangling for Cross-lingual Cross-modal Retrieval
di: Cai, Rui, et al.
Pubblicazione: (2024)
di: Cai, Rui, et al.
Pubblicazione: (2024)
TTL: Test-time Textual Learning for OOD Detection with Pretrained Vision-Language Models
di: Ye, Jinlun, et al.
Pubblicazione: (2026)
di: Ye, Jinlun, et al.
Pubblicazione: (2026)
ColorBlindnessEval: Can Vision-Language Models Pass Color Blindness Tests?
di: Ling, Zijian, et al.
Pubblicazione: (2025)
di: Ling, Zijian, et al.
Pubblicazione: (2025)
CrossGET: Cross-Guided Ensemble of Tokens for Accelerating Vision-Language Transformers
di: Shi, Dachuan, et al.
Pubblicazione: (2023)
di: Shi, Dachuan, et al.
Pubblicazione: (2023)
Are Vision Language Models Cross-Cultural Theory of Mind Reasoners?
di: Nazi, Zabir Al, et al.
Pubblicazione: (2025)
di: Nazi, Zabir Al, et al.
Pubblicazione: (2025)
PromptSync: Bridging Domain Gaps in Vision-Language Models through Class-Aware Prototype Alignment and Discrimination
di: Khandelwal, Anant
Pubblicazione: (2024)
di: Khandelwal, Anant
Pubblicazione: (2024)
Think-Reflect-Revise: A Policy-Guided Reflective Framework for Safety Alignment in Large Vision Language Models
di: Weng, Fenghua, et al.
Pubblicazione: (2025)
di: Weng, Fenghua, et al.
Pubblicazione: (2025)
GroundingGPT:Language Enhanced Multi-modal Grounding Model
di: Li, Zhaowei, et al.
Pubblicazione: (2024)
di: Li, Zhaowei, et al.
Pubblicazione: (2024)
X-VILA: Cross-Modality Alignment for Large Language Model
di: Ye, Hanrong, et al.
Pubblicazione: (2024)
di: Ye, Hanrong, et al.
Pubblicazione: (2024)
Multi-modal, Multi-task, Multi-criteria Automatic Evaluation with Vision Language Models
di: Ohi, Masanari, et al.
Pubblicazione: (2024)
di: Ohi, Masanari, et al.
Pubblicazione: (2024)
VideoXum: Cross-modal Visual and Textural Summarization of Videos
di: Lin, Jingyang, et al.
Pubblicazione: (2023)
di: Lin, Jingyang, et al.
Pubblicazione: (2023)
Documenti analoghi
-
Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times
di: Loginova, Olga, et al.
Pubblicazione: (2025) -
Cross-modal Associations in Vision and Language Models: Revisiting the Bouba-Kiki Effect
di: Kouwenhoven, Tom, et al.
Pubblicazione: (2025) -
Multi-modal Semantic Understanding with Contrastive Cross-modal Feature Alignment
di: Zhang, Ming, et al.
Pubblicazione: (2024) -
Deciphering Cross-Modal Alignment in Large Vision-Language Models with Modality Integration Rate
di: Huang, Qidong, et al.
Pubblicazione: (2024) -
Predicting Implicit Arguments in Procedural Video Instructions
di: Batra, Anil, et al.
Pubblicazione: (2025)