It's Not a Modality Gap: Characterizing and Addressing the Contrastive Gap
Fuente:
arXiv
Salvato in:
| Autori principali: | Fahim, Abrar, Murphy, Alex, Fyshe, Alona |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Exploring Curriculum Learning for Vision-Language Tasks: A Study on Small-Scale Multimodal Training
di: Saha, Rohan, et al.
Pubblicazione: (2024)
di: Saha, Rohan, et al.
Pubblicazione: (2024)
Closing the Modality Gap for Mixed Modality Search
di: Li, Binxu, et al.
Pubblicazione: (2025)
di: Li, Binxu, et al.
Pubblicazione: (2025)
Finding Shared Decodable Concepts and their Negations in the Brain
di: Efird, Cory, et al.
Pubblicazione: (2024)
di: Efird, Cory, et al.
Pubblicazione: (2024)
Multimedia-Aware Question Answering: A Review of Retrieval and Cross-Modal Reasoning Architectures
di: Raja, Rahul, et al.
Pubblicazione: (2025)
di: Raja, Rahul, et al.
Pubblicazione: (2025)
Generalized Contrastive Learning for Multi-Modal Retrieval and Ranking
di: Zhu, Tianyu, et al.
Pubblicazione: (2024)
di: Zhu, Tianyu, et al.
Pubblicazione: (2024)
Benchmarking Robustness of Contrastive Learning Models for Medical Image-Report Retrieval
di: Deanda, Demetrio, et al.
Pubblicazione: (2025)
di: Deanda, Demetrio, et al.
Pubblicazione: (2025)
UniversalRAG: Retrieval-Augmented Generation over Corpora of Diverse Modalities and Granularities
di: Yeo, Woongyeong, et al.
Pubblicazione: (2025)
di: Yeo, Woongyeong, et al.
Pubblicazione: (2025)
Modality-Aware Integration with Large Language Models for Knowledge-based Visual Question Answering
di: Dong, Junnan, et al.
Pubblicazione: (2024)
di: Dong, Junnan, et al.
Pubblicazione: (2024)
Reversed in Time: A Novel Temporal-Emphasized Benchmark for Cross-Modal Video-Text Retrieval
di: Du, Yang, et al.
Pubblicazione: (2024)
di: Du, Yang, et al.
Pubblicazione: (2024)
FlowVQA: Mapping Multimodal Logic in Visual Question Answering with Flowcharts
di: Singh, Shubhankar, et al.
Pubblicazione: (2024)
di: Singh, Shubhankar, et al.
Pubblicazione: (2024)
DREAM: Improving Video-Text Retrieval Through Relevance-Based Augmentation Using Large Foundation Models
di: Wang, Yimu, et al.
Pubblicazione: (2024)
di: Wang, Yimu, et al.
Pubblicazione: (2024)
VLM-KG: Multimodal Radiology Knowledge Graph Generation
di: Abdullah, Abdullah, et al.
Pubblicazione: (2025)
di: Abdullah, Abdullah, et al.
Pubblicazione: (2025)
FilterRAG: Zero-Shot Informed Retrieval-Augmented Generation to Mitigate Hallucinations in VQA
di: Sarwar, Nobin
Pubblicazione: (2025)
di: Sarwar, Nobin
Pubblicazione: (2025)
Using Knowledge Graphs to harvest datasets for efficient CLIP model training
di: Ging, Simon, et al.
Pubblicazione: (2025)
di: Ging, Simon, et al.
Pubblicazione: (2025)
PAPERCLIP: Associating Astronomical Observations and Natural Language with Multi-Modal Models
di: Mishra-Sharma, Siddharth, et al.
Pubblicazione: (2024)
di: Mishra-Sharma, Siddharth, et al.
Pubblicazione: (2024)
Bridging the Modality Gap: Dimension Information Alignment and Sparse Spatial Constraint for Image-Text Matching
di: Ma, Xiang, et al.
Pubblicazione: (2024)
di: Ma, Xiang, et al.
Pubblicazione: (2024)
Object-Aware Query Perturbation for Cross-Modal Image-Text Retrieval
di: Sogi, Naoya, et al.
Pubblicazione: (2024)
di: Sogi, Naoya, et al.
Pubblicazione: (2024)
Maximal Matching Matters: Preventing Representation Collapse for Robust Cross-Modal Retrieval
di: Alomari, Hani, et al.
Pubblicazione: (2025)
di: Alomari, Hani, et al.
Pubblicazione: (2025)
TelcoAI: Advancing 3GPP Technical Specification Search through Agentic Multi-Modal Retrieval-Augmented Generation
di: Ghosh, Rahul, et al.
Pubblicazione: (2025)
di: Ghosh, Rahul, et al.
Pubblicazione: (2025)
Multimodal Inverse Attention Network with Intrinsic Discriminant Feature Exploitation for Fake News Detection
di: Zhang, Tianlin, et al.
Pubblicazione: (2025)
di: Zhang, Tianlin, et al.
Pubblicazione: (2025)
Multi-Vector Index Compression in Any Modality
di: Qin, Hanxiang, et al.
Pubblicazione: (2026)
di: Qin, Hanxiang, et al.
Pubblicazione: (2026)
Efficient and High-Fidelity Omni Modality Retrieval
di: Huynh, Chuong, et al.
Pubblicazione: (2026)
di: Huynh, Chuong, et al.
Pubblicazione: (2026)
CoopHash: Cooperative Learning of Multipurpose Descriptor and Contrastive Pair Generator via Variational MCMC Teaching for Supervised Image Hashing
di: Doan, Khoa D., et al.
Pubblicazione: (2022)
di: Doan, Khoa D., et al.
Pubblicazione: (2022)
VISTA: Visualized Text Embedding For Universal Multi-Modal Retrieval
di: Zhou, Junjie, et al.
Pubblicazione: (2024)
di: Zhou, Junjie, et al.
Pubblicazione: (2024)
Correcting Biased Centered Kernel Alignment Measures in Biological and Artificial Neural Networks
di: Murphy, Alex, et al.
Pubblicazione: (2024)
di: Murphy, Alex, et al.
Pubblicazione: (2024)
Supervised Fine-Tuning or Contrastive Learning? Towards Better Multimodal LLM Reranking
di: Dai, Ziqi, et al.
Pubblicazione: (2025)
di: Dai, Ziqi, et al.
Pubblicazione: (2025)
Why Steering Works: Toward a Unified View of Language Model Parameter Dynamics
di: Xu, Ziwen, et al.
Pubblicazione: (2026)
di: Xu, Ziwen, et al.
Pubblicazione: (2026)
FM2DS: Few-Shot Multimodal Multihop Data Synthesis with Knowledge Distillation for Question Answering
di: Abaskohi, Amirhossein, et al.
Pubblicazione: (2024)
di: Abaskohi, Amirhossein, et al.
Pubblicazione: (2024)
EIVEN: Efficient Implicit Attribute Value Extraction using Multimodal LLM
di: Zou, Henry Peng, et al.
Pubblicazione: (2024)
di: Zou, Henry Peng, et al.
Pubblicazione: (2024)
MM-Embed: Universal Multimodal Retrieval with Multimodal LLMs
di: Lin, Sheng-Chieh, et al.
Pubblicazione: (2024)
di: Lin, Sheng-Chieh, et al.
Pubblicazione: (2024)
ImplicitAVE: An Open-Source Dataset and Multimodal LLMs Benchmark for Implicit Attribute Value Extraction
di: Zou, Henry Peng, et al.
Pubblicazione: (2024)
di: Zou, Henry Peng, et al.
Pubblicazione: (2024)
Knowledge Circuits in Pretrained Transformers
di: Yao, Yunzhi, et al.
Pubblicazione: (2024)
di: Yao, Yunzhi, et al.
Pubblicazione: (2024)
WISE: Rethinking the Knowledge Memory for Lifelong Model Editing of Large Language Models
di: Wang, Peng, et al.
Pubblicazione: (2024)
di: Wang, Peng, et al.
Pubblicazione: (2024)
Retrieval-augmented Prompt Learning for Pre-trained Foundation Models
di: Chen, Xiang, et al.
Pubblicazione: (2025)
di: Chen, Xiang, et al.
Pubblicazione: (2025)
Evaluation of Embedding-Based and Generative Methods for LLM-Driven Document Classification: Opportunities and Challenges
di: Lu, Rong, et al.
Pubblicazione: (2026)
di: Lu, Rong, et al.
Pubblicazione: (2026)
FactCHD: Benchmarking Fact-Conflicting Hallucination Detection
di: Chen, Xiang, et al.
Pubblicazione: (2023)
di: Chen, Xiang, et al.
Pubblicazione: (2023)
CaKE: Circuit-aware Editing Enables Generalizable Knowledge Learners
di: Yao, Yunzhi, et al.
Pubblicazione: (2025)
di: Yao, Yunzhi, et al.
Pubblicazione: (2025)
Utility-Oriented Visual Evidence Selection for Multimodal Retrieval-Augmented Generation
di: Luo, Weiqing, et al.
Pubblicazione: (2026)
di: Luo, Weiqing, et al.
Pubblicazione: (2026)
ADAM: A Diverse Archive of Mankind for Evaluating and Enhancing LLMs in Biographical Reasoning
di: Cekinmez, Jasin, et al.
Pubblicazione: (2025)
di: Cekinmez, Jasin, et al.
Pubblicazione: (2025)
EasyEdit: An Easy-to-use Knowledge Editing Framework for Large Language Models
di: Wang, Peng, et al.
Pubblicazione: (2023)
di: Wang, Peng, et al.
Pubblicazione: (2023)
Documenti analoghi
-
Exploring Curriculum Learning for Vision-Language Tasks: A Study on Small-Scale Multimodal Training
di: Saha, Rohan, et al.
Pubblicazione: (2024) -
Closing the Modality Gap for Mixed Modality Search
di: Li, Binxu, et al.
Pubblicazione: (2025) -
Finding Shared Decodable Concepts and their Negations in the Brain
di: Efird, Cory, et al.
Pubblicazione: (2024) -
Multimedia-Aware Question Answering: A Review of Retrieval and Cross-Modal Reasoning Architectures
di: Raja, Rahul, et al.
Pubblicazione: (2025) -
Generalized Contrastive Learning for Multi-Modal Retrieval and Ranking
di: Zhu, Tianyu, et al.
Pubblicazione: (2024)