Cross-Modal Adapter for Vision-Language Retrieval
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Jiang, Haojun, Zhang, Jianke, Huang, Rui, Ge, Chunjiang, Ni, Zanlin, Song, Shiji, Huang, Gao |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2022
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Everything to the Synthetic: Diffusion-driven Test-time Adaptation via Synthetic-Domain Alignment
von: Guo, Jiayi, et al.
Veröffentlicht: (2024)
von: Guo, Jiayi, et al.
Veröffentlicht: (2024)
VA-Adapter: Adapting Ultrasound Foundation Model to Echocardiography Probe Guidance
von: Wang, Teng, et al.
Veröffentlicht: (2025)
von: Wang, Teng, et al.
Veröffentlicht: (2025)
HopChain: Multi-Hop Data Synthesis for Generalizable Vision-Language Reasoning
von: Wang, Shenzhi, et al.
Veröffentlicht: (2026)
von: Wang, Shenzhi, et al.
Veröffentlicht: (2026)
Dynamic Adapter with Semantics Disentangling for Cross-lingual Cross-modal Retrieval
von: Cai, Rui, et al.
Veröffentlicht: (2024)
von: Cai, Rui, et al.
Veröffentlicht: (2024)
Revisiting Non-Autoregressive Transformers for Efficient Image Synthesis
von: Ni, Zanlin, et al.
Veröffentlicht: (2024)
von: Ni, Zanlin, et al.
Veröffentlicht: (2024)
CLIP-Adapter: Better Vision-Language Models with Feature Adapters
von: Gao, Peng, et al.
Veröffentlicht: (2021)
von: Gao, Peng, et al.
Veröffentlicht: (2021)
Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?
von: Yue, Yang, et al.
Veröffentlicht: (2025)
von: Yue, Yang, et al.
Veröffentlicht: (2025)
Cross-Modal Safety Mechanism Transfer in Large Vision-Language Models
von: Xu, Shicheng, et al.
Veröffentlicht: (2024)
von: Xu, Shicheng, et al.
Veröffentlicht: (2024)
COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training
von: Kim, Sanghwan, et al.
Veröffentlicht: (2024)
von: Kim, Sanghwan, et al.
Veröffentlicht: (2024)
LLaVA-UHD: an LMM Perceiving Any Aspect Ratio and High-Resolution Images
von: Xu, Ruyi, et al.
Veröffentlicht: (2024)
von: Xu, Ruyi, et al.
Veröffentlicht: (2024)
Deciphering Cross-Modal Alignment in Large Vision-Language Models with Modality Integration Rate
von: Huang, Qidong, et al.
Veröffentlicht: (2024)
von: Huang, Qidong, et al.
Veröffentlicht: (2024)
Emulating Human-like Adaptive Vision for Efficient and Flexible Machine Visual Perception
von: Wang, Yulin, et al.
Veröffentlicht: (2025)
von: Wang, Yulin, et al.
Veröffentlicht: (2025)
Federated Cross-Modal Retrieval with Missing Modalities via Semantic Routing and Adapter Personalization
von: Zhou, Hefeng, et al.
Veröffentlicht: (2026)
von: Zhou, Hefeng, et al.
Veröffentlicht: (2026)
Structure-aware World Model for Probe Guidance via Large-scale Self-supervised Pre-train
von: Jiang, Haojun, et al.
Veröffentlicht: (2024)
von: Jiang, Haojun, et al.
Veröffentlicht: (2024)
Cross-Modal Obfuscation for Jailbreak Attacks on Large Vision-Language Models
von: Jiang, Lei, et al.
Veröffentlicht: (2025)
von: Jiang, Lei, et al.
Veröffentlicht: (2025)
Demystify Mamba in Vision: A Linear Attention Perspective
von: Han, Dongchen, et al.
Veröffentlicht: (2024)
von: Han, Dongchen, et al.
Veröffentlicht: (2024)
VLR-Bench: Multilingual Benchmark Dataset for Vision-Language Retrieval Augmented Generation
von: Lim, Hyeonseok, et al.
Veröffentlicht: (2024)
von: Lim, Hyeonseok, et al.
Veröffentlicht: (2024)
Generative Cross-Modal Retrieval: Memorizing Images in Multimodal Language Models for Retrieval and Beyond
von: Li, Yongqi, et al.
Veröffentlicht: (2024)
von: Li, Yongqi, et al.
Veröffentlicht: (2024)
EchoWorld: Learning Motion-Aware World Models for Echocardiography Probe Guidance
von: Yue, Yang, et al.
Veröffentlicht: (2025)
von: Yue, Yang, et al.
Veröffentlicht: (2025)
CLAIM: Mitigating Multilingual Object Hallucination in Large Vision-Language Models with Cross-Lingual Attention Intervention
von: Ye, Zekai, et al.
Veröffentlicht: (2025)
von: Ye, Zekai, et al.
Veröffentlicht: (2025)
VLSM-Adapter: Finetuning Vision-Language Segmentation Efficiently with Lightweight Blocks
von: Dhakal, Manish, et al.
Veröffentlicht: (2024)
von: Dhakal, Manish, et al.
Veröffentlicht: (2024)
CROME: Cross-Modal Adapters for Efficient Multimodal LLM
von: Ebrahimi, Sayna, et al.
Veröffentlicht: (2024)
von: Ebrahimi, Sayna, et al.
Veröffentlicht: (2024)
Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models
von: Huang, Chengyue, et al.
Veröffentlicht: (2025)
von: Huang, Chengyue, et al.
Veröffentlicht: (2025)
HaploVL: A Single-Transformer Baseline for Multi-Modal Understanding
von: Yang, Rui, et al.
Veröffentlicht: (2025)
von: Yang, Rui, et al.
Veröffentlicht: (2025)
Multi-Modal Adapter for Vision-Language Models
von: Seputis, Dominykas, et al.
Veröffentlicht: (2024)
von: Seputis, Dominykas, et al.
Veröffentlicht: (2024)
Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval
von: Shen, Li-Cheng, et al.
Veröffentlicht: (2025)
von: Shen, Li-Cheng, et al.
Veröffentlicht: (2025)
Unraveling Cross-Modality Knowledge Conflicts in Large Vision-Language Models
von: Zhu, Tinghui, et al.
Veröffentlicht: (2024)
von: Zhu, Tinghui, et al.
Veröffentlicht: (2024)
Modality-Specialized Synergizers for Interleaved Vision-Language Generalists
von: Xu, Zhiyang, et al.
Veröffentlicht: (2024)
von: Xu, Zhiyang, et al.
Veröffentlicht: (2024)
Measuring Social Bias in Vision-Language Models with Face-Only Counterfactuals from Real Photos
von: Chen, Haodong, et al.
Veröffentlicht: (2026)
von: Chen, Haodong, et al.
Veröffentlicht: (2026)
RMAdapter: Reconstruction-based Multi-Modal Adapter for Vision-Language Models
von: Lin, Xiang, et al.
Veröffentlicht: (2025)
von: Lin, Xiang, et al.
Veröffentlicht: (2025)
Alleviating Hallucination in Large Vision-Language Models with Active Retrieval Augmentation
von: Qu, Xiaoye, et al.
Veröffentlicht: (2024)
von: Qu, Xiaoye, et al.
Veröffentlicht: (2024)
SPA-VL: A Comprehensive Safety Preference Alignment Dataset for Vision Language Model
von: Zhang, Yongting, et al.
Veröffentlicht: (2024)
von: Zhang, Yongting, et al.
Veröffentlicht: (2024)
Beyond Adapter Retrieval: Latent Geometry-Preserving Composition via Sparse Task Projection
von: Jin, Pengfei, et al.
Veröffentlicht: (2024)
von: Jin, Pengfei, et al.
Veröffentlicht: (2024)
Differentiable Prompt Learning for Vision Language Models
von: Huang, Zhenhan, et al.
Veröffentlicht: (2024)
von: Huang, Zhenhan, et al.
Veröffentlicht: (2024)
Bridging the Missing-Modality Gap: Improving Text-Only Calibration of Vision Language Models
von: Kim, Mingyeong, et al.
Veröffentlicht: (2026)
von: Kim, Mingyeong, et al.
Veröffentlicht: (2026)
Enhancing Visual-Language Modality Alignment in Large Vision Language Models via Self-Improvement
von: Wang, Xiyao, et al.
Veröffentlicht: (2024)
von: Wang, Xiyao, et al.
Veröffentlicht: (2024)
Cross-Cultural Value Awareness in Large Vision-Language Models
von: Howard, Phillip, et al.
Veröffentlicht: (2026)
von: Howard, Phillip, et al.
Veröffentlicht: (2026)
ViPER: Empowering the Self-Evolution of Visual Perception Abilities in Vision-Language Model
von: Zhang, Juntian, et al.
Veröffentlicht: (2025)
von: Zhang, Juntian, et al.
Veröffentlicht: (2025)
CODA: Repurposing Continuous VAEs for Discrete Tokenization
von: Liu, Zeyu, et al.
Veröffentlicht: (2025)
von: Liu, Zeyu, et al.
Veröffentlicht: (2025)
VLM2Vec: Training Vision-Language Models for Massive Multimodal Embedding Tasks
von: Jiang, Ziyan, et al.
Veröffentlicht: (2024)
von: Jiang, Ziyan, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Everything to the Synthetic: Diffusion-driven Test-time Adaptation via Synthetic-Domain Alignment
von: Guo, Jiayi, et al.
Veröffentlicht: (2024) -
VA-Adapter: Adapting Ultrasound Foundation Model to Echocardiography Probe Guidance
von: Wang, Teng, et al.
Veröffentlicht: (2025) -
HopChain: Multi-Hop Data Synthesis for Generalizable Vision-Language Reasoning
von: Wang, Shenzhi, et al.
Veröffentlicht: (2026) -
Dynamic Adapter with Semantics Disentangling for Cross-lingual Cross-modal Retrieval
von: Cai, Rui, et al.
Veröffentlicht: (2024) -
Revisiting Non-Autoregressive Transformers for Efficient Image Synthesis
von: Ni, Zanlin, et al.
Veröffentlicht: (2024)