Multi-Modal Adapter for Vision-Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Seputis, Dominykas, Mihailov, Serghei, Chatterjee, Soham, Xiao, Zehao |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
RMAdapter: Reconstruction-based Multi-Modal Adapter for Vision-Language Models
von: Lin, Xiang, et al.
Veröffentlicht: (2025)
von: Lin, Xiang, et al.
Veröffentlicht: (2025)
Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models
von: Huang, Chengyue, et al.
Veröffentlicht: (2025)
von: Huang, Chengyue, et al.
Veröffentlicht: (2025)
Feedback-based Modal Mutual Search for Attacking Vision-Language Pre-training Models
von: Ding, Renhua, et al.
Veröffentlicht: (2024)
von: Ding, Renhua, et al.
Veröffentlicht: (2024)
Anomaly-Aware Vision-Language Adapters for Zero-Shot Anomaly Detection
von: Aqeel, Muhammad, et al.
Veröffentlicht: (2026)
von: Aqeel, Muhammad, et al.
Veröffentlicht: (2026)
AdapterTune: Zero-Initialized Low-Rank Adapters for Frozen Vision Transformers
von: Khazem, Salim
Veröffentlicht: (2026)
von: Khazem, Salim
Veröffentlicht: (2026)
Jailbreaking Vision-Language Models Through the Visual Modality
von: Azulay, Aharon, et al.
Veröffentlicht: (2026)
von: Azulay, Aharon, et al.
Veröffentlicht: (2026)
ATLAS: Adapter-Based Multi-Modal Continual Learning with a Two-Stage Learning Strategy
von: Li, Hong, et al.
Veröffentlicht: (2024)
von: Li, Hong, et al.
Veröffentlicht: (2024)
FedPIA -- Permuting and Integrating Adapters leveraging Wasserstein Barycenters for Finetuning Foundation Models in Multi-Modal Federated Learning
von: Saha, Pramit, et al.
Veröffentlicht: (2024)
von: Saha, Pramit, et al.
Veröffentlicht: (2024)
Hyperspectral Adapter for Semantic Segmentation with Vision Foundation Models
von: Hurtado, Juana Valeria, et al.
Veröffentlicht: (2025)
von: Hurtado, Juana Valeria, et al.
Veröffentlicht: (2025)
Prismer: A Vision-Language Model with Multi-Task Experts
von: Liu, Shikun, et al.
Veröffentlicht: (2023)
von: Liu, Shikun, et al.
Veröffentlicht: (2023)
Post-pre-training for Modality Alignment in Vision-Language Foundation Models
von: Yamaguchi, Shin'ya, et al.
Veröffentlicht: (2025)
von: Yamaguchi, Shin'ya, et al.
Veröffentlicht: (2025)
VLSM-Adapter: Finetuning Vision-Language Segmentation Efficiently with Lightweight Blocks
von: Dhakal, Manish, et al.
Veröffentlicht: (2024)
von: Dhakal, Manish, et al.
Veröffentlicht: (2024)
ChatGPT Encounters Morphing Attack Detection: Zero-Shot MAD with Multi-Modal Large Language Models and General Vision Models
von: Zhang, Haoyu, et al.
Veröffentlicht: (2025)
von: Zhang, Haoyu, et al.
Veröffentlicht: (2025)
TinyAlign: Boosting Lightweight Vision-Language Models by Mitigating Modal Alignment Bottlenecks
von: Hu, Yuanze, et al.
Veröffentlicht: (2025)
von: Hu, Yuanze, et al.
Veröffentlicht: (2025)
Enhancing Visual-Language Modality Alignment in Large Vision Language Models via Self-Improvement
von: Wang, Xiyao, et al.
Veröffentlicht: (2024)
von: Wang, Xiyao, et al.
Veröffentlicht: (2024)
Visual Modality Prompt for Adapting Vision-Language Object Detectors
von: Medeiros, Heitor R., et al.
Veröffentlicht: (2024)
von: Medeiros, Heitor R., et al.
Veröffentlicht: (2024)
COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training
von: Kim, Sanghwan, et al.
Veröffentlicht: (2024)
von: Kim, Sanghwan, et al.
Veröffentlicht: (2024)
Robust Pre-Training of Medical Vision-and-Language Models with Domain-Invariant Multi-Modal Masked Reconstruction
von: Filvantorkaman, Melika, et al.
Veröffentlicht: (2026)
von: Filvantorkaman, Melika, et al.
Veröffentlicht: (2026)
From Pixels to Prose: Advancing Multi-Modal Language Models for Remote Sensing
von: Sun, Xintian, et al.
Veröffentlicht: (2024)
von: Sun, Xintian, et al.
Veröffentlicht: (2024)
Reasoning Dynamics and the Limits of Monitoring Modality Reliance in Vision-Language Models
von: Villegas, Danae Sánchez, et al.
Veröffentlicht: (2026)
von: Villegas, Danae Sánchez, et al.
Veröffentlicht: (2026)
PRIMA: Multi-Image Vision-Language Models for Reasoning Segmentation
von: Wahed, Muntasir, et al.
Veröffentlicht: (2024)
von: Wahed, Muntasir, et al.
Veröffentlicht: (2024)
Cross-Modal Adapter for Vision-Language Retrieval
von: Jiang, Haojun, et al.
Veröffentlicht: (2022)
von: Jiang, Haojun, et al.
Veröffentlicht: (2022)
How Do Vision-Language Models Process Conflicting Information Across Modalities?
von: Hua, Tianze, et al.
Veröffentlicht: (2025)
von: Hua, Tianze, et al.
Veröffentlicht: (2025)
Hierarchical Network Fusion for Multi-Modal Electron Micrograph Representation Learning with Foundational Large Language Models
von: Srinivas, Sakhinana Sagar, et al.
Veröffentlicht: (2024)
von: Srinivas, Sakhinana Sagar, et al.
Veröffentlicht: (2024)
Beyond Generation: Multi-Hop Reasoning for Factual Accuracy in Vision-Language Models
von: Hossain, Shamima
Veröffentlicht: (2025)
von: Hossain, Shamima
Veröffentlicht: (2025)
4M-21: An Any-to-Any Vision Model for Tens of Tasks and Modalities
von: Bachmann, Roman, et al.
Veröffentlicht: (2024)
von: Bachmann, Roman, et al.
Veröffentlicht: (2024)
The Synergy between Data and Multi-Modal Large Language Models: A Survey from Co-Development Perspective
von: Qin, Zhen, et al.
Veröffentlicht: (2024)
von: Qin, Zhen, et al.
Veröffentlicht: (2024)
FastVLM: Efficient Vision Encoding for Vision Language Models
von: Vasu, Pavan Kumar Anasosalu, et al.
Veröffentlicht: (2024)
von: Vasu, Pavan Kumar Anasosalu, et al.
Veröffentlicht: (2024)
Diagnosing and Mitigating Modality Interference in Multimodal Large Language Models
von: Cai, Rui, et al.
Veröffentlicht: (2025)
von: Cai, Rui, et al.
Veröffentlicht: (2025)
pFedMMA: Personalized Federated Fine-Tuning with Multi-Modal Adapter for Vision-Language Models
von: Ghiasvand, Sajjad, et al.
Veröffentlicht: (2025)
von: Ghiasvand, Sajjad, et al.
Veröffentlicht: (2025)
FedDiff: Diffusion Model Driven Federated Learning for Multi-Modal and Multi-Clients
von: Li, DaiXun, et al.
Veröffentlicht: (2023)
von: Li, DaiXun, et al.
Veröffentlicht: (2023)
Programmatic Video Prediction Using Large Language Models
von: Tang, Hao, et al.
Veröffentlicht: (2025)
von: Tang, Hao, et al.
Veröffentlicht: (2025)
Mitigating Object Hallucinations in Vision-Language Models through Region-Aware Attention Recalibration
von: Xu, Yuanzhi, et al.
Veröffentlicht: (2026)
von: Xu, Yuanzhi, et al.
Veröffentlicht: (2026)
A Retrospect to Multi-prompt Learning across Vision and Language
von: Chen, Ziliang, et al.
Veröffentlicht: (2025)
von: Chen, Ziliang, et al.
Veröffentlicht: (2025)
IDEA: Image Description Enhanced CLIP-Adapter
von: Ye, Zhipeng, et al.
Veröffentlicht: (2025)
von: Ye, Zhipeng, et al.
Veröffentlicht: (2025)
Adapting Vision-Language Models for Evaluating World Models
von: Hendriksen, Mariya, et al.
Veröffentlicht: (2025)
von: Hendriksen, Mariya, et al.
Veröffentlicht: (2025)
Ctrl-Adapter: An Efficient and Versatile Framework for Adapting Diverse Controls to Any Diffusion Model
von: Lin, Han, et al.
Veröffentlicht: (2024)
von: Lin, Han, et al.
Veröffentlicht: (2024)
Urban Waterlogging Detection: A Challenging Benchmark and Large-Small Model Co-Adapter
von: Song, Suqi, et al.
Veröffentlicht: (2024)
von: Song, Suqi, et al.
Veröffentlicht: (2024)
One-Dimensional Adapter to Rule Them All: Concepts, Diffusion Models and Erasing Applications
von: Lyu, Mengyao, et al.
Veröffentlicht: (2023)
von: Lyu, Mengyao, et al.
Veröffentlicht: (2023)
Drive My Way: Preference Alignment of Vision-Language-Action Model for Personalized Driving
von: Wang, Zehao, et al.
Veröffentlicht: (2026)
von: Wang, Zehao, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
RMAdapter: Reconstruction-based Multi-Modal Adapter for Vision-Language Models
von: Lin, Xiang, et al.
Veröffentlicht: (2025) -
Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models
von: Huang, Chengyue, et al.
Veröffentlicht: (2025) -
Feedback-based Modal Mutual Search for Attacking Vision-Language Pre-training Models
von: Ding, Renhua, et al.
Veröffentlicht: (2024) -
Anomaly-Aware Vision-Language Adapters for Zero-Shot Anomaly Detection
von: Aqeel, Muhammad, et al.
Veröffentlicht: (2026) -
AdapterTune: Zero-Initialized Low-Rank Adapters for Frozen Vision Transformers
von: Khazem, Salim
Veröffentlicht: (2026)