Cross-Modal Adapter: Parameter-Efficient Transfer Learning Approach for Vision-Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Yang, Juncheng, Li, Zuchao, Xie, Shuai, Zhu, Weiping, Yu, Wei, Li, Shijun |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
DSDRNet: Disentangling Representation and Reconstruct Network for Domain Generalization
por: Yang, Juncheng, et al.
Publicado: (2024)
por: Yang, Juncheng, et al.
Publicado: (2024)
Centroid-centered Modeling for Efficient Vision Transformer Pre-training
por: Yan, Xin, et al.
Publicado: (2023)
por: Yan, Xin, et al.
Publicado: (2023)
Conv-Adapter: Exploring Parameter Efficient Transfer Learning for ConvNets
por: Chen, Hao, et al.
Publicado: (2022)
por: Chen, Hao, et al.
Publicado: (2022)
Cross-Modal Adapter for Vision-Language Retrieval
por: Jiang, Haojun, et al.
Publicado: (2022)
por: Jiang, Haojun, et al.
Publicado: (2022)
Dynamic Adapter Meets Prompt Tuning: Parameter-Efficient Transfer Learning for Point Cloud Analysis
por: Zhou, Xin, et al.
Publicado: (2024)
por: Zhou, Xin, et al.
Publicado: (2024)
Simulated Ensemble Attack: Transferring Jailbreaks Across Fine-tuned Vision-Language Models
por: Wang, Ruofan, et al.
Publicado: (2025)
por: Wang, Ruofan, et al.
Publicado: (2025)
HeGraphAdapter: Tuning Multi-Modal Vision-Language Models with Heterogeneous Graph Adapter
por: Zhao, Yumiao, et al.
Publicado: (2024)
por: Zhao, Yumiao, et al.
Publicado: (2024)
Multi-Modal Adapter for Vision-Language Models
por: Seputis, Dominykas, et al.
Publicado: (2024)
por: Seputis, Dominykas, et al.
Publicado: (2024)
CLIP-Adapter: Better Vision-Language Models with Feature Adapters
por: Gao, Peng, et al.
Publicado: (2021)
por: Gao, Peng, et al.
Publicado: (2021)
Learning Modality Knowledge Alignment for Cross-Modality Transfer
por: Ma, Wenxuan, et al.
Publicado: (2024)
por: Ma, Wenxuan, et al.
Publicado: (2024)
Adapter-X: A Novel General Parameter-Efficient Fine-Tuning Framework for Vision
por: Li, Minglei, et al.
Publicado: (2024)
por: Li, Minglei, et al.
Publicado: (2024)
Cross-Modal Safety Mechanism Transfer in Large Vision-Language Models
por: Xu, Shicheng, et al.
Publicado: (2024)
por: Xu, Shicheng, et al.
Publicado: (2024)
READ: Recurrent Adapter with Partial Video-Language Alignment for Parameter-Efficient Transfer Learning in Low-Resource Video-Language Modeling
por: Nguyen, Thong, et al.
Publicado: (2023)
por: Nguyen, Thong, et al.
Publicado: (2023)
DIMoE-Adapters: Dynamic Expert Evolution for Continual Learning in Vision-Language Models
por: Qin, Mengxin, et al.
Publicado: (2026)
por: Qin, Mengxin, et al.
Publicado: (2026)
Q-CLIP: Unleashing the Power of Vision-Language Models for Video Quality Assessment through Unified Cross-Modal Adaptation
por: Mi, Yachun, et al.
Publicado: (2025)
por: Mi, Yachun, et al.
Publicado: (2025)
MindAdapter: Few-Shot Parameter-Efficient Residual Calibration of Cross-Subject Brain-to-Visual Decoding Models
por: Liu, Jiaxiang, et al.
Publicado: (2026)
por: Liu, Jiaxiang, et al.
Publicado: (2026)
RMAdapter: Reconstruction-based Multi-Modal Adapter for Vision-Language Models
por: Lin, Xiang, et al.
Publicado: (2025)
por: Lin, Xiang, et al.
Publicado: (2025)
Mixture of Physical Priors Adapter for Parameter-Efficient Fine-Tuning
por: Wang, Zhaozhi, et al.
Publicado: (2024)
por: Wang, Zhaozhi, et al.
Publicado: (2024)
Distilling Vision-Language Pretraining for Efficient Cross-Modal Retrieval
por: Jang, Young Kyun, et al.
Publicado: (2024)
por: Jang, Young Kyun, et al.
Publicado: (2024)
Boosting Continual Learning of Vision-Language Models via Mixture-of-Experts Adapters
por: Yu, Jiazuo, et al.
Publicado: (2024)
por: Yu, Jiazuo, et al.
Publicado: (2024)
VLM-UQBench: A Benchmark for Modality-Specific and Cross-Modality Uncertainties in Vision Language Models
por: Wang, Chenyu, et al.
Publicado: (2026)
por: Wang, Chenyu, et al.
Publicado: (2026)
MGIMM: Multi-Granularity Instruction Multimodal Model for Attribute-Guided Remote Sensing Image Detailed Description
por: Yang, Cong, et al.
Publicado: (2024)
por: Yang, Cong, et al.
Publicado: (2024)
CMAL: A Novel Cross-Modal Associative Learning Framework for Vision-Language Pre-Training
por: Ma, Zhiyuan, et al.
Publicado: (2024)
por: Ma, Zhiyuan, et al.
Publicado: (2024)
Sparse-Dense Mixture of Experts Adapter for Multi-Modal Tracking
por: Zhu, Yabin, et al.
Publicado: (2026)
por: Zhu, Yabin, et al.
Publicado: (2026)
ConsensusDrop: Fusing Visual and Cross-Modal Saliency for Efficient Vision Language Models
por: Parikh, Dhruv, et al.
Publicado: (2026)
por: Parikh, Dhruv, et al.
Publicado: (2026)
Federated Cross-Modal Retrieval with Missing Modalities via Semantic Routing and Adapter Personalization
por: Zhou, Hefeng, et al.
Publicado: (2026)
por: Zhou, Hefeng, et al.
Publicado: (2026)
CROME: Cross-Modal Adapters for Efficient Multimodal LLM
por: Ebrahimi, Sayna, et al.
Publicado: (2024)
por: Ebrahimi, Sayna, et al.
Publicado: (2024)
Firebolt-VL: Efficient Vision-Language Understanding with Cross-Modality Modulation
por: Trinh, Quoc-Huy, et al.
Publicado: (2026)
por: Trinh, Quoc-Huy, et al.
Publicado: (2026)
RelationAdapter: Learning and Transferring Visual Relation with Diffusion Transformers
por: Gong, Yan, et al.
Publicado: (2025)
por: Gong, Yan, et al.
Publicado: (2025)
OmniVLM: A Token-Compressed, Sub-Billion-Parameter Vision-Language Model for Efficient On-Device Inference
por: Chen, Wei, et al.
Publicado: (2024)
por: Chen, Wei, et al.
Publicado: (2024)
Mind the Interference: Retaining Pre-trained Knowledge in Parameter Efficient Continual Learning of Vision-Language Models
por: Tang, Longxiang, et al.
Publicado: (2024)
por: Tang, Longxiang, et al.
Publicado: (2024)
Skip Tuning: Pre-trained Vision-Language Models are Effective and Efficient Adapters Themselves
por: Wu, Shihan, et al.
Publicado: (2024)
por: Wu, Shihan, et al.
Publicado: (2024)
EEPNet-V2: Patch-to-Pixel Solution for Efficient Cross-Modal Registration between LiDAR Point Cloud and Camera Image
por: Yue, Yuanchao, et al.
Publicado: (2025)
por: Yue, Yuanchao, et al.
Publicado: (2025)
LM4LV: A Frozen Large Language Model for Low-level Vision Tasks
por: Zheng, Boyang, et al.
Publicado: (2024)
por: Zheng, Boyang, et al.
Publicado: (2024)
An Empirical Study of Parameter Efficient Fine-tuning on Vision-Language Pre-train Model
por: Tian, Yuxin, et al.
Publicado: (2024)
por: Tian, Yuxin, et al.
Publicado: (2024)
Cross-Modal Attention Guided Unlearning in Vision-Language Models
por: Bhaila, Karuna, et al.
Publicado: (2025)
por: Bhaila, Karuna, et al.
Publicado: (2025)
Cross-Modal Consistency Learning for Sign Language Recognition
por: Wu, Kepeng, et al.
Publicado: (2025)
por: Wu, Kepeng, et al.
Publicado: (2025)
A Parameter-Efficient Mixture-of-Experts Framework for Cross-Modal Geo-Localization
por: Li, LinFeng, et al.
Publicado: (2025)
por: Li, LinFeng, et al.
Publicado: (2025)
Beyond CLIP Generalization: Against Forward&Backward Forgetting Adapter for Continual Learning of Vision-Language Models
por: Dong, Songlin, et al.
Publicado: (2025)
por: Dong, Songlin, et al.
Publicado: (2025)
ToVE: Efficient Vision-Language Learning via Knowledge Transfer from Vision Experts
por: Wu, Yuanchen, et al.
Publicado: (2025)
por: Wu, Yuanchen, et al.
Publicado: (2025)
Ejemplares similares
-
DSDRNet: Disentangling Representation and Reconstruct Network for Domain Generalization
por: Yang, Juncheng, et al.
Publicado: (2024) -
Centroid-centered Modeling for Efficient Vision Transformer Pre-training
por: Yan, Xin, et al.
Publicado: (2023) -
Conv-Adapter: Exploring Parameter Efficient Transfer Learning for ConvNets
por: Chen, Hao, et al.
Publicado: (2022) -
Cross-Modal Adapter for Vision-Language Retrieval
por: Jiang, Haojun, et al.
Publicado: (2022) -
Dynamic Adapter Meets Prompt Tuning: Parameter-Efficient Transfer Learning for Point Cloud Analysis
por: Zhou, Xin, et al.
Publicado: (2024)