CLIP-Adapter: Better Vision-Language Models with Feature Adapters
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Gao, Peng, Geng, Shijie, Zhang, Renrui, Ma, Teli, Fang, Rongyao, Zhang, Yongfeng, Li, Hongsheng, Qiao, Yu |
|---|---|
| Format: | Preprint |
| Publié: |
2021
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
LLaMA-Adapter: Efficient Fine-tuning of Language Models with Zero-init Attention
par: Zhang, Renrui, et autres
Publié: (2023)
par: Zhang, Renrui, et autres
Publié: (2023)
Cross-Modal Adapter for Vision-Language Retrieval
par: Jiang, Haojun, et autres
Publié: (2022)
par: Jiang, Haojun, et autres
Publié: (2022)
NODE-Adapter: Neural Ordinary Differential Equations for Better Vision-Language Reasoning
par: Zhang, Yi, et autres
Publié: (2024)
par: Zhang, Yi, et autres
Publié: (2024)
An Examination of the Compositionality of Large Generative Vision-Language Models
par: Ma, Teli, et autres
Publié: (2023)
par: Ma, Teli, et autres
Publié: (2023)
ArtGPT-4: Towards Artistic-understanding Large Vision-Language Models with Enhanced Adapter
par: Yuan, Zhengqing, et autres
Publié: (2023)
par: Yuan, Zhengqing, et autres
Publié: (2023)
LLMVA-GEBC: Large Language Model with Video Adapter for Generic Event Boundary Captioning
par: Tang, Yolo Yunlong, et autres
Publié: (2023)
par: Tang, Yolo Yunlong, et autres
Publié: (2023)
VLSM-Adapter: Finetuning Vision-Language Segmentation Efficiently with Lightweight Blocks
par: Dhakal, Manish, et autres
Publié: (2024)
par: Dhakal, Manish, et autres
Publié: (2024)
T-Gated Adapter: A Lightweight Temporal Adapter for Vision-Language Medical Segmentation
par: Khadka, Pranjal
Publié: (2026)
par: Khadka, Pranjal
Publié: (2026)
PEA-Diffusion: Parameter-Efficient Adapter with Knowledge Distillation in non-English Text-to-Image Generation
par: Ma, Jian, et autres
Publié: (2023)
par: Ma, Jian, et autres
Publié: (2023)
SOLVE: Synergy of Language-Vision and End-to-End Networks for Autonomous Driving
par: Chen, Xuesong, et autres
Publié: (2025)
par: Chen, Xuesong, et autres
Publié: (2025)
HiMo-CLIP: Modeling Semantic Hierarchy and Monotonicity in Vision-Language Alignment
par: Wu, Ruijia, et autres
Publié: (2025)
par: Wu, Ruijia, et autres
Publié: (2025)
LLMs Meet Long Video: Advancing Long Video Question Answering with An Interactive Visual Adapter in LLMs
par: Li, Yunxin, et autres
Publié: (2024)
par: Li, Yunxin, et autres
Publié: (2024)
Beyond CLIP Generalization: Against Forward&Backward Forgetting Adapter for Continual Learning of Vision-Language Models
par: Dong, Songlin, et autres
Publié: (2025)
par: Dong, Songlin, et autres
Publié: (2025)
Dynamic Adapter with Semantics Disentangling for Cross-lingual Cross-modal Retrieval
par: Cai, Rui, et autres
Publié: (2024)
par: Cai, Rui, et autres
Publié: (2024)
Robust Calibration of Large Vision-Language Adapters
par: Murugesan, Balamurali, et autres
Publié: (2024)
par: Murugesan, Balamurali, et autres
Publié: (2024)
ViDA: Homeostatic Visual Domain Adapter for Continual Test Time Adaptation
par: Liu, Jiaming, et autres
Publié: (2023)
par: Liu, Jiaming, et autres
Publié: (2023)
SPHINX-X: Scaling Data and Parameters for a Family of Multi-modal Large Language Models
par: Liu, Dongyang, et autres
Publié: (2024)
par: Liu, Dongyang, et autres
Publié: (2024)
PromptTA: Prompt-driven Text Adapter for Source-free Domain Generalization
par: Zhang, Haoran, et autres
Publié: (2024)
par: Zhang, Haoran, et autres
Publié: (2024)
READ: Recurrent Adapter with Partial Video-Language Alignment for Parameter-Efficient Transfer Learning in Low-Resource Video-Language Modeling
par: Nguyen, Thong, et autres
Publié: (2023)
par: Nguyen, Thong, et autres
Publié: (2023)
CROME: Cross-Modal Adapters for Efficient Multimodal LLM
par: Ebrahimi, Sayna, et autres
Publié: (2024)
par: Ebrahimi, Sayna, et autres
Publié: (2024)
TripletCLIP: Improving Compositional Reasoning of CLIP via Synthetic Vision-Language Negatives
par: Patel, Maitreya, et autres
Publié: (2024)
par: Patel, Maitreya, et autres
Publié: (2024)
LADA: Scalable Label-Specific CLIP Adapter for Continual Learning
par: Luo, Mao-Lin, et autres
Publié: (2025)
par: Luo, Mao-Lin, et autres
Publié: (2025)
Boosting Continual Learning of Vision-Language Models via Mixture-of-Experts Adapters
par: Yu, Jiazuo, et autres
Publié: (2024)
par: Yu, Jiazuo, et autres
Publié: (2024)
Skip Tuning: Pre-trained Vision-Language Models are Effective and Efficient Adapters Themselves
par: Wu, Shihan, et autres
Publié: (2024)
par: Wu, Shihan, et autres
Publié: (2024)
HeGraphAdapter: Tuning Multi-Modal Vision-Language Models with Heterogeneous Graph Adapter
par: Zhao, Yumiao, et autres
Publié: (2024)
par: Zhao, Yumiao, et autres
Publié: (2024)
I2V-Adapter: A General Image-to-Video Adapter for Diffusion Models
par: Guo, Xun, et autres
Publié: (2023)
par: Guo, Xun, et autres
Publié: (2023)
Q-Adapter: Visual Query Adapter for Extracting Textually-related Features in Video Captioning
par: Chen, Junan, et autres
Publié: (2025)
par: Chen, Junan, et autres
Publié: (2025)
VScan: Rethinking Visual Token Reduction for Efficient Large Vision-Language Models
par: Zhang, Ce, et autres
Publié: (2025)
par: Zhang, Ce, et autres
Publié: (2025)
DraCo: Draft as CoT for Text-to-Image Preview and Rare Concept Generation
par: Jiang, Dongzhi, et autres
Publié: (2025)
par: Jiang, Dongzhi, et autres
Publié: (2025)
Know "No" Better: A Data-Driven Approach for Enhancing Negation Awareness in CLIP
par: Park, Junsung, et autres
Publié: (2025)
par: Park, Junsung, et autres
Publié: (2025)
TransAdapter: Vision Transformer for Feature-Centric Unsupervised Domain Adaptation
par: Doruk, A. Enes, et autres
Publié: (2024)
par: Doruk, A. Enes, et autres
Publié: (2024)
FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark
par: Fang, Rongyao, et autres
Publié: (2025)
par: Fang, Rongyao, et autres
Publié: (2025)
Inv-Adapter: ID Customization Generation via Image Inversion and Lightweight Adapter
par: Xing, Peng, et autres
Publié: (2024)
par: Xing, Peng, et autres
Publié: (2024)
MemLoRA: Distilling Expert Adapters for On-Device Memory Systems
par: Bini, Massimo, et autres
Publié: (2025)
par: Bini, Massimo, et autres
Publié: (2025)
UniCrossAdapter: Multimodal Adaptation of CLIP for Radiology Report Generation
par: Chen, Yaxiong, et autres
Publié: (2025)
par: Chen, Yaxiong, et autres
Publié: (2025)
NPHardEval4V: Dynamic Evaluation of Large Vision-Language Models with Effects of Vision
par: Li, Xiang, et autres
Publié: (2024)
par: Li, Xiang, et autres
Publié: (2024)
When Better Teachers Don't Make Better Students: Revisiting Knowledge Distillation for CLIP Models in VQA
par: Tuchinda, Pume, et autres
Publié: (2025)
par: Tuchinda, Pume, et autres
Publié: (2025)
Mema: Memory-Augmented Adapter for Enhanced Vision-Language Understanding
par: Liu, Ying, et autres
Publié: (2026)
par: Liu, Ying, et autres
Publié: (2026)
Test-time Alignment-Enhanced Adapter for Vision-Language Models
par: Tong, Baoshun, et autres
Publié: (2024)
par: Tong, Baoshun, et autres
Publié: (2024)
Leopard: A Vision Language Model For Text-Rich Multi-Image Tasks
par: Jia, Mengzhao, et autres
Publié: (2024)
par: Jia, Mengzhao, et autres
Publié: (2024)
Documents similaires
-
LLaMA-Adapter: Efficient Fine-tuning of Language Models with Zero-init Attention
par: Zhang, Renrui, et autres
Publié: (2023) -
Cross-Modal Adapter for Vision-Language Retrieval
par: Jiang, Haojun, et autres
Publié: (2022) -
NODE-Adapter: Neural Ordinary Differential Equations for Better Vision-Language Reasoning
par: Zhang, Yi, et autres
Publié: (2024) -
An Examination of the Compositionality of Large Generative Vision-Language Models
par: Ma, Teli, et autres
Publié: (2023) -
ArtGPT-4: Towards Artistic-understanding Large Vision-Language Models with Enhanced Adapter
par: Yuan, Zhengqing, et autres
Publié: (2023)