Selective Vision-Language Subspace Projection for Few-shot CLIP
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Zhu, Xingyu, Zhu, Beier, Tan, Yi, Wang, Shuo, Hao, Yanbin, Zhang, Hanwang |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Enhancing Zero-Shot Vision Models by Label-Free Prompt Distribution Learning and Bias Correcting
von: Zhu, Xingyu, et al.
Veröffentlicht: (2024)
von: Zhu, Xingyu, et al.
Veröffentlicht: (2024)
GuardAlign: Test-time Safety Alignment in Multimodal Large Language Models
von: Zhu, Xingyu, et al.
Veröffentlicht: (2026)
von: Zhu, Xingyu, et al.
Veröffentlicht: (2026)
Test-Time Adaptation with CLIP Reward for Zero-Shot Generalization in Vision-Language Models
von: Zhao, Shuai, et al.
Veröffentlicht: (2023)
von: Zhao, Shuai, et al.
Veröffentlicht: (2023)
Enhancing CLIP Robustness via Cross-Modality Alignment
von: Zhu, Xingyu, et al.
Veröffentlicht: (2025)
von: Zhu, Xingyu, et al.
Veröffentlicht: (2025)
Hand1000: Generating Realistic Hands from Text with Only 1,000 Images
von: Zhang, Haozhuo, et al.
Veröffentlicht: (2024)
von: Zhang, Haozhuo, et al.
Veröffentlicht: (2024)
Principled Steering via Null-space Projection for Jailbreak Defense in Vision-Language Models
von: Zhu, Xingyu, et al.
Veröffentlicht: (2026)
von: Zhu, Xingyu, et al.
Veröffentlicht: (2026)
TALDS-Net: Task-Aware Adaptive Local Descriptors Selection for Few-shot Image Classification
von: Qiao, Qian, et al.
Veröffentlicht: (2023)
von: Qiao, Qian, et al.
Veröffentlicht: (2023)
CLIP-PCQA: Exploring Subjective-Aligned Vision-Language Modeling for Point Cloud Quality Assessment
von: Liu, Yating, et al.
Veröffentlicht: (2025)
von: Liu, Yating, et al.
Veröffentlicht: (2025)
Pseudo-triplet Guided Few-shot Composed Image Retrieval
von: Hou, Bohan, et al.
Veröffentlicht: (2024)
von: Hou, Bohan, et al.
Veröffentlicht: (2024)
Accelerating Controllable Generation via Hybrid-grained Cache
von: Liu, Lin, et al.
Veröffentlicht: (2025)
von: Liu, Lin, et al.
Veröffentlicht: (2025)
A Simple Task-aware Contrastive Local Descriptor Selection Strategy for Few-shot Learning between inter class and intra class
von: Qiao, Qian, et al.
Veröffentlicht: (2024)
von: Qiao, Qian, et al.
Veröffentlicht: (2024)
GAIA: Zero-shot Talking Avatar Generation
von: He, Tianyu, et al.
Veröffentlicht: (2023)
von: He, Tianyu, et al.
Veröffentlicht: (2023)
Linguistics-Vision Monotonic Consistent Network for Sign Language Production
von: Wang, Xu, et al.
Veröffentlicht: (2024)
von: Wang, Xu, et al.
Veröffentlicht: (2024)
Regularizing Subspace Redundancy of Low-Rank Adaptation
von: Zhu, Yue, et al.
Veröffentlicht: (2025)
von: Zhu, Yue, et al.
Veröffentlicht: (2025)
Not Just What's There: Enabling CLIP to Comprehend Negated Visual Descriptions Without Fine-tuning
von: Xiao, Junhao, et al.
Veröffentlicht: (2026)
von: Xiao, Junhao, et al.
Veröffentlicht: (2026)
DuoTeach: Dual Role Self-Teaching for Coarse-to-Fine Decision Coordination in Vision--Language Models
von: Yang, Wei, et al.
Veröffentlicht: (2025)
von: Yang, Wei, et al.
Veröffentlicht: (2025)
Unified Generative and Discriminative Training for Multi-modal Large Language Models
von: Chow, Wei, et al.
Veröffentlicht: (2024)
von: Chow, Wei, et al.
Veröffentlicht: (2024)
Enhancing Interactive Image Retrieval With Query Rewriting Using Large Language Models and Vision Language Models
von: Zhu, Hongyi, et al.
Veröffentlicht: (2024)
von: Zhu, Hongyi, et al.
Veröffentlicht: (2024)
Robust Fine-tuning of Zero-shot Models via Variance Reduction
von: Zhu, Beier, et al.
Veröffentlicht: (2024)
von: Zhu, Beier, et al.
Veröffentlicht: (2024)
Look Carefully: Adaptive Visual Reinforcements in Multimodal Large Language Models for Hallucination Mitigation
von: Zhu, Xingyu, et al.
Veröffentlicht: (2026)
von: Zhu, Xingyu, et al.
Veröffentlicht: (2026)
Zero-shot image privacy classification with Vision-Language Models
von: Baia, Alina Elena, et al.
Veröffentlicht: (2025)
von: Baia, Alina Elena, et al.
Veröffentlicht: (2025)
OT-DETECTOR: Delving into Optimal Transport for Zero-shot Out-of-Distribution Detection
von: Liu, Yu, et al.
Veröffentlicht: (2025)
von: Liu, Yu, et al.
Veröffentlicht: (2025)
Do LLMs Understand Visual Anomalies? Uncovering LLM's Capabilities in Zero-shot Anomaly Detection
von: Zhu, Jiaqi, et al.
Veröffentlicht: (2024)
von: Zhu, Jiaqi, et al.
Veröffentlicht: (2024)
Logic Unseen: Revealing the Logical Blindspots of Vision-Language Models
von: Zhou, Yuchen, et al.
Veröffentlicht: (2025)
von: Zhou, Yuchen, et al.
Veröffentlicht: (2025)
Mitigating Image Captioning Hallucinations in Vision-Language Models
von: Zhao, Fei, et al.
Veröffentlicht: (2025)
von: Zhao, Fei, et al.
Veröffentlicht: (2025)
Unlearning the Noisy Correspondence Makes CLIP More Robust
von: Han, Haochen, et al.
Veröffentlicht: (2025)
von: Han, Haochen, et al.
Veröffentlicht: (2025)
CLIP Brings Better Features to Visual Aesthetics Learners
von: Xu, Liwu, et al.
Veröffentlicht: (2023)
von: Xu, Liwu, et al.
Veröffentlicht: (2023)
Modality Gap-Driven Subspace Alignment Training Paradigm For Multimodal Large Language Models
von: Yu, Xiaomin, et al.
Veröffentlicht: (2026)
von: Yu, Xiaomin, et al.
Veröffentlicht: (2026)
Pre-training CLIP against Data Poisoning with Optimal Transport-based Matching and Alignment
von: Zhang, Tong, et al.
Veröffentlicht: (2025)
von: Zhang, Tong, et al.
Veröffentlicht: (2025)
Dynamic Multimodal Prototype Learning in Vision-Language Models
von: Zhu, Xingyu, et al.
Veröffentlicht: (2025)
von: Zhu, Xingyu, et al.
Veröffentlicht: (2025)
PixCLIP: Achieving Fine-grained Visual Language Understanding via Any-granularity Pixel-Text Alignment Learning
von: Xiao, Yicheng, et al.
Veröffentlicht: (2025)
von: Xiao, Yicheng, et al.
Veröffentlicht: (2025)
VideoCLIP-XL: Advancing Long Description Understanding for Video CLIP Models
von: Wang, Jiapeng, et al.
Veröffentlicht: (2024)
von: Wang, Jiapeng, et al.
Veröffentlicht: (2024)
Rethinking Few-Shot Adaptation of Vision-Language Models in Two Stages
von: Farina, Matteo, et al.
Veröffentlicht: (2025)
von: Farina, Matteo, et al.
Veröffentlicht: (2025)
Unveiling Encoder-Free Vision-Language Models
von: Diao, Haiwen, et al.
Veröffentlicht: (2024)
von: Diao, Haiwen, et al.
Veröffentlicht: (2024)
LMM-Regularized CLIP Embeddings for Image Classification
von: Tzelepi, Maria, et al.
Veröffentlicht: (2024)
von: Tzelepi, Maria, et al.
Veröffentlicht: (2024)
Improving Multi-modal Large Language Model through Boosting Vision Capabilities
von: Sun, Yanpeng, et al.
Veröffentlicht: (2024)
von: Sun, Yanpeng, et al.
Veröffentlicht: (2024)
Cross-modal Proxy Evolving for OOD Detection with Vision-Language Models
von: Tang, Hao, et al.
Veröffentlicht: (2026)
von: Tang, Hao, et al.
Veröffentlicht: (2026)
Connecting Giants: Synergistic Knowledge Transfer of Large Multimodal Models for Few-Shot Learning
von: Tang, Hao, et al.
Veröffentlicht: (2025)
von: Tang, Hao, et al.
Veröffentlicht: (2025)
Cross-domain Few-shot In-context Learning for Enhancing Traffic Sign Recognition
von: Gan, Yaozong, et al.
Veröffentlicht: (2024)
von: Gan, Yaozong, et al.
Veröffentlicht: (2024)
Safe-CLIP: Removing NSFW Concepts from Vision-and-Language Models
von: Poppi, Samuele, et al.
Veröffentlicht: (2023)
von: Poppi, Samuele, et al.
Veröffentlicht: (2023)
Ähnliche Einträge
-
Enhancing Zero-Shot Vision Models by Label-Free Prompt Distribution Learning and Bias Correcting
von: Zhu, Xingyu, et al.
Veröffentlicht: (2024) -
GuardAlign: Test-time Safety Alignment in Multimodal Large Language Models
von: Zhu, Xingyu, et al.
Veröffentlicht: (2026) -
Test-Time Adaptation with CLIP Reward for Zero-Shot Generalization in Vision-Language Models
von: Zhao, Shuai, et al.
Veröffentlicht: (2023) -
Enhancing CLIP Robustness via Cross-Modality Alignment
von: Zhu, Xingyu, et al.
Veröffentlicht: (2025) -
Hand1000: Generating Realistic Hands from Text with Only 1,000 Images
von: Zhang, Haozhuo, et al.
Veröffentlicht: (2024)