Contrast-Aware Calibration for Fine-Tuned CLIP: Leveraging Image-Text Alignment
Fuente:
arXiv
Saved in:
| Main Authors: | Lv, Song-Lin, Chen, Yu-Yang, Zhou, Zhi, Li, Yu-Feng, Guo, Lan-Zhe |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Ultrasound-CLIP: Semantic-Aware Contrastive Pre-training for Ultrasound Image-Text Understanding
by: Jin, Jiayun, et al.
Published: (2026)
by: Jin, Jiayun, et al.
Published: (2026)
BMIP: Bi-directional Modality Interaction Prompt Learning for VLM
by: Lv, Song-Lin, et al.
Published: (2025)
by: Lv, Song-Lin, et al.
Published: (2025)
COHERENCE: Benchmarking Fine-Grained Image-Text Alignment in Interleaved Multimodal Contexts
by: Wang, Bingli, et al.
Published: (2026)
by: Wang, Bingli, et al.
Published: (2026)
Attention Calibration for Disentangled Text-to-Image Personalization
by: Zhang, Yanbing, et al.
Published: (2024)
by: Zhang, Yanbing, et al.
Published: (2024)
DeCoOp: Robust Prompt Tuning with Out-of-Distribution Detection
by: Zhou, Zhi, et al.
Published: (2024)
by: Zhou, Zhi, et al.
Published: (2024)
FastEdit: Fast Text-Guided Single-Image Editing via Semantic-Aware Diffusion Fine-Tuning
by: Chen, Zhi, et al.
Published: (2024)
by: Chen, Zhi, et al.
Published: (2024)
MoCLIP: Motion-Aware Fine-Tuning and Distillation of CLIP for Human Motion Generation
by: Maldonado, Gabriel, et al.
Published: (2025)
by: Maldonado, Gabriel, et al.
Published: (2025)
LAST: Leveraging Tools as Hints to Enhance Spatial Reasoning for Multimodal Large Language Models
by: Tian, Shi-Yu, et al.
Published: (2026)
by: Tian, Shi-Yu, et al.
Published: (2026)
Focus-N-Fix: Region-Aware Fine-Tuning for Text-to-Image Generation
by: Xing, Xiaoying, et al.
Published: (2025)
by: Xing, Xiaoying, et al.
Published: (2025)
$β$-CLIP: Text-Conditioned Contrastive Learning for Multi-Granular Vision-Language Alignment
by: Zohra, Fatimah, et al.
Published: (2025)
by: Zohra, Fatimah, et al.
Published: (2025)
You Only Submit One Image to Find the Most Suitable Generative Model
by: Zhou, Zhi, et al.
Published: (2024)
by: Zhou, Zhi, et al.
Published: (2024)
PixCLIP: Achieving Fine-grained Visual Language Understanding via Any-granularity Pixel-Text Alignment Learning
by: Xiao, Yicheng, et al.
Published: (2025)
by: Xiao, Yicheng, et al.
Published: (2025)
Extending CLIP's Image-Text Alignment to Referring Image Segmentation
by: Kim, Seoyeon, et al.
Published: (2023)
by: Kim, Seoyeon, et al.
Published: (2023)
Advancing Compositional Awareness in CLIP with Efficient Fine-Tuning
by: Peleg, Amit, et al.
Published: (2025)
by: Peleg, Amit, et al.
Published: (2025)
CalibCLIP: Contextual Calibration of Dominant Semantics for Text-Driven Image Retrieval
by: Kang, Bin, et al.
Published: (2025)
by: Kang, Bin, et al.
Published: (2025)
Fine-Tuning is Fine, if Calibrated
by: Mai, Zheda, et al.
Published: (2024)
by: Mai, Zheda, et al.
Published: (2024)
NeuroCLIP: Neuromorphic Data Understanding by CLIP and SNN
by: Guo, Yufei, et al.
Published: (2023)
by: Guo, Yufei, et al.
Published: (2023)
Omni-NegCLIP: Enhancing CLIP with Front-Layer Contrastive Fine-Tuning for Comprehensive Negation Understanding
by: Xu, Jingqi
Published: (2026)
by: Xu, Jingqi
Published: (2026)
CGI: Identifying Conditional Generative Models with Example Images
by: Zhou, Zhi, et al.
Published: (2025)
by: Zhou, Zhi, et al.
Published: (2025)
ComKD-CLIP: Comprehensive Knowledge Distillation for Contrastive Language-Image Pre-traning Model
by: Chen, Yifan, et al.
Published: (2024)
by: Chen, Yifan, et al.
Published: (2024)
HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models
by: Wei, Zhixiang, et al.
Published: (2025)
by: Wei, Zhixiang, et al.
Published: (2025)
LatteCLIP: Unsupervised CLIP Fine-Tuning via LMM-Synthetic Texts
by: Cao, Anh-Quan, et al.
Published: (2024)
by: Cao, Anh-Quan, et al.
Published: (2024)
ProCLIP: Progressive Vision-Language Alignment via LLM-based Embedder
by: Hu, Xiaoxing, et al.
Published: (2025)
by: Hu, Xiaoxing, et al.
Published: (2025)
PowerCLIP: Powerset Alignment for Contrastive Pre-Training
by: Kawamura, Masaki, et al.
Published: (2025)
by: Kawamura, Masaki, et al.
Published: (2025)
TTD: Text-Tag Self-Distillation Enhancing Image-Text Alignment in CLIP to Alleviate Single Tag Bias
by: Jo, Sanghyun, et al.
Published: (2024)
by: Jo, Sanghyun, et al.
Published: (2024)
DGTRSD & DGTRS-CLIP: A Dual-Granularity Remote Sensing Image-Text Dataset and Vision Language Foundation Model for Alignment
by: Chen, Weizhi, et al.
Published: (2025)
by: Chen, Weizhi, et al.
Published: (2025)
Detecting Deepfakes with Multivariate Soft Blending and CLIP-based Image-Text Alignment
by: Li, Jingwei, et al.
Published: (2026)
by: Li, Jingwei, et al.
Published: (2026)
Mixed Text Recognition with Efficient Parameter Fine-Tuning and Transformer
by: Chang, Da, et al.
Published: (2024)
by: Chang, Da, et al.
Published: (2024)
CLIP-FTI: Fine-Grained Face Template Inversion via CLIP-Driven Attribute Conditioning
by: Dai, Longchen, et al.
Published: (2025)
by: Dai, Longchen, et al.
Published: (2025)
Enhancing Multimodal Understanding with CLIP-Based Image-to-Text Transformation
by: Che, Chang, et al.
Published: (2024)
by: Che, Chang, et al.
Published: (2024)
KETA: Kinematic-Phrases-Enhanced Text-to-Motion Generation via Fine-grained Alignment
by: Jiang, Yu, et al.
Published: (2025)
by: Jiang, Yu, et al.
Published: (2025)
VAR-CLIP: Text-to-Image Generator with Visual Auto-Regressive Modeling
by: Zhang, Qian, et al.
Published: (2024)
by: Zhang, Qian, et al.
Published: (2024)
WP-CLIP: Leveraging CLIP to Predict Wölfflin's Principles in Visual Art
by: Ghildyal, Abhijay, et al.
Published: (2025)
by: Ghildyal, Abhijay, et al.
Published: (2025)
Fine-Grained Spatiotemporal Motion Alignment for Contrastive Video Representation Learning
by: Zhu, Minghao, et al.
Published: (2023)
by: Zhu, Minghao, et al.
Published: (2023)
Leveraging CLIP Encoder for Multimodal Emotion Recognition
by: Song, Yehun, et al.
Published: (2025)
by: Song, Yehun, et al.
Published: (2025)
Towards Calibrated Robust Fine-Tuning of Vision-Language Models
by: Oh, Changdae, et al.
Published: (2023)
by: Oh, Changdae, et al.
Published: (2023)
Leveraging Text Localization for Scene Text Removal via Text-aware Masked Image Modeling
by: Wang, Zixiao, et al.
Published: (2024)
by: Wang, Zixiao, et al.
Published: (2024)
EntityCLIP: Entity-Centric Image-Text Matching via Multimodal Attentive Contrastive Learning
by: Wang, Yaxiong, et al.
Published: (2024)
by: Wang, Yaxiong, et al.
Published: (2024)
TalkCLIP: Talking Head Generation with Text-Guided Expressive Speaking Styles
by: Ma, Yifeng, et al.
Published: (2023)
by: Ma, Yifeng, et al.
Published: (2023)
Mesh-RFT: Enhancing Mesh Generation via Fine-grained Reinforcement Fine-Tuning
by: Liu, Jian, et al.
Published: (2025)
by: Liu, Jian, et al.
Published: (2025)
Similar Items
-
Ultrasound-CLIP: Semantic-Aware Contrastive Pre-training for Ultrasound Image-Text Understanding
by: Jin, Jiayun, et al.
Published: (2026) -
BMIP: Bi-directional Modality Interaction Prompt Learning for VLM
by: Lv, Song-Lin, et al.
Published: (2025) -
COHERENCE: Benchmarking Fine-Grained Image-Text Alignment in Interleaved Multimodal Contexts
by: Wang, Bingli, et al.
Published: (2026) -
Attention Calibration for Disentangled Text-to-Image Personalization
by: Zhang, Yanbing, et al.
Published: (2024) -
DeCoOp: Robust Prompt Tuning with Out-of-Distribution Detection
by: Zhou, Zhi, et al.
Published: (2024)