Color in Visual-Language Models: CLIP deficiencies
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Arias, Guillem, Baldrich, Ramon, Vanrell, Maria |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Color encoding in Latent Space of Stable Diffusion Models
par: Arias, Guillem, et autres
Publié: (2025)
par: Arias, Guillem, et autres
Publié: (2025)
Relighting from a Single Image: Datasets and Deep Intrinsic-based Architecture
par: Yang, Yixiong, et autres
Publié: (2024)
par: Yang, Yixiong, et autres
Publié: (2024)
Learning Relighting and Intrinsic Decomposition in Neural Radiance Fields
par: Yang, Yixiong, et autres
Publié: (2024)
par: Yang, Yixiong, et autres
Publié: (2024)
MLI-NeRF: Multi-Light Intrinsic-Aware Neural Radiance Fields
par: Yang, Yixiong, et autres
Publié: (2024)
par: Yang, Yixiong, et autres
Publié: (2024)
AdaptCLIP: Adapting CLIP for Universal Visual Anomaly Detection
par: Gao, Bin-Bin, et autres
Publié: (2025)
par: Gao, Bin-Bin, et autres
Publié: (2025)
PriorCLIP: Visual Prior Guided Vision-Language Model for Remote Sensing Image-Text Retrieval
par: Pan, Jiancheng, et autres
Publié: (2024)
par: Pan, Jiancheng, et autres
Publié: (2024)
Evaluating Low-Light Image Enhancement Across Multiple Intensity Levels
par: Pilligua, Maria, et autres
Publié: (2025)
par: Pilligua, Maria, et autres
Publié: (2025)
CLIP-MUSED: CLIP-Guided Multi-Subject Visual Neural Information Semantic Decoding
par: Zhou, Qiongyi, et autres
Publié: (2024)
par: Zhou, Qiongyi, et autres
Publié: (2024)
FG-CLIP: Fine-Grained Visual and Textual Alignment
par: Xie, Chunyu, et autres
Publié: (2025)
par: Xie, Chunyu, et autres
Publié: (2025)
Investigating and Mitigating Object Hallucinations in Pretrained Vision-Language (CLIP) Models
par: Liu, Yufang, et autres
Publié: (2024)
par: Liu, Yufang, et autres
Publié: (2024)
HarmoCLIP: Harmonizing Global and Regional Representations in Contrastive Vision-Language Models
par: Zeng, Haoxi, et autres
Publié: (2025)
par: Zeng, Haoxi, et autres
Publié: (2025)
AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis
par: Alawode, Basit, et autres
Publié: (2025)
par: Alawode, Basit, et autres
Publié: (2025)
TriCLIP-3D: A Unified Parameter-Efficient Framework for Tri-Modal 3D Visual Grounding based on CLIP
par: Li, Fan, et autres
Publié: (2025)
par: Li, Fan, et autres
Publié: (2025)
Language Models Can Explain Visual Features via Steering
par: Ferrando, Javier, et autres
Publié: (2026)
par: Ferrando, Javier, et autres
Publié: (2026)
VeCLIP: Improving CLIP Training via Visual-enriched Captions
par: Lai, Zhengfeng, et autres
Publié: (2023)
par: Lai, Zhengfeng, et autres
Publié: (2023)
TernaryCLIP: Efficiently Compressing Vision-Language Models with Ternary Weights and Distilled Knowledge
par: Zhang, Shu-Hao, et autres
Publié: (2025)
par: Zhang, Shu-Hao, et autres
Publié: (2025)
Concept Visualization: Explaining the CLIP Multi-modal Embedding Using WordNet
par: Giulivi, Loris, et autres
Publié: (2024)
par: Giulivi, Loris, et autres
Publié: (2024)
Quantifying and Enabling the Interpretability of CLIP-like Models
par: Madasu, Avinash, et autres
Publié: (2024)
par: Madasu, Avinash, et autres
Publié: (2024)
DesignCLIP: Multimodal Learning with CLIP for Design Patent Understanding
par: Wang, Zhu, et autres
Publié: (2025)
par: Wang, Zhu, et autres
Publié: (2025)
FetalCLIP: A Visual-Language Foundation Model for Fetal Ultrasound Image Analysis
par: Maani, Fadillah, et autres
Publié: (2025)
par: Maani, Fadillah, et autres
Publié: (2025)
MedProbCLIP: Probabilistic Adaptation of Vision-Language Foundation Model for Reliable Radiograph-Report Retrieval
par: Elallaf, Ahmad, et autres
Publié: (2026)
par: Elallaf, Ahmad, et autres
Publié: (2026)
Video CLIP Model for Multi-View Echocardiography Interpretation
par: Takizawa, Ryo, et autres
Publié: (2025)
par: Takizawa, Ryo, et autres
Publié: (2025)
TNG-CLIP:Training-Time Negation Data Generation for Negation Awareness of CLIP
par: Cai, Yuliang, et autres
Publié: (2025)
par: Cai, Yuliang, et autres
Publié: (2025)
VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings
par: Giahi, Ramin, et autres
Publié: (2025)
par: Giahi, Ramin, et autres
Publié: (2025)
CLIP Tricks You: Training-free Token Pruning for Efficient Pixel Grounding in Large VIsion-Language Models
par: Lee, Sangin, et autres
Publié: (2026)
par: Lee, Sangin, et autres
Publié: (2026)
ViCLIP-OT: The First Foundation Vision-Language Model for Vietnamese Image-Text Retrieval with Optimal Transport
par: Tran, Quoc-Khang, et autres
Publié: (2026)
par: Tran, Quoc-Khang, et autres
Publié: (2026)
VisionCLIP: An Med-AIGC based Ethical Language-Image Foundation Model for Generalizable Retina Image Analysis
par: Wei, Hao, et autres
Publié: (2024)
par: Wei, Hao, et autres
Publié: (2024)
XAI-CLIP: ROI-Guided Perturbation Framework for Explainable Medical Image Segmentation in Multimodal Vision-Language Models
par: Alzubaidi, Thuraya, et autres
Publié: (2026)
par: Alzubaidi, Thuraya, et autres
Publié: (2026)
Vision-Language Models for Autonomous Driving: CLIP-Based Dynamic Scene Understanding
par: Elhenawy, Mohammed, et autres
Publié: (2025)
par: Elhenawy, Mohammed, et autres
Publié: (2025)
Towards Understanding Visual Grounding in Visual Language Models
par: Pantazopoulos, Georgios, et autres
Publié: (2025)
par: Pantazopoulos, Georgios, et autres
Publié: (2025)
DesCLIP: Robust Continual Learning via General Attribute Descriptions for VLM-Based Visual Recognition
par: He, Chiyuan, et autres
Publié: (2025)
par: He, Chiyuan, et autres
Publié: (2025)
ViP$^2$-CLIP: Visual-Perception Prompting with Unified Alignment for Zero-Shot Anomaly Detection
par: Yang, Ziteng, et autres
Publié: (2025)
par: Yang, Ziteng, et autres
Publié: (2025)
Pedestrian Attribute Recognition via CLIP based Prompt Vision-Language Fusion
par: Wang, Xiao, et autres
Publié: (2023)
par: Wang, Xiao, et autres
Publié: (2023)
TokLIP: Marry Visual Tokens to CLIP for Multimodal Comprehension and Generation
par: Lin, Haokun, et autres
Publié: (2025)
par: Lin, Haokun, et autres
Publié: (2025)
Position-aware Guided Point Cloud Completion with CLIP Model
par: Zhou, Feng, et autres
Publié: (2024)
par: Zhou, Feng, et autres
Publié: (2024)
AA-CLIP: Enhancing Zero-shot Anomaly Detection via Anomaly-Aware CLIP
par: Ma, Wenxin, et autres
Publié: (2025)
par: Ma, Wenxin, et autres
Publié: (2025)
CLIP-MoE: Towards Building Mixture of Experts for CLIP with Diversified Multiplet Upcycling
par: Zhang, Jihai, et autres
Publié: (2024)
par: Zhang, Jihai, et autres
Publié: (2024)
Unifying Biomedical Vision-Language Expertise: Towards a Generalist Foundation Model via Multi-CLIP Knowledge Distillation
par: Wang, Shansong, et autres
Publié: (2025)
par: Wang, Shansong, et autres
Publié: (2025)
CLIPErase: Efficient Unlearning of Visual-Textual Associations in CLIP
par: Yang, Tianyu, et autres
Publié: (2024)
par: Yang, Tianyu, et autres
Publié: (2024)
CLIP-DQA: Blindly Evaluating Dehazed Images from Global and Local Perspectives Using CLIP
par: Zeng, Yirui, et autres
Publié: (2025)
par: Zeng, Yirui, et autres
Publié: (2025)
Documents similaires
-
Color encoding in Latent Space of Stable Diffusion Models
par: Arias, Guillem, et autres
Publié: (2025) -
Relighting from a Single Image: Datasets and Deep Intrinsic-based Architecture
par: Yang, Yixiong, et autres
Publié: (2024) -
Learning Relighting and Intrinsic Decomposition in Neural Radiance Fields
par: Yang, Yixiong, et autres
Publié: (2024) -
MLI-NeRF: Multi-Light Intrinsic-Aware Neural Radiance Fields
par: Yang, Yixiong, et autres
Publié: (2024) -
AdaptCLIP: Adapting CLIP for Universal Visual Anomaly Detection
par: Gao, Bin-Bin, et autres
Publié: (2025)