Towards Alleviating Text-to-Image Retrieval Hallucination for CLIP in Zero-shot Learning
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Hanyao, Zhan, Yibing, Liu, Liu, Ding, Liang, Yang, Yan, Yu, Jun |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models
di: Xu, Yifang, et al.
Pubblicazione: (2025)
di: Xu, Yifang, et al.
Pubblicazione: (2025)
Pseudo-triplet Guided Few-shot Composed Image Retrieval
di: Hou, Bohan, et al.
Pubblicazione: (2024)
di: Hou, Bohan, et al.
Pubblicazione: (2024)
AsCL: An Asymmetry-sensitive Contrastive Learning Method for Image-Text Retrieval with Cross-Modal Fusion
di: Gong, Ziyu, et al.
Pubblicazione: (2024)
di: Gong, Ziyu, et al.
Pubblicazione: (2024)
Prototypical Prompting for Text-to-image Person Re-identification
di: Yan, Shuanglin, et al.
Pubblicazione: (2024)
di: Yan, Shuanglin, et al.
Pubblicazione: (2024)
Selective Vision-Language Subspace Projection for Few-shot CLIP
di: Zhu, Xingyu, et al.
Pubblicazione: (2024)
di: Zhu, Xingyu, et al.
Pubblicazione: (2024)
OT-DETECTOR: Delving into Optimal Transport for Zero-shot Out-of-Distribution Detection
di: Liu, Yu, et al.
Pubblicazione: (2025)
di: Liu, Yu, et al.
Pubblicazione: (2025)
GAIA: Zero-shot Talking Avatar Generation
di: He, Tianyu, et al.
Pubblicazione: (2023)
di: He, Tianyu, et al.
Pubblicazione: (2023)
On the Brittleness of CLIP Text Encoders
di: Tran, Allie, et al.
Pubblicazione: (2025)
di: Tran, Allie, et al.
Pubblicazione: (2025)
Test-Time Adaptation with CLIP Reward for Zero-Shot Generalization in Vision-Language Models
di: Zhao, Shuai, et al.
Pubblicazione: (2023)
di: Zhao, Shuai, et al.
Pubblicazione: (2023)
Fine-grained Textual Inversion Network for Zero-Shot Composed Image Retrieval
di: Lin, Haoqiang, et al.
Pubblicazione: (2025)
di: Lin, Haoqiang, et al.
Pubblicazione: (2025)
Retrieval Augmented Verification for Zero-Shot Detection of Multimodal Disinformation
di: Dey, Arka Ujjal, et al.
Pubblicazione: (2024)
di: Dey, Arka Ujjal, et al.
Pubblicazione: (2024)
SteerMusic: Enhanced Musical Consistency for Zero-shot Text-guided and Personalized Music Editing
di: Niu, Xinlei, et al.
Pubblicazione: (2025)
di: Niu, Xinlei, et al.
Pubblicazione: (2025)
Beyond Semantic Search: Towards Referential Anchoring in Composed Image Retrieval
di: Yang, Yuxin, et al.
Pubblicazione: (2026)
di: Yang, Yuxin, et al.
Pubblicazione: (2026)
Robust Multi-generation Learned Compression of Point Cloud Attribute
di: Liu, Xiangzuo, et al.
Pubblicazione: (2025)
di: Liu, Xiangzuo, et al.
Pubblicazione: (2025)
Towards Unbiased Cross-Modal Representation Learning for Food Image-to-Recipe Retrieval
di: Wang, Qing, et al.
Pubblicazione: (2025)
di: Wang, Qing, et al.
Pubblicazione: (2025)
High-level Codes and Fine-grained Weights for Online Multi-modal Hashing Retrieval
di: Zhan, Yu-Wei, et al.
Pubblicazione: (2024)
di: Zhan, Yu-Wei, et al.
Pubblicazione: (2024)
An Empirical Study of Excitation and Aggregation Design Adaptions in CLIP4Clip for Video-Text Retrieval
di: Jing, Xiaolun, et al.
Pubblicazione: (2024)
di: Jing, Xiaolun, et al.
Pubblicazione: (2024)
CustomDancer: Customized Dance Recommendation by Text-Dance Retrieval
di: Qin, Yawen, et al.
Pubblicazione: (2026)
di: Qin, Yawen, et al.
Pubblicazione: (2026)
PixCLIP: Achieving Fine-grained Visual Language Understanding via Any-granularity Pixel-Text Alignment Learning
di: Xiao, Yicheng, et al.
Pubblicazione: (2025)
di: Xiao, Yicheng, et al.
Pubblicazione: (2025)
Towards Multimodal Sentiment Analysis via Contrastive Cross-modal Retrieval Augmentation and Hierachical Prompts
di: Zhao, Xianbing, et al.
Pubblicazione: (2025)
di: Zhao, Xianbing, et al.
Pubblicazione: (2025)
PRISM: Exposing and Resolving Spurious Isolation in Federated Multimodal Continual Learning
di: Wu, Beining, et al.
Pubblicazione: (2026)
di: Wu, Beining, et al.
Pubblicazione: (2026)
Retrieval-Augmented Text-to-Audio Generation
di: Yuan, Yi, et al.
Pubblicazione: (2023)
di: Yuan, Yi, et al.
Pubblicazione: (2023)
RA-BLIP: Multimodal Adaptive Retrieval-Augmented Bootstrapping Language-Image Pre-training
di: Ding, Muhe, et al.
Pubblicazione: (2024)
di: Ding, Muhe, et al.
Pubblicazione: (2024)
Multimodal Learned Sparse Retrieval for Image Suggestion
di: Nguyen, Thong, et al.
Pubblicazione: (2024)
di: Nguyen, Thong, et al.
Pubblicazione: (2024)
Hallucination Localization in Video Captioning
di: Nakada, Shota, et al.
Pubblicazione: (2025)
di: Nakada, Shota, et al.
Pubblicazione: (2025)
RFNNS: Robust Fixed Neural Network Steganography with Universal Text-to-Image Models
di: Cheng, Yu, et al.
Pubblicazione: (2025)
di: Cheng, Yu, et al.
Pubblicazione: (2025)
GPT-4V with Emotion: A Zero-shot Benchmark for Generalized Emotion Recognition
di: Lian, Zheng, et al.
Pubblicazione: (2023)
di: Lian, Zheng, et al.
Pubblicazione: (2023)
ML-CLIPSim: Multi-Layer CLIP Similarity for Machine-Oriented Image Quality
di: Ding, Feng, et al.
Pubblicazione: (2026)
di: Ding, Feng, et al.
Pubblicazione: (2026)
Learning Switchable Priors for Neural Image Compression
di: Zhang, Haotian, et al.
Pubblicazione: (2025)
di: Zhang, Haotian, et al.
Pubblicazione: (2025)
A CLIP-based siamese approach for meme classification
di: Huertas-Tato, Javier, et al.
Pubblicazione: (2024)
di: Huertas-Tato, Javier, et al.
Pubblicazione: (2024)
Modularized Zero-shot VQA with Pre-trained Models
di: Cao, Rui, et al.
Pubblicazione: (2023)
di: Cao, Rui, et al.
Pubblicazione: (2023)
Scaling Prompt Instructed Zero Shot Composed Image Retrieval with Image-Only Data
di: Duan, Yiqun, et al.
Pubblicazione: (2025)
di: Duan, Yiqun, et al.
Pubblicazione: (2025)
Zero-Shot Visual Grounding in 3D Gaussians via View Retrieval
di: Liao, Liwei, et al.
Pubblicazione: (2025)
di: Liao, Liwei, et al.
Pubblicazione: (2025)
Cross-Modal and Uni-Modal Soft-Label Alignment for Image-Text Retrieval
di: Huang, Hailang, et al.
Pubblicazione: (2024)
di: Huang, Hailang, et al.
Pubblicazione: (2024)
Transcending Fusion: A Multi-Scale Alignment Method for Remote Sensing Image-Text Retrieval
di: Yang, Rui, et al.
Pubblicazione: (2024)
di: Yang, Rui, et al.
Pubblicazione: (2024)
VideoCLIP-XL: Advancing Long Description Understanding for Video CLIP Models
di: Wang, Jiapeng, et al.
Pubblicazione: (2024)
di: Wang, Jiapeng, et al.
Pubblicazione: (2024)
Emotional Cues Extraction and Fusion for Multi-modal Emotion Prediction and Recognition in Conversation
di: Shi, Haoxiang, et al.
Pubblicazione: (2024)
di: Shi, Haoxiang, et al.
Pubblicazione: (2024)
Toward Automatic Relevance Judgment using Vision--Language Models for Image--Text Retrieval Evaluation
di: Yang, Jheng-Hong, et al.
Pubblicazione: (2024)
di: Yang, Jheng-Hong, et al.
Pubblicazione: (2024)
CUS3D :CLIP-based Unsupervised 3D Segmentation via Object-level Denoise
di: Yu, Fuyang, et al.
Pubblicazione: (2024)
di: Yu, Fuyang, et al.
Pubblicazione: (2024)
Unlearning the Noisy Correspondence Makes CLIP More Robust
di: Han, Haochen, et al.
Pubblicazione: (2025)
di: Han, Haochen, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models
di: Xu, Yifang, et al.
Pubblicazione: (2025) -
Pseudo-triplet Guided Few-shot Composed Image Retrieval
di: Hou, Bohan, et al.
Pubblicazione: (2024) -
AsCL: An Asymmetry-sensitive Contrastive Learning Method for Image-Text Retrieval with Cross-Modal Fusion
di: Gong, Ziyu, et al.
Pubblicazione: (2024) -
Prototypical Prompting for Text-to-image Person Re-identification
di: Yan, Shuanglin, et al.
Pubblicazione: (2024) -
Selective Vision-Language Subspace Projection for Few-shot CLIP
di: Zhu, Xingyu, et al.
Pubblicazione: (2024)