Unlearning the Noisy Correspondence Makes CLIP More Robust
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Han, Haochen, Wang, Alex Jinpeng, Ye, Peijun, Liu, Fangming |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Noisy-Correspondence Learning for Text-to-Image Person Re-identification
par: Qin, Yang, et autres
Publié: (2023)
par: Qin, Yang, et autres
Publié: (2023)
A Unified Optimal Transport Framework for Cross-Modal Retrieval with Noisy Labels
par: Han, Haochen, et autres
Publié: (2024)
par: Han, Haochen, et autres
Publié: (2024)
PDA: Text-Augmented Defense Framework for Robust Vision-Language Models against Adversarial Image Attacks
par: Xu, Jingning, et autres
Publié: (2026)
par: Xu, Jingning, et autres
Publié: (2026)
Robust Self-Paced Hashing for Cross-Modal Retrieval with Noisy Labels
par: Pu, Ruitao, et autres
Publié: (2025)
par: Pu, Ruitao, et autres
Publié: (2025)
Learning to Rematch Mismatched Pairs for Robust Cross-Modal Retrieval
par: Han, Haochen, et autres
Publié: (2024)
par: Han, Haochen, et autres
Publié: (2024)
Unified Coding for Both Human Perception and Generalized Machine Analytics with CLIP Supervision
par: Yin, Kangsheng, et autres
Publié: (2025)
par: Yin, Kangsheng, et autres
Publié: (2025)
CLIP Brings Better Features to Visual Aesthetics Learners
par: Xu, Liwu, et autres
Publié: (2023)
par: Xu, Liwu, et autres
Publié: (2023)
VideoCLIP-XL: Advancing Long Description Understanding for Video CLIP Models
par: Wang, Jiapeng, et autres
Publié: (2024)
par: Wang, Jiapeng, et autres
Publié: (2024)
Selective Vision-Language Subspace Projection for Few-shot CLIP
par: Zhu, Xingyu, et autres
Publié: (2024)
par: Zhu, Xingyu, et autres
Publié: (2024)
Not Just What's There: Enabling CLIP to Comprehend Negated Visual Descriptions Without Fine-tuning
par: Xiao, Junhao, et autres
Publié: (2026)
par: Xiao, Junhao, et autres
Publié: (2026)
LMM-Regularized CLIP Embeddings for Image Classification
par: Tzelepi, Maria, et autres
Publié: (2024)
par: Tzelepi, Maria, et autres
Publié: (2024)
Robust Modality-incomplete Anomaly Detection: A Modality-instructive Framework with Benchmark
par: Miao, Bingchen, et autres
Publié: (2024)
par: Miao, Bingchen, et autres
Publié: (2024)
Incorporating Visual Correspondence into Diffusion Model for Virtual Try-On
par: Wan, Siqi, et autres
Publié: (2025)
par: Wan, Siqi, et autres
Publié: (2025)
Test-Time Adaptation with CLIP Reward for Zero-Shot Generalization in Vision-Language Models
par: Zhao, Shuai, et autres
Publié: (2023)
par: Zhao, Shuai, et autres
Publié: (2023)
CLIP-PCQA: Exploring Subjective-Aligned Vision-Language Modeling for Point Cloud Quality Assessment
par: Liu, Yating, et autres
Publié: (2025)
par: Liu, Yating, et autres
Publié: (2025)
Noise-Tolerant Learning for Audio-Visual Action Recognition
par: Han, Haochen, et autres
Publié: (2022)
par: Han, Haochen, et autres
Publié: (2022)
CUS3D :CLIP-based Unsupervised 3D Segmentation via Object-level Denoise
par: Yu, Fuyang, et autres
Publié: (2024)
par: Yu, Fuyang, et autres
Publié: (2024)
Pre-training CLIP against Data Poisoning with Optimal Transport-based Matching and Alignment
par: Zhang, Tong, et autres
Publié: (2025)
par: Zhang, Tong, et autres
Publié: (2025)
Negation-Aware Test-Time Adaptation for Vision-Language Models
par: Han, Haochen, et autres
Publié: (2025)
par: Han, Haochen, et autres
Publié: (2025)
CoPRS: Learning Positional Prior from Chain-of-Thought for Reasoning Segmentation
par: Lu, Zhenyu, et autres
Publié: (2025)
par: Lu, Zhenyu, et autres
Publié: (2025)
PixCLIP: Achieving Fine-grained Visual Language Understanding via Any-granularity Pixel-Text Alignment Learning
par: Xiao, Yicheng, et autres
Publié: (2025)
par: Xiao, Yicheng, et autres
Publié: (2025)
DARA: Domain- and Relation-aware Adapters Make Parameter-efficient Tuning for Visual Grounding
par: Liu, Ting, et autres
Publié: (2024)
par: Liu, Ting, et autres
Publié: (2024)
Wavelet-Decoupling Contrastive Enhancement Network for Fine-Grained Skeleton-Based Action Recognition
par: Chang, Haochen, et autres
Publié: (2024)
par: Chang, Haochen, et autres
Publié: (2024)
MMSD3.0: A Multi-Image Benchmark for Real-World Multimodal Sarcasm Detection
par: Zhao, Haochen, et autres
Publié: (2025)
par: Zhao, Haochen, et autres
Publié: (2025)
VideoZeroBench: Probing the Limits of Video MLLMs with Spatio-Temporal Evidence Verification
par: Meng, Jiahao, et autres
Publié: (2026)
par: Meng, Jiahao, et autres
Publié: (2026)
Towards Efficient Low-rate Image Compression with Frequency-aware Diffusion Prior Refinement
par: Xia, Yichong, et autres
Publié: (2026)
par: Xia, Yichong, et autres
Publié: (2026)
ASAP: Advancing Semantic Alignment Promotes Multi-Modal Manipulation Detecting and Grounding
par: Zhang, Zhenxing, et autres
Publié: (2024)
par: Zhang, Zhenxing, et autres
Publié: (2024)
Multi-task Prompt Words Learning for Social Media Content Generation
par: Xue, Haochen, et autres
Publié: (2024)
par: Xue, Haochen, et autres
Publié: (2024)
M3FAS: An Accurate and Robust MultiModal Mobile Face Anti-Spoofing System
par: Kong, Chenqi, et autres
Publié: (2023)
par: Kong, Chenqi, et autres
Publié: (2023)
Robust Active Speaker Detection in Noisy Environments
par: Vasireddy, Siva Sai Nagender, et autres
Publié: (2024)
par: Vasireddy, Siva Sai Nagender, et autres
Publié: (2024)
Discriminative-Generative Synergy for Occlusion Robust 3D Human Mesh Recovery
par: Liu, Yang, et autres
Publié: (2026)
par: Liu, Yang, et autres
Publié: (2026)
Data or Language Supervision: What Makes CLIP Better than DINO?
par: Liu, Yiming, et autres
Publié: (2025)
par: Liu, Yiming, et autres
Publié: (2025)
Anchoring Emotions in Text: Robust Multimodal Fusion for Mimicry Intensity Estimation
par: Zhu, Lingsi, et autres
Publié: (2026)
par: Zhu, Lingsi, et autres
Publié: (2026)
Gradient-Guided Modality Decoupling for Missing-Modality Robustness
par: Wang, Hao, et autres
Publié: (2024)
par: Wang, Hao, et autres
Publié: (2024)
Graph-Based Cross-Domain Knowledge Distillation for Cross-Dataset Text-to-Image Person Retrieval
par: Luo, Bingjun, et autres
Publié: (2025)
par: Luo, Bingjun, et autres
Publié: (2025)
WAVECLIP: Wavelet Tokenization for Adaptive-Resolution CLIP
par: Kimhi, Moshe, et autres
Publié: (2025)
par: Kimhi, Moshe, et autres
Publié: (2025)
Make Graph-based Referring Expression Comprehension Great Again through Expression-guided Dynamic Gating and Regression
par: Ke, Jingcheng, et autres
Publié: (2024)
par: Ke, Jingcheng, et autres
Publié: (2024)
MVPbev: Multi-view Perspective Image Generation from BEV with Test-time Controllability and Generalizability
par: Liu, Buyu, et autres
Publié: (2024)
par: Liu, Buyu, et autres
Publié: (2024)
Robust Mesh Saliency Ground Truth Acquisition in VR via View Cone Sampling and Manifold Diffusion
par: Zheng, Guoquan, et autres
Publié: (2026)
par: Zheng, Guoquan, et autres
Publié: (2026)
ROGLE: Robust Global-Local Alignment with Automated Region Supervision for Text-Based Person Search
par: Xie, Zequn, et autres
Publié: (2026)
par: Xie, Zequn, et autres
Publié: (2026)
Documents similaires
-
Noisy-Correspondence Learning for Text-to-Image Person Re-identification
par: Qin, Yang, et autres
Publié: (2023) -
A Unified Optimal Transport Framework for Cross-Modal Retrieval with Noisy Labels
par: Han, Haochen, et autres
Publié: (2024) -
PDA: Text-Augmented Defense Framework for Robust Vision-Language Models against Adversarial Image Attacks
par: Xu, Jingning, et autres
Publié: (2026) -
Robust Self-Paced Hashing for Cross-Modal Retrieval with Noisy Labels
par: Pu, Ruitao, et autres
Publié: (2025) -
Learning to Rematch Mismatched Pairs for Robust Cross-Modal Retrieval
par: Han, Haochen, et autres
Publié: (2024)