Joint Vision-Language Social Bias Removal for CLIP
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Haoyu, Guo, Yangyang, Kankanhalli, Mohan |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ELIP: Efficient Discriminative Language-Image Pre-training with Fewer Vision Tokens
par: Guo, Yangyang, et autres
Publié: (2023)
par: Guo, Yangyang, et autres
Publié: (2023)
SCAN: Bootstrapping Contrastive Pre-training for Data Efficiency
par: Guo, Yangyang, et autres
Publié: (2024)
par: Guo, Yangyang, et autres
Publié: (2024)
VidHal: Benchmarking Temporal Hallucinations in Vision LLMs
par: Choong, Wey Yeh, et autres
Publié: (2024)
par: Choong, Wey Yeh, et autres
Publié: (2024)
Do Vision-Language Transformers Exhibit Visual Commonsense? An Empirical Study of VCR
par: Li, Zhenyang, et autres
Publié: (2024)
par: Li, Zhenyang, et autres
Publié: (2024)
The VLLM Safety Paradox: Dual Ease in Jailbreak Attack and Defense
par: Guo, Yangyang, et autres
Publié: (2024)
par: Guo, Yangyang, et autres
Publié: (2024)
UNK-VQA: A Dataset and a Probe into the Abstention Ability of Multi-modal Large Models
par: Guo, Yangyang, et autres
Publié: (2023)
par: Guo, Yangyang, et autres
Publié: (2023)
Diffusion Facial Forgery Detection
par: Cheng, Harry, et autres
Publié: (2024)
par: Cheng, Harry, et autres
Publié: (2024)
Towards Generalizable Deepfake Detection via Real Distribution Bias Correction
par: Liu, Ming-Hui, et autres
Publié: (2026)
par: Liu, Ming-Hui, et autres
Publié: (2026)
Enhancing HOI Detection with Contextual Cues from Large Vision-Language Models
par: Zhan, Yu-Wei, et autres
Publié: (2023)
par: Zhan, Yu-Wei, et autres
Publié: (2023)
Technical Report for ICML 2024 TiFA Workshop MLLM Attack Challenge: Suffix Injection and Projected Gradient Descent Can Easily Fool An MLLM
par: Guo, Yangyang, et autres
Publié: (2024)
par: Guo, Yangyang, et autres
Publié: (2024)
Fair Deepfake Detectors Can Generalize
par: Cheng, Harry, et autres
Publié: (2025)
par: Cheng, Harry, et autres
Publié: (2025)
From Global to Local: Social Bias Transfer in CLIP
par: Ramos, Ryan, et autres
Publié: (2025)
par: Ramos, Ryan, et autres
Publié: (2025)
ClearCLIP: Decomposing CLIP Representations for Dense Vision-Language Inference
par: Lan, Mengcheng, et autres
Publié: (2024)
par: Lan, Mengcheng, et autres
Publié: (2024)
Aggregating Diverse Cue Experts for AI-Generated Image Detection
par: Tan, Lei, et autres
Publié: (2026)
par: Tan, Lei, et autres
Publié: (2026)
Safe-CLIP: Removing NSFW Concepts from Vision-and-Language Models
par: Poppi, Samuele, et autres
Publié: (2023)
par: Poppi, Samuele, et autres
Publié: (2023)
FairCLIP: Social Bias Elimination based on Attribute Prototype Learning and Representation Neutralization
par: Wang, Junyang, et autres
Publié: (2022)
par: Wang, Junyang, et autres
Publié: (2022)
FractalForensics: Proactive Deepfake Detection and Localization via Fractal Watermarks
par: Wang, Tianyi, et autres
Publié: (2025)
par: Wang, Tianyi, et autres
Publié: (2025)
Can CLIP Count Stars? An Empirical Study on Quantity Bias in CLIP
par: Zhang, Zeliang, et autres
Publié: (2024)
par: Zhang, Zeliang, et autres
Publié: (2024)
ReCLIP++: Learn to Rectify the Bias of CLIP for Unsupervised Semantic Segmentation
par: Wang, Jingyun, et autres
Publié: (2024)
par: Wang, Jingyun, et autres
Publié: (2024)
Word-Anchored Temporal Forgery Localization
par: Wang, Tianyi, et autres
Publié: (2026)
par: Wang, Tianyi, et autres
Publié: (2026)
Object-Centric Framework for Video Moment Retrieval
par: Li, Zongyao, et autres
Publié: (2025)
par: Li, Zongyao, et autres
Publié: (2025)
FairCLIP: Harnessing Fairness in Vision-Language Learning
par: Luo, Yan, et autres
Publié: (2024)
par: Luo, Yan, et autres
Publié: (2024)
ProCLIP: Progressive Vision-Language Alignment via LLM-based Embedder
par: Hu, Xiaoxing, et autres
Publié: (2025)
par: Hu, Xiaoxing, et autres
Publié: (2025)
CLIP-Adapter: Better Vision-Language Models with Feature Adapters
par: Gao, Peng, et autres
Publié: (2021)
par: Gao, Peng, et autres
Publié: (2021)
STAR: Skeleton-aware Text-based 4D Avatar Generation with In-Network Motion Retargeting
par: Chai, Zenghao, et autres
Publié: (2024)
par: Chai, Zenghao, et autres
Publié: (2024)
Learning to Predict Gradients for Semi-Supervised Continual Learning
par: Luo, Yan, et autres
Publié: (2022)
par: Luo, Yan, et autres
Publié: (2022)
TOPA: Extending Large Language Models for Video Understanding via Text-Only Pre-Alignment
par: Li, Wei, et autres
Publié: (2024)
par: Li, Wei, et autres
Publié: (2024)
MaskedCLIP: Bridging the Masked and CLIP Space for Semi-Supervised Medical Vision-Language Pre-training
par: Zhu, Lei, et autres
Publié: (2025)
par: Zhu, Lei, et autres
Publié: (2025)
Is CLIP Cross-Eyed? Revealing and Mitigating Center Bias in the CLIP Family
par: Chew, Oscar, et autres
Publié: (2026)
par: Chew, Oscar, et autres
Publié: (2026)
VidLBEval: Benchmarking and Mitigating Language Bias in Video-Involved LVLMs
par: Yang, Yiming, et autres
Publié: (2025)
par: Yang, Yiming, et autres
Publié: (2025)
Defurnishing with X-Ray Vision: Joint Removal of Furniture from Panoramas and Mesh
par: Dolhasz, Alan, et autres
Publié: (2025)
par: Dolhasz, Alan, et autres
Publié: (2025)
TripletCLIP: Improving Compositional Reasoning of CLIP via Synthetic Vision-Language Negatives
par: Patel, Maitreya, et autres
Publié: (2024)
par: Patel, Maitreya, et autres
Publié: (2024)
VisBias: Measuring Explicit and Implicit Social Biases in Vision Language Models
par: Huang, Jen-tse, et autres
Publié: (2025)
par: Huang, Jen-tse, et autres
Publié: (2025)
RWKV-CLIP: A Robust Vision-Language Representation Learner
par: Gu, Tiancheng, et autres
Publié: (2024)
par: Gu, Tiancheng, et autres
Publié: (2024)
Selective Vision-Language Subspace Projection for Few-shot CLIP
par: Zhu, Xingyu, et autres
Publié: (2024)
par: Zhu, Xingyu, et autres
Publié: (2024)
Image-Based Virtual Try-On: A Survey
par: Song, Dan, et autres
Publié: (2023)
par: Song, Dan, et autres
Publié: (2023)
MimiCAT: Mimic with Correspondence-Aware Cascade-Transformer for Category-Free 3D Pose Transfer
par: Chai, Zenghao, et autres
Publié: (2025)
par: Chai, Zenghao, et autres
Publié: (2025)
Locating Demographic Bias at the Attention-Head Level in CLIP's Vision Encoder
par: Yasser, Alaa, et autres
Publié: (2026)
par: Yasser, Alaa, et autres
Publié: (2026)
Nearest Neighbor Projection Removal Adversarial Training
par: Singh, Himanshu, et autres
Publié: (2025)
par: Singh, Himanshu, et autres
Publié: (2025)
CosmoCLIP: Generalizing Large Vision-Language Models for Astronomical Imaging
par: Imam, Raza, et autres
Publié: (2024)
par: Imam, Raza, et autres
Publié: (2024)
Documents similaires
-
ELIP: Efficient Discriminative Language-Image Pre-training with Fewer Vision Tokens
par: Guo, Yangyang, et autres
Publié: (2023) -
SCAN: Bootstrapping Contrastive Pre-training for Data Efficiency
par: Guo, Yangyang, et autres
Publié: (2024) -
VidHal: Benchmarking Temporal Hallucinations in Vision LLMs
par: Choong, Wey Yeh, et autres
Publié: (2024) -
Do Vision-Language Transformers Exhibit Visual Commonsense? An Empirical Study of VCR
par: Li, Zhenyang, et autres
Publié: (2024) -
The VLLM Safety Paradox: Dual Ease in Jailbreak Attack and Defense
par: Guo, Yangyang, et autres
Publié: (2024)