Joint Vision-Language Social Bias Removal for CLIP
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhang, Haoyu, Guo, Yangyang, Kankanhalli, Mohan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
ELIP: Efficient Discriminative Language-Image Pre-training with Fewer Vision Tokens
por: Guo, Yangyang, et al.
Publicado: (2023)
por: Guo, Yangyang, et al.
Publicado: (2023)
SCAN: Bootstrapping Contrastive Pre-training for Data Efficiency
por: Guo, Yangyang, et al.
Publicado: (2024)
por: Guo, Yangyang, et al.
Publicado: (2024)
VidHal: Benchmarking Temporal Hallucinations in Vision LLMs
por: Choong, Wey Yeh, et al.
Publicado: (2024)
por: Choong, Wey Yeh, et al.
Publicado: (2024)
Do Vision-Language Transformers Exhibit Visual Commonsense? An Empirical Study of VCR
por: Li, Zhenyang, et al.
Publicado: (2024)
por: Li, Zhenyang, et al.
Publicado: (2024)
The VLLM Safety Paradox: Dual Ease in Jailbreak Attack and Defense
por: Guo, Yangyang, et al.
Publicado: (2024)
por: Guo, Yangyang, et al.
Publicado: (2024)
UNK-VQA: A Dataset and a Probe into the Abstention Ability of Multi-modal Large Models
por: Guo, Yangyang, et al.
Publicado: (2023)
por: Guo, Yangyang, et al.
Publicado: (2023)
Diffusion Facial Forgery Detection
por: Cheng, Harry, et al.
Publicado: (2024)
por: Cheng, Harry, et al.
Publicado: (2024)
Towards Generalizable Deepfake Detection via Real Distribution Bias Correction
por: Liu, Ming-Hui, et al.
Publicado: (2026)
por: Liu, Ming-Hui, et al.
Publicado: (2026)
Enhancing HOI Detection with Contextual Cues from Large Vision-Language Models
por: Zhan, Yu-Wei, et al.
Publicado: (2023)
por: Zhan, Yu-Wei, et al.
Publicado: (2023)
Technical Report for ICML 2024 TiFA Workshop MLLM Attack Challenge: Suffix Injection and Projected Gradient Descent Can Easily Fool An MLLM
por: Guo, Yangyang, et al.
Publicado: (2024)
por: Guo, Yangyang, et al.
Publicado: (2024)
Fair Deepfake Detectors Can Generalize
por: Cheng, Harry, et al.
Publicado: (2025)
por: Cheng, Harry, et al.
Publicado: (2025)
From Global to Local: Social Bias Transfer in CLIP
por: Ramos, Ryan, et al.
Publicado: (2025)
por: Ramos, Ryan, et al.
Publicado: (2025)
ClearCLIP: Decomposing CLIP Representations for Dense Vision-Language Inference
por: Lan, Mengcheng, et al.
Publicado: (2024)
por: Lan, Mengcheng, et al.
Publicado: (2024)
Aggregating Diverse Cue Experts for AI-Generated Image Detection
por: Tan, Lei, et al.
Publicado: (2026)
por: Tan, Lei, et al.
Publicado: (2026)
Safe-CLIP: Removing NSFW Concepts from Vision-and-Language Models
por: Poppi, Samuele, et al.
Publicado: (2023)
por: Poppi, Samuele, et al.
Publicado: (2023)
FairCLIP: Social Bias Elimination based on Attribute Prototype Learning and Representation Neutralization
por: Wang, Junyang, et al.
Publicado: (2022)
por: Wang, Junyang, et al.
Publicado: (2022)
FractalForensics: Proactive Deepfake Detection and Localization via Fractal Watermarks
por: Wang, Tianyi, et al.
Publicado: (2025)
por: Wang, Tianyi, et al.
Publicado: (2025)
Can CLIP Count Stars? An Empirical Study on Quantity Bias in CLIP
por: Zhang, Zeliang, et al.
Publicado: (2024)
por: Zhang, Zeliang, et al.
Publicado: (2024)
ReCLIP++: Learn to Rectify the Bias of CLIP for Unsupervised Semantic Segmentation
por: Wang, Jingyun, et al.
Publicado: (2024)
por: Wang, Jingyun, et al.
Publicado: (2024)
Word-Anchored Temporal Forgery Localization
por: Wang, Tianyi, et al.
Publicado: (2026)
por: Wang, Tianyi, et al.
Publicado: (2026)
Object-Centric Framework for Video Moment Retrieval
por: Li, Zongyao, et al.
Publicado: (2025)
por: Li, Zongyao, et al.
Publicado: (2025)
FairCLIP: Harnessing Fairness in Vision-Language Learning
por: Luo, Yan, et al.
Publicado: (2024)
por: Luo, Yan, et al.
Publicado: (2024)
ProCLIP: Progressive Vision-Language Alignment via LLM-based Embedder
por: Hu, Xiaoxing, et al.
Publicado: (2025)
por: Hu, Xiaoxing, et al.
Publicado: (2025)
CLIP-Adapter: Better Vision-Language Models with Feature Adapters
por: Gao, Peng, et al.
Publicado: (2021)
por: Gao, Peng, et al.
Publicado: (2021)
STAR: Skeleton-aware Text-based 4D Avatar Generation with In-Network Motion Retargeting
por: Chai, Zenghao, et al.
Publicado: (2024)
por: Chai, Zenghao, et al.
Publicado: (2024)
Learning to Predict Gradients for Semi-Supervised Continual Learning
por: Luo, Yan, et al.
Publicado: (2022)
por: Luo, Yan, et al.
Publicado: (2022)
TOPA: Extending Large Language Models for Video Understanding via Text-Only Pre-Alignment
por: Li, Wei, et al.
Publicado: (2024)
por: Li, Wei, et al.
Publicado: (2024)
MaskedCLIP: Bridging the Masked and CLIP Space for Semi-Supervised Medical Vision-Language Pre-training
por: Zhu, Lei, et al.
Publicado: (2025)
por: Zhu, Lei, et al.
Publicado: (2025)
Is CLIP Cross-Eyed? Revealing and Mitigating Center Bias in the CLIP Family
por: Chew, Oscar, et al.
Publicado: (2026)
por: Chew, Oscar, et al.
Publicado: (2026)
VidLBEval: Benchmarking and Mitigating Language Bias in Video-Involved LVLMs
por: Yang, Yiming, et al.
Publicado: (2025)
por: Yang, Yiming, et al.
Publicado: (2025)
Defurnishing with X-Ray Vision: Joint Removal of Furniture from Panoramas and Mesh
por: Dolhasz, Alan, et al.
Publicado: (2025)
por: Dolhasz, Alan, et al.
Publicado: (2025)
TripletCLIP: Improving Compositional Reasoning of CLIP via Synthetic Vision-Language Negatives
por: Patel, Maitreya, et al.
Publicado: (2024)
por: Patel, Maitreya, et al.
Publicado: (2024)
VisBias: Measuring Explicit and Implicit Social Biases in Vision Language Models
por: Huang, Jen-tse, et al.
Publicado: (2025)
por: Huang, Jen-tse, et al.
Publicado: (2025)
RWKV-CLIP: A Robust Vision-Language Representation Learner
por: Gu, Tiancheng, et al.
Publicado: (2024)
por: Gu, Tiancheng, et al.
Publicado: (2024)
Selective Vision-Language Subspace Projection for Few-shot CLIP
por: Zhu, Xingyu, et al.
Publicado: (2024)
por: Zhu, Xingyu, et al.
Publicado: (2024)
Image-Based Virtual Try-On: A Survey
por: Song, Dan, et al.
Publicado: (2023)
por: Song, Dan, et al.
Publicado: (2023)
MimiCAT: Mimic with Correspondence-Aware Cascade-Transformer for Category-Free 3D Pose Transfer
por: Chai, Zenghao, et al.
Publicado: (2025)
por: Chai, Zenghao, et al.
Publicado: (2025)
Locating Demographic Bias at the Attention-Head Level in CLIP's Vision Encoder
por: Yasser, Alaa, et al.
Publicado: (2026)
por: Yasser, Alaa, et al.
Publicado: (2026)
Nearest Neighbor Projection Removal Adversarial Training
por: Singh, Himanshu, et al.
Publicado: (2025)
por: Singh, Himanshu, et al.
Publicado: (2025)
CosmoCLIP: Generalizing Large Vision-Language Models for Astronomical Imaging
por: Imam, Raza, et al.
Publicado: (2024)
por: Imam, Raza, et al.
Publicado: (2024)
Ejemplares similares
-
ELIP: Efficient Discriminative Language-Image Pre-training with Fewer Vision Tokens
por: Guo, Yangyang, et al.
Publicado: (2023) -
SCAN: Bootstrapping Contrastive Pre-training for Data Efficiency
por: Guo, Yangyang, et al.
Publicado: (2024) -
VidHal: Benchmarking Temporal Hallucinations in Vision LLMs
por: Choong, Wey Yeh, et al.
Publicado: (2024) -
Do Vision-Language Transformers Exhibit Visual Commonsense? An Empirical Study of VCR
por: Li, Zhenyang, et al.
Publicado: (2024) -
The VLLM Safety Paradox: Dual Ease in Jailbreak Attack and Defense
por: Guo, Yangyang, et al.
Publicado: (2024)