SocialFusion: Addressing Social Degradation in Pre-trained Vision-Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Tahboub, Hamza, Shi, Weiyan, Hua, Gang, Jiang, Huaizu |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Downstream Transfer Attack: Adversarial Attacks on Downstream Models with Pre-trained Vision Transformers
por: Zheng, Weijie, et al.
Publicado: (2024)
por: Zheng, Weijie, et al.
Publicado: (2024)
Demographic User Modeling for Social Robotics with Multimodal Pre-trained Models
por: Rahimi, Hamed, et al.
Publicado: (2025)
por: Rahimi, Hamed, et al.
Publicado: (2025)
A Unified Understanding of Adversarial Vulnerability Regarding Unimodal Models and Vision-Language Pre-training Models
por: Zheng, Haonan, et al.
Publicado: (2024)
por: Zheng, Haonan, et al.
Publicado: (2024)
Do Pre-trained Vision-Language Models Encode Object States?
por: Newman, Kaleb, et al.
Publicado: (2024)
por: Newman, Kaleb, et al.
Publicado: (2024)
Efficient Vision-and-Language Pre-training with Text-Relevant Image Patch Selection
por: Ye, Wei, et al.
Publicado: (2024)
por: Ye, Wei, et al.
Publicado: (2024)
MAFA: Managing False Negatives for Vision-Language Pre-training
por: Byun, Jaeseok, et al.
Publicado: (2023)
por: Byun, Jaeseok, et al.
Publicado: (2023)
TRIPS: Efficient Vision-and-Language Pre-training with Text-Relevant Image Patch Selection
por: Jiang, Chaoya, et al.
Publicado: (2023)
por: Jiang, Chaoya, et al.
Publicado: (2023)
Low-hallucination Synthetic Captions for Large-Scale Vision-Language Model Pre-training
por: Zhang, Xinsong, et al.
Publicado: (2025)
por: Zhang, Xinsong, et al.
Publicado: (2025)
Conjugated Semantic Pool Improves OOD Detection with Pre-trained Vision-Language Models
por: Chen, Mengyuan, et al.
Publicado: (2024)
por: Chen, Mengyuan, et al.
Publicado: (2024)
Patch is Enough: Naturalistic Adversarial Patch against Vision-Language Pre-training Models
por: Kong, Dehong, et al.
Publicado: (2024)
por: Kong, Dehong, et al.
Publicado: (2024)
TAP-VL: Text Layout-Aware Pre-training for Enriched Vision-Language Models
por: Fhima, Jonathan, et al.
Publicado: (2024)
por: Fhima, Jonathan, et al.
Publicado: (2024)
Fine-tuning Pre-trained Vision-Language Models in a Human-Annotation-Free Manner
por: Wang, Qian-Wei, et al.
Publicado: (2026)
por: Wang, Qian-Wei, et al.
Publicado: (2026)
A Two-Stage Globally-Diverse Adversarial Attack for Vision-Language Pre-training Models
por: Chen, Wutao, et al.
Publicado: (2026)
por: Chen, Wutao, et al.
Publicado: (2026)
Interpretable Debiasing of Vision-Language Models for Social Fairness
por: An, Na Min, et al.
Publicado: (2026)
por: An, Na Min, et al.
Publicado: (2026)
Can Medical Vision-Language Pre-training Succeed with Purely Synthetic Data?
por: Liu, Che, et al.
Publicado: (2024)
por: Liu, Che, et al.
Publicado: (2024)
NeuFlow: Real-time, High-accuracy Optical Flow Estimation on Robots Using Edge Devices
por: Zhang, Zhiyong, et al.
Publicado: (2024)
por: Zhang, Zhiyong, et al.
Publicado: (2024)
Avoid Wasted Annotation Costs in Open-set Active Learning with Pre-trained Vision-Language Model
por: Heo, Jaehyuk, et al.
Publicado: (2024)
por: Heo, Jaehyuk, et al.
Publicado: (2024)
Respecting Modality Gap in Post-hoc Out-of-distribution Detection with Pre-trained Vision-Language Models
por: Hu, Yuanwei, et al.
Publicado: (2026)
por: Hu, Yuanwei, et al.
Publicado: (2026)
Superpixel Semantics Representation and Pre-training for Vision-Language Task
por: Zhang, Siyu, et al.
Publicado: (2023)
por: Zhang, Siyu, et al.
Publicado: (2023)
SocialCounterfactuals: Probing and Mitigating Intersectional Social Biases in Vision-Language Models with Counterfactual Examples
por: Howard, Phillip, et al.
Publicado: (2023)
por: Howard, Phillip, et al.
Publicado: (2023)
Grounded Knowledge-Enhanced Medical Vision-Language Pre-training for Chest X-Ray
por: Deng, Qiao, et al.
Publicado: (2024)
por: Deng, Qiao, et al.
Publicado: (2024)
3D Modality-Aware Pre-training for Vision-Language Model in MRI Multi-organ Abnormality Detection
por: Zhu, Haowen, et al.
Publicado: (2026)
por: Zhu, Haowen, et al.
Publicado: (2026)
DanQing: An Up-to-Date Large-Scale Chinese Vision-Language Pre-training Dataset
por: Shen, Hengyu, et al.
Publicado: (2026)
por: Shen, Hengyu, et al.
Publicado: (2026)
Effective Backdoor Mitigation in Vision-Language Models Depends on the Pre-training Objective
por: Verma, Sahil, et al.
Publicado: (2023)
por: Verma, Sahil, et al.
Publicado: (2023)
FUSE-RSVLM: Feature Fusion Vision-Language Model for Remote Sensing
por: Dang, Yunkai, et al.
Publicado: (2025)
por: Dang, Yunkai, et al.
Publicado: (2025)
Adversarial Prompt Distillation for Vision-Language Models
por: Luo, Lin, et al.
Publicado: (2024)
por: Luo, Lin, et al.
Publicado: (2024)
AddressVLM: Cross-view Alignment Tuning for Image Address Localization using Large Vision-Language Models
por: Xu, Shixiong, et al.
Publicado: (2025)
por: Xu, Shixiong, et al.
Publicado: (2025)
MedUnifier: Unifying Vision-and-Language Pre-training on Medical Data with Vision Generation Task using Discrete Visual Representations
por: Zhang, Ziyang, et al.
Publicado: (2025)
por: Zhang, Ziyang, et al.
Publicado: (2025)
Pre-Trained Vision-Language Models as Partial Annotators
por: Wang, Qian-Wei, et al.
Publicado: (2024)
por: Wang, Qian-Wei, et al.
Publicado: (2024)
Pre-trained Vision-Language Models Learn Discoverable Visual Concepts
por: Zang, Yuan, et al.
Publicado: (2024)
por: Zang, Yuan, et al.
Publicado: (2024)
Practical Continual Forgetting for Pre-trained Vision Models
por: Zhao, Hongbo, et al.
Publicado: (2025)
por: Zhao, Hongbo, et al.
Publicado: (2025)
Adversarial Prompt Tuning for Vision-Language Models
por: Zhang, Jiaming, et al.
Publicado: (2023)
por: Zhang, Jiaming, et al.
Publicado: (2023)
MedFILIP: Medical Fine-grained Language-Image Pre-training
por: Liang, Xinjie, et al.
Publicado: (2025)
por: Liang, Xinjie, et al.
Publicado: (2025)
NeuFlow v2: Push High-Efficiency Optical Flow To the Limit
por: Zhang, Zhiyong, et al.
Publicado: (2024)
por: Zhang, Zhiyong, et al.
Publicado: (2024)
Feedback-based Modal Mutual Search for Attacking Vision-Language Pre-training Models
por: Ding, Renhua, et al.
Publicado: (2024)
por: Ding, Renhua, et al.
Publicado: (2024)
Generative Pre-trained Autoregressive Diffusion Transformer
por: Zhang, Yuan, et al.
Publicado: (2025)
por: Zhang, Yuan, et al.
Publicado: (2025)
Efficient Adaptation of Pre-trained Vision Transformer via Householder Transformation
por: Dong, Wei, et al.
Publicado: (2024)
por: Dong, Wei, et al.
Publicado: (2024)
MG-3D: Multi-Grained Knowledge-Enhanced 3D Medical Vision-Language Pre-training
por: Ni, Xuefeng, et al.
Publicado: (2024)
por: Ni, Xuefeng, et al.
Publicado: (2024)
Edu-MMBias: A Three-Tier Multimodal Benchmark for Auditing Social Bias in Vision-Language Models under Educational Contexts
por: Li, Ruijia, et al.
Publicado: (2026)
por: Li, Ruijia, et al.
Publicado: (2026)
Grounding DINO-US-SAM: Text-Prompted Multi-Organ Segmentation in Ultrasound with LoRA-Tuned Vision-Language Models
por: Rasaee, Hamza, et al.
Publicado: (2025)
por: Rasaee, Hamza, et al.
Publicado: (2025)
Ejemplares similares
-
Downstream Transfer Attack: Adversarial Attacks on Downstream Models with Pre-trained Vision Transformers
por: Zheng, Weijie, et al.
Publicado: (2024) -
Demographic User Modeling for Social Robotics with Multimodal Pre-trained Models
por: Rahimi, Hamed, et al.
Publicado: (2025) -
A Unified Understanding of Adversarial Vulnerability Regarding Unimodal Models and Vision-Language Pre-training Models
por: Zheng, Haonan, et al.
Publicado: (2024) -
Do Pre-trained Vision-Language Models Encode Object States?
por: Newman, Kaleb, et al.
Publicado: (2024) -
Efficient Vision-and-Language Pre-training with Text-Relevant Image Patch Selection
por: Ye, Wei, et al.
Publicado: (2024)