$\texttt{ModSCAN}$: Measuring Stereotypical Bias in Large Vision-Language Models from Vision and Language Modalities
Fuente:
arXiv
Salvato in:
| Autori principali: | Jiang, Yukun, Li, Zheng, Shen, Xinyue, Liu, Yugeng, Backes, Michael, Zhang, Yang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Robustness Over Time: Understanding Adversarial Examples' Effectiveness on Longitudinal Versions of Large Language Models
di: Liu, Yugeng, et al.
Pubblicazione: (2023)
di: Liu, Yugeng, et al.
Pubblicazione: (2023)
Adjacent Words, Divergent Intents: Jailbreaking Large Language Models via Task Concurrency
di: Jiang, Yukun, et al.
Pubblicazione: (2025)
di: Jiang, Yukun, et al.
Pubblicazione: (2025)
Bridging the Gap in Vision Language Models in Identifying Unsafe Concepts Across Modalities
di: Qu, Yiting, et al.
Pubblicazione: (2025)
di: Qu, Yiting, et al.
Pubblicazione: (2025)
Pop Quiz Attack: Black-box Membership Inference Attacks Against Large Language Models
di: Chen, Zeyuan, et al.
Pubblicazione: (2026)
di: Chen, Zeyuan, et al.
Pubblicazione: (2026)
Watermarking LLM-Generated Datasets in Downstream Tasks
di: Liu, Yugeng, et al.
Pubblicazione: (2025)
di: Liu, Yugeng, et al.
Pubblicazione: (2025)
Amplifying Machine Learning Attacks Through Strategic Compositions
di: Liu, Yugeng, et al.
Pubblicazione: (2025)
di: Liu, Yugeng, et al.
Pubblicazione: (2025)
"Do Anything Now": Characterizing and Evaluating In-The-Wild Jailbreak Prompts on Large Language Models
di: Shen, Xinyue, et al.
Pubblicazione: (2023)
di: Shen, Xinyue, et al.
Pubblicazione: (2023)
HarmfulSkillBench: How Do Harmful Skills Weaponize Your Agents?
di: Jiang, Yukun, et al.
Pubblicazione: (2026)
di: Jiang, Yukun, et al.
Pubblicazione: (2026)
JailbreakRadar: Comprehensive Assessment of Jailbreak Attacks Against LLMs
di: Chu, Junjie, et al.
Pubblicazione: (2024)
di: Chu, Junjie, et al.
Pubblicazione: (2024)
Playing Devil's Advocate: Unmasking Toxicity and Vulnerabilities in Large Vision-Language Models
di: Erol, Abdulkadir, et al.
Pubblicazione: (2025)
di: Erol, Abdulkadir, et al.
Pubblicazione: (2025)
Real Money, Fake Models: Deceptive Model Claims in Shadow APIs
di: Zhang, Yage, et al.
Pubblicazione: (2026)
di: Zhang, Yage, et al.
Pubblicazione: (2026)
"Humans welcome to observe": A First Look at the Agent Social Network Moltbook
di: Jiang, Yukun, et al.
Pubblicazione: (2026)
di: Jiang, Yukun, et al.
Pubblicazione: (2026)
Peering Behind the Shield: Guardrail Identification in Large Language Models
di: Yang, Ziqing, et al.
Pubblicazione: (2025)
di: Yang, Ziqing, et al.
Pubblicazione: (2025)
Synthetic Artifact Auditing: Tracing LLM-Generated Synthetic Data Usage in Downstream Applications
di: Wu, Yixin, et al.
Pubblicazione: (2025)
di: Wu, Yixin, et al.
Pubblicazione: (2025)
The Challenge of Identifying the Origin of Black-Box Large Language Models
di: Yang, Ziqing, et al.
Pubblicazione: (2025)
di: Yang, Ziqing, et al.
Pubblicazione: (2025)
Prompt Stealing Attacks Against Text-to-Image Generation Models
di: Shen, Xinyue, et al.
Pubblicazione: (2023)
di: Shen, Xinyue, et al.
Pubblicazione: (2023)
A Longitudinal Measurement of Privacy Policy Evolution for Large Language Models
di: Tao, Zhen, et al.
Pubblicazione: (2025)
di: Tao, Zhen, et al.
Pubblicazione: (2025)
Data Defenses Against Large Language Models
di: Agnew, William, et al.
Pubblicazione: (2024)
di: Agnew, William, et al.
Pubblicazione: (2024)
Bridging the Copyright Gap: Do Large Vision-Language Models Recognize and Respect Copyrighted Content?
di: Xu, Naen, et al.
Pubblicazione: (2025)
di: Xu, Naen, et al.
Pubblicazione: (2025)
When GPT Spills the Tea: Comprehensive Assessment of Knowledge File Leakage in GPTs
di: Shen, Xinyue, et al.
Pubblicazione: (2025)
di: Shen, Xinyue, et al.
Pubblicazione: (2025)
MM-AttacKG: A Multimodal Approach to Attack Graph Construction with Large Language Models
di: Zhang, Yongheng, et al.
Pubblicazione: (2025)
di: Zhang, Yongheng, et al.
Pubblicazione: (2025)
Composite Backdoor Attacks Against Large Language Models
di: Huang, Hai, et al.
Pubblicazione: (2023)
di: Huang, Hai, et al.
Pubblicazione: (2023)
Large Language Models as a (Bad) Security Norm in the Context of Regulation and Compliance
di: Ludvigsen, Kaspar Rosager
Pubblicazione: (2025)
di: Ludvigsen, Kaspar Rosager
Pubblicazione: (2025)
Image-Perfect Imperfections: Safety, Bias, and Authenticity in the Shadow of Text-To-Image Model Evolution
di: Wu, Yixin, et al.
Pubblicazione: (2024)
di: Wu, Yixin, et al.
Pubblicazione: (2024)
Resource Consumption Red-Teaming for Large Vision-Language Models
di: Gao, Haoran, et al.
Pubblicazione: (2025)
di: Gao, Haoran, et al.
Pubblicazione: (2025)
Safety and Security Analysis of Large Language Models: Benchmarking Risk Profile and Harm Potential
di: Akiri, Charankumar, et al.
Pubblicazione: (2025)
di: Akiri, Charankumar, et al.
Pubblicazione: (2025)
Voice Jailbreak Attacks Against GPT-4o
di: Shen, Xinyue, et al.
Pubblicazione: (2024)
di: Shen, Xinyue, et al.
Pubblicazione: (2024)
How Do Data Owners Say No? A Case Study of Data Consent Mechanisms in Web-Scraped Vision-Language AI Training Datasets
di: Lee, Chung Peng, et al.
Pubblicazione: (2025)
di: Lee, Chung Peng, et al.
Pubblicazione: (2025)
Reasoning-Oriented Programming: Chaining Semantic Gadgets to Jailbreak Large Vision Language Models
di: Zou, Quanchen, et al.
Pubblicazione: (2026)
di: Zou, Quanchen, et al.
Pubblicazione: (2026)
A Cross-Modal Prompt Injection Attack against Large Vision-Language Models with Image-Only Perturbation
di: Yang, Hao, et al.
Pubblicazione: (2026)
di: Yang, Hao, et al.
Pubblicazione: (2026)
Membership Inference Attacks Against Vision-Language Models
di: Hu, Yuke, et al.
Pubblicazione: (2025)
di: Hu, Yuke, et al.
Pubblicazione: (2025)
De-amplifying Bias from Differential Privacy in Language Model Fine-tuning
di: Srivastava, Sanjari, et al.
Pubblicazione: (2024)
di: Srivastava, Sanjari, et al.
Pubblicazione: (2024)
How Susceptible are Large Language Models to Ideological Manipulation?
di: Chen, Kai, et al.
Pubblicazione: (2024)
di: Chen, Kai, et al.
Pubblicazione: (2024)
Auditing Pay-Per-Token in Large Language Models
di: Velasco, Ander Artola, et al.
Pubblicazione: (2025)
di: Velasco, Ander Artola, et al.
Pubblicazione: (2025)
Tit-for-Tat: Safeguarding Large Vision-Language Models Against Jailbreak Attacks via Adversarial Defense
di: Hao, Shuyang, et al.
Pubblicazione: (2025)
di: Hao, Shuyang, et al.
Pubblicazione: (2025)
SOS! Soft Prompt Attack Against Open-Source Large Language Models
di: Yang, Ziqing, et al.
Pubblicazione: (2024)
di: Yang, Ziqing, et al.
Pubblicazione: (2024)
Physical Backdoor Attack can Jeopardize Driving with Vision-Large-Language Models
di: Ni, Zhenyang, et al.
Pubblicazione: (2024)
di: Ni, Zhenyang, et al.
Pubblicazione: (2024)
An Investigation into Misuse of Java Security APIs by Large Language Models
di: Mousavi, Zahra, et al.
Pubblicazione: (2024)
di: Mousavi, Zahra, et al.
Pubblicazione: (2024)
Jailbreak Vision Language Models via Bi-Modal Adversarial Prompt
di: Ying, Zonghao, et al.
Pubblicazione: (2024)
di: Ying, Zonghao, et al.
Pubblicazione: (2024)
Ethical Challenges in Computer Vision: Ensuring Privacy and Mitigating Bias in Publicly Available Datasets
di: Tahir, Ghalib Ahmed
Pubblicazione: (2024)
di: Tahir, Ghalib Ahmed
Pubblicazione: (2024)
Documenti analoghi
-
Robustness Over Time: Understanding Adversarial Examples' Effectiveness on Longitudinal Versions of Large Language Models
di: Liu, Yugeng, et al.
Pubblicazione: (2023) -
Adjacent Words, Divergent Intents: Jailbreaking Large Language Models via Task Concurrency
di: Jiang, Yukun, et al.
Pubblicazione: (2025) -
Bridging the Gap in Vision Language Models in Identifying Unsafe Concepts Across Modalities
di: Qu, Yiting, et al.
Pubblicazione: (2025) -
Pop Quiz Attack: Black-box Membership Inference Attacks Against Large Language Models
di: Chen, Zeyuan, et al.
Pubblicazione: (2026) -
Watermarking LLM-Generated Datasets in Downstream Tasks
di: Liu, Yugeng, et al.
Pubblicazione: (2025)