Playing Devil's Advocate: Unmasking Toxicity and Vulnerabilities in Large Vision-Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Erol, Abdulkadir, Padhi, Trilok, Saha, Agnik, Kursuncu, Ugur, Aktas, Mehmet Emin |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
From Reddit to Generative AI: Evaluating Large Language Models for Anxiety Support Fine-tuned on Social Media Data
by: Kursuncu, Ugur, et al.
Published: (2025)
by: Kursuncu, Ugur, et al.
Published: (2025)
The Silicon Psyche: Anthropomorphic Vulnerabilities in Large Language Models
by: Canale, Giuseppe, et al.
Published: (2025)
by: Canale, Giuseppe, et al.
Published: (2025)
Can Transformer Memory Be Corrupted? Investigating Cache-Side Vulnerabilities in Large Language Models
by: Hossain, Elias, et al.
Published: (2025)
by: Hossain, Elias, et al.
Published: (2025)
Auditing Pay-Per-Token in Large Language Models
by: Velasco, Ander Artola, et al.
Published: (2025)
by: Velasco, Ander Artola, et al.
Published: (2025)
PRISON: Unmasking the Criminal Potential of Large Language Models
by: Wu, Xinyi, et al.
Published: (2025)
by: Wu, Xinyi, et al.
Published: (2025)
A Longitudinal Measurement of Privacy Policy Evolution for Large Language Models
by: Tao, Zhen, et al.
Published: (2025)
by: Tao, Zhen, et al.
Published: (2025)
$\texttt{ModSCAN}$: Measuring Stereotypical Bias in Large Vision-Language Models from Vision and Language Modalities
by: Jiang, Yukun, et al.
Published: (2024)
by: Jiang, Yukun, et al.
Published: (2024)
User Privacy and Large Language Models: An Analysis of Frontier Developers' Privacy Policies
by: King, Jennifer, et al.
Published: (2025)
by: King, Jennifer, et al.
Published: (2025)
Guardrails for trust, safety, and ethical development and deployment of Large Language Models (LLM)
by: Biswas, Anjanava, et al.
Published: (2026)
by: Biswas, Anjanava, et al.
Published: (2026)
Coordinated Flaw Disclosure for AI: Beyond Security Vulnerabilities
by: Cattell, Sven, et al.
Published: (2024)
by: Cattell, Sven, et al.
Published: (2024)
Bridging the Copyright Gap: Do Large Vision-Language Models Recognize and Respect Copyrighted Content?
by: Xu, Naen, et al.
Published: (2025)
by: Xu, Naen, et al.
Published: (2025)
A Proposal for Evaluating the Operational Risk for ChatBots based on Large Language Models
by: Pinacho-Davidson, Pedro, et al.
Published: (2025)
by: Pinacho-Davidson, Pedro, et al.
Published: (2025)
On the Vulnerability of Fairness Constrained Learning to Malicious Noise
by: Blum, Avrim, et al.
Published: (2023)
by: Blum, Avrim, et al.
Published: (2023)
BEACON: A Unified Behavioral-Tactical Framework for Explainable Cybercrime Analysis with Large Language Models
by: Sachdeva, Arush, et al.
Published: (2025)
by: Sachdeva, Arush, et al.
Published: (2025)
Theoretically Unmasking Inference Attacks Against LDP-Protected Clients in Federated Vision Models
by: Nguyen, Quan, et al.
Published: (2025)
by: Nguyen, Quan, et al.
Published: (2025)
Evaluating Adversarial Vulnerabilities in Modern Large Language Models
by: Perel, Tom
Published: (2025)
by: Perel, Tom
Published: (2025)
Exploring Membership Inference Vulnerabilities in Clinical Large Language Models
by: Nemecek, Alexander, et al.
Published: (2025)
by: Nemecek, Alexander, et al.
Published: (2025)
Watermarking Discrete Diffusion Language Models
by: Bagchi, Avi, et al.
Published: (2025)
by: Bagchi, Avi, et al.
Published: (2025)
How Do Data Owners Say No? A Case Study of Data Consent Mechanisms in Web-Scraped Vision-Language AI Training Datasets
by: Lee, Chung Peng, et al.
Published: (2025)
by: Lee, Chung Peng, et al.
Published: (2025)
Phare: A Safety Probe for Large Language Models
by: Jeune, Pierre Le, et al.
Published: (2025)
by: Jeune, Pierre Le, et al.
Published: (2025)
Attacks on Third-Party APIs of Large Language Models
by: Zhao, Wanru, et al.
Published: (2024)
by: Zhao, Wanru, et al.
Published: (2024)
Unvalidated Trust: Cross-Stage Vulnerabilities in Large Language Model Architectures
by: Schwarz, Dominik
Published: (2025)
by: Schwarz, Dominik
Published: (2025)
BugWhisperer: Fine-Tuning LLMs for SoC Hardware Vulnerability Detection
by: Tarek, Shams, et al.
Published: (2025)
by: Tarek, Shams, et al.
Published: (2025)
Love, Lies, and Language Models: Investigating AI's Role in Romance-Baiting Scams
by: Gressel, Gilad, et al.
Published: (2025)
by: Gressel, Gilad, et al.
Published: (2025)
A Study of Vulnerability Repair in JavaScript Programs with Large Language Models
by: Le, Tan Khang, et al.
Published: (2024)
by: Le, Tan Khang, et al.
Published: (2024)
MARVEL: Multi-Agent RTL Vulnerability Extraction using Large Language Models
by: Collini, Luca, et al.
Published: (2025)
by: Collini, Luca, et al.
Published: (2025)
Beyond Single Bugs: Benchmarking Large Language Models for Multi-Vulnerability Detection
by: Pushkar, Chinmay, et al.
Published: (2025)
by: Pushkar, Chinmay, et al.
Published: (2025)
Beyond Context: Large Language Models' Failure to Grasp Users' Intent
by: Hussain, Ahmed M., et al.
Published: (2025)
by: Hussain, Ahmed M., et al.
Published: (2025)
TombRaider: Entering the Vault of History to Jailbreak Large Language Models
by: Ding, Junchen, et al.
Published: (2025)
by: Ding, Junchen, et al.
Published: (2025)
The Devil's Advocate: Shattering the Illusion of Unexploitable Data using Diffusion Models
by: Dolatabadi, Hadi M., et al.
Published: (2023)
by: Dolatabadi, Hadi M., et al.
Published: (2023)
Echoes of Human Malice in Agents: Benchmarking LLMs for Multi-Turn Online Harassment Attacks
by: Padhi, Trilok, et al.
Published: (2025)
by: Padhi, Trilok, et al.
Published: (2025)
DSSmoothing: Toward Certified Dataset Ownership Verification for Pre-trained Language Models via Dual-Space Smoothing
by: Qiao, Ting, et al.
Published: (2025)
by: Qiao, Ting, et al.
Published: (2025)
PrompTrend: Continuous Community-Driven Vulnerability Discovery and Assessment for Large Language Models
by: Gasmi, Tarek, et al.
Published: (2025)
by: Gasmi, Tarek, et al.
Published: (2025)
CryptoScope: Utilizing Large Language Models for Automated Cryptographic Logic Vulnerability Detection
by: Li, Zhihao, et al.
Published: (2025)
by: Li, Zhihao, et al.
Published: (2025)
Retrieval Augmented Generation Integrated Large Language Models in Smart Contract Vulnerability Detection
by: Yu, Jeffy
Published: (2024)
by: Yu, Jeffy
Published: (2024)
Code Vulnerability Repair with Large Language Model using Context-Aware Prompt Tuning
by: Khan, Arshiya, et al.
Published: (2024)
by: Khan, Arshiya, et al.
Published: (2024)
Transient Turn Injection: Exposing Stateless Multi-Turn Vulnerabilities in Large Language Models
by: Rayhan, Naheed, et al.
Published: (2026)
by: Rayhan, Naheed, et al.
Published: (2026)
Beyond Content Safety: Real-Time Monitoring for Reasoning Vulnerabilities in Large Language Models
by: Wang, Xunguang, et al.
Published: (2026)
by: Wang, Xunguang, et al.
Published: (2026)
Jailbreaking and Mitigation of Vulnerabilities in Large Language Models
by: Peng, Benji, et al.
Published: (2024)
by: Peng, Benji, et al.
Published: (2024)
Finetuning Large Language Models for Vulnerability Detection
by: Shestov, Alexey, et al.
Published: (2024)
by: Shestov, Alexey, et al.
Published: (2024)
Similar Items
-
From Reddit to Generative AI: Evaluating Large Language Models for Anxiety Support Fine-tuned on Social Media Data
by: Kursuncu, Ugur, et al.
Published: (2025) -
The Silicon Psyche: Anthropomorphic Vulnerabilities in Large Language Models
by: Canale, Giuseppe, et al.
Published: (2025) -
Can Transformer Memory Be Corrupted? Investigating Cache-Side Vulnerabilities in Large Language Models
by: Hossain, Elias, et al.
Published: (2025) -
Auditing Pay-Per-Token in Large Language Models
by: Velasco, Ander Artola, et al.
Published: (2025) -
PRISON: Unmasking the Criminal Potential of Large Language Models
by: Wu, Xinyi, et al.
Published: (2025)