Red Teaming Multimodal Language Models: Evaluating Harm Across Prompt Modalities and Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Van Doren, Madison, Ford, Casey |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Alignment Drift in Multimodal LLMs: A Two-Phase, Longitudinal Evaluation of Harm Across Eight Model Releases
par: Ford, Casey, et autres
Publié: (2026)
par: Ford, Casey, et autres
Publié: (2026)
Same Model, Different Weakness: How Language and Modality Reshape the Jailbreak Attack Surface in Frontier MLLMs
par: Ford, Casey, et autres
Publié: (2026)
par: Ford, Casey, et autres
Publié: (2026)
"Be My Cheese?": Cultural Nuance Benchmarking for Machine Translation in Multilingual LLMs
par: Van Doren, Madison, et autres
Publié: (2026)
par: Van Doren, Madison, et autres
Publié: (2026)
"Be My Cheese?": Assessing Cultural Nuance in Multilingual LLM Translations
par: Van Doren, Madison, et autres
Publié: (2025)
par: Van Doren, Madison, et autres
Publié: (2025)
Anecdoctoring: Automated Red-Teaming Across Language and Place
par: Cuevas, Alejandro, et autres
Publié: (2025)
par: Cuevas, Alejandro, et autres
Publié: (2025)
Gradient-Based Language Model Red Teaming
par: Wichers, Nevan, et autres
Publié: (2024)
par: Wichers, Nevan, et autres
Publié: (2024)
Prompt Optimization and Evaluation for LLM Automated Red Teaming
par: Freenor, Michael, et autres
Publié: (2025)
par: Freenor, Michael, et autres
Publié: (2025)
When Prompt Optimization Becomes Jailbreaking: Adaptive Red-Teaming of Large Language Models
par: Shamsi, Zafir, et autres
Publié: (2026)
par: Shamsi, Zafir, et autres
Publié: (2026)
ASTPrompter: Preference-Aligned Automated Language Model Red-Teaming to Generate Low-Perplexity Unsafe Prompts
par: Hardy, Amelia F., et autres
Publié: (2024)
par: Hardy, Amelia F., et autres
Publié: (2024)
Red Teaming Visual Language Models
par: Li, Mukai, et autres
Publié: (2024)
par: Li, Mukai, et autres
Publié: (2024)
Red Teaming Large Language Models for Healthcare
par: Balazadeh, Vahid, et autres
Publié: (2025)
par: Balazadeh, Vahid, et autres
Publié: (2025)
Prompting4Debugging: Red-Teaming Text-to-Image Diffusion Models by Finding Problematic Prompts
par: Chin, Zhi-Yi, et autres
Publié: (2023)
par: Chin, Zhi-Yi, et autres
Publié: (2023)
Evaluating and Steering Modality Preferences in Multimodal Large Language Model
par: Zhang, Yu, et autres
Publié: (2025)
par: Zhang, Yu, et autres
Publié: (2025)
HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal
par: Mazeika, Mantas, et autres
Publié: (2024)
par: Mazeika, Mantas, et autres
Publié: (2024)
RedBench: A Universal Dataset for Comprehensive Red Teaming of Large Language Models
par: Dang, Quy-Anh, et autres
Publié: (2026)
par: Dang, Quy-Anh, et autres
Publié: (2026)
Red Teaming Language Models for Processing Contradictory Dialogues
par: Wen, Xiaofei, et autres
Publié: (2024)
par: Wen, Xiaofei, et autres
Publié: (2024)
Automatic Pseudo-Harmful Prompt Generation for Evaluating False Refusals in Large Language Models
par: An, Bang, et autres
Publié: (2024)
par: An, Bang, et autres
Publié: (2024)
Learning-Based Automated Adversarial Red-Teaming for Robustness Evaluation of Large Language Models
par: Wei, Zhang, et autres
Publié: (2025)
par: Wei, Zhang, et autres
Publié: (2025)
RRTL: Red Teaming Reasoning Large Language Models in Tool Learning
par: Liu, Yifei, et autres
Publié: (2025)
par: Liu, Yifei, et autres
Publié: (2025)
MEGAVERSE: Benchmarking Large Language Models Across Languages, Modalities, Models and Tasks
par: Ahuja, Sanchit, et autres
Publié: (2023)
par: Ahuja, Sanchit, et autres
Publié: (2023)
Resource Consumption Red-Teaming for Large Vision-Language Models
par: Gao, Haoran, et autres
Publié: (2025)
par: Gao, Haoran, et autres
Publié: (2025)
Red-Teaming for Inducing Societal Bias in Large Language Models
par: Luo, Chu Fei, et autres
Publié: (2024)
par: Luo, Chu Fei, et autres
Publié: (2024)
Red-Teaming Vision-Language-Action Models via Quality Diversity Prompt Generation for Robust Robot Policies
par: Srikanth, Siddharth, et autres
Publié: (2026)
par: Srikanth, Siddharth, et autres
Publié: (2026)
RedTopic: Toward Topic-Diverse Red Teaming of Large Language Models
par: Ding, Jiale, et autres
Publié: (2025)
par: Ding, Jiale, et autres
Publié: (2025)
STAR: SocioTechnical Approach to Red Teaming Language Models
par: Weidinger, Laura, et autres
Publié: (2024)
par: Weidinger, Laura, et autres
Publié: (2024)
AutoRed: A Free-form Adversarial Prompt Generation Framework for Automated Red Teaming
par: Diao, Muxi, et autres
Publié: (2025)
par: Diao, Muxi, et autres
Publié: (2025)
Be a Multitude to Itself: A Prompt Evolution Framework for Red Teaming
par: Li, Rui, et autres
Publié: (2025)
par: Li, Rui, et autres
Publié: (2025)
Towards Red Teaming in Multimodal and Multilingual Translation
par: Ropers, Christophe, et autres
Publié: (2024)
par: Ropers, Christophe, et autres
Publié: (2024)
MemeArena: Automating Context-Aware Unbiased Evaluation of Harmfulness Understanding for Multimodal Large Language Models
par: Chen, Zixin, et autres
Publié: (2025)
par: Chen, Zixin, et autres
Publié: (2025)
Audio Is the Achilles' Heel: Red Teaming Audio Large Multimodal Models
par: Yang, Hao, et autres
Publié: (2024)
par: Yang, Hao, et autres
Publié: (2024)
Red Teaming the Mind of the Machine: A Systematic Evaluation of Prompt Injection and Jailbreak Vulnerabilities in LLMs
par: Pathade, Chetan
Publié: (2025)
par: Pathade, Chetan
Publié: (2025)
Evaluating Fairness in Large Vision-Language Models Across Diverse Demographic Attributes and Prompts
par: Wu, Xuyang, et autres
Publié: (2024)
par: Wu, Xuyang, et autres
Publié: (2024)
RedAgent: Red Teaming Large Language Models with Context-aware Autonomous Language Agent
par: Xu, Huiyu, et autres
Publié: (2024)
par: Xu, Huiyu, et autres
Publié: (2024)
A Multi-Domain Red Teaming Framework for Safety, Robustness, and Fairness Evaluation of Medical Large Language Models
par: Feier, Andrei Marian, et autres
Publié: (2026)
par: Feier, Andrei Marian, et autres
Publié: (2026)
The Semantic Hub Hypothesis: Language Models Share Semantic Representations Across Languages and Modalities
par: Wu, Zhaofeng, et autres
Publié: (2024)
par: Wu, Zhaofeng, et autres
Publié: (2024)
Stop Fixating on Prompts: Reasoning Hijacking and Constraint Tightening for Red-Teaming LLM Agents
par: Mao, Yanxu, et autres
Publié: (2026)
par: Mao, Yanxu, et autres
Publié: (2026)
Operationalizing a Threat Model for Red-Teaming Large Language Models (LLMs)
par: Verma, Apurv, et autres
Publié: (2024)
par: Verma, Apurv, et autres
Publié: (2024)
Performance Gap in Entity Knowledge Extraction Across Modalities in Vision Language Models
par: Cohen, Ido, et autres
Publié: (2024)
par: Cohen, Ido, et autres
Publié: (2024)
Building Safe GenAI Applications: An End-to-End Overview of Red Teaming for Large Language Models
par: Purpura, Alberto, et autres
Publié: (2025)
par: Purpura, Alberto, et autres
Publié: (2025)
TRIDENT: Enhancing Large Language Model Safety with Tri-Dimensional Diversified Red-Teaming Data Synthesis
par: Wu, Xiaorui, et autres
Publié: (2025)
par: Wu, Xiaorui, et autres
Publié: (2025)
Documents similaires
-
Alignment Drift in Multimodal LLMs: A Two-Phase, Longitudinal Evaluation of Harm Across Eight Model Releases
par: Ford, Casey, et autres
Publié: (2026) -
Same Model, Different Weakness: How Language and Modality Reshape the Jailbreak Attack Surface in Frontier MLLMs
par: Ford, Casey, et autres
Publié: (2026) -
"Be My Cheese?": Cultural Nuance Benchmarking for Machine Translation in Multilingual LLMs
par: Van Doren, Madison, et autres
Publié: (2026) -
"Be My Cheese?": Assessing Cultural Nuance in Multilingual LLM Translations
par: Van Doren, Madison, et autres
Publié: (2025) -
Anecdoctoring: Automated Red-Teaming Across Language and Place
par: Cuevas, Alejandro, et autres
Publié: (2025)