GUARD: Role-playing to Generate Natural-language Jailbreakings to Test Guideline Adherence of Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Jin, Haibo, Chen, Ruoxi, Zhang, Peiyan, Zhou, Andy, Wang, Haohan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
GUARD: Guideline Upholding Test through Adaptive Role-play and Jailbreak Diagnostics for LLMs
di: Jin, Haibo, et al.
Pubblicazione: (2025)
di: Jin, Haibo, et al.
Pubblicazione: (2025)
From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models
di: Jin, Haibo, et al.
Pubblicazione: (2025)
di: Jin, Haibo, et al.
Pubblicazione: (2025)
Jailbreaking Large Language Models Against Moderation Guardrails via Cipher Characters
di: Jin, Haibo, et al.
Pubblicazione: (2024)
di: Jin, Haibo, et al.
Pubblicazione: (2024)
JailbreakZoo: Survey, Landscapes, and Horizons in Jailbreaking Large Language and Vision-Language Models
di: Jin, Haibo, et al.
Pubblicazione: (2024)
di: Jin, Haibo, et al.
Pubblicazione: (2024)
Reasoning Can Hurt the Inductive Abilities of Large Language Models
di: Jin, Haibo, et al.
Pubblicazione: (2025)
di: Jin, Haibo, et al.
Pubblicazione: (2025)
Robust Prompt Optimization for Defending Language Models Against Jailbreaking Attacks
di: Zhou, Andy, et al.
Pubblicazione: (2024)
di: Zhou, Andy, et al.
Pubblicazione: (2024)
Images are Achilles' Heel of Alignment: Exploiting Visual Vulnerabilities for Jailbreaking Multimodal Large Language Models
di: Li, Yifan, et al.
Pubblicazione: (2024)
di: Li, Yifan, et al.
Pubblicazione: (2024)
Cross-Modal Obfuscation for Jailbreak Attacks on Large Vision-Language Models
di: Jiang, Lei, et al.
Pubblicazione: (2025)
di: Jiang, Lei, et al.
Pubblicazione: (2025)
GuardVal: Dynamic Large Language Model Jailbreak Evaluation for Comprehensive Safety Testing
di: Zhang, Peiyan, et al.
Pubblicazione: (2025)
di: Zhang, Peiyan, et al.
Pubblicazione: (2025)
Jailbreaking Attack against Multimodal Large Language Model
di: Niu, Zhenxing, et al.
Pubblicazione: (2024)
di: Niu, Zhenxing, et al.
Pubblicazione: (2024)
Language Agent Tree Search Unifies Reasoning Acting and Planning in Language Models
di: Zhou, Andy, et al.
Pubblicazione: (2023)
di: Zhou, Andy, et al.
Pubblicazione: (2023)
Open Sesame! Universal Black Box Jailbreaking of Large Language Models
di: Lapid, Raz, et al.
Pubblicazione: (2023)
di: Lapid, Raz, et al.
Pubblicazione: (2023)
Jailbreaking Multimodal Large Language Models using Multi-Clip Video
di: Kang, Choongwon, et al.
Pubblicazione: (2026)
di: Kang, Choongwon, et al.
Pubblicazione: (2026)
Jailbreak Attacks and Defenses against Multimodal Generative Models: A Survey
di: Liu, Xuannan, et al.
Pubblicazione: (2024)
di: Liu, Xuannan, et al.
Pubblicazione: (2024)
E$^2$AT: Multimodal Jailbreak Defense via Dynamic Joint Optimization for Multimodal Large Language Models
di: Lu, Liming, et al.
Pubblicazione: (2025)
di: Lu, Liming, et al.
Pubblicazione: (2025)
EditShield: Protecting Unauthorized Image Editing by Instruction-guided Diffusion Models
di: Chen, Ruoxi, et al.
Pubblicazione: (2023)
di: Chen, Ruoxi, et al.
Pubblicazione: (2023)
Modality Bias in LVLMs: Analyzing and Mitigating Object Hallucination via Attention Lens
di: Zheng, Haohan, et al.
Pubblicazione: (2025)
di: Zheng, Haohan, et al.
Pubblicazione: (2025)
PromptMRG: Diagnosis-Driven Prompts for Medical Report Generation
di: Jin, Haibo, et al.
Pubblicazione: (2023)
di: Jin, Haibo, et al.
Pubblicazione: (2023)
Crafting Adversarial Inputs for Large Vision-Language Models Using Black-Box Optimization
di: Guan, Jiwei, et al.
Pubblicazione: (2026)
di: Guan, Jiwei, et al.
Pubblicazione: (2026)
Exploring the Role of Explicit Temporal Modeling in Multimodal Large Language Models for Video Understanding
di: Li, Yun, et al.
Pubblicazione: (2025)
di: Li, Yun, et al.
Pubblicazione: (2025)
ChartMuseum: Testing Visual Reasoning Capabilities of Large Vision-Language Models
di: Tang, Liyan, et al.
Pubblicazione: (2025)
di: Tang, Liyan, et al.
Pubblicazione: (2025)
LLM-driven Medical Report Generation via Communication-efficient Heterogeneous Federated Learning
di: Che, Haoxuan, et al.
Pubblicazione: (2025)
di: Che, Haoxuan, et al.
Pubblicazione: (2025)
Black-Box Visual Prompt Engineering for Mitigating Object Hallucination in Large Vision Language Models
di: Woo, Sangmin, et al.
Pubblicazione: (2025)
di: Woo, Sangmin, et al.
Pubblicazione: (2025)
Jailbreaking Safeguarded Text-to-Image Models via Large Language Models
di: Jiang, Zhengyuan, et al.
Pubblicazione: (2025)
di: Jiang, Zhengyuan, et al.
Pubblicazione: (2025)
Phoneme-Level Visual Speech Recognition via Point-Visual Fusion and Language Model Reconstruction
di: Teng, Matthew Kit Khinn, et al.
Pubblicazione: (2025)
di: Teng, Matthew Kit Khinn, et al.
Pubblicazione: (2025)
Intriguing Properties of Large Language and Vision Models
di: Lee, Young-Jun, et al.
Pubblicazione: (2024)
di: Lee, Young-Jun, et al.
Pubblicazione: (2024)
LADR: Locality-Aware Dynamic Rescue for Efficient Text-to-Image Generation with Diffusion Large Language Models
di: Wang, Chenglin, et al.
Pubblicazione: (2026)
di: Wang, Chenglin, et al.
Pubblicazione: (2026)
NaturalBench: Evaluating Vision-Language Models on Natural Adversarial Samples
di: Li, Baiqi, et al.
Pubblicazione: (2024)
di: Li, Baiqi, et al.
Pubblicazione: (2024)
Visual In-Context Learning for Large Vision-Language Models
di: Zhou, Yucheng, et al.
Pubblicazione: (2024)
di: Zhou, Yucheng, et al.
Pubblicazione: (2024)
Natural Language Inference Improves Compositionality in Vision-Language Models
di: Cascante-Bonilla, Paola, et al.
Pubblicazione: (2024)
di: Cascante-Bonilla, Paola, et al.
Pubblicazione: (2024)
ColorBlindnessEval: Can Vision-Language Models Pass Color Blindness Tests?
di: Ling, Zijian, et al.
Pubblicazione: (2025)
di: Ling, Zijian, et al.
Pubblicazione: (2025)
Video2Roleplay: A Multimodal Dataset and Framework for Video-Guided Role-playing Agents
di: Zhang, Xueqiao, et al.
Pubblicazione: (2025)
di: Zhang, Xueqiao, et al.
Pubblicazione: (2025)
From Behavioral Performance to Internal Competence: Interpreting Vision-Language Models with VLM-Lens
di: Sheta, Hala, et al.
Pubblicazione: (2025)
di: Sheta, Hala, et al.
Pubblicazione: (2025)
Mitigating Hallucinations in Large Vision-Language Models with Internal Fact-based Contrastive Decoding
di: Wang, Chao, et al.
Pubblicazione: (2025)
di: Wang, Chao, et al.
Pubblicazione: (2025)
Frame-Voyager: Learning to Query Frames for Video Large Language Models
di: Yu, Sicheng, et al.
Pubblicazione: (2024)
di: Yu, Sicheng, et al.
Pubblicazione: (2024)
Kosmos-G: Generating Images in Context with Multimodal Large Language Models
di: Pan, Xichen, et al.
Pubblicazione: (2023)
di: Pan, Xichen, et al.
Pubblicazione: (2023)
TUBench: Benchmarking Large Vision-Language Models on Trustworthiness with Unanswerable Questions
di: He, Xingwei, et al.
Pubblicazione: (2024)
di: He, Xingwei, et al.
Pubblicazione: (2024)
Adaptive Vision-Language Model Routing for Computer Use Agents
di: Liu, Xunzhuo, et al.
Pubblicazione: (2026)
di: Liu, Xunzhuo, et al.
Pubblicazione: (2026)
Rethinking Visual Dependency in Long-Context Reasoning for Large Vision-Language Models
di: Zhou, Yucheng, et al.
Pubblicazione: (2024)
di: Zhou, Yucheng, et al.
Pubblicazione: (2024)
Leveraging Large Language Models for Scalable Vector Graphics-Driven Image Understanding
di: Cai, Mu, et al.
Pubblicazione: (2023)
di: Cai, Mu, et al.
Pubblicazione: (2023)
Documenti analoghi
-
GUARD: Guideline Upholding Test through Adaptive Role-play and Jailbreak Diagnostics for LLMs
di: Jin, Haibo, et al.
Pubblicazione: (2025) -
From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models
di: Jin, Haibo, et al.
Pubblicazione: (2025) -
Jailbreaking Large Language Models Against Moderation Guardrails via Cipher Characters
di: Jin, Haibo, et al.
Pubblicazione: (2024) -
JailbreakZoo: Survey, Landscapes, and Horizons in Jailbreaking Large Language and Vision-Language Models
di: Jin, Haibo, et al.
Pubblicazione: (2024) -
Reasoning Can Hurt the Inductive Abilities of Large Language Models
di: Jin, Haibo, et al.
Pubblicazione: (2025)