RapGuard: Safeguarding Multimodal Large Language Models via Rationale-aware Defensive Prompting
Fuente:
arXiv
Salvato in:
| Autori principali: | Jiang, Yilei, Tan, Yingshui, Yue, Xiangyu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MSR-Align: Policy-Grounded Multimodal Alignment for Safety-Aware Reasoning in Vision-Language Models
di: Xia, Yinan, et al.
Pubblicazione: (2025)
di: Xia, Yinan, et al.
Pubblicazione: (2025)
HiddenDetect: Detecting Jailbreak Attacks against Large Vision-Language Models via Monitoring Hidden States
di: Jiang, Yilei, et al.
Pubblicazione: (2025)
di: Jiang, Yilei, et al.
Pubblicazione: (2025)
QuadSentinel: Sequent Safety for Machine-Checkable Control in Multi-agent Systems
di: Yang, Yiliu, et al.
Pubblicazione: (2025)
di: Yang, Yiliu, et al.
Pubblicazione: (2025)
On Prompt-Driven Safeguarding for Large Language Models
di: Zheng, Chujie, et al.
Pubblicazione: (2024)
di: Zheng, Chujie, et al.
Pubblicazione: (2024)
ConceptGuard: Proactive Safety in Text-and-Image-to-Video Generation through Multimodal Risk Detection
di: Ma, Ruize, et al.
Pubblicazione: (2025)
di: Ma, Ruize, et al.
Pubblicazione: (2025)
Self-Guard: Empower the LLM to Safeguard Itself
di: Wang, Zezhong, et al.
Pubblicazione: (2023)
di: Wang, Zezhong, et al.
Pubblicazione: (2023)
ReasoningGuard: Safeguarding Large Reasoning Models with Inference-time Safety Aha Moments
di: Wang, Yuquan, et al.
Pubblicazione: (2025)
di: Wang, Yuquan, et al.
Pubblicazione: (2025)
Sysformer: Safeguarding Frozen Large Language Models with Adaptive System Prompts
di: Sharma, Kartik, et al.
Pubblicazione: (2025)
di: Sharma, Kartik, et al.
Pubblicazione: (2025)
SEA-Guard: Culturally Grounded Multilingual Safeguard for Southeast Asia
di: Tasawong, Panuthep, et al.
Pubblicazione: (2026)
di: Tasawong, Panuthep, et al.
Pubblicazione: (2026)
Jailbreaking Safeguarded Text-to-Image Models via Large Language Models
di: Jiang, Zhengyuan, et al.
Pubblicazione: (2025)
di: Jiang, Zhengyuan, et al.
Pubblicazione: (2025)
GLiGuard: Schema-Conditioned Classification for LLM Safeguard
di: Zaratiana, Urchade, et al.
Pubblicazione: (2026)
di: Zaratiana, Urchade, et al.
Pubblicazione: (2026)
Large Language Models are Clinical Reasoners: Reasoning-Aware Diagnosis Framework with Prompt-Generated Rationales
di: Kwon, Taeyoon, et al.
Pubblicazione: (2023)
di: Kwon, Taeyoon, et al.
Pubblicazione: (2023)
DualGuard: Dual-stream Large Language Model Watermarking Defense against Paraphrase and Spoofing Attack
di: Li, Hao, et al.
Pubblicazione: (2025)
di: Li, Hao, et al.
Pubblicazione: (2025)
TriSum: Learning Summarization Ability from Large Language Models with Structured Rationale
di: Jiang, Pengcheng, et al.
Pubblicazione: (2024)
di: Jiang, Pengcheng, et al.
Pubblicazione: (2024)
SpeechGuard: Exploring the Adversarial Robustness of Multimodal Large Language Models
di: Peri, Raghuveer, et al.
Pubblicazione: (2024)
di: Peri, Raghuveer, et al.
Pubblicazione: (2024)
DistillGuard: Evaluating Defenses Against LLM Knowledge Distillation
di: Jiang, Bo
Pubblicazione: (2026)
di: Jiang, Bo
Pubblicazione: (2026)
A Chinese Dataset for Evaluating the Safeguards in Large Language Models
di: Wang, Yuxia, et al.
Pubblicazione: (2024)
di: Wang, Yuxia, et al.
Pubblicazione: (2024)
CoCA: Regaining Safety-awareness of Multimodal Large Language Models with Constitutional Calibration
di: Gao, Jiahui, et al.
Pubblicazione: (2024)
di: Gao, Jiahui, et al.
Pubblicazione: (2024)
Large Language Model Can Be a Foundation for Hidden Rationale-Based Retrieval
di: Ji, Luo, et al.
Pubblicazione: (2024)
di: Ji, Luo, et al.
Pubblicazione: (2024)
E$^2$AT: Multimodal Jailbreak Defense via Dynamic Joint Optimization for Multimodal Large Language Models
di: Lu, Liming, et al.
Pubblicazione: (2025)
di: Lu, Liming, et al.
Pubblicazione: (2025)
Data Defenses Against Large Language Models
di: Agnew, William, et al.
Pubblicazione: (2024)
di: Agnew, William, et al.
Pubblicazione: (2024)
Structure-aware Domain Knowledge Injection for Large Language Models
di: Liu, Kai, et al.
Pubblicazione: (2024)
di: Liu, Kai, et al.
Pubblicazione: (2024)
Can Language Models Perform Robust Reasoning in Chain-of-thought Prompting with Noisy Rationales?
di: Zhou, Zhanke, et al.
Pubblicazione: (2024)
di: Zhou, Zhanke, et al.
Pubblicazione: (2024)
DREAM: Disentangling Risks to Enhance Safety Alignment in Multimodal Large Language Models
di: Liu, Jianyu, et al.
Pubblicazione: (2025)
di: Liu, Jianyu, et al.
Pubblicazione: (2025)
Llama Guard 3 Vision: Safeguarding Human-AI Image Understanding Conversations
di: Chi, Jianfeng, et al.
Pubblicazione: (2024)
di: Chi, Jianfeng, et al.
Pubblicazione: (2024)
Mitigating Reversal Curse in Large Language Models via Semantic-aware Permutation Training
di: Guo, Qingyan, et al.
Pubblicazione: (2024)
di: Guo, Qingyan, et al.
Pubblicazione: (2024)
Joint Visual and Text Prompting for Improved Object-Centric Perception with Multimodal Large Language Models
di: Jiang, Songtao, et al.
Pubblicazione: (2024)
di: Jiang, Songtao, et al.
Pubblicazione: (2024)
Image-of-Thought Prompting for Visual Reasoning Refinement in Multimodal Large Language Models
di: Zhou, Qiji, et al.
Pubblicazione: (2024)
di: Zhou, Qiji, et al.
Pubblicazione: (2024)
RAP: Retrieval-Augmented Personalization for Multimodal Large Language Models
di: Hao, Haoran, et al.
Pubblicazione: (2024)
di: Hao, Haoran, et al.
Pubblicazione: (2024)
UniGuardian: A Unified Defense for Detecting Prompt Injection, Backdoor Attacks and Adversarial Attacks in Large Language Models
di: Lin, Huawei, et al.
Pubblicazione: (2025)
di: Lin, Huawei, et al.
Pubblicazione: (2025)
Modality-Aware Neuron Pruning for Unlearning in Multimodal Large Language Models
di: Liu, Zheyuan, et al.
Pubblicazione: (2025)
di: Liu, Zheyuan, et al.
Pubblicazione: (2025)
From Answers to Rationales: Self-Aligning Multimodal Reasoning with Answer-Oriented Chain-of-Thought
di: Tan, Wentao, et al.
Pubblicazione: (2025)
di: Tan, Wentao, et al.
Pubblicazione: (2025)
ConfGuard: A Simple and Effective Backdoor Detection for Large Language Models
di: Wang, Zihan, et al.
Pubblicazione: (2025)
di: Wang, Zihan, et al.
Pubblicazione: (2025)
In Defense of RAG in the Era of Long-Context Language Models
di: Yu, Tan, et al.
Pubblicazione: (2024)
di: Yu, Tan, et al.
Pubblicazione: (2024)
QCRD: Quality-guided Contrastive Rationale Distillation for Large Language Models
di: Wang, Wei, et al.
Pubblicazione: (2024)
di: Wang, Wei, et al.
Pubblicazione: (2024)
Comparison of Scoring Rationales Between Large Language Models and Human Raters
di: Hua, Haowei, et al.
Pubblicazione: (2025)
di: Hua, Haowei, et al.
Pubblicazione: (2025)
SentGuard: Sentence-Level Streaming Guardrails for Large Language Models
di: Yu, Jiaqi, et al.
Pubblicazione: (2026)
di: Yu, Jiaqi, et al.
Pubblicazione: (2026)
Mitigating Prompt-Induced Hallucinations in Large Language Models via Structured Reasoning
di: Hao, Jinbo, et al.
Pubblicazione: (2026)
di: Hao, Jinbo, et al.
Pubblicazione: (2026)
Unified Defense for Large Language Models against Jailbreak and Fine-Tuning Attacks in Education
di: Yi, Xin, et al.
Pubblicazione: (2025)
di: Yi, Xin, et al.
Pubblicazione: (2025)
Eraser: Jailbreaking Defense in Large Language Models via Unlearning Harmful Knowledge
di: Lu, Weikai, et al.
Pubblicazione: (2024)
di: Lu, Weikai, et al.
Pubblicazione: (2024)
Documenti analoghi
-
MSR-Align: Policy-Grounded Multimodal Alignment for Safety-Aware Reasoning in Vision-Language Models
di: Xia, Yinan, et al.
Pubblicazione: (2025) -
HiddenDetect: Detecting Jailbreak Attacks against Large Vision-Language Models via Monitoring Hidden States
di: Jiang, Yilei, et al.
Pubblicazione: (2025) -
QuadSentinel: Sequent Safety for Machine-Checkable Control in Multi-agent Systems
di: Yang, Yiliu, et al.
Pubblicazione: (2025) -
On Prompt-Driven Safeguarding for Large Language Models
di: Zheng, Chujie, et al.
Pubblicazione: (2024) -
ConceptGuard: Proactive Safety in Text-and-Image-to-Video Generation through Multimodal Risk Detection
di: Ma, Ruize, et al.
Pubblicazione: (2025)