Do We Really Need Curated Malicious Data for Safety Alignment in Multi-modal Large Language Models?
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Yanbo, Guan, Jiyang, Liang, Jian, He, Ran |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models
por: Wang, Yanbo, et al.
Publicado: (2025)
por: Wang, Yanbo, et al.
Publicado: (2025)
Mitigating the Safety-utility Trade-off in LLM Alignment via Adaptive Safe Context Learning
por: Wang, Yanbo, et al.
Publicado: (2026)
por: Wang, Yanbo, et al.
Publicado: (2026)
Test-Time Immunization: A Universal Defense Framework Against Jailbreaks for (Multimodal) Large Language Models
por: Yu, Yongcan, et al.
Publicado: (2025)
por: Yu, Yongcan, et al.
Publicado: (2025)
Evolving Contextual Safety in Multi-Modal Large Language Models via Inference-Time Self-Reflective Memory
por: Zhang, Ce, et al.
Publicado: (2026)
por: Zhang, Ce, et al.
Publicado: (2026)
MOSAIC: Multi-Objective Slice-Aware Iterative Curation for Alignment
por: Dou, Yipu, et al.
Publicado: (2026)
por: Dou, Yipu, et al.
Publicado: (2026)
Towards Eliminating Hard Label Constraints in Gradient Inversion Attacks
por: Wang, Yanbo, et al.
Publicado: (2024)
por: Wang, Yanbo, et al.
Publicado: (2024)
EnchTable: Unified Safety Alignment Transfer in Fine-tuned Large Language Models
por: Wu, Jialin, et al.
Publicado: (2025)
por: Wu, Jialin, et al.
Publicado: (2025)
Understanding and Mitigating Over-refusal for Large Language Models via Safety Representation
por: Zhang, Junbo, et al.
Publicado: (2025)
por: Zhang, Junbo, et al.
Publicado: (2025)
Overlooked Safety Vulnerability in LLMs: Malicious Intelligent Optimization Algorithm Request and its Jailbreak
por: Gu, Haoran, et al.
Publicado: (2026)
por: Gu, Haoran, et al.
Publicado: (2026)
SEA: Low-Resource Safety Alignment for Multimodal Large Language Models via Synthetic Embeddings
por: Lu, Weikai, et al.
Publicado: (2025)
por: Lu, Weikai, et al.
Publicado: (2025)
Is the System Message Really Important to Jailbreaks in Large Language Models?
por: Zou, Xiaotian, et al.
Publicado: (2024)
por: Zou, Xiaotian, et al.
Publicado: (2024)
Reformulation is All You Need: Addressing Malicious Text Features in DNNs
por: Jiang, Yi, et al.
Publicado: (2025)
por: Jiang, Yi, et al.
Publicado: (2025)
Rethinking Bottlenecks in Safety Fine-Tuning of Vision Language Models
por: Ding, Yi, et al.
Publicado: (2025)
por: Ding, Yi, et al.
Publicado: (2025)
Jailbreak Antidote: Runtime Safety-Utility Balance via Sparse Representation Adjustment in Large Language Models
por: Shen, Guobin, et al.
Publicado: (2024)
por: Shen, Guobin, et al.
Publicado: (2024)
How Much Do Large Language Model Cheat on Evaluation? Benchmarking Overestimation under the One-Time-Pad-Based Framework
por: Liang, Zi, et al.
Publicado: (2025)
por: Liang, Zi, et al.
Publicado: (2025)
Self-Jailbreaking: Language Models Can Reason Themselves Out of Safety Alignment After Benign Reasoning Training
por: Yong, Zheng-Xin, et al.
Publicado: (2025)
por: Yong, Zheng-Xin, et al.
Publicado: (2025)
S-Eval: Towards Automated and Comprehensive Safety Evaluation for Large Language Models
por: Yuan, Xiaohan, et al.
Publicado: (2024)
por: Yuan, Xiaohan, et al.
Publicado: (2024)
DAVSP: Safety Alignment for Large Vision-Language Models via Deep Aligned Visual Safety Prompt
por: Zhang, Yitong, et al.
Publicado: (2025)
por: Zhang, Yitong, et al.
Publicado: (2025)
AgentDoG 1.5: A Lightweight and Scalable Alignment Framework for AI Agent Safety and Security
por: Liu, Dongrui, et al.
Publicado: (2026)
por: Liu, Dongrui, et al.
Publicado: (2026)
AgentAlign: Navigating Safety Alignment in the Shift from Informative to Agentic Large Language Models
por: Zhang, Jinchuan, et al.
Publicado: (2025)
por: Zhang, Jinchuan, et al.
Publicado: (2025)
Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety
por: Ma, Xingjun, et al.
Publicado: (2025)
por: Ma, Xingjun, et al.
Publicado: (2025)
Localizing Malicious Outputs from CodeLLM
por: Borana, Mayukh, et al.
Publicado: (2025)
por: Borana, Mayukh, et al.
Publicado: (2025)
MLLMGuard: A Multi-dimensional Safety Evaluation Suite for Multimodal Large Language Models
por: Gu, Tianle, et al.
Publicado: (2024)
por: Gu, Tianle, et al.
Publicado: (2024)
Do Concept Replacement Techniques Really Erase Unacceptable Concepts?
por: Das, Anudeep, et al.
Publicado: (2025)
por: Das, Anudeep, et al.
Publicado: (2025)
SciSafeEval: A Comprehensive Benchmark for Safety Alignment of Large Language Models in Scientific Tasks
por: Li, Tianhao, et al.
Publicado: (2024)
por: Li, Tianhao, et al.
Publicado: (2024)
Trojan Activation Attack: Red-Teaming Large Language Models using Activation Steering for Safety-Alignment
por: Wang, Haoran, et al.
Publicado: (2023)
por: Wang, Haoran, et al.
Publicado: (2023)
Mitigating Fine-tuning based Jailbreak Attack with Backdoor Enhanced Safety Alignment
por: Wang, Jiongxiao, et al.
Publicado: (2024)
por: Wang, Jiongxiao, et al.
Publicado: (2024)
Image-Based Geolocation Using Large Vision-Language Models
por: Liu, Yi, et al.
Publicado: (2024)
por: Liu, Yi, et al.
Publicado: (2024)
Stop Tracking Me! Proactive Defense Against Attribute Inference Attack in LLMs
por: Yan, Dong, et al.
Publicado: (2026)
por: Yan, Dong, et al.
Publicado: (2026)
Preventing Jailbreak Prompts as Malicious Tools for Cybercriminals: A Cyber Defense Perspective
por: Tshimula, Jean Marie, et al.
Publicado: (2024)
por: Tshimula, Jean Marie, et al.
Publicado: (2024)
ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models
por: Zhao, Yunhan, et al.
Publicado: (2026)
por: Zhao, Yunhan, et al.
Publicado: (2026)
SafeAligner: Safety Alignment against Jailbreak Attacks via Response Disparity Guidance
por: Huang, Caishuang, et al.
Publicado: (2024)
por: Huang, Caishuang, et al.
Publicado: (2024)
One Trigger Token Is Enough: A Defense Strategy for Balancing Safety and Usability in Large Language Models
por: Gu, Haoran, et al.
Publicado: (2025)
por: Gu, Haoran, et al.
Publicado: (2025)
Be Your Own Red Teamer: Safety Alignment via Self-Play and Reflective Experience Replay
por: Wang, Hao, et al.
Publicado: (2026)
por: Wang, Hao, et al.
Publicado: (2026)
Do We Really Need to Design New Byzantine-robust Aggregation Rules?
por: Fang, Minghong, et al.
Publicado: (2025)
por: Fang, Minghong, et al.
Publicado: (2025)
MLLM-Protector: Ensuring MLLM's Safety without Hurting Performance
por: Pi, Renjie, et al.
Publicado: (2024)
por: Pi, Renjie, et al.
Publicado: (2024)
Beyond Text: Unveiling Privacy Vulnerabilities in Multi-modal Retrieval-Augmented Generation
por: Zhang, Jiankun, et al.
Publicado: (2025)
por: Zhang, Jiankun, et al.
Publicado: (2025)
Applying Pre-trained Multilingual BERT in Embeddings for Improved Malicious Prompt Injection Attacks Detection
por: Rahman, Md Abdur, et al.
Publicado: (2024)
por: Rahman, Md Abdur, et al.
Publicado: (2024)
Do Prompts Guarantee Safety? Mitigating Toxicity from LLM Generations through Subspace Intervention
por: Singh, Himanshu, et al.
Publicado: (2026)
por: Singh, Himanshu, et al.
Publicado: (2026)
Multi-Agent Collaboration in Incident Response with Large Language Models
por: Liu, Zefang
Publicado: (2024)
por: Liu, Zefang
Publicado: (2024)
Ejemplares similares
-
A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models
por: Wang, Yanbo, et al.
Publicado: (2025) -
Mitigating the Safety-utility Trade-off in LLM Alignment via Adaptive Safe Context Learning
por: Wang, Yanbo, et al.
Publicado: (2026) -
Test-Time Immunization: A Universal Defense Framework Against Jailbreaks for (Multimodal) Large Language Models
por: Yu, Yongcan, et al.
Publicado: (2025) -
Evolving Contextual Safety in Multi-Modal Large Language Models via Inference-Time Self-Reflective Memory
por: Zhang, Ce, et al.
Publicado: (2026) -
MOSAIC: Multi-Objective Slice-Aware Iterative Curation for Alignment
por: Dou, Yipu, et al.
Publicado: (2026)