Safety Geometry Collapse in Multimodal LLMs and Adaptive Drift Correction
Fuente:
arXiv
Saved in:
| Main Authors: | Guo, Jiahe, Guo, Xiangran, Chen, Jiaxuan, Zhao, Weixiang, Zhao, Yanyan, Hou, Yutai, Wang, Qianchao, Tu, Dandan, Qin, Bing |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
AdaSteer: Your Aligned LLM is Inherently an Adaptive Jailbreak Defender
by: Zhao, Weixiang, et al.
Published: (2025)
by: Zhao, Weixiang, et al.
Published: (2025)
Improved Generation of Adversarial Examples Against Safety-aligned LLMs
by: Li, Qizhang, et al.
Published: (2024)
by: Li, Qizhang, et al.
Published: (2024)
SafeBench: A Safety Evaluation Framework for Multimodal Large Language Models
by: Ying, Zonghao, et al.
Published: (2024)
by: Ying, Zonghao, et al.
Published: (2024)
When Safety Geometry Collapses: Fine-Tuning Vulnerabilities in Agentic Guard Models
by: Hossain, Ismail, et al.
Published: (2026)
by: Hossain, Ismail, et al.
Published: (2026)
VisuoAlign: Safety Alignment of LVLMs with Multimodal Tree Search
by: Li, MingSheng, et al.
Published: (2025)
by: Li, MingSheng, et al.
Published: (2025)
FedCAPrivacy: Privacy-Preserving Heterogeneous Federated Learning with Anonymous Adaptive Clustering
by: Wei, Yunan, et al.
Published: (2025)
by: Wei, Yunan, et al.
Published: (2025)
Too Easily Fooled? Prompt Injection Breaks LLMs on Frustratingly Simple Multiple-Choice Questions
by: Guo, Xuyang, et al.
Published: (2025)
by: Guo, Xuyang, et al.
Published: (2025)
Knowing without Acting: The Disentangled Geometry of Safety Mechanisms in Large Language Models
by: Wu, Jinman, et al.
Published: (2026)
by: Wu, Jinman, et al.
Published: (2026)
PRISM: Robust VLM Alignment with Principled Reasoning for Integrated Safety in Multimodality
by: Li, Nanxi, et al.
Published: (2025)
by: Li, Nanxi, et al.
Published: (2025)
Playing the Fool: Jailbreaking LLMs and Multimodal LLMs with Out-of-Distribution Strategy
by: Jeong, Joonhyun, et al.
Published: (2025)
by: Jeong, Joonhyun, et al.
Published: (2025)
CNT: Safety-oriented Function Reuse across LLMs via Cross-Model Neuron Transfer
by: Zhao, Yue, et al.
Published: (2026)
by: Zhao, Yue, et al.
Published: (2026)
SafeRedirect: Defeating Internal Safety Collapse via Task-Completion Redirection in Frontier LLMs
by: Pan, Chao, et al.
Published: (2026)
by: Pan, Chao, et al.
Published: (2026)
SafeToolBench: Pioneering a Prospective Benchmark to Evaluating Tool Utilization Safety in LLMs
by: Xia, Hongfei, et al.
Published: (2025)
by: Xia, Hongfei, et al.
Published: (2025)
MTSA: Multi-turn Safety Alignment for LLMs through Multi-round Red-teaming
by: Guo, Weiyang, et al.
Published: (2025)
by: Guo, Weiyang, et al.
Published: (2025)
MAJIC: Markovian Adaptive Jailbreaking via Iterative Composition of Diverse Innovative Strategies
by: Qi, Weiwei, et al.
Published: (2025)
by: Qi, Weiwei, et al.
Published: (2025)
Parasites in the Toolchain: A Large-Scale Analysis of Attacks on the MCP Ecosystem
by: Zhao, Shuli, et al.
Published: (2025)
by: Zhao, Shuli, et al.
Published: (2025)
Combating Concept Drift with Explanatory Detection and Adaptation for Android Malware Classification
by: He, Yiling, et al.
Published: (2024)
by: He, Yiling, et al.
Published: (2024)
Revisiting Concept Drift in Windows Malware Detection: Adaptation to Real Drifted Malware with Minimal Samples
by: Li, Adrian Shuai, et al.
Published: (2024)
by: Li, Adrian Shuai, et al.
Published: (2024)
Can Drift-Adaptive Malware Detectors Be Made Robust? Attacks and Defenses Under White-Box and Black-Box Threats
by: Li, Adrian Shuai, et al.
Published: (2026)
by: Li, Adrian Shuai, et al.
Published: (2026)
RL-JACK: Reinforcement Learning-powered Black-box Jailbreaking Attack against LLMs
by: Chen, Xuan, et al.
Published: (2024)
by: Chen, Xuan, et al.
Published: (2024)
FoC: Figure out the Cryptographic Functions in Stripped Binaries with LLMs
by: Shang, Xiuwei, et al.
Published: (2024)
by: Shang, Xiuwei, et al.
Published: (2024)
CrowdAL: Towards a Blockchain-empowered Active Learning System in Crowd Data Labeling
by: Hou, Shaojie, et al.
Published: (2025)
by: Hou, Shaojie, et al.
Published: (2025)
MLLMGuard: A Multi-dimensional Safety Evaluation Suite for Multimodal Large Language Models
by: Gu, Tianle, et al.
Published: (2024)
by: Gu, Tianle, et al.
Published: (2024)
METANOIA: A Lifelong Intrusion Detection and Investigation System for Mitigating Concept Drift
by: Ying, Jie, et al.
Published: (2024)
by: Ying, Jie, et al.
Published: (2024)
Poly-Guard: Massive Multi-Domain Safety Policy-Grounded Guardrail Dataset
by: Kang, Mintong, et al.
Published: (2025)
by: Kang, Mintong, et al.
Published: (2025)
TrojanEdit: Multimodal Backdoor Attack Against Image Editing Model
by: Guo, Ji, et al.
Published: (2024)
by: Guo, Ji, et al.
Published: (2024)
Securing UAV Communications by Fusing Cross-Layer Fingerprints
by: Huang, Yong, et al.
Published: (2025)
by: Huang, Yong, et al.
Published: (2025)
Adaptive Plan-Execute Framework for Smart Contract Security Auditing
by: Wei, Zhiyuan, et al.
Published: (2025)
by: Wei, Zhiyuan, et al.
Published: (2025)
LLMs Can Unlearn Refusal with Only 1,000 Benign Samples
by: Guo, Yangyang, et al.
Published: (2026)
by: Guo, Yangyang, et al.
Published: (2026)
VLWE: Variety-based Learning with Errors for Vector Encryption through Algebraic Geometry
by: Zhao, Dongfang
Published: (2025)
by: Zhao, Dongfang
Published: (2025)
Jailbreaking Leading Safety-Aligned LLMs with Simple Adaptive Attacks
by: Andriushchenko, Maksym, et al.
Published: (2024)
by: Andriushchenko, Maksym, et al.
Published: (2024)
Privacy-preserving Prompt Personalization in Federated Learning for Multimodal Large Language Models
by: Hou, Sizai, et al.
Published: (2025)
by: Hou, Sizai, et al.
Published: (2025)
FARM: Few-shot Adaptive Malware Family Classification under Concept Drift
by: Guldemir, Numan Halit, et al.
Published: (2026)
by: Guldemir, Numan Halit, et al.
Published: (2026)
Internal Safety Collapse in Frontier Large Language Models
by: Wu, Yutao, et al.
Published: (2026)
by: Wu, Yutao, et al.
Published: (2026)
MMDT: Decoding the Trustworthiness and Safety of Multimodal Foundation Models
by: Xu, Chejian, et al.
Published: (2025)
by: Xu, Chejian, et al.
Published: (2025)
McNdroid: A Longitudinal Multimodal Benchmark for Robust Drift Detection in Android Malware
by: Kamol, Md Mahmuduzzaman, et al.
Published: (2026)
by: Kamol, Md Mahmuduzzaman, et al.
Published: (2026)
Beyond Surface Alignment: Rebuilding LLMs Safety Mechanism via Probabilistically Ablating Refusal Direction
by: Xie, Yuanbo, et al.
Published: (2025)
by: Xie, Yuanbo, et al.
Published: (2025)
Uncovering Pretraining Code in LLMs: A Syntax-Aware Attribution Approach
by: Li, Yuanheng, et al.
Published: (2025)
by: Li, Yuanheng, et al.
Published: (2025)
Benign Fine-Tuning Breaks Safety Alignment in Audio LLMs
by: Roh, Jaechul, et al.
Published: (2026)
by: Roh, Jaechul, et al.
Published: (2026)
FlexLLM: Exploring LLM Customization for Moving Target Defense on Black-Box LLMs Against Jailbreak Attacks
by: Chen, Bocheng, et al.
Published: (2024)
by: Chen, Bocheng, et al.
Published: (2024)
Similar Items
-
AdaSteer: Your Aligned LLM is Inherently an Adaptive Jailbreak Defender
by: Zhao, Weixiang, et al.
Published: (2025) -
Improved Generation of Adversarial Examples Against Safety-aligned LLMs
by: Li, Qizhang, et al.
Published: (2024) -
SafeBench: A Safety Evaluation Framework for Multimodal Large Language Models
by: Ying, Zonghao, et al.
Published: (2024) -
When Safety Geometry Collapses: Fine-Tuning Vulnerabilities in Agentic Guard Models
by: Hossain, Ismail, et al.
Published: (2026) -
VisuoAlign: Safety Alignment of LVLMs with Multimodal Tree Search
by: Li, MingSheng, et al.
Published: (2025)