Omni-Safety under Cross-Modality Conflict: Vulnerabilities, Dynamics Mechanisms and Efficient Alignment
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Kun, Li, Zherui, Zhou, Zhenhong, Zhang, Yitong, Mi, Yan, Yang, Kun, Zhang, Yiming, Dong, Junhao, Sun, Zhongxiang, Li, Qiankun, Liu, Yang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Exploiting Cross-Layer Vulnerabilities: Off-Path Attacks on the TCP/IP Protocol Suite
por: Feng, Xuewei, et al.
Publicado: (2024)
por: Feng, Xuewei, et al.
Publicado: (2024)
DAVSP: Safety Alignment for Large Vision-Language Models via Deep Aligned Visual Safety Prompt
por: Zhang, Yitong, et al.
Publicado: (2025)
por: Zhang, Yitong, et al.
Publicado: (2025)
LeechHijack: Covert Computational Resource Exploitation in Intelligent Agent Systems
por: Zhang, Yuanhe, et al.
Publicado: (2025)
por: Zhang, Yuanhe, et al.
Publicado: (2025)
When Safety Becomes a Vulnerability: Exploiting LLM Alignment Homogeneity for Transferable Blocking in RAG
por: Li, Junchen, et al.
Publicado: (2026)
por: Li, Junchen, et al.
Publicado: (2026)
DCVD: Dual-Channel Cross-Modal Fusion for Joint Vulnerability Detection and Localization
por: Tang, Wenxin, et al.
Publicado: (2026)
por: Tang, Wenxin, et al.
Publicado: (2026)
Cross-Modal Safety Alignment: Is textual unlearning all you need?
por: Chakraborty, Trishna, et al.
Publicado: (2024)
por: Chakraborty, Trishna, et al.
Publicado: (2024)
Safety Context Injection: Inference-Time Safety Alignment via Static Filtering and Agentic Analysis
por: Xu, Zhenhao, et al.
Publicado: (2026)
por: Xu, Zhenhao, et al.
Publicado: (2026)
Uncovering Logit Suppression Vulnerabilities in LLM Safety Alignment
por: Li, Yuxi, et al.
Publicado: (2024)
por: Li, Yuxi, et al.
Publicado: (2024)
On the Role of Attention Heads in Large Language Model Safety
por: Zhou, Zhenhong, et al.
Publicado: (2024)
por: Zhou, Zhenhong, et al.
Publicado: (2024)
Beyond Surface Alignment: Rebuilding LLMs Safety Mechanism via Probabilistically Ablating Refusal Direction
por: Xie, Yuanbo, et al.
Publicado: (2025)
por: Xie, Yuanbo, et al.
Publicado: (2025)
Fine-Grained 1-Day Vulnerability Detection in Binaries via Patch Code Localization
por: Dong, Chaopeng, et al.
Publicado: (2025)
por: Dong, Chaopeng, et al.
Publicado: (2025)
Okara: Detection and Attribution of TLS Man-in-the-Middle Vulnerabilities in Android Apps with Foundation Models
por: Yang, Haoyun, et al.
Publicado: (2026)
por: Yang, Haoyun, et al.
Publicado: (2026)
Jailbreaking LLMs & VLMs: Mechanisms, Evaluation, and Unified Defense
por: Chen, Zejian, et al.
Publicado: (2026)
por: Chen, Zejian, et al.
Publicado: (2026)
How Alignment and Jailbreak Work: Explain LLM Safety through Intermediate Hidden States
por: Zhou, Zhenhong, et al.
Publicado: (2024)
por: Zhou, Zhenhong, et al.
Publicado: (2024)
DemonAgent: Dynamically Encrypted Multi-Backdoor Implantation Attack on LLM-based Agent
por: Zhu, Pengyu, et al.
Publicado: (2025)
por: Zhu, Pengyu, et al.
Publicado: (2025)
Efficient and Privacy-Preserving Federated Learning based on Full Homomorphic Encryption
por: Guo, Yuqi, et al.
Publicado: (2024)
por: Guo, Yuqi, et al.
Publicado: (2024)
Conflicts Make Large Reasoning Models Vulnerable to Attacks
por: Liu, Honghao, et al.
Publicado: (2026)
por: Liu, Honghao, et al.
Publicado: (2026)
Hunting Vulnerability Variants in AI Infra: Measurement and Reference-Driven Detection
por: Dong, Tian, et al.
Publicado: (2026)
por: Dong, Tian, et al.
Publicado: (2026)
Multi-Faceted Attack: Exposing Cross-Model Vulnerabilities in Defense-Equipped Vision-Language Models
por: Yang, Yijun, et al.
Publicado: (2025)
por: Yang, Yijun, et al.
Publicado: (2025)
Colluding LoRA: A Compositional Vulnerability in LLM Safety Alignment
por: Ding, Sihao
Publicado: (2026)
por: Ding, Sihao
Publicado: (2026)
AutoIoT: Automated IoT Platform Using Large Language Models
por: Cheng, Ye, et al.
Publicado: (2024)
por: Cheng, Ye, et al.
Publicado: (2024)
Beyond Algorithmic Proofs: Towards Implementation-Level Provable Security
por: Shang, Jiahui, et al.
Publicado: (2025)
por: Shang, Jiahui, et al.
Publicado: (2025)
Practical Secure Inference Algorithm for Fine-tuned Large Language Model Based on Fully Homomorphic Encryption
por: Ruoyan, Zhang, et al.
Publicado: (2025)
por: Ruoyan, Zhang, et al.
Publicado: (2025)
From Cyber Threat to Data Shield: Constructing Provably Secure File Erasure with Repurposed Ransomware Cryptography
por: Shang, Jiahui, et al.
Publicado: (2025)
por: Shang, Jiahui, et al.
Publicado: (2025)
ExDoS: Expert-Guided Dual-Focus Cross-Modal Distillation for Smart Contract Vulnerability Detection
por: Tian, Ye, et al.
Publicado: (2025)
por: Tian, Ye, et al.
Publicado: (2025)
Cross-Modal Backdoors in Multimodal Large Language Models
por: Wang, Runhe, et al.
Publicado: (2026)
por: Wang, Runhe, et al.
Publicado: (2026)
Resource Consumption Red-Teaming for Large Vision-Language Models
por: Gao, Haoran, et al.
Publicado: (2025)
por: Gao, Haoran, et al.
Publicado: (2025)
Buffered Asynchronous Secure Aggregation for Cross-Device Federated Learning
por: Wang, Kun, et al.
Publicado: (2024)
por: Wang, Kun, et al.
Publicado: (2024)
A Multi-Scale Graph Learning Framework with Temporal Consistency Constraints for Financial Fraud Detection in Transaction Networks under Non-Stationary Conditions
por: Lei, Yiming, et al.
Publicado: (2026)
por: Lei, Yiming, et al.
Publicado: (2026)
Automatic State Machine Inference for Binary Protocol Reverse Engineering
por: Yang, Junhai, et al.
Publicado: (2024)
por: Yang, Junhai, et al.
Publicado: (2024)
VENOMREC: Cross-Modal Interactive Poisoning for Targeted Promotion in Multimodal LLM Recommender Systems
por: Guan, Guowei, et al.
Publicado: (2026)
por: Guan, Guowei, et al.
Publicado: (2026)
Interaction-Aware Vulnerability Detection in Smart Contract Bytecodes
por: Li, Wenkai, et al.
Publicado: (2024)
por: Li, Wenkai, et al.
Publicado: (2024)
Layer-Aware Representation Filtering: Purifying Finetuning Data to Preserve LLM Safety Alignment
por: Li, Hao, et al.
Publicado: (2025)
por: Li, Hao, et al.
Publicado: (2025)
ProjLens: Unveiling the Role of Projectors in Multimodal Model Safety
por: Wang, Kun, et al.
Publicado: (2026)
por: Wang, Kun, et al.
Publicado: (2026)
Breaking the Bulkhead: Demystifying Cross-Namespace Reference Vulnerabilities in Kubernetes Operators
por: Chen, Andong, et al.
Publicado: (2025)
por: Chen, Andong, et al.
Publicado: (2025)
Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense
por: Zhang, Jiawen, et al.
Publicado: (2025)
por: Zhang, Jiawen, et al.
Publicado: (2025)
Resolving Indirect Calls in Binary Code via Cross-Reference Augmented Graph Neural Networks
por: Zhang, Haotian, et al.
Publicado: (2025)
por: Zhang, Haotian, et al.
Publicado: (2025)
Insecurity Through Obscurity: Veiled Vulnerabilities in Closed-Source Contracts
por: Yang, Sen, et al.
Publicado: (2025)
por: Yang, Sen, et al.
Publicado: (2025)
When Code Crosses Borders: A Security-Centric Study of LLM-based Code Translation
por: Chang, Hailong, et al.
Publicado: (2025)
por: Chang, Hailong, et al.
Publicado: (2025)
RELIC-GNN: Efficient State Registers Identification with Graph Neural Network for Reverse Engineering
por: Pan, Weitao, et al.
Publicado: (2025)
por: Pan, Weitao, et al.
Publicado: (2025)
Ejemplares similares
-
Exploiting Cross-Layer Vulnerabilities: Off-Path Attacks on the TCP/IP Protocol Suite
por: Feng, Xuewei, et al.
Publicado: (2024) -
DAVSP: Safety Alignment for Large Vision-Language Models via Deep Aligned Visual Safety Prompt
por: Zhang, Yitong, et al.
Publicado: (2025) -
LeechHijack: Covert Computational Resource Exploitation in Intelligent Agent Systems
por: Zhang, Yuanhe, et al.
Publicado: (2025) -
When Safety Becomes a Vulnerability: Exploiting LLM Alignment Homogeneity for Transferable Blocking in RAG
por: Li, Junchen, et al.
Publicado: (2026) -
DCVD: Dual-Channel Cross-Modal Fusion for Joint Vulnerability Detection and Localization
por: Tang, Wenxin, et al.
Publicado: (2026)