Attributing and Exploiting Safety Vectors through Global Optimization in Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Chu, Fengheng, Chen, Jiahao, Wang, Yuhong, Wang, Jun, Fu, Zhihui, Ji, Shouling, Li, Songze |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Knowledge-Driven Multi-Turn Jailbreaking on Large Language Models
by: Li, Songze, et al.
Published: (2026)
by: Li, Songze, et al.
Published: (2026)
TooBadRL: Trigger Optimization to Boost Effectiveness of Backdoor Attacks on Deep Reinforcement Learning
by: Zhang, Mingxuan, et al.
Published: (2025)
by: Zhang, Mingxuan, et al.
Published: (2025)
ReCIT: Reconstructing Full Private Data from Gradient in Parameter-Efficient Fine-Tuning of Large Language Models
by: Xie, Jin, et al.
Published: (2025)
by: Xie, Jin, et al.
Published: (2025)
Unveiling the Security Risks of Federated Learning in the Wild: From Research to Practice
by: Chen, Jiahao, et al.
Published: (2026)
by: Chen, Jiahao, et al.
Published: (2026)
Towards Scalable and Interpretable Mobile App Risk Analysis via Large Language Models
by: Yang, Yu, et al.
Published: (2025)
by: Yang, Yu, et al.
Published: (2025)
OmniLytics+: A Secure, Efficient, and Affordable Blockchain Data Market for Machine Learning through Off-Chain Processing
by: Li, Songze, et al.
Published: (2024)
by: Li, Songze, et al.
Published: (2024)
Cross-Modal Backdoors in Multimodal Large Language Models
by: Wang, Runhe, et al.
Published: (2026)
by: Wang, Runhe, et al.
Published: (2026)
LLMs Cannot Reliably Judge (Yet?): A Comprehensive Assessment on the Robustness of LLM-as-a-Judge
by: Li, Songze, et al.
Published: (2025)
by: Li, Songze, et al.
Published: (2025)
HashVFL: Defending Against Data Reconstruction Attacks in Vertical Federated Learning
by: Qiu, Pengyu, et al.
Published: (2022)
by: Qiu, Pengyu, et al.
Published: (2022)
Model-Editing-Based Jailbreak against Safety-aligned Large Language Models
by: Li, Yuxi, et al.
Published: (2024)
by: Li, Yuxi, et al.
Published: (2024)
TrojanDam: Detection-Free Backdoor Defense in Federated Learning through Proactive Model Robustification utilizing OOD Data
by: Dai, Yanbo, et al.
Published: (2025)
by: Dai, Yanbo, et al.
Published: (2025)
LoRAShield: Data-Free Editing Alignment for Secure Personalized LoRA Sharing
by: Chen, Jiahao, et al.
Published: (2025)
by: Chen, Jiahao, et al.
Published: (2025)
Beauty and the Beast: Imperceptible Perturbations Against Diffusion-Based Face Swapping via Directional Attribute Editing
by: Huang, Yilong, et al.
Published: (2026)
by: Huang, Yilong, et al.
Published: (2026)
Privacy-preserving Prompt Personalization in Federated Learning for Multimodal Large Language Models
by: Hou, Sizai, et al.
Published: (2025)
by: Hou, Sizai, et al.
Published: (2025)
TUNI: A Textual Unimodal Detector for Identity Inference in CLIP Models
by: Li, Songze, et al.
Published: (2024)
by: Li, Songze, et al.
Published: (2024)
FuncPoison: Poisoning Function Library to Hijack Multi-agent Autonomous Driving Systems
by: Long, Yuzhen, et al.
Published: (2025)
by: Long, Yuzhen, et al.
Published: (2025)
Constructing Adversarial Examples for Vertical Federated Learning: Optimal Client Corruption through Multi-Armed Bandit
by: Yao, Duanyi, et al.
Published: (2024)
by: Yao, Duanyi, et al.
Published: (2024)
Awakening the Hydra: Stabilizing Multi-Concept Backdoor Injection in Text-to-Image Diffusion Models
by: Wang, Kai, et al.
Published: (2026)
by: Wang, Kai, et al.
Published: (2026)
Exploiting Leaderboards for Large-Scale Distribution of Malicious Models
by: Suri, Anshuman, et al.
Published: (2025)
by: Suri, Anshuman, et al.
Published: (2025)
EASE: Practical and Efficient Safety Alignment for Small Language Models
by: Shi, Haonan, et al.
Published: (2025)
by: Shi, Haonan, et al.
Published: (2025)
Angel or Demon: Investigating the Plasticity Interventions' Impact on Backdoor Threats in Deep Reinforcement Learning
by: Ma, Oubo, et al.
Published: (2026)
by: Ma, Oubo, et al.
Published: (2026)
Noise as a Probe: Membership Inference Attacks on Diffusion Models Leveraging Initial Noise
by: Lian, Puwei, et al.
Published: (2026)
by: Lian, Puwei, et al.
Published: (2026)
Enhancing Membership Inference Attacks on Diffusion Models from a Frequency-Domain Perspective
by: Lian, Puwei, et al.
Published: (2025)
by: Lian, Puwei, et al.
Published: (2025)
Watermark under Fire: A Robustness Evaluation of LLM Watermarking
by: Liang, Jiacheng, et al.
Published: (2024)
by: Liang, Jiacheng, et al.
Published: (2024)
DeDe: Detecting Backdoor Samples for SSL Encoders via Decoders
by: Hou, Sizai, et al.
Published: (2024)
by: Hou, Sizai, et al.
Published: (2024)
AutoRAN: Automated Hijacking of Safety Reasoning in Large Reasoning Models
by: Liang, Jiacheng, et al.
Published: (2025)
by: Liang, Jiacheng, et al.
Published: (2025)
"No Matter What You Do": Purifying GNN Models via Backdoor Unlearning
by: Zhang, Jiale, et al.
Published: (2024)
by: Zhang, Jiale, et al.
Published: (2024)
Visual CoT Makes VLMs Smarter but More Fragile
by: Xu, Chunxue, et al.
Published: (2025)
by: Xu, Chunxue, et al.
Published: (2025)
Ideal Attribution and Faithful Watermarks for Language Models
by: Song, Min Jae, et al.
Published: (2025)
by: Song, Min Jae, et al.
Published: (2025)
TREC: APT Tactic / Technique Recognition via Few-Shot Provenance Subgraph Learning
by: Lv, Mingqi, et al.
Published: (2024)
by: Lv, Mingqi, et al.
Published: (2024)
CLIBE: Detecting Dynamic Backdoors in Transformer-based NLP Models
by: Zeng, Rui, et al.
Published: (2024)
by: Zeng, Rui, et al.
Published: (2024)
On Large Language Model Continual Unlearning
by: Gao, Chongyang, et al.
Published: (2024)
by: Gao, Chongyang, et al.
Published: (2024)
AEIOU: A Unified Defense Framework against NSFW Prompts in Text-to-Image Models
by: Wang, Yiming, et al.
Published: (2024)
by: Wang, Yiming, et al.
Published: (2024)
CAMH: Advancing Model Hijacking Attack in Machine Learning
by: He, Xing, et al.
Published: (2024)
by: He, Xing, et al.
Published: (2024)
Adversarial Search Engine Optimization for Large Language Models
by: Nestaas, Fredrik, et al.
Published: (2024)
by: Nestaas, Fredrik, et al.
Published: (2024)
Hijack Vertical Federated Learning Models As One Party
by: Qiu, Pengyu, et al.
Published: (2022)
by: Qiu, Pengyu, et al.
Published: (2022)
How does Watermarking Affect Visual Language Models in Document Understanding?
by: Xu, Chunxue, et al.
Published: (2025)
by: Xu, Chunxue, et al.
Published: (2025)
Hidden Ads: Behavior Triggered Semantic Backdoors for Advertisement Injection in Vision Language Models
by: Yao, Duanyi, et al.
Published: (2026)
by: Yao, Duanyi, et al.
Published: (2026)
Information Leakage from Embedding in Large Language Models
by: Wan, Zhipeng, et al.
Published: (2024)
by: Wan, Zhipeng, et al.
Published: (2024)
Rethinking the Vulnerabilities of Face Recognition Systems:From a Practical Perspective
by: Chen, Jiahao, et al.
Published: (2024)
by: Chen, Jiahao, et al.
Published: (2024)
Similar Items
-
Knowledge-Driven Multi-Turn Jailbreaking on Large Language Models
by: Li, Songze, et al.
Published: (2026) -
TooBadRL: Trigger Optimization to Boost Effectiveness of Backdoor Attacks on Deep Reinforcement Learning
by: Zhang, Mingxuan, et al.
Published: (2025) -
ReCIT: Reconstructing Full Private Data from Gradient in Parameter-Efficient Fine-Tuning of Large Language Models
by: Xie, Jin, et al.
Published: (2025) -
Unveiling the Security Risks of Federated Learning in the Wild: From Research to Practice
by: Chen, Jiahao, et al.
Published: (2026) -
Towards Scalable and Interpretable Mobile App Risk Analysis via Large Language Models
by: Yang, Yu, et al.
Published: (2025)