Circumventing Safety Alignment in Large Language Models Through Embedding Space Toxicity Attenuation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Zhibo, Li, Yuxi, Wang, Kailong, Yuan, Shuai, Shi, Ling, Wang, Haoyu |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
GlitchProber: Advancing Effective Detection and Mitigation of Glitch Tokens in Large Language Models
par: Zhang, Zhibo, et autres
Publié: (2024)
par: Zhang, Zhibo, et autres
Publié: (2024)
Continuous Embedding Attacks via Clipped Inputs in Jailbreaking Large Language Models
par: Xu, Zihao, et autres
Publié: (2024)
par: Xu, Zihao, et autres
Publié: (2024)
Model-Editing-Based Jailbreak against Safety-aligned Large Language Models
par: Li, Yuxi, et autres
Publié: (2024)
par: Li, Yuxi, et autres
Publié: (2024)
Enhancing Safety of Large Language Models via Embedding Space Separation
par: Zhao, Xu, et autres
Publié: (2026)
par: Zhao, Xu, et autres
Publié: (2026)
Embedding Poisoning: Bypassing Safety Alignment via Embedding Semantic Shift
par: Yuan, Shuai, et autres
Publié: (2025)
par: Yuan, Shuai, et autres
Publié: (2025)
Uncovering Logit Suppression Vulnerabilities in LLM Safety Alignment
par: Li, Yuxi, et autres
Publié: (2024)
par: Li, Yuxi, et autres
Publié: (2024)
Towards Context-Invariant Safety Alignment for Large Language Models
par: Wang, Yixu, et autres
Publié: (2026)
par: Wang, Yixu, et autres
Publié: (2026)
Lifelong Safety Alignment for Language Models
par: Wang, Haoyu, et autres
Publié: (2025)
par: Wang, Haoyu, et autres
Publié: (2025)
Fairness in Large Language Models: A Taxonomic Survey
par: Chu, Zhibo, et autres
Publié: (2024)
par: Chu, Zhibo, et autres
Publié: (2024)
Unforgotten Safety: Preserving Safety Alignment of Large Language Models with Continual Learning
par: Alssum, Lama, et autres
Publié: (2025)
par: Alssum, Lama, et autres
Publié: (2025)
Large Language Model Safety: A Holistic Survey
par: Shi, Dan, et autres
Publié: (2024)
par: Shi, Dan, et autres
Publié: (2024)
Unlocking the Power of Large Language Models for Entity Alignment
par: Jiang, Xuhui, et autres
Publié: (2024)
par: Jiang, Xuhui, et autres
Publié: (2024)
Characterising Toxicity in Generative Large Language Models
par: Zhang, Zhiyao, et autres
Publié: (2026)
par: Zhang, Zhiyao, et autres
Publié: (2026)
Safe Inputs but Unsafe Output: Benchmarking Cross-modality Safety Alignment of Large Vision-Language Model
par: Wang, Siyin, et autres
Publié: (2024)
par: Wang, Siyin, et autres
Publié: (2024)
Efficient Detection of Toxic Prompts in Large Language Models
par: Liu, Yi, et autres
Publié: (2024)
par: Liu, Yi, et autres
Publié: (2024)
Multi-objective Large Language Model Alignment with Hierarchical Experts
par: Li, Zhuo, et autres
Publié: (2025)
par: Li, Zhuo, et autres
Publié: (2025)
All Languages Matter: On the Multilingual Safety of Large Language Models
par: Wang, Wenxuan, et autres
Publié: (2023)
par: Wang, Wenxuan, et autres
Publié: (2023)
Defending Large Language Models Against Jailbreak Attacks via In-Decoding Safety-Awareness Probing
par: Zhao, Yinzhi, et autres
Publié: (2026)
par: Zhao, Yinzhi, et autres
Publié: (2026)
Compressing Sequences in the Latent Embedding Space: $K$-Token Merging for Large Language Models
par: Xu, Zihao, et autres
Publié: (2026)
par: Xu, Zihao, et autres
Publié: (2026)
Induction Head Toxicity Mechanistically Explains Repetition Curse in Large Language Models
par: Wang, Shuxun, et autres
Publié: (2025)
par: Wang, Shuxun, et autres
Publié: (2025)
Booster: Tackling Harmful Fine-tuning for Large Language Models via Attenuating Harmful Perturbation
par: Huang, Tiansheng, et autres
Publié: (2024)
par: Huang, Tiansheng, et autres
Publié: (2024)
SciSafeEval: A Comprehensive Benchmark for Safety Alignment of Large Language Models in Scientific Tasks
par: Li, Tianhao, et autres
Publié: (2024)
par: Li, Tianhao, et autres
Publié: (2024)
LongSafety: Evaluating Long-Context Safety of Large Language Models
par: Lu, Yida, et autres
Publié: (2025)
par: Lu, Yida, et autres
Publié: (2025)
Refining Positive and Toxic Samples for Dual Safety Self-Alignment of LLMs with Minimal Human Interventions
par: Xu, Jingxin, et autres
Publié: (2025)
par: Xu, Jingxin, et autres
Publié: (2025)
What Matters For Safety Alignment?
par: Li, Xing, et autres
Publié: (2026)
par: Li, Xing, et autres
Publié: (2026)
Data Advisor: Dynamic Data Curation for Safety Alignment of Large Language Models
par: Wang, Fei, et autres
Publié: (2024)
par: Wang, Fei, et autres
Publié: (2024)
Embedding Self-Correction as an Inherent Ability in Large Language Models for Enhanced Mathematical Reasoning
par: Gao, Kuofeng, et autres
Publié: (2024)
par: Gao, Kuofeng, et autres
Publié: (2024)
Struct-X: Enhancing Large Language Models Reasoning with Structured Data
par: Tan, Xiaoyu, et autres
Publié: (2024)
par: Tan, Xiaoyu, et autres
Publié: (2024)
Large Language Models Are Neurosymbolic Reasoners
par: Fang, Meng, et autres
Publié: (2024)
par: Fang, Meng, et autres
Publié: (2024)
Realistic Evaluation of Toxicity in Large Language Models
par: Luong, Tinh Son, et autres
Publié: (2024)
par: Luong, Tinh Son, et autres
Publié: (2024)
Diverse Human Value Alignment for Large Language Models via Ethical Reasoning
par: Wang, Jiahao, et autres
Publié: (2025)
par: Wang, Jiahao, et autres
Publié: (2025)
Testing and Evaluation of Large Language Models: Correctness, Non-Toxicity, and Fairness
par: Wang, Wenxuan
Publié: (2024)
par: Wang, Wenxuan
Publié: (2024)
Trojan Activation Attack: Red-Teaming Large Language Models using Activation Steering for Safety-Alignment
par: Wang, Haoran, et autres
Publié: (2023)
par: Wang, Haoran, et autres
Publié: (2023)
Struc-EMB: The Potential of Structure-Aware Encoding in Language Embeddings
par: Liu, Shikun, et autres
Publié: (2025)
par: Liu, Shikun, et autres
Publié: (2025)
Demystifying Embedding Spaces using Large Language Models
par: Tennenholtz, Guy, et autres
Publié: (2023)
par: Tennenholtz, Guy, et autres
Publié: (2023)
Safety Alignment via Constrained Knowledge Unlearning
par: Shi, Zesheng, et autres
Publié: (2025)
par: Shi, Zesheng, et autres
Publié: (2025)
Benchmarking Multi-National Value Alignment for Large Language Models
par: Shi, Weijie, et autres
Publié: (2025)
par: Shi, Weijie, et autres
Publié: (2025)
Brain in a Vat: On Missing Pieces Towards Artificial General Intelligence in Large Language Models
par: Ma, Yuxi, et autres
Publié: (2023)
par: Ma, Yuxi, et autres
Publié: (2023)
CHiSafetyBench: A Chinese Hierarchical Safety Benchmark for Large Language Models
par: Zhang, Wenjing, et autres
Publié: (2024)
par: Zhang, Wenjing, et autres
Publié: (2024)
Integrating Chemistry Knowledge in Large Language Models via Prompt Engineering
par: Liu, Hongxuan, et autres
Publié: (2024)
par: Liu, Hongxuan, et autres
Publié: (2024)
Documents similaires
-
GlitchProber: Advancing Effective Detection and Mitigation of Glitch Tokens in Large Language Models
par: Zhang, Zhibo, et autres
Publié: (2024) -
Continuous Embedding Attacks via Clipped Inputs in Jailbreaking Large Language Models
par: Xu, Zihao, et autres
Publié: (2024) -
Model-Editing-Based Jailbreak against Safety-aligned Large Language Models
par: Li, Yuxi, et autres
Publié: (2024) -
Enhancing Safety of Large Language Models via Embedding Space Separation
par: Zhao, Xu, et autres
Publié: (2026) -
Embedding Poisoning: Bypassing Safety Alignment via Embedding Semantic Shift
par: Yuan, Shuai, et autres
Publié: (2025)