Matching Ranks Over Probability Yields Truly Deep Safety Alignment
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Vega, Jason, Singh, Gagandeep |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Bypassing the Safety Training of Open-Source LLMs with Priming Attacks
von: Vega, Jason, et al.
Veröffentlicht: (2023)
von: Vega, Jason, et al.
Veröffentlicht: (2023)
Quantitative Certification of Agentic Tool Selection
von: Yeon, Jehyeok, et al.
Veröffentlicht: (2025)
von: Yeon, Jehyeok, et al.
Veröffentlicht: (2025)
Safety Alignment Should Be Made More Than Just a Few Tokens Deep
von: Qi, Xiangyu, et al.
Veröffentlicht: (2024)
von: Qi, Xiangyu, et al.
Veröffentlicht: (2024)
Reimagining Safety Alignment with An Image
von: Xia, Yifan, et al.
Veröffentlicht: (2025)
von: Xia, Yifan, et al.
Veröffentlicht: (2025)
Universal Black-Box Reward Poisoning Attack against Offline Reinforcement Learning
von: Xu, Yinglun, et al.
Veröffentlicht: (2024)
von: Xu, Yinglun, et al.
Veröffentlicht: (2024)
Few-Shot Truly Benign DPO Attack for Jailbreaking LLMs
von: Yoon, Sangyeon, et al.
Veröffentlicht: (2026)
von: Yoon, Sangyeon, et al.
Veröffentlicht: (2026)
Agent Safety Alignment via Reinforcement Learning
von: Sha, Zeyang, et al.
Veröffentlicht: (2025)
von: Sha, Zeyang, et al.
Veröffentlicht: (2025)
Targeting Alignment: Extracting Safety Classifiers of Aligned LLMs
von: Ferrand, Jean-Charles Noirot, et al.
Veröffentlicht: (2025)
von: Ferrand, Jean-Charles Noirot, et al.
Veröffentlicht: (2025)
Measuring Safety Alignment Effects in Autonomous Security Agents
von: David, Isaac, et al.
Veröffentlicht: (2026)
von: David, Isaac, et al.
Veröffentlicht: (2026)
VisuoAlign: Safety Alignment of LVLMs with Multimodal Tree Search
von: Li, MingSheng, et al.
Veröffentlicht: (2025)
von: Li, MingSheng, et al.
Veröffentlicht: (2025)
FreakOut-LLM: The Effect of Emotional Stimuli on Safety Alignment
von: Kuznetsov, Daniel, et al.
Veröffentlicht: (2026)
von: Kuznetsov, Daniel, et al.
Veröffentlicht: (2026)
PRISM: Robust VLM Alignment with Principled Reasoning for Integrated Safety in Multimodality
von: Li, Nanxi, et al.
Veröffentlicht: (2025)
von: Li, Nanxi, et al.
Veröffentlicht: (2025)
Ablating Safety: Mechanisms for Removing Alignment in Language Models for Security Applications
von: David, Isaac, et al.
Veröffentlicht: (2026)
von: David, Isaac, et al.
Veröffentlicht: (2026)
Defensive Refusal Bias: How Safety Alignment Fails Cyber Defenders
von: Campbell, David, et al.
Veröffentlicht: (2026)
von: Campbell, David, et al.
Veröffentlicht: (2026)
Refusal Falls off a Cliff: How Safety Alignment Fails in Reasoning?
von: Yin, Qingyu, et al.
Veröffentlicht: (2025)
von: Yin, Qingyu, et al.
Veröffentlicht: (2025)
SafeThinker: Reasoning about Risk to Deepen Safety Beyond Shallow Alignment
von: Fang, Xianya, et al.
Veröffentlicht: (2026)
von: Fang, Xianya, et al.
Veröffentlicht: (2026)
MTSA: Multi-turn Safety Alignment for LLMs through Multi-round Red-teaming
von: Guo, Weiyang, et al.
Veröffentlicht: (2025)
von: Guo, Weiyang, et al.
Veröffentlicht: (2025)
What Matters For Safety Alignment?
von: Li, Xing, et al.
Veröffentlicht: (2026)
von: Li, Xing, et al.
Veröffentlicht: (2026)
Defending MoE LLMs against Harmful Fine-Tuning via Safety Routing Alignment
von: Kim, Jaehan, et al.
Veröffentlicht: (2025)
von: Kim, Jaehan, et al.
Veröffentlicht: (2025)
Antidote: Post-fine-tuning Safety Alignment for Large Language Models against Harmful Fine-tuning
von: Huang, Tiansheng, et al.
Veröffentlicht: (2024)
von: Huang, Tiansheng, et al.
Veröffentlicht: (2024)
Multi-Stream Perturbation Attack: Breaking Safety Alignment of Thinking LLMs Through Concurrent Task Interference
von: Yang, Fan
Veröffentlicht: (2026)
von: Yang, Fan
Veröffentlicht: (2026)
Immune: Improving Safety Against Jailbreaks in Multi-modal LLMs via Inference-Time Alignment
von: Ghosal, Soumya Suvra, et al.
Veröffentlicht: (2024)
von: Ghosal, Soumya Suvra, et al.
Veröffentlicht: (2024)
Adversarial Attack-Defense Co-Evolution for LLM Safety Alignment via Tree-Group Dual-Aware Search and Optimization
von: Li, Xurui, et al.
Veröffentlicht: (2025)
von: Li, Xurui, et al.
Veröffentlicht: (2025)
Depth Charge: Jailbreak Large Language Models from Deep Safety Attention Heads
von: Wu, Jinman, et al.
Veröffentlicht: (2026)
von: Wu, Jinman, et al.
Veröffentlicht: (2026)
Structured Visual Narratives Undermine Safety Alignment in Multimodal Large Language Models
von: Tan, Rui Yang, et al.
Veröffentlicht: (2026)
von: Tan, Rui Yang, et al.
Veröffentlicht: (2026)
How Catastrophic is Your LLM? Certifying Risk in Conversation
von: Wang, Chengxiao, et al.
Veröffentlicht: (2025)
von: Wang, Chengxiao, et al.
Veröffentlicht: (2025)
Is Your AI Truly Yours? Leveraging Blockchain for Copyrights, Provenance, and Lineage
von: Wang, Qin, et al.
Veröffentlicht: (2024)
von: Wang, Qin, et al.
Veröffentlicht: (2024)
Safety Tax: Safety Alignment Makes Your Large Reasoning Models Less Reasonable
von: Huang, Tiansheng, et al.
Veröffentlicht: (2025)
von: Huang, Tiansheng, et al.
Veröffentlicht: (2025)
Containment Verification: AI Safety Guarantees Independent of Alignment
von: Moon, Royce, et al.
Veröffentlicht: (2026)
von: Moon, Royce, et al.
Veröffentlicht: (2026)
Uncovering Logit Suppression Vulnerabilities in LLM Safety Alignment
von: Li, Yuxi, et al.
Veröffentlicht: (2024)
von: Li, Yuxi, et al.
Veröffentlicht: (2024)
SoSBench: Benchmarking Safety Alignment on Six Scientific Domains
von: Jiang, Fengqing, et al.
Veröffentlicht: (2025)
von: Jiang, Fengqing, et al.
Veröffentlicht: (2025)
Attention Eclipse: Manipulating Attention to Bypass LLM Safety-Alignment
von: Zaree, Pedram, et al.
Veröffentlicht: (2025)
von: Zaree, Pedram, et al.
Veröffentlicht: (2025)
RASA: Routing-Aware Safety Alignment for Mixture-of-Experts Models
von: Liang, Jiacheng, et al.
Veröffentlicht: (2026)
von: Liang, Jiacheng, et al.
Veröffentlicht: (2026)
An LLM Framework For Cryptography Over Chat Channels
von: Gligoroski, Danilo, et al.
Veröffentlicht: (2025)
von: Gligoroski, Danilo, et al.
Veröffentlicht: (2025)
AlphaAlign: Incentivizing Safety Alignment with Extremely Simplified Reinforcement Learning
von: Zhang, Yi, et al.
Veröffentlicht: (2025)
von: Zhang, Yi, et al.
Veröffentlicht: (2025)
PrivacyXray: Detecting Privacy Breaches in LLMs through Semantic Consistency and Probability Certainty
von: He, Jinwen, et al.
Veröffentlicht: (2025)
von: He, Jinwen, et al.
Veröffentlicht: (2025)
The Inadequacy of Similarity-based Privacy Metrics: Privacy Attacks against "Truly Anonymous" Synthetic Datasets
von: Ganev, Georgi, et al.
Veröffentlicht: (2023)
von: Ganev, Georgi, et al.
Veröffentlicht: (2023)
From Threat to Tool: Leveraging Refusal-Aware Injection Attacks for Safety Alignment
von: Chae, Kyubyung, et al.
Veröffentlicht: (2025)
von: Chae, Kyubyung, et al.
Veröffentlicht: (2025)
SAGE-RT: Synthetic Alignment data Generation for Safety Evaluation and Red Teaming
von: Kumar, Anurakt, et al.
Veröffentlicht: (2024)
von: Kumar, Anurakt, et al.
Veröffentlicht: (2024)
ReasAlign: Reasoning Enhanced Safety Alignment against Prompt Injection Attack
von: Li, Hao, et al.
Veröffentlicht: (2026)
von: Li, Hao, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
Bypassing the Safety Training of Open-Source LLMs with Priming Attacks
von: Vega, Jason, et al.
Veröffentlicht: (2023) -
Quantitative Certification of Agentic Tool Selection
von: Yeon, Jehyeok, et al.
Veröffentlicht: (2025) -
Safety Alignment Should Be Made More Than Just a Few Tokens Deep
von: Qi, Xiangyu, et al.
Veröffentlicht: (2024) -
Reimagining Safety Alignment with An Image
von: Xia, Yifan, et al.
Veröffentlicht: (2025) -
Universal Black-Box Reward Poisoning Attack against Offline Reinforcement Learning
von: Xu, Yinglun, et al.
Veröffentlicht: (2024)