SafeRedirect: Defeating Internal Safety Collapse via Task-Completion Redirection in Frontier LLMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Pan, Chao, Wu, Yu, Yao, Xin |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SafeRedir: Prompt Embedding Redirection for Robust Unlearning in Image Generation Models
par: Liu, Renyang, et autres
Publié: (2026)
par: Liu, Renyang, et autres
Publié: (2026)
Strategic Dishonesty Can Undermine AI Safety Evaluations of Frontier LLMs
par: Panfilov, Alexander, et autres
Publié: (2025)
par: Panfilov, Alexander, et autres
Publié: (2025)
Internal Safety Collapse in Frontier Large Language Models
par: Wu, Yutao, et autres
Publié: (2026)
par: Wu, Yutao, et autres
Publié: (2026)
Safe Delta: Consistently Preserving Safety when Fine-Tuning LLMs on Diverse Datasets
par: Lu, Ning, et autres
Publié: (2025)
par: Lu, Ning, et autres
Publié: (2025)
SAFEx: Analyzing Vulnerabilities of MoE-Based LLMs via Stable Safety-critical Expert Identification
par: Lai, Zhenglin, et autres
Publié: (2025)
par: Lai, Zhenglin, et autres
Publié: (2025)
SafeMLRM: Demystifying Safety in Multi-modal Large Reasoning Models
par: Fang, Junfeng, et autres
Publié: (2025)
par: Fang, Junfeng, et autres
Publié: (2025)
UpSafe$^\circ$C: Upcycling for Controllable Safety in Large Language Models
par: Sun, Yuhao, et autres
Publié: (2025)
par: Sun, Yuhao, et autres
Publié: (2025)
When Safety Geometry Collapses: Fine-Tuning Vulnerabilities in Agentic Guard Models
par: Hossain, Ismail, et autres
Publié: (2026)
par: Hossain, Ismail, et autres
Publié: (2026)
Immune: Improving Safety Against Jailbreaks in Multi-modal LLMs via Inference-Time Alignment
par: Ghosal, Soumya Suvra, et autres
Publié: (2024)
par: Ghosal, Soumya Suvra, et autres
Publié: (2024)
Jailbreaking Leading Safety-Aligned LLMs with Simple Adaptive Attacks
par: Andriushchenko, Maksym, et autres
Publié: (2024)
par: Andriushchenko, Maksym, et autres
Publié: (2024)
Sparse Models, Sparse Safety: Unsafe Routes in Mixture-of-Experts LLMs
par: Jiang, Yukun, et autres
Publié: (2026)
par: Jiang, Yukun, et autres
Publié: (2026)
Early Signs of Steganographic Capabilities in Frontier LLMs
par: Zolkowski, Artur, et autres
Publié: (2025)
par: Zolkowski, Artur, et autres
Publié: (2025)
Jailbroken Frontier Models Retain Their Capabilities
par: Zhu, Daniel, et autres
Publié: (2026)
par: Zhu, Daniel, et autres
Publié: (2026)
MCP Safety Audit: LLMs with the Model Context Protocol Allow Major Security Exploits
par: Radosevich, Brandon, et autres
Publié: (2025)
par: Radosevich, Brandon, et autres
Publié: (2025)
Data-Free Privacy-Preserving for LLMs via Model Inversion and Selective Unlearning
par: Zhou, Xinjie, et autres
Publié: (2026)
par: Zhou, Xinjie, et autres
Publié: (2026)
IH-Challenge: A Training Dataset to Improve Instruction Hierarchy on Frontier LLMs
par: Guo, Chuan, et autres
Publié: (2026)
par: Guo, Chuan, et autres
Publié: (2026)
From Firewalls to Frontiers: AI Red-Teaming is a Domain-Specific Evolution of Cyber Red-Teaming
par: Sinha, Anusha, et autres
Publié: (2025)
par: Sinha, Anusha, et autres
Publié: (2025)
Private-RAG: Answering Multiple Queries with LLMs while Keeping Your Data Private
par: Wu, Ruihan, et autres
Publié: (2025)
par: Wu, Ruihan, et autres
Publié: (2025)
SPARD: Defending Harmful Fine-Tuning Attack via Safety Projection with Relevance-Diversity Data Selection
par: Chen, Shuhao, et autres
Publié: (2026)
par: Chen, Shuhao, et autres
Publié: (2026)
DPrivBench: Benchmarking LLMs' Reasoning for Differential Privacy
par: Wang, Erchi, et autres
Publié: (2026)
par: Wang, Erchi, et autres
Publié: (2026)
What is in Your Safe Data? Identifying Benign Data that Breaks Safety
par: He, Luxi, et autres
Publié: (2024)
par: He, Luxi, et autres
Publié: (2024)
Adversaries Can Misuse Combinations of Safe Models
par: Jones, Erik, et autres
Publié: (2024)
par: Jones, Erik, et autres
Publié: (2024)
Trusted Weights, Treacherous Optimizations? Optimization-Triggered Backdoor Attacks on LLMs
par: Wang, Yifei, et autres
Publié: (2026)
par: Wang, Yifei, et autres
Publié: (2026)
Jailbreaking GPT-4V via Self-Adversarial Attacks with System Prompts
par: Wu, Yuanwei, et autres
Publié: (2023)
par: Wu, Yuanwei, et autres
Publié: (2023)
Symmetry Defeats Auditing
par: Merrill, Nick, et autres
Publié: (2026)
par: Merrill, Nick, et autres
Publié: (2026)
Knowing without Acting: The Disentangled Geometry of Safety Mechanisms in Large Language Models
par: Wu, Jinman, et autres
Publié: (2026)
par: Wu, Jinman, et autres
Publié: (2026)
The Task Shield: Enforcing Task Alignment to Defend Against Indirect Prompt Injection in LLM Agents
par: Jia, Feiran, et autres
Publié: (2024)
par: Jia, Feiran, et autres
Publié: (2024)
POT: Inducing Overthinking in LLMs via Black-Box Iterative Optimization
par: Li, Xinyu, et autres
Publié: (2025)
par: Li, Xinyu, et autres
Publié: (2025)
CodeAttack: Revealing Safety Generalization Challenges of Large Language Models via Code Completion
par: Ren, Qibing, et autres
Publié: (2024)
par: Ren, Qibing, et autres
Publié: (2024)
AlphaAlign: Incentivizing Safety Alignment with Extremely Simplified Reinforcement Learning
par: Zhang, Yi, et autres
Publié: (2025)
par: Zhang, Yi, et autres
Publié: (2025)
Safety Tax: Safety Alignment Makes Your Large Reasoning Models Less Reasonable
par: Huang, Tiansheng, et autres
Publié: (2025)
par: Huang, Tiansheng, et autres
Publié: (2025)
Safety Geometry Collapse in Multimodal LLMs and Adaptive Drift Correction
par: Guo, Jiahe, et autres
Publié: (2026)
par: Guo, Jiahe, et autres
Publié: (2026)
Probing Latent Subspaces in LLM for AI Security: Identifying and Manipulating Adversarial States
par: Chia, Xin Wei, et autres
Publié: (2025)
par: Chia, Xin Wei, et autres
Publié: (2025)
SPRINT: Robust Model Attribution of Generated Images via Secret Pixel Reconstruction
par: Yao, Kai, et autres
Publié: (2025)
par: Yao, Kai, et autres
Publié: (2025)
Guiding not Forcing: Enhancing the Transferability of Jailbreaking Attacks on LLMs via Removing Superfluous Constraints
par: Yang, Junxiao, et autres
Publié: (2025)
par: Yang, Junxiao, et autres
Publié: (2025)
Prompt, Divide, and Conquer: Bypassing Large Language Model Safety Filters via Segmented and Distributed Prompt Processing
par: Wahréus, Johan, et autres
Publié: (2025)
par: Wahréus, Johan, et autres
Publié: (2025)
BrowseSafe: Understanding and Preventing Prompt Injection Within AI Browser Agents
par: Zhang, Kaiyuan, et autres
Publié: (2025)
par: Zhang, Kaiyuan, et autres
Publié: (2025)
Trapping Attacker in Dilemma: Examining Internal Correlations and External Influences of Trigger for Defending GNN Backdoors
par: Yang, Fan, et autres
Publié: (2026)
par: Yang, Fan, et autres
Publié: (2026)
Attention Tracker: Detecting Prompt Injection Attacks in LLMs
par: Hung, Kuo-Han, et autres
Publié: (2024)
par: Hung, Kuo-Han, et autres
Publié: (2024)
Saffron-1: Safety Inference Scaling
par: Qiu, Ruizhong, et autres
Publié: (2025)
par: Qiu, Ruizhong, et autres
Publié: (2025)
Documents similaires
-
SafeRedir: Prompt Embedding Redirection for Robust Unlearning in Image Generation Models
par: Liu, Renyang, et autres
Publié: (2026) -
Strategic Dishonesty Can Undermine AI Safety Evaluations of Frontier LLMs
par: Panfilov, Alexander, et autres
Publié: (2025) -
Internal Safety Collapse in Frontier Large Language Models
par: Wu, Yutao, et autres
Publié: (2026) -
Safe Delta: Consistently Preserving Safety when Fine-Tuning LLMs on Diverse Datasets
par: Lu, Ning, et autres
Publié: (2025) -
SAFEx: Analyzing Vulnerabilities of MoE-Based LLMs via Stable Safety-critical Expert Identification
par: Lai, Zhenglin, et autres
Publié: (2025)