Quantifying LLM Safety Degradation Under Repeated Attacks Using Survival Analysis
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Topol, Zvi |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Quantifying Loss Aversion in Cyber Adversaries via LLM Analysis
par: Hans, Soham, et autres
Publié: (2025)
par: Hans, Soham, et autres
Publié: (2025)
TamperBench: Systematically Stress-Testing LLM Safety Under Fine-Tuning and Tampering
par: Hossain, Saad, et autres
Publié: (2026)
par: Hossain, Saad, et autres
Publié: (2026)
Surviving the Unseen: Predictive Defense for Novel Multi-Turn Multimodal Attacks
par: You, Doohee
Publié: (2026)
par: You, Doohee
Publié: (2026)
Safety-Oriented Routing Analysis of Mixtral MoE Under Benign and Harmful Prompts
par: Siddiky, Md Nurul Absar
Publié: (2026)
par: Siddiky, Md Nurul Absar
Publié: (2026)
Robustness Analysis of Machine Learning Models for IoT Intrusion Detection Under Data Poisoning Attacks
par: Wulnye, Fortunatus Aabangbio, et autres
Publié: (2026)
par: Wulnye, Fortunatus Aabangbio, et autres
Publié: (2026)
Adversarial Attack-Defense Co-Evolution for LLM Safety Alignment via Tree-Group Dual-Aware Search and Optimization
par: Li, Xurui, et autres
Publié: (2025)
par: Li, Xurui, et autres
Publié: (2025)
Quantifying Frontier LLM Capabilities for Container Sandbox Escape
par: Marchand, Rahul, et autres
Publié: (2026)
par: Marchand, Rahul, et autres
Publié: (2026)
LLM Embedding-based Attribution (LEA): Quantifying Source Contributions to Generative Model's Response for Vulnerability Analysis
par: Fayyazi, Reza, et autres
Publié: (2025)
par: Fayyazi, Reza, et autres
Publié: (2025)
LLM-based Multi-class Attack Analysis and Mitigation Framework in IoT/IIoT Networks
par: Ikbarieh, Seif, et autres
Publié: (2025)
par: Ikbarieh, Seif, et autres
Publié: (2025)
Attention Masks Help Adversarial Attacks to Bypass Safety Detectors
par: Shi, Yunfan
Publié: (2024)
par: Shi, Yunfan
Publié: (2024)
Relevance as a Vulnerability: How Web Retrieval Degrades Safety Alignment in LLM Agents
par: Nawal, Aditya, et autres
Publié: (2026)
par: Nawal, Aditya, et autres
Publié: (2026)
LLM-Safety Evaluations Lack Robustness
par: Beyer, Tim, et autres
Publié: (2025)
par: Beyer, Tim, et autres
Publié: (2025)
RevPRAG: Revealing Poisoning Attacks in Retrieval-Augmented Generation through LLM Activation Analysis
par: Tan, Xue, et autres
Publié: (2024)
par: Tan, Xue, et autres
Publié: (2024)
AttackPilot: Autonomous Inference Attacks Against ML Services With LLM-Based Agents
par: Wu, Yixin, et autres
Publié: (2025)
par: Wu, Yixin, et autres
Publié: (2025)
aiXamine: Simplified LLM Safety and Security
par: Deniz, Fatih, et autres
Publié: (2025)
par: Deniz, Fatih, et autres
Publié: (2025)
CheatAgent: Attacking LLM-Empowered Recommender Systems via LLM Agent
par: Ning, Liang-bo, et autres
Publié: (2025)
par: Ning, Liang-bo, et autres
Publié: (2025)
CompressionAttack: Exploiting Prompt Compression as a New Attack Surface in LLM-Powered Agents
par: Liu, Zesen, et autres
Publié: (2025)
par: Liu, Zesen, et autres
Publié: (2025)
Execution Is the New Attack Surface: Survivability-Aware Agentic Crypto Trading with OpenClaw-Style Local Executors
par: Borjigin, Ailiya, et autres
Publié: (2026)
par: Borjigin, Ailiya, et autres
Publié: (2026)
LoopTrap: Termination Poisoning Attacks on LLM Agents
par: Xu, Huiyu, et autres
Publié: (2026)
par: Xu, Huiyu, et autres
Publié: (2026)
Targeted Bit-Flip Attacks on LLM-Based Agents
par: Wang, Jialai, et autres
Publié: (2026)
par: Wang, Jialai, et autres
Publié: (2026)
Exploring Backdoor Attack and Defense for LLM-empowered Recommendations
par: Ning, Liangbo, et autres
Publié: (2025)
par: Ning, Liangbo, et autres
Publié: (2025)
SAGE: A Generic Framework for LLM Safety Evaluation
par: Jindal, Madhur, et autres
Publié: (2025)
par: Jindal, Madhur, et autres
Publié: (2025)
AISA: Awakening Intrinsic Safety Awareness in Large Language Models against Jailbreak Attacks
par: Song, Weiming, et autres
Publié: (2026)
par: Song, Weiming, et autres
Publié: (2026)
AutoBackdoor: Automating Backdoor Attacks via LLM Agents
par: Li, Yige, et autres
Publié: (2025)
par: Li, Yige, et autres
Publié: (2025)
Multi-Stage Prompt Inference Attacks on Enterprise LLM Systems
par: Balashov, Andrii, et autres
Publié: (2025)
par: Balashov, Andrii, et autres
Publié: (2025)
ToolTweak: An Attack on Tool Selection in LLM-based Agents
par: Sneh, Jonathan, et autres
Publié: (2025)
par: Sneh, Jonathan, et autres
Publié: (2025)
Human-Imperceptible Retrieval Poisoning Attacks in LLM-Powered Applications
par: Zhang, Quan, et autres
Publié: (2024)
par: Zhang, Quan, et autres
Publié: (2024)
Optimization-based Prompt Injection Attack to LLM-as-a-Judge
par: Shi, Jiawen, et autres
Publié: (2024)
par: Shi, Jiawen, et autres
Publié: (2024)
Cloud-based XAI Services for Assessing Open Repository Models Under Adversarial Attacks
par: Wang, Zerui, et autres
Publié: (2024)
par: Wang, Zerui, et autres
Publié: (2024)
Quantifying the Noise of Structural Perturbations on Graph Adversarial Attacks
par: Fang, Junyuan, et autres
Publié: (2025)
par: Fang, Junyuan, et autres
Publié: (2025)
Distillability of LLM Security Logic: Predicting Attack Success Rate of Outline Filling Attack via Ranking Regression
par: Zhang, Tianyu, et autres
Publié: (2025)
par: Zhang, Tianyu, et autres
Publié: (2025)
FreakOut-LLM: The Effect of Emotional Stimuli on Safety Alignment
par: Kuznetsov, Daniel, et autres
Publié: (2026)
par: Kuznetsov, Daniel, et autres
Publié: (2026)
A Method for Enhancing the Safety of Large Model Generation Based on Multi-dimensional Attack and Defense
par: Zhai, Keke
Publié: (2024)
par: Zhai, Keke
Publié: (2024)
UNSEEN: A Cross-Stack LLM Unlearning Defense against AR-LLM Social Engineering Attacks
par: Yu, Tianlong, et autres
Publié: (2026)
par: Yu, Tianlong, et autres
Publié: (2026)
When Backdoors Go Beyond Triggers: Semantic Drift in Diffusion Models Under Encoder Attacks
par: Chen, Shenyang, et autres
Publié: (2026)
par: Chen, Shenyang, et autres
Publié: (2026)
Under the Hood of SKILL.md: Semantic Supply-chain Attacks on AI Agent Skill Registry
par: Saha, Shoumik, et autres
Publié: (2026)
par: Saha, Shoumik, et autres
Publié: (2026)
From Incomplete Architecture to Quantified Risk: Multimodal LLM-Driven Security Assessment for Cyber-Physical Systems
par: Huang, Shaofei, et autres
Publié: (2026)
par: Huang, Shaofei, et autres
Publié: (2026)
From Similarity to Vulnerability: Key Collision Attack on LLM Semantic Caching
par: Zhang, Zhixiang, et autres
Publié: (2026)
par: Zhang, Zhixiang, et autres
Publié: (2026)
Enhancing Linux Privilege Escalation Attack Capabilities of Local LLM Agents
par: Probst, Benjamin, et autres
Publié: (2026)
par: Probst, Benjamin, et autres
Publié: (2026)
Rethinking Latency Denial-of-Service: Attacking the LLM Serving Framework, Not the Model
par: Wang, Tianyi, et autres
Publié: (2026)
par: Wang, Tianyi, et autres
Publié: (2026)
Documents similaires
-
Quantifying Loss Aversion in Cyber Adversaries via LLM Analysis
par: Hans, Soham, et autres
Publié: (2025) -
TamperBench: Systematically Stress-Testing LLM Safety Under Fine-Tuning and Tampering
par: Hossain, Saad, et autres
Publié: (2026) -
Surviving the Unseen: Predictive Defense for Novel Multi-Turn Multimodal Attacks
par: You, Doohee
Publié: (2026) -
Safety-Oriented Routing Analysis of Mixtral MoE Under Benign and Harmful Prompts
par: Siddiky, Md Nurul Absar
Publié: (2026) -
Robustness Analysis of Machine Learning Models for IoT Intrusion Detection Under Data Poisoning Attacks
par: Wulnye, Fortunatus Aabangbio, et autres
Publié: (2026)