SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Wu, Xiaodong, Li, Xiangman, Li, Qi, Liu, Lingshuang, Ni, Jianbing |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Robustness of Watermarking on Text-to-Image Diffusion Models
di: Wu, Xiaodong, et al.
Pubblicazione: (2024)
di: Wu, Xiaodong, et al.
Pubblicazione: (2024)
SoK: Evaluating Jailbreak Guardrails for Large Language Models
di: Wang, Xunguang, et al.
Pubblicazione: (2025)
di: Wang, Xunguang, et al.
Pubblicazione: (2025)
SoK: a Comprehensive Causality Analysis Framework for Large Language Model Security
di: Zhao, Wei, et al.
Pubblicazione: (2025)
di: Zhao, Wei, et al.
Pubblicazione: (2025)
Security in LLM-as-a-Judge: A Comprehensive SoK
di: Masoud, Aiman Al, et al.
Pubblicazione: (2026)
di: Masoud, Aiman Al, et al.
Pubblicazione: (2026)
SoK: Robustness in Large Language Models against Jailbreak Attacks
di: Xu, Feiyue, et al.
Pubblicazione: (2026)
di: Xu, Feiyue, et al.
Pubblicazione: (2026)
SoK: Semantic Privacy in Large Language Models
di: Ma, Baihe, et al.
Pubblicazione: (2025)
di: Ma, Baihe, et al.
Pubblicazione: (2025)
SecureT2I: No More Unauthorized Manipulation on AI Generated Images from Prompts
di: Wu, Xiaodong, et al.
Pubblicazione: (2025)
di: Wu, Xiaodong, et al.
Pubblicazione: (2025)
SoK: Security Analysis of Blockchain-based Cryptocurrency
di: Liu, Zekai, et al.
Pubblicazione: (2025)
di: Liu, Zekai, et al.
Pubblicazione: (2025)
PDLRecover: Privacy-preserving Decentralized Model Recovery with Machine Unlearning
di: Li, Xiangman, et al.
Pubblicazione: (2025)
di: Li, Xiangman, et al.
Pubblicazione: (2025)
When There Is No Decoder: Removing Watermarks from Stable Diffusion Models in a No-box Setting
di: Wu, Xiaodong, et al.
Pubblicazione: (2025)
di: Wu, Xiaodong, et al.
Pubblicazione: (2025)
SoK: On the Semantic AI Security in Autonomous Driving
di: Shen, Junjie, et al.
Pubblicazione: (2022)
di: Shen, Junjie, et al.
Pubblicazione: (2022)
From AI-Generated Content to Agentic Action: Security and Safety Threats in Generative AI
di: Zhang, Zelin, et al.
Pubblicazione: (2026)
di: Zhang, Zelin, et al.
Pubblicazione: (2026)
SoK: Taxonomy and Evaluation of Prompt Security in Large Language Models
di: Hong, Hanbin, et al.
Pubblicazione: (2025)
di: Hong, Hanbin, et al.
Pubblicazione: (2025)
SoK: Security and Privacy of AI Agents for Blockchain
di: Romandini, Nicolò, et al.
Pubblicazione: (2025)
di: Romandini, Nicolò, et al.
Pubblicazione: (2025)
SoK: Towards Security and Safety of Edge AI
di: Wingarz, Tatjana, et al.
Pubblicazione: (2024)
di: Wingarz, Tatjana, et al.
Pubblicazione: (2024)
SoK: Understanding (New) Security Issues Across AI4Code Use Cases
di: Wu, Qilong, et al.
Pubblicazione: (2025)
di: Wu, Qilong, et al.
Pubblicazione: (2025)
MelShield: Robust Mel-Domain Audio Watermarking for Provenance Attribution of AI Generated Synthesized Speech
di: Jin, Yutong, et al.
Pubblicazione: (2026)
di: Jin, Yutong, et al.
Pubblicazione: (2026)
SoK: An Introspective Analysis of RPKI Security
di: Mirdita, Donika, et al.
Pubblicazione: (2024)
di: Mirdita, Donika, et al.
Pubblicazione: (2024)
SoK: Security and Privacy Risks of Healthcare AI
di: Chang, Yuanhaur, et al.
Pubblicazione: (2024)
di: Chang, Yuanhaur, et al.
Pubblicazione: (2024)
SoK: On Gradient Leakage in Federated Learning
di: Du, Jiacheng, et al.
Pubblicazione: (2024)
di: Du, Jiacheng, et al.
Pubblicazione: (2024)
SoK: Security of Programmable Logic Controllers
di: López-Morales, Efrén, et al.
Pubblicazione: (2024)
di: López-Morales, Efrén, et al.
Pubblicazione: (2024)
SoK: Unlearnability and Unlearning for Model Dememorization
di: Zhang, Mengying, et al.
Pubblicazione: (2026)
di: Zhang, Mengying, et al.
Pubblicazione: (2026)
SoK: Trust-Authorization Mismatch in LLM Agent Interactions
di: Shi, Guanquan, et al.
Pubblicazione: (2025)
di: Shi, Guanquan, et al.
Pubblicazione: (2025)
SoK: The Last Line of Defense: On Backdoor Defense Evaluation
di: Abad, Gorka, et al.
Pubblicazione: (2025)
di: Abad, Gorka, et al.
Pubblicazione: (2025)
SoK: Security of EMV Contactless Payment Systems
di: Nezhad, Mahshid Mehr, et al.
Pubblicazione: (2025)
di: Nezhad, Mahshid Mehr, et al.
Pubblicazione: (2025)
SoK: Watermarking for AI-Generated Content
di: Zhao, Xuandong, et al.
Pubblicazione: (2024)
di: Zhao, Xuandong, et al.
Pubblicazione: (2024)
SoK: The Security-Safety Continuum of Multimodal Foundation Models through Information Flow and Global Game-Theoretic Analysis of Asymmetric Threats
di: Sun, Ruoxi, et al.
Pubblicazione: (2024)
di: Sun, Ruoxi, et al.
Pubblicazione: (2024)
SoK: Benchmarking Poisoning Attacks and Defenses in Federated Learning
di: Zhang, Heyi, et al.
Pubblicazione: (2025)
di: Zhang, Heyi, et al.
Pubblicazione: (2025)
SoK: Security of Autonomous LLM Agents in Agentic Commerce
di: Mao, Qian'ang, et al.
Pubblicazione: (2026)
di: Mao, Qian'ang, et al.
Pubblicazione: (2026)
SoK: Large Language Model Copyright Auditing via Fingerprinting
di: Shao, Shuo, et al.
Pubblicazione: (2025)
di: Shao, Shuo, et al.
Pubblicazione: (2025)
SoK: Public Blockchain Sharding
di: Barat, Md Mohaimin Al, et al.
Pubblicazione: (2024)
di: Barat, Md Mohaimin Al, et al.
Pubblicazione: (2024)
SoK: Analysis techniques for WebAssembly
di: Harnes, Håkon, et al.
Pubblicazione: (2024)
di: Harnes, Håkon, et al.
Pubblicazione: (2024)
SoK: Leveraging Transformers for Malware Analysis
di: Kunwar, Pradip, et al.
Pubblicazione: (2024)
di: Kunwar, Pradip, et al.
Pubblicazione: (2024)
SoK: Evolution, Security, and Fundamental Properties of Transactional Systems
di: Waterpeace, Sky Pelletier, et al.
Pubblicazione: (2026)
di: Waterpeace, Sky Pelletier, et al.
Pubblicazione: (2026)
SoK: Verifiable Cross-Silo FL
di: Korneev, Aleksei, et al.
Pubblicazione: (2024)
di: Korneev, Aleksei, et al.
Pubblicazione: (2024)
SoK: Prompt Hacking of Large Language Models
di: Rababah, Baha, et al.
Pubblicazione: (2024)
di: Rababah, Baha, et al.
Pubblicazione: (2024)
SoK: Runtime Integrity
di: Ammar, Mahmoud, et al.
Pubblicazione: (2024)
di: Ammar, Mahmoud, et al.
Pubblicazione: (2024)
SoK: How Robust is Audio Watermarking in Generative AI models?
di: Wen, Yizhu, et al.
Pubblicazione: (2025)
di: Wen, Yizhu, et al.
Pubblicazione: (2025)
Towards Understanding the Safety Boundaries of DeepSeek Models: Evaluation and Findings
di: Ying, Zonghao, et al.
Pubblicazione: (2025)
di: Ying, Zonghao, et al.
Pubblicazione: (2025)
SoK: Speedy Secure Finality
di: Saraswat, Yash, et al.
Pubblicazione: (2025)
di: Saraswat, Yash, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Robustness of Watermarking on Text-to-Image Diffusion Models
di: Wu, Xiaodong, et al.
Pubblicazione: (2024) -
SoK: Evaluating Jailbreak Guardrails for Large Language Models
di: Wang, Xunguang, et al.
Pubblicazione: (2025) -
SoK: a Comprehensive Causality Analysis Framework for Large Language Model Security
di: Zhao, Wei, et al.
Pubblicazione: (2025) -
Security in LLM-as-a-Judge: A Comprehensive SoK
di: Masoud, Aiman Al, et al.
Pubblicazione: (2026) -
SoK: Robustness in Large Language Models against Jailbreak Attacks
di: Xu, Feiyue, et al.
Pubblicazione: (2026)