Voice Jailbreak Attacks Against GPT-4o
Fuente:
arXiv
Salvato in:
| Autori principali: | Shen, Xinyue, Wu, Yixin, Backes, Michael, Zhang, Yang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
JailbreakRadar: Comprehensive Assessment of Jailbreak Attacks Against LLMs
di: Chu, Junjie, et al.
Pubblicazione: (2024)
di: Chu, Junjie, et al.
Pubblicazione: (2024)
Prompt Stealing Attacks Against Text-to-Image Generation Models
di: Shen, Xinyue, et al.
Pubblicazione: (2023)
di: Shen, Xinyue, et al.
Pubblicazione: (2023)
When GPT Spills the Tea: Comprehensive Assessment of Knowledge File Leakage in GPTs
di: Shen, Xinyue, et al.
Pubblicazione: (2025)
di: Shen, Xinyue, et al.
Pubblicazione: (2025)
"Do Anything Now": Characterizing and Evaluating In-The-Wild Jailbreak Prompts on Large Language Models
di: Shen, Xinyue, et al.
Pubblicazione: (2023)
di: Shen, Xinyue, et al.
Pubblicazione: (2023)
Link Stealing Attacks Against Inductive Graph Neural Networks
di: Wu, Yixin, et al.
Pubblicazione: (2024)
di: Wu, Yixin, et al.
Pubblicazione: (2024)
HateBench: Benchmarking Hate Speech Detectors on LLM-Generated Content and Hate Campaigns
di: Shen, Xinyue, et al.
Pubblicazione: (2025)
di: Shen, Xinyue, et al.
Pubblicazione: (2025)
Jailbreaking GPT-4V via Self-Adversarial Attacks with System Prompts
di: Wu, Yuanwei, et al.
Pubblicazione: (2023)
di: Wu, Yuanwei, et al.
Pubblicazione: (2023)
Image-Perfect Imperfections: Safety, Bias, and Authenticity in the Shadow of Text-To-Image Model Evolution
di: Wu, Yixin, et al.
Pubblicazione: (2024)
di: Wu, Yixin, et al.
Pubblicazione: (2024)
Instruction Backdoor Attacks Against Customized LLMs
di: Zhang, Rui, et al.
Pubblicazione: (2024)
di: Zhang, Rui, et al.
Pubblicazione: (2024)
Composite Backdoor Attacks Against Large Language Models
di: Huang, Hai, et al.
Pubblicazione: (2023)
di: Huang, Hai, et al.
Pubblicazione: (2023)
SoK: Data Reconstruction Attacks Against Machine Learning Models: Definition, Metrics, and Benchmark
di: Wen, Rui, et al.
Pubblicazione: (2025)
di: Wen, Rui, et al.
Pubblicazione: (2025)
Red Teaming GPT-4V: Are GPT-4V Safe Against Uni/Multi-Modal Jailbreak Attacks?
di: Chen, Shuo, et al.
Pubblicazione: (2024)
di: Chen, Shuo, et al.
Pubblicazione: (2024)
SOS! Soft Prompt Attack Against Open-Source Large Language Models
di: Yang, Ziqing, et al.
Pubblicazione: (2024)
di: Yang, Ziqing, et al.
Pubblicazione: (2024)
The Challenge of Identifying the Origin of Black-Box Large Language Models
di: Yang, Ziqing, et al.
Pubblicazione: (2025)
di: Yang, Ziqing, et al.
Pubblicazione: (2025)
MGTBench: Benchmarking Machine-Generated Text Detection
di: He, Xinlei, et al.
Pubblicazione: (2023)
di: He, Xinlei, et al.
Pubblicazione: (2023)
Vera Verto: Multimodal Hijacking Attack
di: Zhang, Minxing, et al.
Pubblicazione: (2024)
di: Zhang, Minxing, et al.
Pubblicazione: (2024)
Synthetic Artifact Auditing: Tracing LLM-Generated Synthetic Data Usage in Downstream Applications
di: Wu, Yixin, et al.
Pubblicazione: (2025)
di: Wu, Yixin, et al.
Pubblicazione: (2025)
Understanding Data Importance in Machine Learning Attacks: Does Valuable Data Pose Greater Harm?
di: Wen, Rui, et al.
Pubblicazione: (2024)
di: Wen, Rui, et al.
Pubblicazione: (2024)
Transferable Availability Poisoning Attacks
di: Liu, Yiyong, et al.
Pubblicazione: (2023)
di: Liu, Yiyong, et al.
Pubblicazione: (2023)
Pop Quiz Attack: Black-box Membership Inference Attacks Against Large Language Models
di: Chen, Zeyuan, et al.
Pubblicazione: (2026)
di: Chen, Zeyuan, et al.
Pubblicazione: (2026)
Excessive Reasoning Attack on Reasoning LLMs
di: Si, Wai Man, et al.
Pubblicazione: (2025)
di: Si, Wai Man, et al.
Pubblicazione: (2025)
The Attacker Moves Second: Stronger Adaptive Attacks Bypass Defenses Against Llm Jailbreaks and Prompt Injections
di: Nasr, Milad, et al.
Pubblicazione: (2025)
di: Nasr, Milad, et al.
Pubblicazione: (2025)
From Theft to Bomb-Making: The Ripple Effect of Unlearning in Defending Against Jailbreak Attacks
di: Zhang, Zhexin, et al.
Pubblicazione: (2024)
di: Zhang, Zhexin, et al.
Pubblicazione: (2024)
AttackPilot: Autonomous Inference Attacks Against ML Services With LLM-Based Agents
di: Wu, Yixin, et al.
Pubblicazione: (2025)
di: Wu, Yixin, et al.
Pubblicazione: (2025)
Understanding and Enhancing the Transferability of Jailbreaking Attacks
di: Lin, Runqi, et al.
Pubblicazione: (2025)
di: Lin, Runqi, et al.
Pubblicazione: (2025)
Jailbreak Attack Initializations as Extractors of Compliance Directions
di: Levi, Amit, et al.
Pubblicazione: (2025)
di: Levi, Amit, et al.
Pubblicazione: (2025)
Break the Breakout: Reinventing LM Defense Against Jailbreak Attacks with Self-Refinement
di: Kim, Heegyu, et al.
Pubblicazione: (2024)
di: Kim, Heegyu, et al.
Pubblicazione: (2024)
Rethinking Membership Inference Attacks Against Transfer Learning
di: Wu, Cong, et al.
Pubblicazione: (2025)
di: Wu, Cong, et al.
Pubblicazione: (2025)
BadMerging: Backdoor Attacks Against Model Merging
di: Zhang, Jinghuai, et al.
Pubblicazione: (2024)
di: Zhang, Jinghuai, et al.
Pubblicazione: (2024)
Adversarial Attacks Against Deep Learning-Based Radio Frequency Fingerprint Identification
di: Ma, Jie, et al.
Pubblicazione: (2025)
di: Ma, Jie, et al.
Pubblicazione: (2025)
Online Poisoning Attack Against Reinforcement Learning under Black-box Environments
di: Li, Jianhui, et al.
Pubblicazione: (2024)
di: Li, Jianhui, et al.
Pubblicazione: (2024)
Systematic Scaling Analysis of Jailbreak Attacks in Large Language Models
di: Wang, Xiangwen, et al.
Pubblicazione: (2026)
di: Wang, Xiangwen, et al.
Pubblicazione: (2026)
AutoDefense: Multi-Agent LLM Defense against Jailbreak Attacks
di: Zeng, Yifan, et al.
Pubblicazione: (2024)
di: Zeng, Yifan, et al.
Pubblicazione: (2024)
Breaking Agents: Compromising Autonomous LLM Agents Through Malfunction Amplification
di: Zhang, Boyang, et al.
Pubblicazione: (2024)
di: Zhang, Boyang, et al.
Pubblicazione: (2024)
Reconstruct Your Previous Conversations! Comprehensively Investigating Privacy Leakage Risks in Conversations with GPT Models
di: Chu, Junjie, et al.
Pubblicazione: (2024)
di: Chu, Junjie, et al.
Pubblicazione: (2024)
Low-Resource Languages Jailbreak GPT-4
di: Yong, Zheng-Xin, et al.
Pubblicazione: (2023)
di: Yong, Zheng-Xin, et al.
Pubblicazione: (2023)
TRYLOCK: Defense-in-Depth Against LLM Jailbreaks via Layered Preference and Representation Engineering
di: Thornton, Scott
Pubblicazione: (2026)
di: Thornton, Scott
Pubblicazione: (2026)
BadGPT-4o: stripping safety finetuning from GPT models
di: Krupkina, Ekaterina, et al.
Pubblicazione: (2024)
di: Krupkina, Ekaterina, et al.
Pubblicazione: (2024)
Ensembling Membership Inference Attacks Against Tabular Generative Models
di: Ward, Joshua, et al.
Pubblicazione: (2025)
di: Ward, Joshua, et al.
Pubblicazione: (2025)
HashVFL: Defending Against Data Reconstruction Attacks in Vertical Federated Learning
di: Qiu, Pengyu, et al.
Pubblicazione: (2022)
di: Qiu, Pengyu, et al.
Pubblicazione: (2022)
Documenti analoghi
-
JailbreakRadar: Comprehensive Assessment of Jailbreak Attacks Against LLMs
di: Chu, Junjie, et al.
Pubblicazione: (2024) -
Prompt Stealing Attacks Against Text-to-Image Generation Models
di: Shen, Xinyue, et al.
Pubblicazione: (2023) -
When GPT Spills the Tea: Comprehensive Assessment of Knowledge File Leakage in GPTs
di: Shen, Xinyue, et al.
Pubblicazione: (2025) -
"Do Anything Now": Characterizing and Evaluating In-The-Wild Jailbreak Prompts on Large Language Models
di: Shen, Xinyue, et al.
Pubblicazione: (2023) -
Link Stealing Attacks Against Inductive Graph Neural Networks
di: Wu, Yixin, et al.
Pubblicazione: (2024)