Persona-Conditioned Adversarial Prompting: Multi-Identity Red-Teaming for Adversarial Discovery and Mitigation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Morasso, Cristian, Halimi, Anisa, Hameed, Muhammad Zaid, Leith, Douglas |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Persona-Conditioned Adversarial Prompting (PCAP): Multi-Identity Red-Teaming for Enhanced Adversarial Prompt Discovery
par: Morasso, Cristian, et autres
Publié: (2026)
par: Morasso, Cristian, et autres
Publié: (2026)
Adversarial Prompt Evaluation: Systematic Benchmarking of Guardrails Against Prompt Input Attacks on LLMs
par: Zizzo, Giulio, et autres
Publié: (2025)
par: Zizzo, Giulio, et autres
Publié: (2025)
LoMime: Query-Efficient Membership Inference using Model Extraction in Label-Only Settings
par: Oksuz, Abdullah Caglar, et autres
Publié: (2026)
par: Oksuz, Abdullah Caglar, et autres
Publié: (2026)
AUTOLYCUS: Exploiting Explainable AI (XAI) for Model Extraction Attacks against Interpretable Models
par: Oksuz, Abdullah Caglar, et autres
Publié: (2023)
par: Oksuz, Abdullah Caglar, et autres
Publié: (2023)
Towards a Re-evaluation of Data Forging Attacks in Practice
par: Suliman, Mohamed, et autres
Publié: (2024)
par: Suliman, Mohamed, et autres
Publié: (2024)
Mitigating Error Amplification in Fast Adversarial Training
par: Zhao, Mengnan, et autres
Publié: (2026)
par: Zhao, Mengnan, et autres
Publié: (2026)
Co-RedTeam: Orchestrated Security Discovery and Exploitation with LLM Agents
par: He, Pengfei, et autres
Publié: (2026)
par: He, Pengfei, et autres
Publié: (2026)
Improving Privacy Benefits of Redaction
par: Gusain, Vaibhav, et autres
Publié: (2025)
par: Gusain, Vaibhav, et autres
Publié: (2025)
Attack Atlas: A Practitioner's Perspective on Challenges and Pitfalls in Red Teaming GenAI
par: Rawat, Ambrish, et autres
Publié: (2024)
par: Rawat, Ambrish, et autres
Publié: (2024)
PISmith: Reinforcement Learning-based Red Teaming for Prompt Injection Defenses
par: Yin, Chenlong, et autres
Publié: (2026)
par: Yin, Chenlong, et autres
Publié: (2026)
MoJE: Mixture of Jailbreak Experts, Naive Tabular Classifiers as Guard for Prompt Attacks
par: Cornacchia, Giandomenico, et autres
Publié: (2024)
par: Cornacchia, Giandomenico, et autres
Publié: (2024)
Exploring and Mitigating Adversarial Manipulation of Voting-Based Leaderboards
par: Huang, Yangsibo, et autres
Publié: (2025)
par: Huang, Yangsibo, et autres
Publié: (2025)
AutoAdv: Automated Adversarial Prompting for Multi-Turn Jailbreaking of Large Language Models
par: Reddy, Aashray, et autres
Publié: (2025)
par: Reddy, Aashray, et autres
Publié: (2025)
Defending Jailbreak Prompts via In-Context Adversarial Game
par: Zhou, Yujun, et autres
Publié: (2024)
par: Zhou, Yujun, et autres
Publié: (2024)
Fine-Tuning Personalization in Federated Learning to Mitigate Adversarial Clients
par: Allouah, Youssef, et autres
Publié: (2024)
par: Allouah, Youssef, et autres
Publié: (2024)
On the Robustness of Malware Detectors to Adversarial Samples
par: Salman, Muhammad, et autres
Publié: (2024)
par: Salman, Muhammad, et autres
Publié: (2024)
Comprehensive Survey on Adversarial Examples in Cybersecurity: Impacts, Challenges, and Mitigation Strategies
par: Li, Li
Publié: (2024)
par: Li, Li
Publié: (2024)
Adversarial Sample Generation for Anomaly Detection in Industrial Control Systems
par: Mustafa, Abdul, et autres
Publié: (2025)
par: Mustafa, Abdul, et autres
Publié: (2025)
Mitigating the Structural Bias in Graph Adversarial Defenses
par: Fang, Junyuan, et autres
Publié: (2025)
par: Fang, Junyuan, et autres
Publié: (2025)
Detecting Adversarial Data via Provable Adversarial Noise Amplification
par: Mumcu, Furkan, et autres
Publié: (2026)
par: Mumcu, Furkan, et autres
Publié: (2026)
Enhancing Adversarial Attacks via Parameter Adaptive Adversarial Attack
par: Jin, Zhibo, et autres
Publié: (2024)
par: Jin, Zhibo, et autres
Publié: (2024)
Stealthy Adversarial Attacks on Stochastic Multi-Armed Bandits
par: Wang, Zhiwei, et autres
Publié: (2024)
par: Wang, Zhiwei, et autres
Publié: (2024)
Double-Adversarial Activation Anomaly Detection: Adversarial Autoencoders are Anomaly Generators
par: Schulze, J. -P., et autres
Publié: (2021)
par: Schulze, J. -P., et autres
Publié: (2021)
Robustness Against Adversarial Attacks via Learning Confined Adversarial Polytopes
par: Hamidi, Shayan Mohajer, et autres
Publié: (2024)
par: Hamidi, Shayan Mohajer, et autres
Publié: (2024)
Generalization Properties of Adversarial Training for $\ell_0$-Bounded Adversarial Attacks
par: Delgosha, Payam, et autres
Publié: (2024)
par: Delgosha, Payam, et autres
Publié: (2024)
Detecting Adversarial Examples
par: Mumcu, Furkan, et autres
Publié: (2024)
par: Mumcu, Furkan, et autres
Publié: (2024)
Adversarial Machine Unlearning
par: Di, Zonglin, et autres
Publié: (2024)
par: Di, Zonglin, et autres
Publié: (2024)
SoK: Analyzing Adversarial Examples: A Framework to Study Adversary Knowledge
par: Fenaux, Lucas, et autres
Publié: (2024)
par: Fenaux, Lucas, et autres
Publié: (2024)
Autonomous Adversary: Red-Teaming in the age of LLM
par: Mamun, Mohammad, et autres
Publié: (2026)
par: Mamun, Mohammad, et autres
Publié: (2026)
Test-time Adversarial Defense with Opposite Adversarial Path and High Attack Time Cost
par: Yeh, Cheng-Han, et autres
Publié: (2024)
par: Yeh, Cheng-Han, et autres
Publié: (2024)
PromptRobust: Towards Evaluating the Robustness of Large Language Models on Adversarial Prompts
par: Zhu, Kaijie, et autres
Publié: (2023)
par: Zhu, Kaijie, et autres
Publié: (2023)
Adaptive Randomized Smoothing: Certified Adversarial Robustness for Multi-Step Defences
par: Lyu, Saiyue, et autres
Publié: (2024)
par: Lyu, Saiyue, et autres
Publié: (2024)
Adversarial Observations in Weather Forecasting
par: Imgrund, Erik, et autres
Publié: (2025)
par: Imgrund, Erik, et autres
Publié: (2025)
Transferability Ranking of Adversarial Examples
par: Levy, Mosh, et autres
Publié: (2022)
par: Levy, Mosh, et autres
Publié: (2022)
AMUN: Adversarial Machine UNlearning
par: Ebrahimpour-Boroojeny, Ali, et autres
Publié: (2025)
par: Ebrahimpour-Boroojeny, Ali, et autres
Publié: (2025)
Colliding with Adversaries at ECML-PKDD 2025 Adversarial Attack Competition 1st Prize Solution
par: Stefanopoulos, Dimitris, et autres
Publié: (2025)
par: Stefanopoulos, Dimitris, et autres
Publié: (2025)
Poisoning the Watchtower: Prompt Injection Attacks Against LLM-Augmented Security Operations Through Adversarial Log Content
par: Pandey, Rohan, et autres
Publié: (2026)
par: Pandey, Rohan, et autres
Publié: (2026)
Consistent Valid Physically-Realizable Adversarial Attack against Crowd-flow Prediction Models
par: Ali, Hassan, et autres
Publié: (2023)
par: Ali, Hassan, et autres
Publié: (2023)
Arondight: Red Teaming Large Vision Language Models with Auto-generated Multi-modal Jailbreak Prompts
par: Liu, Yi, et autres
Publié: (2024)
par: Liu, Yi, et autres
Publié: (2024)
Early Approaches to Adversarial Fine-Tuning for Prompt Injection Defense: A 2022 Study of GPT-3 and Contemporary Models
par: Sandoval, Gustavo, et autres
Publié: (2025)
par: Sandoval, Gustavo, et autres
Publié: (2025)
Documents similaires
-
Persona-Conditioned Adversarial Prompting (PCAP): Multi-Identity Red-Teaming for Enhanced Adversarial Prompt Discovery
par: Morasso, Cristian, et autres
Publié: (2026) -
Adversarial Prompt Evaluation: Systematic Benchmarking of Guardrails Against Prompt Input Attacks on LLMs
par: Zizzo, Giulio, et autres
Publié: (2025) -
LoMime: Query-Efficient Membership Inference using Model Extraction in Label-Only Settings
par: Oksuz, Abdullah Caglar, et autres
Publié: (2026) -
AUTOLYCUS: Exploiting Explainable AI (XAI) for Model Extraction Attacks against Interpretable Models
par: Oksuz, Abdullah Caglar, et autres
Publié: (2023) -
Towards a Re-evaluation of Data Forging Attacks in Practice
par: Suliman, Mohamed, et autres
Publié: (2024)