Pandora: Jailbreak GPTs by Retrieval Augmented Generation Poisoning
Fuente:
arXiv
Salvato in:
| Autori principali: | Deng, Gelei, Liu, Yi, Wang, Kailong, Li, Yuekang, Zhang, Tianwei, Liu, Yang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MasterKey: Automated Jailbreak Across Multiple Large Language Model Chatbots
di: Deng, Gelei, et al.
Pubblicazione: (2023)
di: Deng, Gelei, et al.
Pubblicazione: (2023)
Continuous Embedding Attacks via Clipped Inputs in Jailbreaking Large Language Models
di: Xu, Zihao, et al.
Pubblicazione: (2024)
di: Xu, Zihao, et al.
Pubblicazione: (2024)
A Comprehensive Study of Jailbreak Attack versus Defense for Large Language Models
di: Xu, Zihao, et al.
Pubblicazione: (2024)
di: Xu, Zihao, et al.
Pubblicazione: (2024)
Digger: Detecting Copyright Content Mis-usage in Large Language Model Training
di: Li, Haodong, et al.
Pubblicazione: (2024)
di: Li, Haodong, et al.
Pubblicazione: (2024)
Uncovering Logit Suppression Vulnerabilities in LLM Safety Alignment
di: Li, Yuxi, et al.
Pubblicazione: (2024)
di: Li, Yuxi, et al.
Pubblicazione: (2024)
TombRaider: Entering the Vault of History to Jailbreak Large Language Models
di: Ding, Junchen, et al.
Pubblicazione: (2025)
di: Ding, Junchen, et al.
Pubblicazione: (2025)
What Makes a Good LLM Agent for Real-world Penetration Testing?
di: Deng, Gelei, et al.
Pubblicazione: (2026)
di: Deng, Gelei, et al.
Pubblicazione: (2026)
Enhancing Model Defense Against Jailbreaks with Proactive Safety Reasoning
di: Yang, Xianglin, et al.
Pubblicazione: (2025)
di: Yang, Xianglin, et al.
Pubblicazione: (2025)
Membership Inference Attacks Against Video Large Language Models
di: Song, Wei, et al.
Pubblicazione: (2026)
di: Song, Wei, et al.
Pubblicazione: (2026)
Oedipus: LLM-enchanced Reasoning CAPTCHA Solver
di: Deng, Gelei, et al.
Pubblicazione: (2024)
di: Deng, Gelei, et al.
Pubblicazione: (2024)
Supply-Chain Poisoning Attacks Against LLM Coding Agent Skill Ecosystems
di: Qu, Yubin, et al.
Pubblicazione: (2026)
di: Qu, Yubin, et al.
Pubblicazione: (2026)
Opening A Pandora's Box: Things You Should Know in the Era of Custom GPTs
di: Tao, Guanhong, et al.
Pubblicazione: (2023)
di: Tao, Guanhong, et al.
Pubblicazione: (2023)
RefineRAG: Word-Level Poisoning Attacks via Retriever-Guided Text Refinement
di: Wang, Ziye, et al.
Pubblicazione: (2026)
di: Wang, Ziye, et al.
Pubblicazione: (2026)
Prompt Injection attack against LLM-integrated Applications
di: Liu, Yi, et al.
Pubblicazione: (2023)
di: Liu, Yi, et al.
Pubblicazione: (2023)
IllusionCAPTCHA: A CAPTCHA based on Visual Illusion
di: Ding, Ziqi, et al.
Pubblicazione: (2025)
di: Ding, Ziqi, et al.
Pubblicazione: (2025)
PentestGPT: An LLM-empowered Automatic Penetration Testing Tool
di: Deng, Gelei, et al.
Pubblicazione: (2023)
di: Deng, Gelei, et al.
Pubblicazione: (2023)
A Rusty Link in the AI Supply Chain: Detecting Evil Configurations in Model Repositories
di: Ding, Ziqi, et al.
Pubblicazione: (2025)
di: Ding, Ziqi, et al.
Pubblicazione: (2025)
Traceback of Poisoning Attacks to Retrieval-Augmented Generation
di: Zhang, Baolei, et al.
Pubblicazione: (2025)
di: Zhang, Baolei, et al.
Pubblicazione: (2025)
MiniScope: Automated UI Exploration and Privacy Inconsistency Detection of MiniApps via Two-phase Iterative Hybrid Analysis
di: Wang, Shenao, et al.
Pubblicazione: (2024)
di: Wang, Shenao, et al.
Pubblicazione: (2024)
Image-Based Geolocation Using Large Vision-Language Models
di: Liu, Yi, et al.
Pubblicazione: (2024)
di: Liu, Yi, et al.
Pubblicazione: (2024)
Poisoned-MRAG: Knowledge Poisoning Attacks to Multimodal Retrieval Augmented Generation
di: Liu, Yinuo, et al.
Pubblicazione: (2025)
di: Liu, Yinuo, et al.
Pubblicazione: (2025)
Benchmarking Poisoning Attacks against Retrieval-Augmented Generation
di: Zhang, Baolei, et al.
Pubblicazione: (2025)
di: Zhang, Baolei, et al.
Pubblicazione: (2025)
Practical Poisoning Attacks against Retrieval-Augmented Generation
di: Zhang, Baolei, et al.
Pubblicazione: (2025)
di: Zhang, Baolei, et al.
Pubblicazione: (2025)
One Shot Dominance: Knowledge Poisoning Attack on Retrieval-Augmented Generation Systems
di: Chang, Zhiyuan, et al.
Pubblicazione: (2025)
di: Chang, Zhiyuan, et al.
Pubblicazione: (2025)
Knowledge Poisoning Attacks on Medical Multi-Modal Retrieval-Augmented Generation
di: Yang, Peiru, et al.
Pubblicazione: (2026)
di: Yang, Peiru, et al.
Pubblicazione: (2026)
SNARE: Adaptive Scenario Synthesis for Eliciting Overeager Behavior in Coding Agents
di: Qu, Yubin, et al.
Pubblicazione: (2026)
di: Qu, Yubin, et al.
Pubblicazione: (2026)
FidelityGPT: Correcting Decompilation Distortions with Retrieval Augmented Generation
di: Zhou, Zhiping, et al.
Pubblicazione: (2025)
di: Zhou, Zhiping, et al.
Pubblicazione: (2025)
IRCopilot: Automated Incident Response with Large Language Models
di: Lin, Xihuan, et al.
Pubblicazione: (2025)
di: Lin, Xihuan, et al.
Pubblicazione: (2025)
CPA-RAG:Covert Poisoning Attacks on Retrieval-Augmented Generation in Large Language Models
di: Li, Chunyang, et al.
Pubblicazione: (2025)
di: Li, Chunyang, et al.
Pubblicazione: (2025)
Disabling Self-Correction in Retrieval-Augmented Generation via Stealthy Retriever Poisoning
di: Dai, Yanbo, et al.
Pubblicazione: (2025)
di: Dai, Yanbo, et al.
Pubblicazione: (2025)
MIRAGE: Misleading Retrieval-Augmented Generation via Black-box and Query-agnostic Poisoning Attacks
di: Chen, Tailun, et al.
Pubblicazione: (2025)
di: Chen, Tailun, et al.
Pubblicazione: (2025)
When Search Goes Wrong: Red-Teaming Web-Augmented Large Language Models
di: Ou, Haoran, et al.
Pubblicazione: (2025)
di: Ou, Haoran, et al.
Pubblicazione: (2025)
Who Taught the Lie? Responsibility Attribution for Poisoned Knowledge in Retrieval-Augmented Generation
di: Zhang, Baolei, et al.
Pubblicazione: (2025)
di: Zhang, Baolei, et al.
Pubblicazione: (2025)
Retrieval-Augmented Review Generation for Poisoning Recommender Systems
di: Yang, Shiyi, et al.
Pubblicazione: (2025)
di: Yang, Shiyi, et al.
Pubblicazione: (2025)
Joint-GCG: Unified Gradient-Based Poisoning Attacks on Retrieval-Augmented Generation Systems
di: Wang, Haowei, et al.
Pubblicazione: (2025)
di: Wang, Haowei, et al.
Pubblicazione: (2025)
RAG Safety: Exploring Knowledge Poisoning Attacks to Retrieval-Augmented Generation
di: Zhao, Tianzhe, et al.
Pubblicazione: (2025)
di: Zhao, Tianzhe, et al.
Pubblicazione: (2025)
Overeager Coding Agents: Measuring Out-of-Scope Actions on Benign Tasks
di: Qu, Yubin, et al.
Pubblicazione: (2026)
di: Qu, Yubin, et al.
Pubblicazione: (2026)
PIDP-Attack: Combining Prompt Injection with Database Poisoning Attacks on Retrieval-Augmented Generation Systems
di: Wang, Haozhen, et al.
Pubblicazione: (2026)
di: Wang, Haozhen, et al.
Pubblicazione: (2026)
Groot: Adversarial Testing for Generative Text-to-Image Models with Tree-based Semantic Transformation
di: Liu, Yi, et al.
Pubblicazione: (2024)
di: Liu, Yi, et al.
Pubblicazione: (2024)
Credential Leakage in LLM Agent Skills: A Large-Scale Empirical Study
di: Chen, Zhihao, et al.
Pubblicazione: (2026)
di: Chen, Zhihao, et al.
Pubblicazione: (2026)
Documenti analoghi
-
MasterKey: Automated Jailbreak Across Multiple Large Language Model Chatbots
di: Deng, Gelei, et al.
Pubblicazione: (2023) -
Continuous Embedding Attacks via Clipped Inputs in Jailbreaking Large Language Models
di: Xu, Zihao, et al.
Pubblicazione: (2024) -
A Comprehensive Study of Jailbreak Attack versus Defense for Large Language Models
di: Xu, Zihao, et al.
Pubblicazione: (2024) -
Digger: Detecting Copyright Content Mis-usage in Large Language Model Training
di: Li, Haodong, et al.
Pubblicazione: (2024) -
Uncovering Logit Suppression Vulnerabilities in LLM Safety Alignment
di: Li, Yuxi, et al.
Pubblicazione: (2024)