Retrieval-Confused Generation is a Good Defender for Privacy Violation Attack of Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Peng, Wanli, Chen, Xin, Fu, Hang, He, XinYu, Yiming, Xue, Wen, Juan |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Inhibitory Attacks on Backdoor-based Fingerprinting for Large Language Models
by: Fu, Hang, et al.
Published: (2026)
by: Fu, Hang, et al.
Published: (2026)
BadApex: Backdoor Attack Based on Adaptive Optimization Mechanism of Black-box Large Language Models
by: Wu, Zhengxian, et al.
Published: (2025)
by: Wu, Zhengxian, et al.
Published: (2025)
EditMF: Drawing an Invisible Fingerprint for Your Large Language Models
by: Wu, Jiaxuan, et al.
Published: (2025)
by: Wu, Jiaxuan, et al.
Published: (2025)
External Data Extraction Attacks against Retrieval-Augmented Large Language Models
by: He, Yu, et al.
Published: (2025)
by: He, Yu, et al.
Published: (2025)
Self-Disguise Attack: Induce the LLM to disguise itself for AIGT detection evasion
by: Zhou, Yinghan, et al.
Published: (2025)
by: Zhou, Yinghan, et al.
Published: (2025)
Concept-Aware Privacy Mechanisms for Defending Embedding Inversion Attacks
by: Tsai, Yu-Che, et al.
Published: (2026)
by: Tsai, Yu-Che, et al.
Published: (2026)
BeDKD: Backdoor Defense Based on Directional Mapping Module and Adversarial Knowledge Distillation
by: Wu, Zhengxian, et al.
Published: (2025)
by: Wu, Zhengxian, et al.
Published: (2025)
SLIP: Soft Label Mechanism and Key-Extraction-Guided CoT-based Defense Against Instruction Backdoor in APIs
by: Wu, Zhengxian, et al.
Published: (2025)
by: Wu, Zhengxian, et al.
Published: (2025)
JBShield: Defending Large Language Models from Jailbreak Attacks through Activated Concept Analysis and Manipulation
by: Zhang, Shenyi, et al.
Published: (2025)
by: Zhang, Shenyi, et al.
Published: (2025)
Large Language Models are Good Attackers: Efficient and Stealthy Textual Backdoor Attacks
by: Li, Ziqiang, et al.
Published: (2024)
by: Li, Ziqiang, et al.
Published: (2024)
Defending Large Language Models Against Attacks With Residual Stream Activation Analysis
by: Kawasaki, Amelia, et al.
Published: (2024)
by: Kawasaki, Amelia, et al.
Published: (2024)
CPA-RAG:Covert Poisoning Attacks on Retrieval-Augmented Generation in Large Language Models
by: Li, Chunyang, et al.
Published: (2025)
by: Li, Chunyang, et al.
Published: (2025)
Is Your Writing Being Mimicked by AI? Unveiling Imitation with Invisible Watermarks in Creative Writing
by: Zhang, Ziwei, et al.
Published: (2025)
by: Zhang, Ziwei, et al.
Published: (2025)
Privacy in Large Language Models: Attacks, Defenses and Future Directions
by: Li, Haoran, et al.
Published: (2023)
by: Li, Haoran, et al.
Published: (2023)
Defending against Backdoor Attack on Deep Neural Networks
by: Cheng, Hao, et al.
Published: (2020)
by: Cheng, Hao, et al.
Published: (2020)
GTSD: Generative Text Steganography Based on Diffusion Model
by: Wu, Zhengxian, et al.
Published: (2025)
by: Wu, Zhengxian, et al.
Published: (2025)
Backdoored Retrievers for Prompt Injection Attacks on Retrieval Augmented Generation of Large Language Models
by: Clop, Cody, et al.
Published: (2024)
by: Clop, Cody, et al.
Published: (2024)
Using Retriever Augmented Large Language Models for Attack Graph Generation
by: Prapty, Renascence Tarafder, et al.
Published: (2024)
by: Prapty, Renascence Tarafder, et al.
Published: (2024)
Text Steganography with Dynamic Codebook and Multimodal Large Language Model
by: Gao, Jianxin, et al.
Published: (2026)
by: Gao, Jianxin, et al.
Published: (2026)
Prompt Inversion Attack against Collaborative Inference of Large Language Models
by: Qu, Wenjie, et al.
Published: (2025)
by: Qu, Wenjie, et al.
Published: (2025)
Defending Code Language Models against Backdoor Attacks with Deceptive Cross-Entropy Loss
by: Yang, Guang, et al.
Published: (2024)
by: Yang, Guang, et al.
Published: (2024)
Good News for Script Kiddies? Evaluating Large Language Models for Automated Exploit Generation
by: Jin, David, et al.
Published: (2025)
by: Jin, David, et al.
Published: (2025)
The Good and The Bad: Exploring Privacy Issues in Retrieval-Augmented Generation (RAG)
by: Zeng, Shenglai, et al.
Published: (2024)
by: Zeng, Shenglai, et al.
Published: (2024)
Defending Against Neural Network Model Inversion Attacks via Data Poisoning
by: Zhou, Shuai, et al.
Published: (2024)
by: Zhou, Shuai, et al.
Published: (2024)
Privacy Violations in Election Results
by: Kuriwaki, Shiro, et al.
Published: (2023)
by: Kuriwaki, Shiro, et al.
Published: (2023)
No Free Lunch for Defending Against Prefilling Attack by In-Context Learning
by: Xue, Zhiyu, et al.
Published: (2024)
by: Xue, Zhiyu, et al.
Published: (2024)
Spore: Efficient and Training-Free Privacy Extraction Attack on LLMs via Inference-Time Hybrid Probing
by: Cui, Yu, et al.
Published: (2026)
by: Cui, Yu, et al.
Published: (2026)
A Survey on Large Language Model (LLM) Security and Privacy: The Good, the Bad, and the Ugly
by: Yao, Yifan, et al.
Published: (2023)
by: Yao, Yifan, et al.
Published: (2023)
Membership Reference Attack against Laplace Mechanism of Differential Privacy
by: Huang, Wen
Published: (2024)
by: Huang, Wen
Published: (2024)
PoisonedRAG: Knowledge Corruption Attacks to Retrieval-Augmented Generation of Large Language Models
by: Zou, Wei, et al.
Published: (2024)
by: Zou, Wei, et al.
Published: (2024)
Practical Reasoning Interruption Attacks on Reasoning Large Language Models
by: Cui, Yu, et al.
Published: (2025)
by: Cui, Yu, et al.
Published: (2025)
Revisiting Gradient Pruning: A Dual Realization for Defending against Gradient Attacks
by: Xue, Lulu, et al.
Published: (2024)
by: Xue, Lulu, et al.
Published: (2024)
No Attack Required: Semantic Fuzzing for Specification Violations in Agent Skills
by: Li, Ying, et al.
Published: (2026)
by: Li, Ying, et al.
Published: (2026)
KinGuard: Hierarchical Kinship-Aware Fingerprinting to Defend Against Large Language Model Stealing
by: Xu, Zhenhua, et al.
Published: (2026)
by: Xu, Zhenhua, et al.
Published: (2026)
Speed Kills: Exploring Confused Deputy Attacks Through Edge AI Accelerators
by: Danduri, Datta Manikanta Sri Hari, et al.
Published: (2026)
by: Danduri, Datta Manikanta Sri Hari, et al.
Published: (2026)
Robustness via Referencing: Defending against Prompt Injection Attacks by Referencing the Executed Instruction
by: Chen, Yulin, et al.
Published: (2025)
by: Chen, Yulin, et al.
Published: (2025)
LLM-PBE: Assessing Data Privacy in Large Language Models
by: Li, Qinbin, et al.
Published: (2024)
by: Li, Qinbin, et al.
Published: (2024)
PR-Attack: Coordinated Prompt-RAG Attacks on Retrieval-Augmented Generation in Large Language Models via Bilevel Optimization
by: Jiao, Yang, et al.
Published: (2025)
by: Jiao, Yang, et al.
Published: (2025)
Defending Large Language Models Against Jailbreak Exploits with Responsible AI Considerations
by: Wong, Ryan, et al.
Published: (2025)
by: Wong, Ryan, et al.
Published: (2025)
Towards Label-Only Membership Inference Attack against Pre-trained Large Language Models
by: He, Yu, et al.
Published: (2025)
by: He, Yu, et al.
Published: (2025)
Similar Items
-
Inhibitory Attacks on Backdoor-based Fingerprinting for Large Language Models
by: Fu, Hang, et al.
Published: (2026) -
BadApex: Backdoor Attack Based on Adaptive Optimization Mechanism of Black-box Large Language Models
by: Wu, Zhengxian, et al.
Published: (2025) -
EditMF: Drawing an Invisible Fingerprint for Your Large Language Models
by: Wu, Jiaxuan, et al.
Published: (2025) -
External Data Extraction Attacks against Retrieval-Augmented Large Language Models
by: He, Yu, et al.
Published: (2025) -
Self-Disguise Attack: Induce the LLM to disguise itself for AIGT detection evasion
by: Zhou, Yinghan, et al.
Published: (2025)