Stop Tracking Me! Proactive Defense Against Attribute Inference Attack in LLMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yan, Dong, Liang, Jian, He, Ran, Tan, Tieniu |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Test-Time Immunization: A Universal Defense Framework Against Jailbreaks for (Multimodal) Large Language Models
par: Yu, Yongcan, et autres
Publié: (2025)
par: Yu, Yongcan, et autres
Publié: (2025)
LoRA-Leak: Membership Inference Attacks Against LoRA Fine-tuned Language Models
par: Ran, Delong, et autres
Publié: (2025)
par: Ran, Delong, et autres
Publié: (2025)
FraudShield: Knowledge Graph Empowered Defense for LLMs against Fraud Attacks
par: Xu, Naen, et autres
Publié: (2026)
par: Xu, Naen, et autres
Publié: (2026)
Attention Slipping: A Mechanistic Understanding of Jailbreak Attacks and Defenses in LLMs
par: Hu, Xiaomeng, et autres
Publié: (2025)
par: Hu, Xiaomeng, et autres
Publié: (2025)
ShieldLearner: A New Paradigm for Jailbreak Attack Defense in LLMs
par: Ni, Ziyi, et autres
Publié: (2025)
par: Ni, Ziyi, et autres
Publié: (2025)
Adversarial Tuning: Defending Against Jailbreak Attacks for LLMs
par: Liu, Fan, et autres
Publié: (2024)
par: Liu, Fan, et autres
Publié: (2024)
Now You Hear Me: Audio Narrative Attacks Against Large Audio-Language Models
par: Yu, Ye, et autres
Publié: (2026)
par: Yu, Ye, et autres
Publié: (2026)
Jailbreak Attacks and Defenses Against Large Language Models: A Survey
par: Yi, Sibo, et autres
Publié: (2024)
par: Yi, Sibo, et autres
Publié: (2024)
Bidirectional Intention Inference Enhances LLMs' Defense Against Multi-Turn Jailbreak Attacks
par: Tong, Haibo, et autres
Publié: (2025)
par: Tong, Haibo, et autres
Publié: (2025)
Window-based Membership Inference Attacks Against Fine-tuned Large Language Models
par: Chen, Yuetian, et autres
Publié: (2026)
par: Chen, Yuetian, et autres
Publié: (2026)
MANATEE: Inference-Time Lightweight Diffusion Based Safety Defense for LLMs
par: Kan, Chun Yan Ryan, et autres
Publié: (2026)
par: Kan, Chun Yan Ryan, et autres
Publié: (2026)
Adversarial Attacks Against Automated Fact-Checking: A Survey
par: Liu, Fanzhen, et autres
Publié: (2025)
par: Liu, Fanzhen, et autres
Publié: (2025)
A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models
par: Wang, Yanbo, et autres
Publié: (2025)
par: Wang, Yanbo, et autres
Publié: (2025)
DistillGuard: Evaluating Defenses Against LLM Knowledge Distillation
par: Jiang, Bo
Publié: (2026)
par: Jiang, Bo
Publié: (2026)
Enhancing Model Defense Against Jailbreaks with Proactive Safety Reasoning
par: Yang, Xianglin, et autres
Publié: (2025)
par: Yang, Xianglin, et autres
Publié: (2025)
Data to Defense: The Role of Curation in Customizing LLMs Against Jailbreaking Attacks
par: Liu, Xiaoqun, et autres
Publié: (2024)
par: Liu, Xiaoqun, et autres
Publié: (2024)
Defenses & Enablers For Skill Injection Attacks on Terminal Based Agents
par: Fujinuma, Yoshinari, et autres
Publié: (2026)
par: Fujinuma, Yoshinari, et autres
Publié: (2026)
A Survey of Recent Backdoor Attacks and Defenses in Large Language Models
par: Zhao, Shuai, et autres
Publié: (2024)
par: Zhao, Shuai, et autres
Publié: (2024)
JailbreakRadar: Comprehensive Assessment of Jailbreak Attacks Against LLMs
par: Chu, Junjie, et autres
Publié: (2024)
par: Chu, Junjie, et autres
Publié: (2024)
Layer-Level Self-Exposure and Patch: Affirmative Token Mitigation for Jailbreak Attack Defense
par: Ouyang, Yang, et autres
Publié: (2025)
par: Ouyang, Yang, et autres
Publié: (2025)
MemPot: Defending Against Memory Extraction Attack with Optimized Honeypots
par: Wang, Yuhao, et autres
Publié: (2026)
par: Wang, Yuhao, et autres
Publié: (2026)
Mitigating the Safety-utility Trade-off in LLM Alignment via Adaptive Safe Context Learning
par: Wang, Yanbo, et autres
Publié: (2026)
par: Wang, Yanbo, et autres
Publié: (2026)
Virus Infection Attack on LLMs: Your Poisoning Can Spread "VIA" Synthetic Data
par: Liang, Zi, et autres
Publié: (2025)
par: Liang, Zi, et autres
Publié: (2025)
JailbreakEval: An Integrated Toolkit for Evaluating Jailbreak Attempts Against Large Language Models
par: Ran, Delong, et autres
Publié: (2024)
par: Ran, Delong, et autres
Publié: (2024)
One Turn Too Late: Response-Aware Defense Against Hidden Malicious Intent in Multi-Turn Dialogue
par: Shen, Xinjie, et autres
Publié: (2026)
par: Shen, Xinjie, et autres
Publié: (2026)
IPIGuard: A Novel Tool Dependency Graph-Based Defense Against Indirect Prompt Injection in LLM Agents
par: An, Hengyu, et autres
Publié: (2025)
par: An, Hengyu, et autres
Publié: (2025)
Bag of Tricks: Benchmarking of Jailbreak Attacks on LLMs
par: Xu, Zhao, et autres
Publié: (2024)
par: Xu, Zhao, et autres
Publié: (2024)
P2P: A Poison-to-Poison Remedy for Reliable Backdoor Defense in LLMs
par: Zhao, Shuai, et autres
Publié: (2025)
par: Zhao, Shuai, et autres
Publié: (2025)
Supply-Chain Poisoning Attacks Against LLM Coding Agent Skill Ecosystems
par: Qu, Yubin, et autres
Publié: (2026)
par: Qu, Yubin, et autres
Publié: (2026)
Defending Against Weight-Poisoning Backdoor Attacks for Parameter-Efficient Fine-Tuning
par: Zhao, Shuai, et autres
Publié: (2024)
par: Zhao, Shuai, et autres
Publié: (2024)
Formalizing and Benchmarking Prompt Injection Attacks and Defenses
par: Liu, Yupei, et autres
Publié: (2023)
par: Liu, Yupei, et autres
Publié: (2023)
Graph of Attacks: Improved Black-Box and Interpretable Jailbreaks for LLMs
par: Akbar-Tajari, Mohammad, et autres
Publié: (2025)
par: Akbar-Tajari, Mohammad, et autres
Publié: (2025)
Feint and Attack: Attention-Based Strategies for Jailbreaking and Protecting LLMs
par: Pu, Rui, et autres
Publié: (2024)
par: Pu, Rui, et autres
Publié: (2024)
Sandwich attack: Multi-language Mixture Adaptive Attack on LLMs
par: Upadhayay, Bibek, et autres
Publié: (2024)
par: Upadhayay, Bibek, et autres
Publié: (2024)
Unlearning Backdoor Attacks for LLMs with Weak-to-Strong Knowledge Distillation
par: Zhao, Shuai, et autres
Publié: (2024)
par: Zhao, Shuai, et autres
Publié: (2024)
Prefix Guidance: A Steering Wheel for Large Language Models to Defend Against Jailbreak Attacks
par: Zhao, Jiawei, et autres
Publié: (2024)
par: Zhao, Jiawei, et autres
Publié: (2024)
Eguard: Defending LLM Embeddings Against Inversion Attacks via Text Mutual Information Optimization
par: Liu, Tiantian, et autres
Publié: (2024)
par: Liu, Tiantian, et autres
Publié: (2024)
Topology Matters: Measuring Memory Leakage in Multi-Agent LLMs
par: Liu, Jinbo, et autres
Publié: (2025)
par: Liu, Jinbo, et autres
Publié: (2025)
May I have your Attention? Breaking Fine-Tuning based Prompt Injection Defenses using Architecture-Aware Attacks
par: Pandya, Nishit V., et autres
Publié: (2025)
par: Pandya, Nishit V., et autres
Publié: (2025)
DeSIA: Attribute Inference Attacks Against Limited Fixed Aggregate Statistics
par: Mao, Yifeng, et autres
Publié: (2025)
par: Mao, Yifeng, et autres
Publié: (2025)
Documents similaires
-
Test-Time Immunization: A Universal Defense Framework Against Jailbreaks for (Multimodal) Large Language Models
par: Yu, Yongcan, et autres
Publié: (2025) -
LoRA-Leak: Membership Inference Attacks Against LoRA Fine-tuned Language Models
par: Ran, Delong, et autres
Publié: (2025) -
FraudShield: Knowledge Graph Empowered Defense for LLMs against Fraud Attacks
par: Xu, Naen, et autres
Publié: (2026) -
Attention Slipping: A Mechanistic Understanding of Jailbreak Attacks and Defenses in LLMs
par: Hu, Xiaomeng, et autres
Publié: (2025) -
ShieldLearner: A New Paradigm for Jailbreak Attack Defense in LLMs
par: Ni, Ziyi, et autres
Publié: (2025)