PATCH: Mitigating PII Leakage in Language Models with Privacy-Aware Targeted Circuit PatcHing
Fuente:
arXiv
Saved in:
| Main Authors: | Hughes, Anthony, Duddu, Vasisht, Asokan, N., Aletras, Nikolaos, Ma, Ning |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Locket: Robust Feature-Locking Technique for Language Models
by: He, Lipeng, et al.
Published: (2025)
by: He, Lipeng, et al.
Published: (2025)
Combining Machine Learning Defenses without Conflicts
by: Duddu, Vasisht, et al.
Published: (2024)
by: Duddu, Vasisht, et al.
Published: (2024)
SoK: Unintended Interactions among Machine Learning Defenses and Risks
by: Duddu, Vasisht, et al.
Published: (2023)
by: Duddu, Vasisht, et al.
Published: (2023)
Laminator: Verifiable ML Property Cards using Hardware-assisted Attestations
by: Duddu, Vasisht, et al.
Published: (2024)
by: Duddu, Vasisht, et al.
Published: (2024)
Espresso: Robust Concept Filtering in Text-to-Image Models
by: Das, Anudeep, et al.
Published: (2024)
by: Das, Anudeep, et al.
Published: (2024)
Privacy Bias in Language Models: A Contextual Integrity-based Auditing Metric
by: Shvartzshnaider, Yan, et al.
Published: (2024)
by: Shvartzshnaider, Yan, et al.
Published: (2024)
On the Alignment of Group Fairness with Attribute Privacy
by: Aalmoes, Jan, et al.
Published: (2022)
by: Aalmoes, Jan, et al.
Published: (2022)
PAL*M: Property Attestation for Large Generative Models
by: Chantasantitam, Prach, et al.
Published: (2026)
by: Chantasantitam, Prach, et al.
Published: (2026)
Attesting Distributional Properties of Training Data for Machine Learning
by: Duddu, Vasisht, et al.
Published: (2023)
by: Duddu, Vasisht, et al.
Published: (2023)
Sanitize Your Responses: Mitigating Privacy Leakage in Large Language Models
by: Fu, Wenjie, et al.
Published: (2025)
by: Fu, Wenjie, et al.
Published: (2025)
PII-Bench: Evaluating Query-Aware Privacy Protection Systems
by: Shen, Hao, et al.
Published: (2025)
by: Shen, Hao, et al.
Published: (2025)
CAPID: Context-Aware PII Detection for Question-Answering Systems
by: Ponomarenko, Mariia, et al.
Published: (2026)
by: Ponomarenko, Mariia, et al.
Published: (2026)
"I Strongly Suspect This Website Is a Scam": Benchmarking PII Leakage and Detection without Defense in Autonomous Web Agents
by: Roy, Soham, et al.
Published: (2026)
by: Roy, Soham, et al.
Published: (2026)
PIIGuard: Mitigating PII Harvesting under Adversarial Sanitization
by: Liu, Mingshuo, et al.
Published: (2026)
by: Liu, Mingshuo, et al.
Published: (2026)
Discovering Universal Activation Directions for PII Leakage in Language Models
by: Marchyok, Leo, et al.
Published: (2026)
by: Marchyok, Leo, et al.
Published: (2026)
Amulet: a Python Library for Assessing Interactions Among ML Defenses and Risks
by: Waheed, Asim, et al.
Published: (2025)
by: Waheed, Asim, et al.
Published: (2025)
Extracting Training Data from Diffusion Language Models via Infilling
by: Wang, Yihan, et al.
Published: (2026)
by: Wang, Yihan, et al.
Published: (2026)
PII Jailbreaking in LLMs via Activation Steering Reveals Personal Information Leakage
by: Nakka, Krishna Kanth, et al.
Published: (2025)
by: Nakka, Krishna Kanth, et al.
Published: (2025)
Quantifying Association Capabilities of Large Language Models and Its Implications on Privacy Leakage
by: Shao, Hanyin, et al.
Published: (2023)
by: Shao, Hanyin, et al.
Published: (2023)
Tracing Privacy Leakage of Language Models to Training Data via Adjusted Influence Functions
by: Liu, Jinxin, et al.
Published: (2024)
by: Liu, Jinxin, et al.
Published: (2024)
SecureGate: Learning When to Reveal PII Safely via Token-Gated Dual-Adapters for Federated LLMs
by: Shaaban, Mohamed, et al.
Published: (2026)
by: Shaaban, Mohamed, et al.
Published: (2026)
What Does the Server See? Understanding Privacy Leakage from Large Language Models in Split Inference
by: Fan, Mingyuan, et al.
Published: (2026)
by: Fan, Mingyuan, et al.
Published: (2026)
Nonmalleable Progress Leakage
by: Cecchetti, Ethan
Published: (2025)
by: Cecchetti, Ethan
Published: (2025)
PII-Compass: Guiding LLM training data extraction prompts towards the target PII via grounding
by: Nakka, Krishna Kanth, et al.
Published: (2024)
by: Nakka, Krishna Kanth, et al.
Published: (2024)
A False Sense of Privacy: Evaluating Textual Data Sanitization Beyond Surface-level Privacy Leakage
by: Xin, Rui, et al.
Published: (2025)
by: Xin, Rui, et al.
Published: (2025)
Adaptive PII Mitigation Framework for Large Language Models
by: Asthana, Shubhi, et al.
Published: (2025)
by: Asthana, Shubhi, et al.
Published: (2025)
Mitigating Jailbreaks with Intent-Aware LLMs
by: Yeo, Wei Jie, et al.
Published: (2025)
by: Yeo, Wei Jie, et al.
Published: (2025)
PrivacyLens: Evaluating Privacy Norm Awareness of Language Models in Action
by: Shao, Yijia, et al.
Published: (2024)
by: Shao, Yijia, et al.
Published: (2024)
Defeating Cerberus: Concept-Guided Privacy-Leakage Mitigation in Multimodal Language Models
by: Zhang, Boyang, et al.
Published: (2025)
by: Zhang, Boyang, et al.
Published: (2025)
CircuitGuard: Mitigating LLM Memorization in RTL Code Generation Against IP Leakage
by: Mashnoor, Nowfel, et al.
Published: (2025)
by: Mashnoor, Nowfel, et al.
Published: (2025)
SoK: Privacy Risks and Mitigations in Retrieval-Augmented Generation Systems
by: Bodea, Andreea-Elena, et al.
Published: (2026)
by: Bodea, Andreea-Elena, et al.
Published: (2026)
Privacy-R1: Privacy-Aware Multi-LLM Agent Collaboration via Reinforcement Learning
by: Hui, Zheng, et al.
Published: (2025)
by: Hui, Zheng, et al.
Published: (2025)
IP Leakage Attacks Targeting LLM-Based Multi-Agent Systems
by: Wang, Liwen, et al.
Published: (2025)
by: Wang, Liwen, et al.
Published: (2025)
How Private are Language Models in Abstractive Summarization?
by: Hughes, Anthony, et al.
Published: (2024)
by: Hughes, Anthony, et al.
Published: (2024)
You Can't Steal Nothing: Mitigating Prompt Leakages in LLMs via System Vectors
by: Cao, Bochuan, et al.
Published: (2025)
by: Cao, Bochuan, et al.
Published: (2025)
CodeCloak: A Method for Evaluating and Mitigating Code Leakage by LLM Code Assistants
by: Noah, Amit Finkman, et al.
Published: (2024)
by: Noah, Amit Finkman, et al.
Published: (2024)
Analysis of Privacy Leakage in Federated Large Language Models
by: Vu, Minh N., et al.
Published: (2024)
by: Vu, Minh N., et al.
Published: (2024)
SEAL-Tag: Self-Tag Evidence Aggregation with Probabilistic Circuits for PII-Safe Retrieval-Augmented Generation
by: Xie, Jin, et al.
Published: (2026)
by: Xie, Jin, et al.
Published: (2026)
Merger-as-a-Stealer: Stealing Targeted PII from Aligned LLMs with Model Merging
by: Lu, Lin, et al.
Published: (2025)
by: Lu, Lin, et al.
Published: (2025)
Token-Level Privacy in Large Language Models
by: Harel, Re'em, et al.
Published: (2025)
by: Harel, Re'em, et al.
Published: (2025)
Similar Items
-
Locket: Robust Feature-Locking Technique for Language Models
by: He, Lipeng, et al.
Published: (2025) -
Combining Machine Learning Defenses without Conflicts
by: Duddu, Vasisht, et al.
Published: (2024) -
SoK: Unintended Interactions among Machine Learning Defenses and Risks
by: Duddu, Vasisht, et al.
Published: (2023) -
Laminator: Verifiable ML Property Cards using Hardware-assisted Attestations
by: Duddu, Vasisht, et al.
Published: (2024) -
Espresso: Robust Concept Filtering in Text-to-Image Models
by: Das, Anudeep, et al.
Published: (2024)