Merger-as-a-Stealer: Stealing Targeted PII from Aligned LLMs with Model Merging
Fuente:
arXiv
Salvato in:
| Autori principali: | Lu, Lin, Zuo, Zhigang, Sheng, Ziji, Zhou, Pan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Stealing Training Data from Large Language Models in Decentralized Training through Activation Inversion Attack
di: Dai, Chenxi, et al.
Pubblicazione: (2025)
di: Dai, Chenxi, et al.
Pubblicazione: (2025)
PII Jailbreaking in LLMs via Activation Steering Reveals Personal Information Leakage
di: Nakka, Krishna Kanth, et al.
Pubblicazione: (2025)
di: Nakka, Krishna Kanth, et al.
Pubblicazione: (2025)
Large Language Models Merging for Enhancing the Link Stealing Attack on Graph Neural Networks
di: Guan, Faqian, et al.
Pubblicazione: (2024)
di: Guan, Faqian, et al.
Pubblicazione: (2024)
Merge Hijacking: Backdoor Attacks to Model Merging of Large Language Models
di: Yuan, Zenghui, et al.
Pubblicazione: (2025)
di: Yuan, Zenghui, et al.
Pubblicazione: (2025)
Stealing Part of a Production Language Model
di: Carlini, Nicholas, et al.
Pubblicazione: (2024)
di: Carlini, Nicholas, et al.
Pubblicazione: (2024)
WebPII: Benchmarking Visual PII Detection for Computer-Use Agents
di: Zhao, Nathan
Pubblicazione: (2026)
di: Zhao, Nathan
Pubblicazione: (2026)
GraphSteal: Structural Knowledge Stealing from Graph RAG via Traversal Reconstruction
di: Gu, Jinze, et al.
Pubblicazione: (2026)
di: Gu, Jinze, et al.
Pubblicazione: (2026)
Measuring the Accuracy and Effectiveness of PII Removal Services
di: He, Jiahui, et al.
Pubblicazione: (2025)
di: He, Jiahui, et al.
Pubblicazione: (2025)
PATCH: Mitigating PII Leakage in Language Models with Privacy-Aware Targeted Circuit PatcHing
di: Hughes, Anthony, et al.
Pubblicazione: (2025)
di: Hughes, Anthony, et al.
Pubblicazione: (2025)
PRvL: Quantifying the Capabilities and Risks of Large Language Models for PII Redaction
di: Garza, Leon, et al.
Pubblicazione: (2025)
di: Garza, Leon, et al.
Pubblicazione: (2025)
Do Not Merge My Model! Safeguarding Open-Source LLMs Against Unauthorized Model Merging
di: Li, Qinfeng, et al.
Pubblicazione: (2025)
di: Li, Qinfeng, et al.
Pubblicazione: (2025)
Efficient Data-Free Model Stealing with Label Diversity
di: Liu, Yiyong, et al.
Pubblicazione: (2024)
di: Liu, Yiyong, et al.
Pubblicazione: (2024)
A Model Stealing Attack Against Multi-Exit Networks
di: Pan, Li, et al.
Pubblicazione: (2023)
di: Pan, Li, et al.
Pubblicazione: (2023)
BarkBeetle: Stealing Decision Tree Models with Fault Injection
di: Wang, Qifan, et al.
Pubblicazione: (2025)
di: Wang, Qifan, et al.
Pubblicazione: (2025)
Secret Stealing Attacks on Local LLM Fine-Tuning through Supply-Chain Model Code Backdoors
di: Li, Zi, et al.
Pubblicazione: (2026)
di: Li, Zi, et al.
Pubblicazione: (2026)
KinGuard: Hierarchical Kinship-Aware Fingerprinting to Defend Against Large Language Model Stealing
di: Xu, Zhenhua, et al.
Pubblicazione: (2026)
di: Xu, Zhenhua, et al.
Pubblicazione: (2026)
Large Language Model Watermark Stealing With Mixed Integer Programming
di: Zhang, Zhaoxi, et al.
Pubblicazione: (2024)
di: Zhang, Zhaoxi, et al.
Pubblicazione: (2024)
Prompt Pirates Need a Map: Stealing Seeds helps Stealing Prompts
di: Mächtle, Felix, et al.
Pubblicazione: (2025)
di: Mächtle, Felix, et al.
Pubblicazione: (2025)
Targeting Alignment: Extracting Safety Classifiers of Aligned LLMs
di: Ferrand, Jean-Charles Noirot, et al.
Pubblicazione: (2025)
di: Ferrand, Jean-Charles Noirot, et al.
Pubblicazione: (2025)
On Stealing Graph Neural Network Models
di: Podhajski, Marcin, et al.
Pubblicazione: (2025)
di: Podhajski, Marcin, et al.
Pubblicazione: (2025)
Discovering Universal Activation Directions for PII Leakage in Language Models
di: Marchyok, Leo, et al.
Pubblicazione: (2026)
di: Marchyok, Leo, et al.
Pubblicazione: (2026)
How to Steal Reasoning Without Reasoning Traces
di: Zhang, Tingwei, et al.
Pubblicazione: (2026)
di: Zhang, Tingwei, et al.
Pubblicazione: (2026)
Stealing Training Graphs from Graph Neural Networks
di: Lin, Minhua, et al.
Pubblicazione: (2024)
di: Lin, Minhua, et al.
Pubblicazione: (2024)
Towards Effective Prompt Stealing Attack against Text-to-Image Diffusion Models
di: Zhao, Shiqian, et al.
Pubblicazione: (2025)
di: Zhao, Shiqian, et al.
Pubblicazione: (2025)
Stealix: Model Stealing via Prompt Evolution
di: Zhuang, Zhixiong, et al.
Pubblicazione: (2025)
di: Zhuang, Zhixiong, et al.
Pubblicazione: (2025)
SecureGate: Learning When to Reveal PII Safely via Token-Gated Dual-Adapters for Federated LLMs
di: Shaaban, Mohamed, et al.
Pubblicazione: (2026)
di: Shaaban, Mohamed, et al.
Pubblicazione: (2026)
Membership Inference for Contrastive Pre-training Models with Text-only PII Queries
di: Cheng, Ruoxi, et al.
Pubblicazione: (2026)
di: Cheng, Ruoxi, et al.
Pubblicazione: (2026)
Can LLMs Threaten Human Survival? Benchmarking Potential Existential Threats from LLMs via Prefix Completion
di: Cui, Yu, et al.
Pubblicazione: (2025)
di: Cui, Yu, et al.
Pubblicazione: (2025)
Prompt Stealing Attacks Against Large Language Models
di: Sha, Zeyang, et al.
Pubblicazione: (2024)
di: Sha, Zeyang, et al.
Pubblicazione: (2024)
Privacy Backdoors: Stealing Data with Corrupted Pretrained Models
di: Feng, Shanglun, et al.
Pubblicazione: (2024)
di: Feng, Shanglun, et al.
Pubblicazione: (2024)
Adaptive PII Mitigation Framework for Large Language Models
di: Asthana, Shubhi, et al.
Pubblicazione: (2025)
di: Asthana, Shubhi, et al.
Pubblicazione: (2025)
Black-Box Skill Stealing Attack from Proprietary LLM Agents: An Empirical Study
di: Wang, Zihan, et al.
Pubblicazione: (2026)
di: Wang, Zihan, et al.
Pubblicazione: (2026)
Teach LLMs to Phish: Stealing Private Information from Language Models
di: Panda, Ashwinee, et al.
Pubblicazione: (2024)
di: Panda, Ashwinee, et al.
Pubblicazione: (2024)
Stealing Trust: Unraveling Blind Message Attacks in Web3 Authentication
di: Yan, Kailun, et al.
Pubblicazione: (2024)
di: Yan, Kailun, et al.
Pubblicazione: (2024)
SEAL-Tag: Self-Tag Evidence Aggregation with Probabilistic Circuits for PII-Safe Retrieval-Augmented Generation
di: Xie, Jin, et al.
Pubblicazione: (2026)
di: Xie, Jin, et al.
Pubblicazione: (2026)
DM4Steal: Diffusion Model For Link Stealing Attack On Graph Neural Networks
di: Chen, Jinyin, et al.
Pubblicazione: (2024)
di: Chen, Jinyin, et al.
Pubblicazione: (2024)
CAPID: Context-Aware PII Detection for Question-Answering Systems
di: Ponomarenko, Mariia, et al.
Pubblicazione: (2026)
di: Ponomarenko, Mariia, et al.
Pubblicazione: (2026)
Intrinsic Fingerprint of LLMs: Continue Training is NOT All You Need to Steal A Model!
di: Yoon, Do-hyeon, et al.
Pubblicazione: (2025)
di: Yoon, Do-hyeon, et al.
Pubblicazione: (2025)
Stealing AI Model Weights Through Covert Communication Channels
di: Barbaza, Valentin, et al.
Pubblicazione: (2025)
di: Barbaza, Valentin, et al.
Pubblicazione: (2025)
PII-Compass: Guiding LLM training data extraction prompts towards the target PII via grounding
di: Nakka, Krishna Kanth, et al.
Pubblicazione: (2024)
di: Nakka, Krishna Kanth, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Stealing Training Data from Large Language Models in Decentralized Training through Activation Inversion Attack
di: Dai, Chenxi, et al.
Pubblicazione: (2025) -
PII Jailbreaking in LLMs via Activation Steering Reveals Personal Information Leakage
di: Nakka, Krishna Kanth, et al.
Pubblicazione: (2025) -
Large Language Models Merging for Enhancing the Link Stealing Attack on Graph Neural Networks
di: Guan, Faqian, et al.
Pubblicazione: (2024) -
Merge Hijacking: Backdoor Attacks to Model Merging of Large Language Models
di: Yuan, Zenghui, et al.
Pubblicazione: (2025) -
Stealing Part of a Production Language Model
di: Carlini, Nicholas, et al.
Pubblicazione: (2024)