Differentiation-Based Extraction of Proprietary Data from Fine-Tuned LLMs
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Li, Zongjie, Wu, Daoyuan, Wang, Shuai, Su, Zhendong |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
SoK: Evaluating Jailbreak Guardrails for Large Language Models
von: Wang, Xunguang, et al.
Veröffentlicht: (2025)
von: Wang, Xunguang, et al.
Veröffentlicht: (2025)
SelfDefend: LLMs Can Defend Themselves against Jailbreaking in a Practical Manner
von: Wang, Xunguang, et al.
Veröffentlicht: (2024)
von: Wang, Xunguang, et al.
Veröffentlicht: (2024)
LLMs Can Defend Themselves Against Jailbreaking in a Practical Manner: A Vision Paper
von: Wu, Daoyuan, et al.
Veröffentlicht: (2024)
von: Wu, Daoyuan, et al.
Veröffentlicht: (2024)
STShield: Single-Token Sentinel for Real-Time Jailbreak Detection in Large Language Models
von: Wang, Xunguang, et al.
Veröffentlicht: (2025)
von: Wang, Xunguang, et al.
Veröffentlicht: (2025)
Taxonomy, Evaluation and Exploitation of IPI-Centric LLM Agent Defense Frameworks
von: Ji, Zimo, et al.
Veröffentlicht: (2025)
von: Ji, Zimo, et al.
Veröffentlicht: (2025)
IP Leakage Attacks Targeting LLM-Based Multi-Agent Systems
von: Wang, Liwen, et al.
Veröffentlicht: (2025)
von: Wang, Liwen, et al.
Veröffentlicht: (2025)
BadMoE: Backdooring Mixture-of-Experts LLMs via Optimizing Routing Triggers and Infecting Dormant Experts
von: Wang, Qingyue, et al.
Veröffentlicht: (2025)
von: Wang, Qingyue, et al.
Veröffentlicht: (2025)
ObfuscaTune: Obfuscated Offsite Fine-tuning and Inference of Proprietary LLMs on Private Datasets
von: Frikha, Ahmed, et al.
Veröffentlicht: (2024)
von: Frikha, Ahmed, et al.
Veröffentlicht: (2024)
Analysing Safety Risks in LLMs Fine-Tuned with Pseudo-Malicious Cyber Security Data
von: ElZemity, Adel, et al.
Veröffentlicht: (2025)
von: ElZemity, Adel, et al.
Veröffentlicht: (2025)
MCPSecBench: A Systematic Security Benchmark and Playground for Testing Model Context Protocols
von: Yang, Yixuan, et al.
Veröffentlicht: (2025)
von: Yang, Yixuan, et al.
Veröffentlicht: (2025)
Fine-Tuning, Quantization, and LLMs: Navigating Unintended Outcomes
von: Kumar, Divyanshu, et al.
Veröffentlicht: (2024)
von: Kumar, Divyanshu, et al.
Veröffentlicht: (2024)
Dual-Priv Pruning : Efficient Differential Private Fine-Tuning in Multimodal Large Language Models
von: Wei, Qianshan, et al.
Veröffentlicht: (2025)
von: Wei, Qianshan, et al.
Veröffentlicht: (2025)
On Protecting Agentic Systems' Intellectual Property via Watermarking
von: Wang, Liwen, et al.
Veröffentlicht: (2026)
von: Wang, Liwen, et al.
Veröffentlicht: (2026)
Persistent Backdoor Attacks under Continual Fine-Tuning of LLMs
von: Cui, Jing, et al.
Veröffentlicht: (2025)
von: Cui, Jing, et al.
Veröffentlicht: (2025)
Rethinking and Exploring String-Based Malware Family Classification in the Era of LLMs and RAG
von: Chen, Yufan, et al.
Veröffentlicht: (2025)
von: Chen, Yufan, et al.
Veröffentlicht: (2025)
Beyond Content Safety: Real-Time Monitoring for Reasoning Vulnerabilities in Large Language Models
von: Wang, Xunguang, et al.
Veröffentlicht: (2026)
von: Wang, Xunguang, et al.
Veröffentlicht: (2026)
Measuring the Permission Gate: A Stress-Test Evaluation of Claude Code's Auto Mode
von: Ji, Zimo, et al.
Veröffentlicht: (2026)
von: Ji, Zimo, et al.
Veröffentlicht: (2026)
BugWhisperer: Fine-Tuning LLMs for SoC Hardware Vulnerability Detection
von: Tarek, Shams, et al.
Veröffentlicht: (2025)
von: Tarek, Shams, et al.
Veröffentlicht: (2025)
A Systematic Evaluation of Parameter-Efficient Fine-Tuning Methods for the Security of Code LLMs
von: Lee, Kiho, et al.
Veröffentlicht: (2025)
von: Lee, Kiho, et al.
Veröffentlicht: (2025)
Scam Shield: Multi-Model Voting and Fine-Tuned LLMs Against Adversarial Attacks
von: Chang, Chen-Wei, et al.
Veröffentlicht: (2025)
von: Chang, Chen-Wei, et al.
Veröffentlicht: (2025)
Defending MoE LLMs against Harmful Fine-Tuning via Safety Routing Alignment
von: Kim, Jaehan, et al.
Veröffentlicht: (2025)
von: Kim, Jaehan, et al.
Veröffentlicht: (2025)
CurricuLLM: Designing Personalized and Workforce-Aligned Cybersecurity Curricula Using Fine-Tuned LLMs
von: Nijdam, Arthur, et al.
Veröffentlicht: (2026)
von: Nijdam, Arthur, et al.
Veröffentlicht: (2026)
GuidedBench: Measuring and Mitigating the Evaluation Discrepancies of In-the-wild LLM Jailbreak Methods
von: Huang, Ruixuan, et al.
Veröffentlicht: (2025)
von: Huang, Ruixuan, et al.
Veröffentlicht: (2025)
Silent Sabotage During Fine-Tuning: Few-Shot Rationale Poisoning of Compact Medical LLMs
von: Xie, Jingyuan, et al.
Veröffentlicht: (2026)
von: Xie, Jingyuan, et al.
Veröffentlicht: (2026)
Red-Teaming Coding Agents from a Tool-Invocation Perspective: An Empirical Security Assessment
von: Xie, Yuchong, et al.
Veröffentlicht: (2025)
von: Xie, Yuchong, et al.
Veröffentlicht: (2025)
Data Provenance Auditing of Fine-Tuned Large Language Models with a Text-Preserving Technique
von: Li, Yanming, et al.
Veröffentlicht: (2025)
von: Li, Yanming, et al.
Veröffentlicht: (2025)
RewardDS: Privacy-Preserving Fine-Tuning for Large Language Models via Reward Driven Data Synthesis
von: Wang, Jianwei, et al.
Veröffentlicht: (2025)
von: Wang, Jianwei, et al.
Veröffentlicht: (2025)
Safe Delta: Consistently Preserving Safety when Fine-Tuning LLMs on Diverse Datasets
von: Lu, Ning, et al.
Veröffentlicht: (2025)
von: Lu, Ning, et al.
Veröffentlicht: (2025)
QueryIPI: Query-agnostic Indirect Prompt Injection on Coding Agents
von: Xie, Yuchong, et al.
Veröffentlicht: (2025)
von: Xie, Yuchong, et al.
Veröffentlicht: (2025)
FTSmartAudit: A Knowledge Distillation-Enhanced Framework for Automated Smart Contract Auditing Using Fine-Tuned LLMs
von: Wei, Zhiyuan, et al.
Veröffentlicht: (2024)
von: Wei, Zhiyuan, et al.
Veröffentlicht: (2024)
Differentially Private Fine-Tuning of Diffusion Models
von: Tsai, Yu-Lin, et al.
Veröffentlicht: (2024)
von: Tsai, Yu-Lin, et al.
Veröffentlicht: (2024)
Taming Various Privilege Escalation in LLM-Based Agent Systems: A Mandatory Access Control Framework
von: Ji, Zimo, et al.
Veröffentlicht: (2026)
von: Ji, Zimo, et al.
Veröffentlicht: (2026)
Detecting Various DeFi Price Manipulations with LLM Reasoning
von: Zhong, Juantao, et al.
Veröffentlicht: (2025)
von: Zhong, Juantao, et al.
Veröffentlicht: (2025)
Accuracy and Efficiency Trade-Offs in LLM-Based Malware Detection and Explanation: A Comparative Study of Parameter Tuning vs. Full Fine-Tuning
von: Gravereaux, Stephen C., et al.
Veröffentlicht: (2025)
von: Gravereaux, Stephen C., et al.
Veröffentlicht: (2025)
LLM4Vuln: A Unified Evaluation Framework for Decoupling and Enhancing LLMs' Vulnerability Reasoning
von: Sun, Yuqiang, et al.
Veröffentlicht: (2024)
von: Sun, Yuqiang, et al.
Veröffentlicht: (2024)
PEFT-as-an-Attack! Jailbreaking Language Models during Federated Parameter-Efficient Fine-Tuning
von: Li, Shenghui, et al.
Veröffentlicht: (2024)
von: Li, Shenghui, et al.
Veröffentlicht: (2024)
Security Document Classification with a Fine-Tuned Local Large Language Model: Benchmark Data and an Open-Source System
von: Dobrovolskyi, Ivan
Veröffentlicht: (2026)
von: Dobrovolskyi, Ivan
Veröffentlicht: (2026)
Secret Stealing Attacks on Local LLM Fine-Tuning through Supply-Chain Model Code Backdoors
von: Li, Zi, et al.
Veröffentlicht: (2026)
von: Li, Zi, et al.
Veröffentlicht: (2026)
ADAM: A Systematic Data Extraction Attack on Agent Memory via Adaptive Querying
von: Lyu, Xingyu, et al.
Veröffentlicht: (2026)
von: Lyu, Xingyu, et al.
Veröffentlicht: (2026)
Can Differentially Private Fine-tuning LLMs Protect Against Privacy Attacks?
von: Du, Hao, et al.
Veröffentlicht: (2025)
von: Du, Hao, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
SoK: Evaluating Jailbreak Guardrails for Large Language Models
von: Wang, Xunguang, et al.
Veröffentlicht: (2025) -
SelfDefend: LLMs Can Defend Themselves against Jailbreaking in a Practical Manner
von: Wang, Xunguang, et al.
Veröffentlicht: (2024) -
LLMs Can Defend Themselves Against Jailbreaking in a Practical Manner: A Vision Paper
von: Wu, Daoyuan, et al.
Veröffentlicht: (2024) -
STShield: Single-Token Sentinel for Real-Time Jailbreak Detection in Large Language Models
von: Wang, Xunguang, et al.
Veröffentlicht: (2025) -
Taxonomy, Evaluation and Exploitation of IPI-Centric LLM Agent Defense Frameworks
von: Ji, Zimo, et al.
Veröffentlicht: (2025)