Privacy in Fine-tuning Large Language Models: Attacks, Defenses, and Future Directions
Fuente:
arXiv
Guardado en:
| Autores principales: | Du, Hao, Liu, Shang, Zheng, Lele, Cao, Yang, Nakamura, Atsuyoshi, Chen, Lei |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Can Differentially Private Fine-tuning LLMs Protect Against Privacy Attacks?
por: Du, Hao, et al.
Publicado: (2025)
por: Du, Hao, et al.
Publicado: (2025)
Harmful Fine-tuning Attacks and Defenses for Large Language Models: A Survey
por: Huang, Tiansheng, et al.
Publicado: (2024)
por: Huang, Tiansheng, et al.
Publicado: (2024)
Security in the Fine-Tuning Lifecycle of Large Language Models: Threats, Defenses,Evaluation, and Future Directions
por: Li, Wenjuan, et al.
Publicado: (2026)
por: Li, Wenjuan, et al.
Publicado: (2026)
Privacy-preserving Fine-tuning of Large Language Models through Flatness
por: Chen, Tiejin, et al.
Publicado: (2024)
por: Chen, Tiejin, et al.
Publicado: (2024)
Window-based Membership Inference Attacks Against Fine-tuned Large Language Models
por: Chen, Yuetian, et al.
Publicado: (2026)
por: Chen, Yuetian, et al.
Publicado: (2026)
Membership Inference Attacks Against Fine-tuned Diffusion Language Models
por: Chen, Yuetian, et al.
Publicado: (2026)
por: Chen, Yuetian, et al.
Publicado: (2026)
Securing Retrieval-Augmented Generation: A Taxonomy of Attacks, Defenses, and Future Directions
por: Xu, Yuming, et al.
Publicado: (2026)
por: Xu, Yuming, et al.
Publicado: (2026)
Pre-train and Fine-tune: Recommenders as Large Models
por: Jiang, Zhenhao, et al.
Publicado: (2025)
por: Jiang, Zhenhao, et al.
Publicado: (2025)
Fine-tuned Large Language Models (LLMs): Improved Prompt Injection Attacks Detection
por: Rahman, Md Abdur, et al.
Publicado: (2024)
por: Rahman, Md Abdur, et al.
Publicado: (2024)
Privacy-Preserving Large Language Models: Mechanisms, Applications, and Future Directions
por: Zhao, Guoshenghui, et al.
Publicado: (2024)
por: Zhao, Guoshenghui, et al.
Publicado: (2024)
On the Security and Privacy of Federated Learning: A Survey with Attacks, Defenses, Frameworks, Applications, and Future Directions
por: Jimenez-Gutierrez, Daniel M., et al.
Publicado: (2025)
por: Jimenez-Gutierrez, Daniel M., et al.
Publicado: (2025)
Semi-supervised Fine-tuning for Large Language Models
por: Luo, Junyu, et al.
Publicado: (2024)
por: Luo, Junyu, et al.
Publicado: (2024)
Entropy-KL Divergence-based Token Masking: A Novel Approach for Selective Fine-tuning of Large Language Models
por: Liu, Qi, et al.
Publicado: (2026)
por: Liu, Qi, et al.
Publicado: (2026)
Virus: Harmful Fine-tuning Attack for Large Language Models Bypassing Guardrail Moderation
por: Huang, Tiansheng, et al.
Publicado: (2025)
por: Huang, Tiansheng, et al.
Publicado: (2025)
Unlocking Large Language Model's Planning Capabilities with Maximum Diversity Fine-tuning
por: Li, Wenjun, et al.
Publicado: (2024)
por: Li, Wenjun, et al.
Publicado: (2024)
Privacy in Large Language Models: Attacks, Defenses and Future Directions
por: Li, Haoran, et al.
Publicado: (2023)
por: Li, Haoran, et al.
Publicado: (2023)
Fine-tuning Large Language Model for Automated Algorithm Design
por: Liu, Fei, et al.
Publicado: (2025)
por: Liu, Fei, et al.
Publicado: (2025)
Sparse is Enough in Fine-tuning Pre-trained Large Language Models
por: Song, Weixi, et al.
Publicado: (2023)
por: Song, Weixi, et al.
Publicado: (2023)
SDD: Self-Degraded Defense against Malicious Fine-tuning
por: Chen, Zixuan, et al.
Publicado: (2025)
por: Chen, Zixuan, et al.
Publicado: (2025)
On Active Privacy Auditing in Supervised Fine-tuning for White-Box Language Models
por: Sun, Qian, et al.
Publicado: (2024)
por: Sun, Qian, et al.
Publicado: (2024)
Emerging Safety Attack and Defense in Federated Instruction Tuning of Large Language Models
por: Ye, Rui, et al.
Publicado: (2024)
por: Ye, Rui, et al.
Publicado: (2024)
Refine Large Language Model Fine-tuning via Instruction Vector
por: Jiang, Gangwei, et al.
Publicado: (2024)
por: Jiang, Gangwei, et al.
Publicado: (2024)
Recent Advances in Attack and Defense Approaches of Large Language Models
por: Cui, Jing, et al.
Publicado: (2024)
por: Cui, Jing, et al.
Publicado: (2024)
Robust Defense Strategies for Multimodal Contrastive Learning: Efficient Fine-tuning Against Backdoor Attacks
por: Hossain, Md. Iqbal, et al.
Publicado: (2025)
por: Hossain, Md. Iqbal, et al.
Publicado: (2025)
Antidote: Post-fine-tuning Safety Alignment for Large Language Models against Harmful Fine-tuning
por: Huang, Tiansheng, et al.
Publicado: (2024)
por: Huang, Tiansheng, et al.
Publicado: (2024)
A Comprehensive Study of Jailbreak Attack versus Defense for Large Language Models
por: Xu, Zihao, et al.
Publicado: (2024)
por: Xu, Zihao, et al.
Publicado: (2024)
KnowTuning: Knowledge-aware Fine-tuning for Large Language Models
por: Lyu, Yougang, et al.
Publicado: (2024)
por: Lyu, Yougang, et al.
Publicado: (2024)
Advancing Single and Multi-task Text Classification through Large Language Model Fine-tuning
por: Zhao, Hang, et al.
Publicado: (2024)
por: Zhao, Hang, et al.
Publicado: (2024)
Panacea: Mitigating Harmful Fine-tuning for Large Language Models via Post-fine-tuning Perturbation
por: Wang, Yibo, et al.
Publicado: (2025)
por: Wang, Yibo, et al.
Publicado: (2025)
A Survey of Personalized Large Language Models: Progress and Future Directions
por: Liu, Jiahong, et al.
Publicado: (2025)
por: Liu, Jiahong, et al.
Publicado: (2025)
Federated Large Language Models: Feasibility, Robustness, Security and Future Directions
por: Jiang, Wenhao, et al.
Publicado: (2025)
por: Jiang, Wenhao, et al.
Publicado: (2025)
Defense-to-Attack: Bypassing Weak Defenses Enables Stronger Jailbreaks in Vision-Language Models
por: Zhao, Yunhan, et al.
Publicado: (2025)
por: Zhao, Yunhan, et al.
Publicado: (2025)
When Long Helps Short: How Context Length in Supervised Fine-tuning Affects Behavior of Large Language Models
por: Zheng, Yingming, et al.
Publicado: (2025)
por: Zheng, Yingming, et al.
Publicado: (2025)
AI Safety Landscape for Large Language Models: Taxonomy, State-of-the-art, and Future Directions
por: Chen, Chen, et al.
Publicado: (2024)
por: Chen, Chen, et al.
Publicado: (2024)
BackdoorLLM: A Comprehensive Benchmark for Backdoor Attacks and Defenses on Large Language Models
por: Li, Yige, et al.
Publicado: (2024)
por: Li, Yige, et al.
Publicado: (2024)
Trap-MID: Trapdoor-based Defense against Model Inversion Attacks
por: Liu, Zhen-Ting, et al.
Publicado: (2024)
por: Liu, Zhen-Ting, et al.
Publicado: (2024)
THRD: A Training-Free Multi-Turn Defense Framework for Jailbreak Attacks on Large Language Models
por: Ma, Zhiqing, et al.
Publicado: (2026)
por: Ma, Zhiqing, et al.
Publicado: (2026)
LaFFi: Leveraging Hybrid Natural Language Feedback for Fine-tuning Language Models
por: Li, Qianxi, et al.
Publicado: (2023)
por: Li, Qianxi, et al.
Publicado: (2023)
Fine-tuning Large Language Models for Multigenerator, Multidomain, and Multilingual Machine-Generated Text Detection
por: Xiong, Feng, et al.
Publicado: (2024)
por: Xiong, Feng, et al.
Publicado: (2024)
Fundamental Safety-Capability Trade-offs in Fine-tuning Large Language Models
por: Chen, Pin-Yu, et al.
Publicado: (2025)
por: Chen, Pin-Yu, et al.
Publicado: (2025)
Ejemplares similares
-
Can Differentially Private Fine-tuning LLMs Protect Against Privacy Attacks?
por: Du, Hao, et al.
Publicado: (2025) -
Harmful Fine-tuning Attacks and Defenses for Large Language Models: A Survey
por: Huang, Tiansheng, et al.
Publicado: (2024) -
Security in the Fine-Tuning Lifecycle of Large Language Models: Threats, Defenses,Evaluation, and Future Directions
por: Li, Wenjuan, et al.
Publicado: (2026) -
Privacy-preserving Fine-tuning of Large Language Models through Flatness
por: Chen, Tiejin, et al.
Publicado: (2024) -
Window-based Membership Inference Attacks Against Fine-tuned Large Language Models
por: Chen, Yuetian, et al.
Publicado: (2026)