Be Careful When Fine-tuning On Open-Source LLMs: Your Fine-tuning Data Could Be Secretly Stolen!
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Zhexin, Sun, Yuhao, Yang, Junxiao, Cui, Shiyao, Zhang, Yuanchao, Wang, Hongning, Huang, Minlie |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
When Smiley Turns Hostile: Interpreting How Emojis Trigger LLMs' Toxicity
di: Cui, Shiyao, et al.
Pubblicazione: (2025)
di: Cui, Shiyao, et al.
Pubblicazione: (2025)
Guiding not Forcing: Enhancing the Transferability of Jailbreaking Attacks on LLMs via Removing Superfluous Constraints
di: Yang, Junxiao, et al.
Pubblicazione: (2025)
di: Yang, Junxiao, et al.
Pubblicazione: (2025)
Agent-SafetyBench: Evaluating the Safety of LLM Agents
di: Zhang, Zhexin, et al.
Pubblicazione: (2024)
di: Zhang, Zhexin, et al.
Pubblicazione: (2024)
From Theft to Bomb-Making: The Ripple Effect of Unlearning in Defending Against Jailbreak Attacks
di: Zhang, Zhexin, et al.
Pubblicazione: (2024)
di: Zhang, Zhexin, et al.
Pubblicazione: (2024)
Defending Large Language Models Against Jailbreaking Attacks Through Goal Prioritization
di: Zhang, Zhexin, et al.
Pubblicazione: (2023)
di: Zhang, Zhexin, et al.
Pubblicazione: (2023)
Memento: Fine-tuning LLM Agents without Fine-tuning LLMs
di: Zhou, Huichi, et al.
Pubblicazione: (2025)
di: Zhou, Huichi, et al.
Pubblicazione: (2025)
The Missing Half: Unveiling Training-time Implicit Safety Risks Beyond Deployment
di: Zhang, Zhexin, et al.
Pubblicazione: (2026)
di: Zhang, Zhexin, et al.
Pubblicazione: (2026)
ShieldVLM: Safeguarding the Multimodal Implicit Toxicity via Deliberative Reasoning with LVLMs
di: Cui, Shiyao, et al.
Pubblicazione: (2025)
di: Cui, Shiyao, et al.
Pubblicazione: (2025)
How Should We Enhance the Safety of Large Reasoning Models: An Empirical Study
di: Zhang, Zhexin, et al.
Pubblicazione: (2025)
di: Zhang, Zhexin, et al.
Pubblicazione: (2025)
UltraLink: An Open-Source Knowledge-Enhanced Multilingual Supervised Fine-tuning Dataset
di: Wang, Haoyu, et al.
Pubblicazione: (2024)
di: Wang, Haoyu, et al.
Pubblicazione: (2024)
Aloe: A Family of Fine-tuned Open Healthcare LLMs
di: Gururajan, Ashwin Kumar, et al.
Pubblicazione: (2024)
di: Gururajan, Ashwin Kumar, et al.
Pubblicazione: (2024)
LASA: Language-Agnostic Semantic Alignment at the Semantic Bottleneck for LLM Safety
di: Yang, Junxiao, et al.
Pubblicazione: (2026)
di: Yang, Junxiao, et al.
Pubblicazione: (2026)
BARREL: Boundary-Aware Reasoning for Factual and Reliable LRMs
di: Yang, Junxiao, et al.
Pubblicazione: (2025)
di: Yang, Junxiao, et al.
Pubblicazione: (2025)
Data-efficient LLM Fine-tuning for Code Generation
di: Lv, Weijie, et al.
Pubblicazione: (2025)
di: Lv, Weijie, et al.
Pubblicazione: (2025)
LongSafety: Evaluating Long-Context Safety of Large Language Models
di: Lu, Yida, et al.
Pubblicazione: (2025)
di: Lu, Yida, et al.
Pubblicazione: (2025)
Scalable Fine-tuning from Multiple Data Sources: A First-Order Approximation Approach
di: Li, Dongyue, et al.
Pubblicazione: (2024)
di: Li, Dongyue, et al.
Pubblicazione: (2024)
Topic Modeling with Fine-tuning LLMs and Bag of Sentences
di: Schneider, Johannes
Pubblicazione: (2024)
di: Schneider, Johannes
Pubblicazione: (2024)
Fine-tuning and Utilization Methods of Domain-specific LLMs
di: Jeong, Cheonsu
Pubblicazione: (2024)
di: Jeong, Cheonsu
Pubblicazione: (2024)
Fine-tuning Done Right in Model Editing
di: Yang, Wanli, et al.
Pubblicazione: (2025)
di: Yang, Wanli, et al.
Pubblicazione: (2025)
When MOE Meets LLMs: Parameter Efficient Fine-tuning for Multi-task Medical Applications
di: Liu, Qidong, et al.
Pubblicazione: (2023)
di: Liu, Qidong, et al.
Pubblicazione: (2023)
EffiCoder: Enhancing Code Generation in Large Language Models through Efficiency-Aware Fine-tuning
di: Huang, Dong, et al.
Pubblicazione: (2024)
di: Huang, Dong, et al.
Pubblicazione: (2024)
ShieldLM: Empowering LLMs as Aligned, Customizable and Explainable Safety Detectors
di: Zhang, Zhexin, et al.
Pubblicazione: (2024)
di: Zhang, Zhexin, et al.
Pubblicazione: (2024)
Can LLMs Predict Citation Intent? An Experimental Analysis of In-context Learning and Fine-tuning on Open LLMs
di: Koloveas, Paris, et al.
Pubblicazione: (2025)
di: Koloveas, Paris, et al.
Pubblicazione: (2025)
AISafetyLab: A Comprehensive Framework for AI Safety Evaluation and Improvement
di: Zhang, Zhexin, et al.
Pubblicazione: (2025)
di: Zhang, Zhexin, et al.
Pubblicazione: (2025)
Token-level Data Selection for Safe LLM Fine-tuning
di: Li, Yanping, et al.
Pubblicazione: (2026)
di: Li, Yanping, et al.
Pubblicazione: (2026)
Disentangling Reasoning Tokens and Boilerplate Tokens For Language Model Fine-tuning
di: Ye, Ziang, et al.
Pubblicazione: (2024)
di: Ye, Ziang, et al.
Pubblicazione: (2024)
Beyond Fine-tuning: Unleashing the Potential of Continuous Pretraining for Clinical LLMs
di: Christophe, Clément, et al.
Pubblicazione: (2024)
di: Christophe, Clément, et al.
Pubblicazione: (2024)
Agent Fine-tuning through Distillation for Domain-specific LLMs in Microdomains
di: Xue, Yawen, et al.
Pubblicazione: (2025)
di: Xue, Yawen, et al.
Pubblicazione: (2025)
RLSF: Fine-tuning LLMs via Symbolic Feedback
di: Jha, Piyush, et al.
Pubblicazione: (2024)
di: Jha, Piyush, et al.
Pubblicazione: (2024)
Investigating the Representation of Backchannels and Fillers in Fine-tuned Language Models
di: Wang, Yu, et al.
Pubblicazione: (2025)
di: Wang, Yu, et al.
Pubblicazione: (2025)
Dynamic Orthogonal Continual Fine-tuning for Mitigating Catastrophic Forgettings
di: Zhang, Zhixin, et al.
Pubblicazione: (2025)
di: Zhang, Zhixin, et al.
Pubblicazione: (2025)
Two Intermediate Translations Are Better Than One: Fine-tuning LLMs for Document-level Translation Refinement
di: Dong, Yichen, et al.
Pubblicazione: (2025)
di: Dong, Yichen, et al.
Pubblicazione: (2025)
Efficient Ensemble for Fine-tuning Language Models on Multiple Datasets
di: Li, Dongyue, et al.
Pubblicazione: (2025)
di: Li, Dongyue, et al.
Pubblicazione: (2025)
Learning or Self-aligning? Rethinking Instruction Fine-tuning
di: Ren, Mengjie, et al.
Pubblicazione: (2024)
di: Ren, Mengjie, et al.
Pubblicazione: (2024)
MTUncertainty: Assessing the Need for Post-editing of Machine Translation Outputs by Fine-tuning OpenAI LLMs
di: Gladkoff, Serge, et al.
Pubblicazione: (2023)
di: Gladkoff, Serge, et al.
Pubblicazione: (2023)
Preference-grounded Token-level Guidance for Language Model Fine-tuning
di: Yang, Shentao, et al.
Pubblicazione: (2023)
di: Yang, Shentao, et al.
Pubblicazione: (2023)
Are LLMs Effective Backbones for Fine-tuning? An Experimental Investigation of Supervised LLMs on Chinese Short Text Matching
di: Liu, Shulin, et al.
Pubblicazione: (2024)
di: Liu, Shulin, et al.
Pubblicazione: (2024)
On Active Privacy Auditing in Supervised Fine-tuning for White-Box Language Models
di: Sun, Qian, et al.
Pubblicazione: (2024)
di: Sun, Qian, et al.
Pubblicazione: (2024)
ITERTL: An Iterative Framework for Fine-tuning LLMs for RTL Code Generation
di: Wu, Peiyang, et al.
Pubblicazione: (2024)
di: Wu, Peiyang, et al.
Pubblicazione: (2024)
JPS: Jailbreak Multimodal Large Language Models with Collaborative Visual Perturbation and Textual Steering
di: Chen, Renmiao, et al.
Pubblicazione: (2025)
di: Chen, Renmiao, et al.
Pubblicazione: (2025)
Documenti analoghi
-
When Smiley Turns Hostile: Interpreting How Emojis Trigger LLMs' Toxicity
di: Cui, Shiyao, et al.
Pubblicazione: (2025) -
Guiding not Forcing: Enhancing the Transferability of Jailbreaking Attacks on LLMs via Removing Superfluous Constraints
di: Yang, Junxiao, et al.
Pubblicazione: (2025) -
Agent-SafetyBench: Evaluating the Safety of LLM Agents
di: Zhang, Zhexin, et al.
Pubblicazione: (2024) -
From Theft to Bomb-Making: The Ripple Effect of Unlearning in Defending Against Jailbreak Attacks
di: Zhang, Zhexin, et al.
Pubblicazione: (2024) -
Defending Large Language Models Against Jailbreaking Attacks Through Goal Prioritization
di: Zhang, Zhexin, et al.
Pubblicazione: (2023)