Toward Secure Tuning: Mitigating Security Risks from Instruction Fine-Tuning
Fuente:
arXiv
Salvato in:
| Autori principali: | Du, Yanrui, Zhao, Sendong, Cao, Jiawei, Ma, Ming, Zhao, Danyang, Qi, Shuren, Fan, Fenglei, Liu, Ting, Qin, Bing |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security
di: Du, Yanrui, et al.
Pubblicazione: (2025)
di: Du, Yanrui, et al.
Pubblicazione: (2025)
Anchoring Refusal Direction: Mitigating Safety Risks in Tuning via Projection Constraint
di: Du, Yanrui, et al.
Pubblicazione: (2025)
di: Du, Yanrui, et al.
Pubblicazione: (2025)
Don't Ignore Dual Logic Ability of LLMs while Privatizing: A Data-Intensive Analysis in Medical Domain
di: Du, Yanrui, et al.
Pubblicazione: (2023)
di: Du, Yanrui, et al.
Pubblicazione: (2023)
Analyzing the Inherent Response Tendency of LLMs: Real-World Instructions-Driven Jailbreak
di: Du, Yanrui, et al.
Pubblicazione: (2023)
di: Du, Yanrui, et al.
Pubblicazione: (2023)
MoGU: A Framework for Enhancing Safety of Open-Sourced LLMs While Preserving Their Usability
di: Du, Yanrui, et al.
Pubblicazione: (2024)
di: Du, Yanrui, et al.
Pubblicazione: (2024)
MolTailor: Tailoring Chemical Molecular Representation to Specific Tasks via Text Prompts
di: Guo, Haoqiang, et al.
Pubblicazione: (2024)
di: Guo, Haoqiang, et al.
Pubblicazione: (2024)
Beware of Your Po! Measuring and Mitigating AI Safety Risks in Role-Play Fine-Tuning of LLMs
di: Zhao, Weixiang, et al.
Pubblicazione: (2025)
di: Zhao, Weixiang, et al.
Pubblicazione: (2025)
Manifold-based Verbalizer Space Re-embedding for Tuning-free Prompt-based Classification
di: Wang, Haochun, et al.
Pubblicazione: (2023)
di: Wang, Haochun, et al.
Pubblicazione: (2023)
S3-CoT: Self-Sampled Succinct Reasoning Enables Efficient Chain-of-Thought LLMs
di: Du, Yanrui, et al.
Pubblicazione: (2026)
di: Du, Yanrui, et al.
Pubblicazione: (2026)
From Artificially Real to Real: Leveraging Pseudo Data from Large Language Models for Low-Resource Molecule Discovery
di: Chen, Yuhan, et al.
Pubblicazione: (2023)
di: Chen, Yuhan, et al.
Pubblicazione: (2023)
Supervised Fine-Tuning Achieve Rapid Task Adaption Via Alternating Attention Head Activation Patterns
di: Zhao, Yang, et al.
Pubblicazione: (2024)
di: Zhao, Yang, et al.
Pubblicazione: (2024)
AS-ES Learning: Towards Efficient CoT Learning in Small Models
di: Xi, Nuwa, et al.
Pubblicazione: (2024)
di: Xi, Nuwa, et al.
Pubblicazione: (2024)
Uncovering the Role of Initial Saliency in U-Shaped Attention Bias: Scaling Initial Token Weight for Enhanced Long-Text Processing
di: Qiang, Zewen, et al.
Pubblicazione: (2025)
di: Qiang, Zewen, et al.
Pubblicazione: (2025)
SL-BiLEM: Structured Learnable Behavior-in-the-Loop Epidemic Modeling for Forecasting and Policy Evaluation
di: Wang, Haochun, et al.
Pubblicazione: (2026)
di: Wang, Haochun, et al.
Pubblicazione: (2026)
From Latent Signals to Reflection Behavior: Tracing Meta-Cognitive Activation Trajectory in R1-Style LLMs
di: Du, Yanrui, et al.
Pubblicazione: (2026)
di: Du, Yanrui, et al.
Pubblicazione: (2026)
GIFT: Guided Fine-Tuning and Transfer for Enhancing Instruction-Tuned Language Models
di: Ruan, Zhiwen, et al.
Pubblicazione: (2026)
di: Ruan, Zhiwen, et al.
Pubblicazione: (2026)
Reinforcement Fine-Tuning Naturally Mitigates Forgetting in Continual Post-Training
di: Lai, Song, et al.
Pubblicazione: (2025)
di: Lai, Song, et al.
Pubblicazione: (2025)
Beyond Similarity: A Gradient-based Graph Method for Instruction Tuning Data Selection
di: Zhao, Yang, et al.
Pubblicazione: (2025)
di: Zhao, Yang, et al.
Pubblicazione: (2025)
Beyond Direct Diagnosis: LLM-based Multi-Specialist Agent Consultation for Automatic Diagnosis
di: Wang, Haochun, et al.
Pubblicazione: (2024)
di: Wang, Haochun, et al.
Pubblicazione: (2024)
LLMs May Perform MCQA by Selecting the Least Incorrect Option
di: Wang, Haochun, et al.
Pubblicazione: (2024)
di: Wang, Haochun, et al.
Pubblicazione: (2024)
Separate the Wheat from the Chaff: A Post-Hoc Approach to Safety Re-Alignment for Fine-Tuned Language Models
di: Wu, Di, et al.
Pubblicazione: (2024)
di: Wu, Di, et al.
Pubblicazione: (2024)
Unintended Misalignment from Agentic Fine-Tuning: Risks and Mitigation
di: Hahm, Dongyoon, et al.
Pubblicazione: (2025)
di: Hahm, Dongyoon, et al.
Pubblicazione: (2025)
Mitigating Training Imbalance in LLM Fine-Tuning via Selective Parameter Merging
di: Ju, Yiming, et al.
Pubblicazione: (2024)
di: Ju, Yiming, et al.
Pubblicazione: (2024)
RECOST: External Knowledge Guided Data-efficient Instruction Tuning
di: Zhang, Qi, et al.
Pubblicazione: (2024)
di: Zhang, Qi, et al.
Pubblicazione: (2024)
EdgeFlowerTune: Evaluating Federated LLM Fine-Tuning Under Realistic Edge System Constraints
di: Geng, Jiaxiang, et al.
Pubblicazione: (2026)
di: Geng, Jiaxiang, et al.
Pubblicazione: (2026)
MolFusion: Multimodal Fusion Learning for Molecular Representations via Multi-granularity Views
di: Cai, Muzhen, et al.
Pubblicazione: (2024)
di: Cai, Muzhen, et al.
Pubblicazione: (2024)
Long Is More for Alignment: A Simple but Tough-to-Beat Baseline for Instruction Fine-Tuning
di: Zhao, Hao, et al.
Pubblicazione: (2024)
di: Zhao, Hao, et al.
Pubblicazione: (2024)
Generalization-Enhanced Code Vulnerability Detection via Multi-Task Instruction Fine-Tuning
di: Du, Xiaohu, et al.
Pubblicazione: (2024)
di: Du, Xiaohu, et al.
Pubblicazione: (2024)
JsonTuning: Towards Generalizable, Robust, and Controllable Instruction Tuning
di: Gao, Chang, et al.
Pubblicazione: (2023)
di: Gao, Chang, et al.
Pubblicazione: (2023)
Secure LLM Fine-Tuning via Safety-Aware Probing
di: Wu, Chengcan, et al.
Pubblicazione: (2025)
di: Wu, Chengcan, et al.
Pubblicazione: (2025)
Knowledge-tuning Large Language Models with Structured Medical Knowledge Bases for Reliable Response Generation in Chinese
di: Wang, Haochun, et al.
Pubblicazione: (2023)
di: Wang, Haochun, et al.
Pubblicazione: (2023)
META-RAG: Meta-Analysis-Inspired Evidence-Re-Ranking Method for Retrieval-Augmented Generation in Evidence-Based Medicine
di: Sun, Mengzhou, et al.
Pubblicazione: (2025)
di: Sun, Mengzhou, et al.
Pubblicazione: (2025)
M-DaQ: Retrieving Samples with Multilingual Diversity and Quality for Instruction Fine-Tuning Datasets
di: Zhao, Chunguang, et al.
Pubblicazione: (2025)
di: Zhao, Chunguang, et al.
Pubblicazione: (2025)
Assessing and Mitigating Data Memorization Risks in Fine-Tuned Large Language Models
di: Ramakrishnan, Badrinath, et al.
Pubblicazione: (2025)
di: Ramakrishnan, Badrinath, et al.
Pubblicazione: (2025)
CC-Tuning: A Cross-Lingual Connection Mechanism for Improving Joint Multilingual Supervised Fine-Tuning
di: Ye, Yangfan, et al.
Pubblicazione: (2025)
di: Ye, Yangfan, et al.
Pubblicazione: (2025)
CoachLM: Automatic Instruction Revisions Improve the Data Quality in LLM Instruction Tuning
di: Liu, Yilun, et al.
Pubblicazione: (2023)
di: Liu, Yilun, et al.
Pubblicazione: (2023)
Data Diversity Matters for Robust Instruction Tuning
di: Bukharin, Alexander, et al.
Pubblicazione: (2023)
di: Bukharin, Alexander, et al.
Pubblicazione: (2023)
Mosaic-IT: Cost-Free Compositional Data Synthesis for Instruction Tuning
di: Li, Ming, et al.
Pubblicazione: (2024)
di: Li, Ming, et al.
Pubblicazione: (2024)
Fine-Tuning on Noisy Instructions: Effects on Generalization and Performance
di: Alajrami, Ahmed, et al.
Pubblicazione: (2025)
di: Alajrami, Ahmed, et al.
Pubblicazione: (2025)
Easier to Judge than to Find: Predicting In-Context Learning Success for Demonstration Selection
di: Wang, Haochun, et al.
Pubblicazione: (2026)
di: Wang, Haochun, et al.
Pubblicazione: (2026)
Documenti analoghi
-
MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security
di: Du, Yanrui, et al.
Pubblicazione: (2025) -
Anchoring Refusal Direction: Mitigating Safety Risks in Tuning via Projection Constraint
di: Du, Yanrui, et al.
Pubblicazione: (2025) -
Don't Ignore Dual Logic Ability of LLMs while Privatizing: A Data-Intensive Analysis in Medical Domain
di: Du, Yanrui, et al.
Pubblicazione: (2023) -
Analyzing the Inherent Response Tendency of LLMs: Real-World Instructions-Driven Jailbreak
di: Du, Yanrui, et al.
Pubblicazione: (2023) -
MoGU: A Framework for Enhancing Safety of Open-Sourced LLMs While Preserving Their Usability
di: Du, Yanrui, et al.
Pubblicazione: (2024)