Toward Secure Tuning: Mitigating Security Risks from Instruction Fine-Tuning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Du, Yanrui, Zhao, Sendong, Cao, Jiawei, Ma, Ming, Zhao, Danyang, Qi, Shuren, Fan, Fenglei, Liu, Ting, Qin, Bing |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security
par: Du, Yanrui, et autres
Publié: (2025)
par: Du, Yanrui, et autres
Publié: (2025)
Anchoring Refusal Direction: Mitigating Safety Risks in Tuning via Projection Constraint
par: Du, Yanrui, et autres
Publié: (2025)
par: Du, Yanrui, et autres
Publié: (2025)
Don't Ignore Dual Logic Ability of LLMs while Privatizing: A Data-Intensive Analysis in Medical Domain
par: Du, Yanrui, et autres
Publié: (2023)
par: Du, Yanrui, et autres
Publié: (2023)
Analyzing the Inherent Response Tendency of LLMs: Real-World Instructions-Driven Jailbreak
par: Du, Yanrui, et autres
Publié: (2023)
par: Du, Yanrui, et autres
Publié: (2023)
MoGU: A Framework for Enhancing Safety of Open-Sourced LLMs While Preserving Their Usability
par: Du, Yanrui, et autres
Publié: (2024)
par: Du, Yanrui, et autres
Publié: (2024)
MolTailor: Tailoring Chemical Molecular Representation to Specific Tasks via Text Prompts
par: Guo, Haoqiang, et autres
Publié: (2024)
par: Guo, Haoqiang, et autres
Publié: (2024)
Beware of Your Po! Measuring and Mitigating AI Safety Risks in Role-Play Fine-Tuning of LLMs
par: Zhao, Weixiang, et autres
Publié: (2025)
par: Zhao, Weixiang, et autres
Publié: (2025)
Manifold-based Verbalizer Space Re-embedding for Tuning-free Prompt-based Classification
par: Wang, Haochun, et autres
Publié: (2023)
par: Wang, Haochun, et autres
Publié: (2023)
S3-CoT: Self-Sampled Succinct Reasoning Enables Efficient Chain-of-Thought LLMs
par: Du, Yanrui, et autres
Publié: (2026)
par: Du, Yanrui, et autres
Publié: (2026)
From Artificially Real to Real: Leveraging Pseudo Data from Large Language Models for Low-Resource Molecule Discovery
par: Chen, Yuhan, et autres
Publié: (2023)
par: Chen, Yuhan, et autres
Publié: (2023)
Supervised Fine-Tuning Achieve Rapid Task Adaption Via Alternating Attention Head Activation Patterns
par: Zhao, Yang, et autres
Publié: (2024)
par: Zhao, Yang, et autres
Publié: (2024)
AS-ES Learning: Towards Efficient CoT Learning in Small Models
par: Xi, Nuwa, et autres
Publié: (2024)
par: Xi, Nuwa, et autres
Publié: (2024)
Uncovering the Role of Initial Saliency in U-Shaped Attention Bias: Scaling Initial Token Weight for Enhanced Long-Text Processing
par: Qiang, Zewen, et autres
Publié: (2025)
par: Qiang, Zewen, et autres
Publié: (2025)
SL-BiLEM: Structured Learnable Behavior-in-the-Loop Epidemic Modeling for Forecasting and Policy Evaluation
par: Wang, Haochun, et autres
Publié: (2026)
par: Wang, Haochun, et autres
Publié: (2026)
From Latent Signals to Reflection Behavior: Tracing Meta-Cognitive Activation Trajectory in R1-Style LLMs
par: Du, Yanrui, et autres
Publié: (2026)
par: Du, Yanrui, et autres
Publié: (2026)
GIFT: Guided Fine-Tuning and Transfer for Enhancing Instruction-Tuned Language Models
par: Ruan, Zhiwen, et autres
Publié: (2026)
par: Ruan, Zhiwen, et autres
Publié: (2026)
Reinforcement Fine-Tuning Naturally Mitigates Forgetting in Continual Post-Training
par: Lai, Song, et autres
Publié: (2025)
par: Lai, Song, et autres
Publié: (2025)
Beyond Similarity: A Gradient-based Graph Method for Instruction Tuning Data Selection
par: Zhao, Yang, et autres
Publié: (2025)
par: Zhao, Yang, et autres
Publié: (2025)
Beyond Direct Diagnosis: LLM-based Multi-Specialist Agent Consultation for Automatic Diagnosis
par: Wang, Haochun, et autres
Publié: (2024)
par: Wang, Haochun, et autres
Publié: (2024)
LLMs May Perform MCQA by Selecting the Least Incorrect Option
par: Wang, Haochun, et autres
Publié: (2024)
par: Wang, Haochun, et autres
Publié: (2024)
Separate the Wheat from the Chaff: A Post-Hoc Approach to Safety Re-Alignment for Fine-Tuned Language Models
par: Wu, Di, et autres
Publié: (2024)
par: Wu, Di, et autres
Publié: (2024)
Unintended Misalignment from Agentic Fine-Tuning: Risks and Mitigation
par: Hahm, Dongyoon, et autres
Publié: (2025)
par: Hahm, Dongyoon, et autres
Publié: (2025)
Mitigating Training Imbalance in LLM Fine-Tuning via Selective Parameter Merging
par: Ju, Yiming, et autres
Publié: (2024)
par: Ju, Yiming, et autres
Publié: (2024)
RECOST: External Knowledge Guided Data-efficient Instruction Tuning
par: Zhang, Qi, et autres
Publié: (2024)
par: Zhang, Qi, et autres
Publié: (2024)
EdgeFlowerTune: Evaluating Federated LLM Fine-Tuning Under Realistic Edge System Constraints
par: Geng, Jiaxiang, et autres
Publié: (2026)
par: Geng, Jiaxiang, et autres
Publié: (2026)
MolFusion: Multimodal Fusion Learning for Molecular Representations via Multi-granularity Views
par: Cai, Muzhen, et autres
Publié: (2024)
par: Cai, Muzhen, et autres
Publié: (2024)
Long Is More for Alignment: A Simple but Tough-to-Beat Baseline for Instruction Fine-Tuning
par: Zhao, Hao, et autres
Publié: (2024)
par: Zhao, Hao, et autres
Publié: (2024)
Generalization-Enhanced Code Vulnerability Detection via Multi-Task Instruction Fine-Tuning
par: Du, Xiaohu, et autres
Publié: (2024)
par: Du, Xiaohu, et autres
Publié: (2024)
JsonTuning: Towards Generalizable, Robust, and Controllable Instruction Tuning
par: Gao, Chang, et autres
Publié: (2023)
par: Gao, Chang, et autres
Publié: (2023)
Secure LLM Fine-Tuning via Safety-Aware Probing
par: Wu, Chengcan, et autres
Publié: (2025)
par: Wu, Chengcan, et autres
Publié: (2025)
Knowledge-tuning Large Language Models with Structured Medical Knowledge Bases for Reliable Response Generation in Chinese
par: Wang, Haochun, et autres
Publié: (2023)
par: Wang, Haochun, et autres
Publié: (2023)
META-RAG: Meta-Analysis-Inspired Evidence-Re-Ranking Method for Retrieval-Augmented Generation in Evidence-Based Medicine
par: Sun, Mengzhou, et autres
Publié: (2025)
par: Sun, Mengzhou, et autres
Publié: (2025)
M-DaQ: Retrieving Samples with Multilingual Diversity and Quality for Instruction Fine-Tuning Datasets
par: Zhao, Chunguang, et autres
Publié: (2025)
par: Zhao, Chunguang, et autres
Publié: (2025)
Assessing and Mitigating Data Memorization Risks in Fine-Tuned Large Language Models
par: Ramakrishnan, Badrinath, et autres
Publié: (2025)
par: Ramakrishnan, Badrinath, et autres
Publié: (2025)
CC-Tuning: A Cross-Lingual Connection Mechanism for Improving Joint Multilingual Supervised Fine-Tuning
par: Ye, Yangfan, et autres
Publié: (2025)
par: Ye, Yangfan, et autres
Publié: (2025)
CoachLM: Automatic Instruction Revisions Improve the Data Quality in LLM Instruction Tuning
par: Liu, Yilun, et autres
Publié: (2023)
par: Liu, Yilun, et autres
Publié: (2023)
Data Diversity Matters for Robust Instruction Tuning
par: Bukharin, Alexander, et autres
Publié: (2023)
par: Bukharin, Alexander, et autres
Publié: (2023)
Mosaic-IT: Cost-Free Compositional Data Synthesis for Instruction Tuning
par: Li, Ming, et autres
Publié: (2024)
par: Li, Ming, et autres
Publié: (2024)
Fine-Tuning on Noisy Instructions: Effects on Generalization and Performance
par: Alajrami, Ahmed, et autres
Publié: (2025)
par: Alajrami, Ahmed, et autres
Publié: (2025)
Easier to Judge than to Find: Predicting In-Context Learning Success for Demonstration Selection
par: Wang, Haochun, et autres
Publié: (2026)
par: Wang, Haochun, et autres
Publié: (2026)
Documents similaires
-
MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security
par: Du, Yanrui, et autres
Publié: (2025) -
Anchoring Refusal Direction: Mitigating Safety Risks in Tuning via Projection Constraint
par: Du, Yanrui, et autres
Publié: (2025) -
Don't Ignore Dual Logic Ability of LLMs while Privatizing: A Data-Intensive Analysis in Medical Domain
par: Du, Yanrui, et autres
Publié: (2023) -
Analyzing the Inherent Response Tendency of LLMs: Real-World Instructions-Driven Jailbreak
par: Du, Yanrui, et autres
Publié: (2023) -
MoGU: A Framework for Enhancing Safety of Open-Sourced LLMs While Preserving Their Usability
par: Du, Yanrui, et autres
Publié: (2024)