NeuronTune: Fine-Grained Neuron Modulation for Balanced Safety-Utility Alignment in LLMs

Fuente: arXiv
Saved in:
Bibliographic Details
Main Authors: Pan, Birong, Xu, Mayi, Pi, Qiankun, Chen, Jianhao, Zhu, Yuanyuan, Zhong, Ming, Qian, Tieyun
Format: Preprint
Published: 2025
Subjects:
Online Access:
Tags: Add Tag
No Tags, Be the first to tag this record!
_version_ 1866915443722158080
author Pan, Birong
Xu, Mayi
Pi, Qiankun
Chen, Jianhao
Zhu, Yuanyuan
Zhong, Ming
Qian, Tieyun
author_facet Pan, Birong
Xu, Mayi
Pi, Qiankun
Chen, Jianhao
Zhu, Yuanyuan
Zhong, Ming
Qian, Tieyun
contents Ensuring robust safety alignment while preserving utility is critical for the reliable deployment of Large Language Models (LLMs). However, current techniques fundamentally suffer from intertwined deficiencies: insufficient robustness against malicious attacks, frequent refusal of benign queries, degradation in generated text quality and general task performance--the former two reflecting deficits in robust safety and the latter constituting utility impairment. We trace these limitations to the coarse-grained layer-wise interventions in existing methods. To resolve this, we propose NeuronTune, a fine-grained framework that dynamically modulates sparse neurons to achieve simultaneous safety-utility optimization. Our approach first identifies safety-critical and utility-preserving neurons across all layers via attribution, then employs meta-learning to adaptively amplify safety-neuron activations and suppress utility-neuron activations. Crucially, NeuronTune enables tunable adjustment of intervention scope via neuron-count thresholds, supporting flexible adaptation to security-critical or utility-priority scenarios. Extensive experimental results demonstrate that our method significantly outperforms existing state-of-the-art technologies, achieving superior model safety while maintaining excellent utility.
format Preprint
id arxiv_https___arxiv_org_abs_2508_09473
institution arXiv
publishDate 2025
record_format arxiv
spellingShingle NeuronTune: Fine-Grained Neuron Modulation for Balanced Safety-Utility Alignment in LLMs
Pan, Birong
Xu, Mayi
Pi, Qiankun
Chen, Jianhao
Zhu, Yuanyuan
Zhong, Ming
Qian, Tieyun
Machine Learning
Artificial Intelligence
Computation and Language
Ensuring robust safety alignment while preserving utility is critical for the reliable deployment of Large Language Models (LLMs). However, current techniques fundamentally suffer from intertwined deficiencies: insufficient robustness against malicious attacks, frequent refusal of benign queries, degradation in generated text quality and general task performance--the former two reflecting deficits in robust safety and the latter constituting utility impairment. We trace these limitations to the coarse-grained layer-wise interventions in existing methods. To resolve this, we propose NeuronTune, a fine-grained framework that dynamically modulates sparse neurons to achieve simultaneous safety-utility optimization. Our approach first identifies safety-critical and utility-preserving neurons across all layers via attribution, then employs meta-learning to adaptively amplify safety-neuron activations and suppress utility-neuron activations. Crucially, NeuronTune enables tunable adjustment of intervention scope via neuron-count thresholds, supporting flexible adaptation to security-critical or utility-priority scenarios. Extensive experimental results demonstrate that our method significantly outperforms existing state-of-the-art technologies, achieving superior model safety while maintaining excellent utility.
title NeuronTune: Fine-Grained Neuron Modulation for Balanced Safety-Utility Alignment in LLMs
topic Machine Learning
Artificial Intelligence
Computation and Language
url https://arxiv.org/abs/2508.09473