Fine-Grained Detoxification via Instance-Level Prefixes for Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Yi, Xin, Wang, Linlin, Wang, Xiaoling, He, Liang |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
NLSR: Neuron-Level Safety Realignment of Large Language Models Against Harmful Fine-Tuning
by: Yi, Xin, et al.
Published: (2024)
by: Yi, Xin, et al.
Published: (2024)
Unified Defense for Large Language Models against Jailbreak and Fine-Tuning Attacks in Education
by: Yi, Xin, et al.
Published: (2025)
by: Yi, Xin, et al.
Published: (2025)
A safety realignment framework via subspace-oriented model fusion for large language models
by: Yi, Xin, et al.
Published: (2024)
by: Yi, Xin, et al.
Published: (2024)
SGM: Safety Glasses for Multimodal Large Language Models via Neuron-Level Detoxification
by: Wang, Hongbo, et al.
Published: (2025)
by: Wang, Hongbo, et al.
Published: (2025)
PrefixQuant: Eliminating Outliers by Prefixed Tokens for Large Language Models Quantization
by: Chen, Mengzhao, et al.
Published: (2024)
by: Chen, Mengzhao, et al.
Published: (2024)
Hierarchical Divide-and-Conquer for Fine-Grained Alignment in LLM-Based Medical Evaluation
by: Zheng, Shunfan, et al.
Published: (2025)
by: Zheng, Shunfan, et al.
Published: (2025)
Unified attacks to large language model watermarks: spoofing and scrubbing in unauthorized knowledge distillation
by: Yi, Xin, et al.
Published: (2025)
by: Yi, Xin, et al.
Published: (2025)
Hierarchical Safety Realignment: Lightweight Restoration of Safety in Pruned Large Vision-Language Models
by: Li, Yue, et al.
Published: (2025)
by: Li, Yue, et al.
Published: (2025)
Attribute Controlled Fine-tuning for Large Language Models: A Case Study on Detoxification
by: Meng, Tao, et al.
Published: (2024)
by: Meng, Tao, et al.
Published: (2024)
DSCD: Large Language Model Detoxification with Self-Constrained Decoding
by: Dong, Ming, et al.
Published: (2025)
by: Dong, Ming, et al.
Published: (2025)
Latent-space adversarial training with post-aware calibration for defending large language models against jailbreak attacks
by: Yi, Xin, et al.
Published: (2025)
by: Yi, Xin, et al.
Published: (2025)
DAPI: Domain Adaptive Toxicity Probe Vector Intervention for Fine-Grained Detoxification
by: Hyeonsu, Cho, et al.
Published: (2025)
by: Hyeonsu, Cho, et al.
Published: (2025)
UniDetox: Universal Detoxification of Large Language Models via Dataset Distillation
by: Lu, Huimin, et al.
Published: (2025)
by: Lu, Huimin, et al.
Published: (2025)
UPLex: Fine-Grained Personality Control in Large Language Models via Unsupervised Lexical Modulation
by: Li, Tianlong, et al.
Published: (2023)
by: Li, Tianlong, et al.
Published: (2023)
AutoMedEval: Harnessing Language Models for Automatic Medical Capability Evaluation
by: Zhang, Xiechi, et al.
Published: (2025)
by: Zhang, Xiechi, et al.
Published: (2025)
LLMRefine: Pinpointing and Refining Large Language Models via Fine-Grained Actionable Feedback
by: Xu, Wenda, et al.
Published: (2023)
by: Xu, Wenda, et al.
Published: (2023)
How Do Humans Write Code? Large Models Do It the Same Way Too
by: Li, Long, et al.
Published: (2024)
by: Li, Long, et al.
Published: (2024)
The First Few Tokens Are All You Need: An Efficient and Effective Unsupervised Prefix Fine-Tuning Method for Reasoning Models
by: Ji, Ke, et al.
Published: (2025)
by: Ji, Ke, et al.
Published: (2025)
PrefixMemory-Tuning: Modernizing Prefix-Tuning by Decoupling the Prefix from Attention
by: Wang, Haonan, et al.
Published: (2025)
by: Wang, Haonan, et al.
Published: (2025)
Unveiling Large Language Models Generated Texts: A Multi-Level Fine-Grained Detection Framework
by: Tao, Zhen, et al.
Published: (2024)
by: Tao, Zhen, et al.
Published: (2024)
TaleFrame: An Interactive Story Generation System with Fine-Grained Control and Large Language Models
by: Wang, Yunchao, et al.
Published: (2025)
by: Wang, Yunchao, et al.
Published: (2025)
CliMedBench: A Large-Scale Chinese Benchmark for Evaluating Medical Large Language Models in Clinical Scenarios
by: Ouyang, Zetian, et al.
Published: (2024)
by: Ouyang, Zetian, et al.
Published: (2024)
Verifiable Generation with Subsentence-Level Fine-Grained Citations
by: Cao, Shuyang, et al.
Published: (2024)
by: Cao, Shuyang, et al.
Published: (2024)
Analyzing Bias in False Refusal Behavior of Large Language Models for Hate Speech Detoxification
by: Im, Kyuri, et al.
Published: (2026)
by: Im, Kyuri, et al.
Published: (2026)
SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models
by: Lai, Peichao, et al.
Published: (2025)
by: Lai, Peichao, et al.
Published: (2025)
CausalDetox: Causal Head Selection and Intervention for Language Model Detoxification
by: Wang, Yian, et al.
Published: (2026)
by: Wang, Yian, et al.
Published: (2026)
Neuron-Level Sequential Editing for Large Language Models
by: Jiang, Houcheng, et al.
Published: (2024)
by: Jiang, Houcheng, et al.
Published: (2024)
MEUV: Achieving Fine-Grained Capability Activation in Large Language Models via Mutually Exclusive Unlock Vectors
by: Tong, Xin, et al.
Published: (2025)
by: Tong, Xin, et al.
Published: (2025)
Unleashing Implicit Rewards: Prefix-Value Learning for Distribution-Level Optimization
by: Gao, Shiping, et al.
Published: (2026)
by: Gao, Shiping, et al.
Published: (2026)
On the Robustness of Knowledge Editing for Detoxification
by: Dong, Ming, et al.
Published: (2026)
by: Dong, Ming, et al.
Published: (2026)
Detoxification of Large Language Models through Output-layer Fusion with a Calibration Model
by: Tian, Yuanhe, et al.
Published: (2025)
by: Tian, Yuanhe, et al.
Published: (2025)
Breaking Bad Molecules: Are MLLMs Ready for Structure-Level Molecular Detoxification?
by: Lin, Fei, et al.
Published: (2025)
by: Lin, Fei, et al.
Published: (2025)
ACE-$M^3$: Automatic Capability Evaluator for Multimodal Medical Models
by: Zhang, Xiechi, et al.
Published: (2024)
by: Zhang, Xiechi, et al.
Published: (2024)
Fine-Grained Evaluation of Large Vision-Language Models in Autonomous Driving
by: Li, Yue, et al.
Published: (2025)
by: Li, Yue, et al.
Published: (2025)
SentGuard: Sentence-Level Streaming Guardrails for Large Language Models
by: Yu, Jiaqi, et al.
Published: (2026)
by: Yu, Jiaqi, et al.
Published: (2026)
Cleansing the Artificial Mind: A Self-Reflective Detoxification Framework for Large Language Models
by: Zhang, Kaituo, et al.
Published: (2026)
by: Zhang, Kaituo, et al.
Published: (2026)
Revealing Fine-Grained Values and Opinions in Large Language Models
by: Wright, Dustin, et al.
Published: (2024)
by: Wright, Dustin, et al.
Published: (2024)
From Construction to Injection: Edit-Based Fingerprints for Large Language Models
by: Li, Yue, et al.
Published: (2025)
by: Li, Yue, et al.
Published: (2025)
Blending Supervised and Reinforcement Fine-Tuning with Prefix Sampling
by: Huang, Zeyu, et al.
Published: (2025)
by: Huang, Zeyu, et al.
Published: (2025)
ylmmcl at Multilingual Text Detoxification 2025: Lexicon-Guided Detoxification and Classifier-Gated Rewriting
by: Lai-Lopez, Nicole, et al.
Published: (2025)
by: Lai-Lopez, Nicole, et al.
Published: (2025)
Similar Items
-
NLSR: Neuron-Level Safety Realignment of Large Language Models Against Harmful Fine-Tuning
by: Yi, Xin, et al.
Published: (2024) -
Unified Defense for Large Language Models against Jailbreak and Fine-Tuning Attacks in Education
by: Yi, Xin, et al.
Published: (2025) -
A safety realignment framework via subspace-oriented model fusion for large language models
by: Yi, Xin, et al.
Published: (2024) -
SGM: Safety Glasses for Multimodal Large Language Models via Neuron-Level Detoxification
by: Wang, Hongbo, et al.
Published: (2025) -
PrefixQuant: Eliminating Outliers by Prefixed Tokens for Large Language Models Quantization
by: Chen, Mengzhao, et al.
Published: (2024)