DESTEIN: Navigating Detoxification of Language Models via Universal Steering Pairs and Head-wise Activation Fusion
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Li, Yu, Jiang, Han, Gong, Chuanyang, Wei, Zhihua |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
CausalDetox: Causal Head Selection and Intervention for Language Model Detoxification
von: Wang, Yian, et al.
Veröffentlicht: (2026)
von: Wang, Yian, et al.
Veröffentlicht: (2026)
Detoxification of Large Language Models through Output-layer Fusion with a Calibration Model
von: Tian, Yuanhe, et al.
Veröffentlicht: (2025)
von: Tian, Yuanhe, et al.
Veröffentlicht: (2025)
Fusion Steering: Prompt-Specific Activation Control
von: Chang, Waldemar, et al.
Veröffentlicht: (2025)
von: Chang, Waldemar, et al.
Veröffentlicht: (2025)
Towards Inference-time Category-wise Safety Steering for Large Language Models
von: Bhattacharjee, Amrita, et al.
Veröffentlicht: (2024)
von: Bhattacharjee, Amrita, et al.
Veröffentlicht: (2024)
Activation Scaling for Steering and Interpreting Language Models
von: Stoehr, Niklas, et al.
Veröffentlicht: (2024)
von: Stoehr, Niklas, et al.
Veröffentlicht: (2024)
Cross-Lingual Activation Steering for Multilingual Language Models
von: Pokharel, Rhitabrat, et al.
Veröffentlicht: (2026)
von: Pokharel, Rhitabrat, et al.
Veröffentlicht: (2026)
Cleansing the Artificial Mind: A Self-Reflective Detoxification Framework for Large Language Models
von: Zhang, Kaituo, et al.
Veröffentlicht: (2026)
von: Zhang, Kaituo, et al.
Veröffentlicht: (2026)
Prompt-Activation Duality: Improving Activation Steering via Attention-Level Interventions
von: Kang, Diancheng, et al.
Veröffentlicht: (2026)
von: Kang, Diancheng, et al.
Veröffentlicht: (2026)
SGM: Safety Glasses for Multimodal Large Language Models via Neuron-Level Detoxification
von: Wang, Hongbo, et al.
Veröffentlicht: (2025)
von: Wang, Hongbo, et al.
Veröffentlicht: (2025)
Raising the Bar: Investigating the Values of Large Language Models via Generative Evolving Testing
von: Jiang, Han, et al.
Veröffentlicht: (2024)
von: Jiang, Han, et al.
Veröffentlicht: (2024)
ASRU: Activation Steering Meets Reinforcement Unlearning for Multimodal Large Language Models
von: Guang, Jiahui, et al.
Veröffentlicht: (2026)
von: Guang, Jiahui, et al.
Veröffentlicht: (2026)
Endogenous Resistance to Activation Steering in Language Models
von: McKenzie, Alex, et al.
Veröffentlicht: (2026)
von: McKenzie, Alex, et al.
Veröffentlicht: (2026)
Breaking Bad Molecules: Are MLLMs Ready for Structure-Level Molecular Detoxification?
von: Lin, Fei, et al.
Veröffentlicht: (2025)
von: Lin, Fei, et al.
Veröffentlicht: (2025)
Word Embeddings Are Steers for Language Models
von: Han, Chi, et al.
Veröffentlicht: (2023)
von: Han, Chi, et al.
Veröffentlicht: (2023)
Steering When Necessary: Flexible Steering Large Language Models with Backtracking
von: Cheng, Zifeng, et al.
Veröffentlicht: (2025)
von: Cheng, Zifeng, et al.
Veröffentlicht: (2025)
Steering Awareness: Detecting Activation Steering from Within
von: Rivera, Joshua Fonseca, et al.
Veröffentlicht: (2025)
von: Rivera, Joshua Fonseca, et al.
Veröffentlicht: (2025)
CogSteer: Cognition-Inspired Selective Layer Intervention for Efficiently Steering Large Language Models
von: Wang, Xintong, et al.
Veröffentlicht: (2024)
von: Wang, Xintong, et al.
Veröffentlicht: (2024)
Mitigating Content Effects on Reasoning in Language Models through Fine-Grained Activation Steering
von: Valentino, Marco, et al.
Veröffentlicht: (2025)
von: Valentino, Marco, et al.
Veröffentlicht: (2025)
DLM-SWAI: Steering Diffusion Language Models Before They Unmask
von: An, Hyeseon, et al.
Veröffentlicht: (2026)
von: An, Hyeseon, et al.
Veröffentlicht: (2026)
Improving Instruction-Following in Language Models through Activation Steering
von: Stolfo, Alessandro, et al.
Veröffentlicht: (2024)
von: Stolfo, Alessandro, et al.
Veröffentlicht: (2024)
BILLY: Steering Large Language Models via Merging Persona Vectors for Creative Generation
von: Pai, Tsung-Min, et al.
Veröffentlicht: (2025)
von: Pai, Tsung-Min, et al.
Veröffentlicht: (2025)
Mechanistic Steering of LLMs Reveals Layer-wise Feature Vulnerabilities in Adversarial Settings
von: Das, Nilanjana, et al.
Veröffentlicht: (2026)
von: Das, Nilanjana, et al.
Veröffentlicht: (2026)
Steering Language Models Before They Speak: Logit-Level Interventions
von: An, Hyeseon, et al.
Veröffentlicht: (2026)
von: An, Hyeseon, et al.
Veröffentlicht: (2026)
Investigating Bias Representations in Llama 2 Chat via Activation Steering
von: Lu, Dawn, et al.
Veröffentlicht: (2024)
von: Lu, Dawn, et al.
Veröffentlicht: (2024)
Self-Steering Language Models
von: Grand, Gabriel, et al.
Veröffentlicht: (2025)
von: Grand, Gabriel, et al.
Veröffentlicht: (2025)
Text Detoxification: Data Efficiency, Semantic Preservation and Model Generalization
von: Yu, Jing, et al.
Veröffentlicht: (2025)
von: Yu, Jing, et al.
Veröffentlicht: (2025)
Multi-property Steering of Large Language Models with Dynamic Activation Composition
von: Scalena, Daniel, et al.
Veröffentlicht: (2024)
von: Scalena, Daniel, et al.
Veröffentlicht: (2024)
Interpretable Steering of Large Language Models with Feature Guided Activation Additions
von: Soo, Samuel, et al.
Veröffentlicht: (2025)
von: Soo, Samuel, et al.
Veröffentlicht: (2025)
ContextFocus: Activation Steering for Contextual Faithfulness in Large Language Models
von: Anand, Nikhil, et al.
Veröffentlicht: (2026)
von: Anand, Nikhil, et al.
Veröffentlicht: (2026)
Layer-wise Regularized Dropout for Neural Language Models
von: Ni, Shiwen, et al.
Veröffentlicht: (2024)
von: Ni, Shiwen, et al.
Veröffentlicht: (2024)
Parameter-Efficient Detoxification with Contrastive Decoding
von: Niu, Tong, et al.
Veröffentlicht: (2024)
von: Niu, Tong, et al.
Veröffentlicht: (2024)
AutoToM: Scaling Model-based Mental Inference via Automated Agent Modeling
von: Zhang, Zhining, et al.
Veröffentlicht: (2025)
von: Zhang, Zhining, et al.
Veröffentlicht: (2025)
HyperSteer: Activation Steering at Scale with Hypernetworks
von: Sun, Jiuding, et al.
Veröffentlicht: (2025)
von: Sun, Jiuding, et al.
Veröffentlicht: (2025)
MultiParaDetox: Extending Text Detoxification with Parallel Data to New Languages
von: Dementieva, Daryna, et al.
Veröffentlicht: (2024)
von: Dementieva, Daryna, et al.
Veröffentlicht: (2024)
Hallucination reduction with CASAL: Contrastive Activation Steering For Amortized Learning
von: Wannan, et al.
Veröffentlicht: (2025)
von: Wannan, et al.
Veröffentlicht: (2025)
SOD: Step-wise On-policy Distillation for Small Language Model Agents
von: Zhong, Qiyong, et al.
Veröffentlicht: (2026)
von: Zhong, Qiyong, et al.
Veröffentlicht: (2026)
Trojan Activation Attack: Red-Teaming Large Language Models using Activation Steering for Safety-Alignment
von: Wang, Haoran, et al.
Veröffentlicht: (2023)
von: Wang, Haoran, et al.
Veröffentlicht: (2023)
On the Limitations of Steering in Language Model Alignment
von: Niranjan, Chebrolu, et al.
Veröffentlicht: (2025)
von: Niranjan, Chebrolu, et al.
Veröffentlicht: (2025)
ThinkPilot: Steering Reasoning Models via Automated Think-prefixes Optimization
von: Li, Sunzhu, et al.
Veröffentlicht: (2025)
von: Li, Sunzhu, et al.
Veröffentlicht: (2025)
Multilingual and Explainable Text Detoxification with Parallel Corpora
von: Dementieva, Daryna, et al.
Veröffentlicht: (2024)
von: Dementieva, Daryna, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
CausalDetox: Causal Head Selection and Intervention for Language Model Detoxification
von: Wang, Yian, et al.
Veröffentlicht: (2026) -
Detoxification of Large Language Models through Output-layer Fusion with a Calibration Model
von: Tian, Yuanhe, et al.
Veröffentlicht: (2025) -
Fusion Steering: Prompt-Specific Activation Control
von: Chang, Waldemar, et al.
Veröffentlicht: (2025) -
Towards Inference-time Category-wise Safety Steering for Large Language Models
von: Bhattacharjee, Amrita, et al.
Veröffentlicht: (2024) -
Activation Scaling for Steering and Interpreting Language Models
von: Stoehr, Niklas, et al.
Veröffentlicht: (2024)