From Refusal Tokens to Refusal Control: Discovering and Steering Category-Specific Refusal Directions
Fuente:
arXiv
Guardado en:
| Autores principales: | Alagharu, Rishab, Singh, Ishneet Sukhvinder, Shamsudeen, Shaibi, Wu, Zhen, Panda, Ashwinee |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Refusal Steering: Fine-grained Control over LLM Refusal Behaviour for Sensitive Topics
por: García-Ferrero, Iker, et al.
Publicado: (2025)
por: García-Ferrero, Iker, et al.
Publicado: (2025)
RepIt: Steering Language Models with Concept-Specific Refusal Vectors
por: Siu, Vincent, et al.
Publicado: (2025)
por: Siu, Vincent, et al.
Publicado: (2025)
Programming Refusal with Conditional Activation Steering
por: Lee, Bruce W., et al.
Publicado: (2024)
por: Lee, Bruce W., et al.
Publicado: (2024)
LatentRefusal: Latent-Signal Refusal for Unanswerable Text-to-SQL Queries
por: Ren, Xuancheng, et al.
Publicado: (2026)
por: Ren, Xuancheng, et al.
Publicado: (2026)
Refusal Tokens: A Simple Way to Calibrate Refusals in Large Language Models
por: Jain, Neel, et al.
Publicado: (2024)
por: Jain, Neel, et al.
Publicado: (2024)
Beyond a Single Direction: Chain-of-Thought Disrupts Simple Steering of Refusal
por: Yang, Kia-Jüng, et al.
Publicado: (2026)
por: Yang, Kia-Jüng, et al.
Publicado: (2026)
Refusal Before Decoding: Detecting and Exploiting Refusal Signals in Intermediate LLM Activations
por: Collu, Matteo Gioele, et al.
Publicado: (2026)
por: Collu, Matteo Gioele, et al.
Publicado: (2026)
RefusalBench: Generative Evaluation of Selective Refusal in Grounded Language Models
por: Muhamed, Aashiq, et al.
Publicado: (2025)
por: Muhamed, Aashiq, et al.
Publicado: (2025)
Blind Refusal: Language Models Refuse to Help Users Evade Unjust, Absurd, and Illegitimate Rules
por: Pattison, Cameron, et al.
Publicado: (2026)
por: Pattison, Cameron, et al.
Publicado: (2026)
AlphaSteer: Learning Refusal Steering with Principled Null-Space Constraint
por: Sheng, Leheng, et al.
Publicado: (2025)
por: Sheng, Leheng, et al.
Publicado: (2025)
Feature-Guided SAE Steering for Refusal-Rate Control using Contrasting Prompts
por: Bhargav, Samaksh, et al.
Publicado: (2025)
por: Bhargav, Samaksh, et al.
Publicado: (2025)
LatentGuard: Controllable Latent Steering for Robust Refusal of Attacks and Reliable Response Generation
por: Shu, Huizhen, et al.
Publicado: (2025)
por: Shu, Huizhen, et al.
Publicado: (2025)
RefusalBench: Why Refusal Rate Misranks Frontier LLMs on Biological Research Prompts
por: Weidener, Lukas, et al.
Publicado: (2026)
por: Weidener, Lukas, et al.
Publicado: (2026)
Think Before Refusal : Triggering Safety Reflection in LLMs to Mitigate False Refusal Behavior
por: Si, Shengyun, et al.
Publicado: (2025)
por: Si, Shengyun, et al.
Publicado: (2025)
Refuse Whenever You Feel Unsafe: Improving Safety in LLMs via Decoupled Refusal Training
por: Yuan, Youliang, et al.
Publicado: (2024)
por: Yuan, Youliang, et al.
Publicado: (2024)
Can LLMs Refuse Questions They Do Not Know? Measuring Knowledge-Aware Refusal in Factual Tasks
por: Pan, Wenbo, et al.
Publicado: (2025)
por: Pan, Wenbo, et al.
Publicado: (2025)
COSMIC: Generalized Refusal Direction Identification in LLM Activations
por: Siu, Vincent, et al.
Publicado: (2025)
por: Siu, Vincent, et al.
Publicado: (2025)
Tracing the Dynamics of Refusal: Exploiting Latent Refusal Trajectories for Robust Jailbreak Detection
por: Hu, Xulin, et al.
Publicado: (2026)
por: Hu, Xulin, et al.
Publicado: (2026)
What Drives Representation Steering? A Mechanistic Case Study on Steering Refusal
por: Cheng, Stephen, et al.
Publicado: (2026)
por: Cheng, Stephen, et al.
Publicado: (2026)
Learn to Refuse: Making Large Language Models More Controllable and Reliable through Knowledge Scope Limitation and Refusal Mechanism
por: Cao, Lang
Publicado: (2023)
por: Cao, Lang
Publicado: (2023)
Steering to Say No: Configurable Refusal via Activation Steering in Vision Language Models
por: Yang, Jiaxi, et al.
Publicado: (2026)
por: Yang, Jiaxi, et al.
Publicado: (2026)
Refusal in Language Models Is Mediated by a Single Direction
por: Arditi, Andy, et al.
Publicado: (2024)
por: Arditi, Andy, et al.
Publicado: (2024)
From Refusal to Recovery: A Control-Theoretic Approach to Generative AI Guardrails
por: Pandya, Ravi, et al.
Publicado: (2025)
por: Pandya, Ravi, et al.
Publicado: (2025)
Cannot or Should Not? Automatic Analysis of Refusal Composition in IFT/RLHF Datasets and Refusal Behavior of Black-Box LLMs
por: von Recum, Alexander, et al.
Publicado: (2024)
por: von Recum, Alexander, et al.
Publicado: (2024)
Where Do Reasoning Models Refuse?
por: Yamaguchi, Kureha, et al.
Publicado: (2025)
por: Yamaguchi, Kureha, et al.
Publicado: (2025)
On the Failure of Topic-Matched Contrast Baselines in Multi-Directional Refusal Abliteration
por: Petrov, Valentin
Publicado: (2026)
por: Petrov, Valentin
Publicado: (2026)
Latent-space Attacks for Refusal Evasion in Language Models
por: Piras, Giorgio, et al.
Publicado: (2026)
por: Piras, Giorgio, et al.
Publicado: (2026)
Furina: Fragmented Uncertainty-Driven Refusal Instability Attack
por: Wu, Tongxi, et al.
Publicado: (2026)
por: Wu, Tongxi, et al.
Publicado: (2026)
SOM Directions are Better than One: Multi-Directional Refusal Suppression in Language Models
por: Piras, Giorgio, et al.
Publicado: (2025)
por: Piras, Giorgio, et al.
Publicado: (2025)
Efficient Refusal Ablation in LLM through Optimal Transport
por: Nanfack, Geraldin, et al.
Publicado: (2026)
por: Nanfack, Geraldin, et al.
Publicado: (2026)
Measuring and Eliminating Refusals in Military Large Language Models
por: FitzGerald, Jack, et al.
Publicado: (2026)
por: FitzGerald, Jack, et al.
Publicado: (2026)
Linearly Decoding Refused Knowledge in Aligned Language Models
por: Shrivastava, Aryan, et al.
Publicado: (2025)
por: Shrivastava, Aryan, et al.
Publicado: (2025)
OR-Bench: An Over-Refusal Benchmark for Large Language Models
por: Cui, Justin, et al.
Publicado: (2024)
por: Cui, Justin, et al.
Publicado: (2024)
Learning to Refuse: Towards Mitigating Privacy Risks in LLMs
por: Liu, Zhenhua, et al.
Publicado: (2024)
por: Liu, Zhenhua, et al.
Publicado: (2024)
Deactivating Refusal Triggers: Understanding and Mitigating Overrefusal in Safety Alignment
por: Xue, Zhiyu, et al.
Publicado: (2026)
por: Xue, Zhiyu, et al.
Publicado: (2026)
Does Refusal Training in LLMs Generalize to the Past Tense?
por: Andriushchenko, Maksym, et al.
Publicado: (2024)
por: Andriushchenko, Maksym, et al.
Publicado: (2024)
Step-Wise Refusal Dynamics in Autoregressive and Diffusion Language Models
por: Rahimi, Eliron, et al.
Publicado: (2026)
por: Rahimi, Eliron, et al.
Publicado: (2026)
ICCU: In-Context Continual Unlearning via Pattern-Induced Refusal Rules
por: Pan, Ruihao, et al.
Publicado: (2026)
por: Pan, Ruihao, et al.
Publicado: (2026)
Beyond No: Quantifying AI Over-Refusal and Emotional Attachment Boundaries
por: Noever, David, et al.
Publicado: (2025)
por: Noever, David, et al.
Publicado: (2025)
Refusal Behavior in Large Language Models: A Nonlinear Perspective
por: Hildebrandt, Fabian, et al.
Publicado: (2025)
por: Hildebrandt, Fabian, et al.
Publicado: (2025)
Ejemplares similares
-
Refusal Steering: Fine-grained Control over LLM Refusal Behaviour for Sensitive Topics
por: García-Ferrero, Iker, et al.
Publicado: (2025) -
RepIt: Steering Language Models with Concept-Specific Refusal Vectors
por: Siu, Vincent, et al.
Publicado: (2025) -
Programming Refusal with Conditional Activation Steering
por: Lee, Bruce W., et al.
Publicado: (2024) -
LatentRefusal: Latent-Signal Refusal for Unanswerable Text-to-SQL Queries
por: Ren, Xuancheng, et al.
Publicado: (2026) -
Refusal Tokens: A Simple Way to Calibrate Refusals in Large Language Models
por: Jain, Neel, et al.
Publicado: (2024)