Blind Refusal: Language Models Refuse to Help Users Evade Unjust, Absurd, and Illegitimate Rules
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Pattison, Cameron, Manuali, Lorenzo, Lazar, Seth |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
From Refusal Tokens to Refusal Control: Discovering and Steering Category-Specific Refusal Directions
von: Alagharu, Rishab, et al.
Veröffentlicht: (2026)
von: Alagharu, Rishab, et al.
Veröffentlicht: (2026)
RefusalBench: Generative Evaluation of Selective Refusal in Grounded Language Models
von: Muhamed, Aashiq, et al.
Veröffentlicht: (2025)
von: Muhamed, Aashiq, et al.
Veröffentlicht: (2025)
Can LLMs advance democratic values?
von: Lazar, Seth, et al.
Veröffentlicht: (2024)
von: Lazar, Seth, et al.
Veröffentlicht: (2024)
LatentRefusal: Latent-Signal Refusal for Unanswerable Text-to-SQL Queries
von: Ren, Xuancheng, et al.
Veröffentlicht: (2026)
von: Ren, Xuancheng, et al.
Veröffentlicht: (2026)
Latent-space Attacks for Refusal Evasion in Language Models
von: Piras, Giorgio, et al.
Veröffentlicht: (2026)
von: Piras, Giorgio, et al.
Veröffentlicht: (2026)
ICCU: In-Context Continual Unlearning via Pattern-Induced Refusal Rules
von: Pan, Ruihao, et al.
Veröffentlicht: (2026)
von: Pan, Ruihao, et al.
Veröffentlicht: (2026)
Learn to Refuse: Making Large Language Models More Controllable and Reliable through Knowledge Scope Limitation and Refusal Mechanism
von: Cao, Lang
Veröffentlicht: (2023)
von: Cao, Lang
Veröffentlicht: (2023)
Measuring and Eliminating Refusals in Military Large Language Models
von: FitzGerald, Jack, et al.
Veröffentlicht: (2026)
von: FitzGerald, Jack, et al.
Veröffentlicht: (2026)
Linearly Decoding Refused Knowledge in Aligned Language Models
von: Shrivastava, Aryan, et al.
Veröffentlicht: (2025)
von: Shrivastava, Aryan, et al.
Veröffentlicht: (2025)
OR-Bench: An Over-Refusal Benchmark for Large Language Models
von: Cui, Justin, et al.
Veröffentlicht: (2024)
von: Cui, Justin, et al.
Veröffentlicht: (2024)
Refusal Before Decoding: Detecting and Exploiting Refusal Signals in Intermediate LLM Activations
von: Collu, Matteo Gioele, et al.
Veröffentlicht: (2026)
von: Collu, Matteo Gioele, et al.
Veröffentlicht: (2026)
RefusalBench: Why Refusal Rate Misranks Frontier LLMs on Biological Research Prompts
von: Weidener, Lukas, et al.
Veröffentlicht: (2026)
von: Weidener, Lukas, et al.
Veröffentlicht: (2026)
Think Before Refusal : Triggering Safety Reflection in LLMs to Mitigate False Refusal Behavior
von: Si, Shengyun, et al.
Veröffentlicht: (2025)
von: Si, Shengyun, et al.
Veröffentlicht: (2025)
Refusal Steering: Fine-grained Control over LLM Refusal Behaviour for Sensitive Topics
von: García-Ferrero, Iker, et al.
Veröffentlicht: (2025)
von: García-Ferrero, Iker, et al.
Veröffentlicht: (2025)
SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal
von: Xie, Tinghao, et al.
Veröffentlicht: (2024)
von: Xie, Tinghao, et al.
Veröffentlicht: (2024)
Beyond Compliance: How AI Could Help Creative Writers by Refusing Them
von: Qin, Hua Xuan, et al.
Veröffentlicht: (2026)
von: Qin, Hua Xuan, et al.
Veröffentlicht: (2026)
Step-Wise Refusal Dynamics in Autoregressive and Diffusion Language Models
von: Rahimi, Eliron, et al.
Veröffentlicht: (2026)
von: Rahimi, Eliron, et al.
Veröffentlicht: (2026)
Refusal in Language Models Is Mediated by a Single Direction
von: Arditi, Andy, et al.
Veröffentlicht: (2024)
von: Arditi, Andy, et al.
Veröffentlicht: (2024)
RepIt: Steering Language Models with Concept-Specific Refusal Vectors
von: Siu, Vincent, et al.
Veröffentlicht: (2025)
von: Siu, Vincent, et al.
Veröffentlicht: (2025)
Refusal Behavior in Large Language Models: A Nonlinear Perspective
von: Hildebrandt, Fabian, et al.
Veröffentlicht: (2025)
von: Hildebrandt, Fabian, et al.
Veröffentlicht: (2025)
Refuse Whenever You Feel Unsafe: Improving Safety in LLMs via Decoupled Refusal Training
von: Yuan, Youliang, et al.
Veröffentlicht: (2024)
von: Yuan, Youliang, et al.
Veröffentlicht: (2024)
Can LLMs Refuse Questions They Do Not Know? Measuring Knowledge-Aware Refusal in Factual Tasks
von: Pan, Wenbo, et al.
Veröffentlicht: (2025)
von: Pan, Wenbo, et al.
Veröffentlicht: (2025)
Where Do Reasoning Models Refuse?
von: Yamaguchi, Kureha, et al.
Veröffentlicht: (2025)
von: Yamaguchi, Kureha, et al.
Veröffentlicht: (2025)
Tracing the Dynamics of Refusal: Exploiting Latent Refusal Trajectories for Robust Jailbreak Detection
von: Hu, Xulin, et al.
Veröffentlicht: (2026)
von: Hu, Xulin, et al.
Veröffentlicht: (2026)
Frontier AI Ethics: Anticipating and Evaluating the Societal Impacts of Language Model Agents
von: Lazar, Seth
Veröffentlicht: (2024)
von: Lazar, Seth
Veröffentlicht: (2024)
Cannot or Should Not? Automatic Analysis of Refusal Composition in IFT/RLHF Datasets and Refusal Behavior of Black-Box LLMs
von: von Recum, Alexander, et al.
Veröffentlicht: (2024)
von: von Recum, Alexander, et al.
Veröffentlicht: (2024)
State-Dependent Refusal and Learned Incapacity in RLHF-Aligned Language Models
von: Lee, TK
Veröffentlicht: (2025)
von: Lee, TK
Veröffentlicht: (2025)
Distinguishable Deletion: Unifying Knowledge Erasure and Refusal for Large Language Model Unlearning
von: Yang, Puning, et al.
Veröffentlicht: (2026)
von: Yang, Puning, et al.
Veröffentlicht: (2026)
Answer, Refuse, or Guess? Investigating Risk-Aware Decision Making in Language Models
von: Wu, Cheng-Kuang, et al.
Veröffentlicht: (2025)
von: Wu, Cheng-Kuang, et al.
Veröffentlicht: (2025)
The Geometry of Refusal in Large Language Models: Concept Cones and Representational Independence
von: Wollschläger, Tom, et al.
Veröffentlicht: (2025)
von: Wollschläger, Tom, et al.
Veröffentlicht: (2025)
The Refusal--Compliance Tradeoff: A Large-Scale Safety Behavior Audit of Large Language Models
von: Hasan, Alif Al, et al.
Veröffentlicht: (2026)
von: Hasan, Alif Al, et al.
Veröffentlicht: (2026)
Programming Refusal with Conditional Activation Steering
von: Lee, Bruce W., et al.
Veröffentlicht: (2024)
von: Lee, Bruce W., et al.
Veröffentlicht: (2024)
A Behavioral Fingerprint for Large Language Models: Provenance Tracking via Refusal Vectors
von: Xu, Zhenyu, et al.
Veröffentlicht: (2026)
von: Xu, Zhenyu, et al.
Veröffentlicht: (2026)
Beyond I'm Sorry, I Can't: Dissecting Large Language Model Refusal
von: Prakash, Nirmalendu, et al.
Veröffentlicht: (2025)
von: Prakash, Nirmalendu, et al.
Veröffentlicht: (2025)
SOM Directions are Better than One: Multi-Directional Refusal Suppression in Language Models
von: Piras, Giorgio, et al.
Veröffentlicht: (2025)
von: Piras, Giorgio, et al.
Veröffentlicht: (2025)
Refusing Safe Prompts for Multi-modal Large Language Models
von: Shao, Zedian, et al.
Veröffentlicht: (2024)
von: Shao, Zedian, et al.
Veröffentlicht: (2024)
A Content-Based Framework for Cybersecurity Refusal Decisions in Large Language Models
von: Linder, Noa, et al.
Veröffentlicht: (2026)
von: Linder, Noa, et al.
Veröffentlicht: (2026)
Deactivating Refusal Triggers: Understanding and Mitigating Overrefusal in Safety Alignment
von: Xue, Zhiyu, et al.
Veröffentlicht: (2026)
von: Xue, Zhiyu, et al.
Veröffentlicht: (2026)
Refusal as Silence: Gendered Disparities in Vision-Language Model Responses
von: Luo, Sha, et al.
Veröffentlicht: (2024)
von: Luo, Sha, et al.
Veröffentlicht: (2024)
Efficient Refusal Ablation in LLM through Optimal Transport
von: Nanfack, Geraldin, et al.
Veröffentlicht: (2026)
von: Nanfack, Geraldin, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
From Refusal Tokens to Refusal Control: Discovering and Steering Category-Specific Refusal Directions
von: Alagharu, Rishab, et al.
Veröffentlicht: (2026) -
RefusalBench: Generative Evaluation of Selective Refusal in Grounded Language Models
von: Muhamed, Aashiq, et al.
Veröffentlicht: (2025) -
Can LLMs advance democratic values?
von: Lazar, Seth, et al.
Veröffentlicht: (2024) -
LatentRefusal: Latent-Signal Refusal for Unanswerable Text-to-SQL Queries
von: Ren, Xuancheng, et al.
Veröffentlicht: (2026) -
Latent-space Attacks for Refusal Evasion in Language Models
von: Piras, Giorgio, et al.
Veröffentlicht: (2026)