The Refusal--Compliance Tradeoff: A Large-Scale Safety Behavior Audit of Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Hasan, Alif Al, Biswas, Sumon |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
What Breaks When LLMs Code? Characterizing Operational Safety Failures of Agentic Code Assistants
by: Hasan, Alif Al, et al.
Published: (2026)
by: Hasan, Alif Al, et al.
Published: (2026)
Refusal Behavior in Large Language Models: A Nonlinear Perspective
by: Hildebrandt, Fabian, et al.
Published: (2025)
by: Hildebrandt, Fabian, et al.
Published: (2025)
SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal
by: Xie, Tinghao, et al.
Published: (2024)
by: Xie, Tinghao, et al.
Published: (2024)
Political Alignment in Large Language Models: A Multidimensional Audit of Psychometric Identity and Behavioral Bias
by: Sakhawat, Adib, et al.
Published: (2026)
by: Sakhawat, Adib, et al.
Published: (2026)
A Behavioral Fingerprint for Large Language Models: Provenance Tracking via Refusal Vectors
by: Xu, Zhenyu, et al.
Published: (2026)
by: Xu, Zhenyu, et al.
Published: (2026)
Towards Automated Regulatory Compliance Verification in Financial Auditing with Large Language Models
by: Berger, Armin, et al.
Published: (2025)
by: Berger, Armin, et al.
Published: (2025)
Enhancing Construction Site Safety: A Lightweight Convolutional Network for Effective Helmet Detection
by: Alif, Mujadded Al Rabbani
Published: (2024)
by: Alif, Mujadded Al Rabbani
Published: (2024)
Unforgotten Safety: Preserving Safety Alignment of Large Language Models with Continual Learning
by: Alssum, Lama, et al.
Published: (2025)
by: Alssum, Lama, et al.
Published: (2025)
Measuring and Eliminating Refusals in Military Large Language Models
by: FitzGerald, Jack, et al.
Published: (2026)
by: FitzGerald, Jack, et al.
Published: (2026)
OR-Bench: An Over-Refusal Benchmark for Large Language Models
by: Cui, Justin, et al.
Published: (2024)
by: Cui, Justin, et al.
Published: (2024)
Think Before Refusal : Triggering Safety Reflection in LLMs to Mitigate False Refusal Behavior
by: Si, Shengyun, et al.
Published: (2025)
by: Si, Shengyun, et al.
Published: (2025)
AuditLLM: A Tool for Auditing Large Language Models Using Multiprobe Approach
by: Amirizaniani, Maryam, et al.
Published: (2024)
by: Amirizaniani, Maryam, et al.
Published: (2024)
Learn to Refuse: Making Large Language Models More Controllable and Reliable through Knowledge Scope Limitation and Refusal Mechanism
by: Cao, Lang
Published: (2023)
by: Cao, Lang
Published: (2023)
Distinguishable Deletion: Unifying Knowledge Erasure and Refusal for Large Language Model Unlearning
by: Yang, Puning, et al.
Published: (2026)
by: Yang, Puning, et al.
Published: (2026)
Privacy Auditing of Large Language Models
by: Panda, Ashwinee, et al.
Published: (2025)
by: Panda, Ashwinee, et al.
Published: (2025)
TRUST: A Decentralized Framework for Auditing Large Language Model Reasoning
by: Huang, Morris Yu-Chao, et al.
Published: (2025)
by: Huang, Morris Yu-Chao, et al.
Published: (2025)
Rule Encoding and Compliance in Large Language Models: An Information-Theoretic Analysis
by: Diederich, Joachim
Published: (2025)
by: Diederich, Joachim
Published: (2025)
AuditWen:An Open-Source Large Language Model for Audit
by: Huang, Jiajia, et al.
Published: (2024)
by: Huang, Jiajia, et al.
Published: (2024)
The Geometry of Refusal in Large Language Models: Concept Cones and Representational Independence
by: Wollschläger, Tom, et al.
Published: (2025)
by: Wollschläger, Tom, et al.
Published: (2025)
A Content-Based Framework for Cybersecurity Refusal Decisions in Large Language Models
by: Linder, Noa, et al.
Published: (2026)
by: Linder, Noa, et al.
Published: (2026)
Beyond I'm Sorry, I Can't: Dissecting Large Language Model Refusal
by: Prakash, Nirmalendu, et al.
Published: (2025)
by: Prakash, Nirmalendu, et al.
Published: (2025)
Compliance versus Sensibility: On the Reasoning Controllability in Large Language Models
by: Tan, Xingwei, et al.
Published: (2026)
by: Tan, Xingwei, et al.
Published: (2026)
Attribution-Driven Explainable Intrusion Detection with Encoder-Based Large Language Models
by: Biswas, Umesh, et al.
Published: (2026)
by: Biswas, Umesh, et al.
Published: (2026)
Enhancing Legal Compliance and Regulation Analysis with Large Language Models
by: Hassani, Shabnam
Published: (2024)
by: Hassani, Shabnam
Published: (2024)
CALM: Curiosity-Driven Auditing for Large Language Models
by: Zheng, Xiang, et al.
Published: (2025)
by: Zheng, Xiang, et al.
Published: (2025)
How Independent are Large Language Models? A Statistical Framework for Auditing Behavioral Entanglement and Reweighting Verifier Ensembles
by: Kuai, Chenchen, et al.
Published: (2026)
by: Kuai, Chenchen, et al.
Published: (2026)
LLMAuditor: A Framework for Auditing Large Language Models Using Human-in-the-Loop
by: Amirizaniani, Maryam, et al.
Published: (2024)
by: Amirizaniani, Maryam, et al.
Published: (2024)
How Propense Are Large Language Models at Producing Code Smells? A Benchmarking Study
by: Velasco, Alejandro, et al.
Published: (2024)
by: Velasco, Alejandro, et al.
Published: (2024)
When Safety Blocks Sense: Measuring Semantic Confusion in LLM Refusals
by: Anonto, Riad Ahmed, et al.
Published: (2025)
by: Anonto, Riad Ahmed, et al.
Published: (2025)
Refusing Safe Prompts for Multi-modal Large Language Models
by: Shao, Zedian, et al.
Published: (2024)
by: Shao, Zedian, et al.
Published: (2024)
Embedding with Large Language Models for Classification of HIPAA Safeguard Compliance Rules
by: Rahman, Md Abdur, et al.
Published: (2024)
by: Rahman, Md Abdur, et al.
Published: (2024)
Legal Compliance Evaluation of Smart Contracts Generated By Large Language Models
by: Wijayakoon, Chanuka, et al.
Published: (2025)
by: Wijayakoon, Chanuka, et al.
Published: (2025)
Explicit Cognitive Allocation: A Principle for Governed and Auditable Inference in Large Language Models
by: Manzanilla-Granados, Héctor Manuel, et al.
Published: (2026)
by: Manzanilla-Granados, Héctor Manuel, et al.
Published: (2026)
Brain Surgery: Ensuring GDPR Compliance in Large Language Models via Concept Erasure
by: Laurelli, Michele
Published: (2024)
by: Laurelli, Michele
Published: (2024)
Output Scouting: Auditing Large Language Models for Catastrophic Responses
by: Bell, Andrew, et al.
Published: (2024)
by: Bell, Andrew, et al.
Published: (2024)
Large Language Model-Driven Code Compliance Checking in Building Information Modeling
by: Madireddy, Soumya, et al.
Published: (2025)
by: Madireddy, Soumya, et al.
Published: (2025)
Blind Refusal: Language Models Refuse to Help Users Evade Unjust, Absurd, and Illegitimate Rules
by: Pattison, Cameron, et al.
Published: (2026)
by: Pattison, Cameron, et al.
Published: (2026)
Operationalizing Pluralistic Values in Large Language Model Alignment Reveals Trade-offs in Safety, Inclusivity, and Model Behavior
by: Ali, Dalia, et al.
Published: (2025)
by: Ali, Dalia, et al.
Published: (2025)
PRISM: A Methodology for Auditing Biases in Large Language Models
by: Azzopardi, Leif, et al.
Published: (2024)
by: Azzopardi, Leif, et al.
Published: (2024)
Auditing Pay-Per-Token in Large Language Models
by: Velasco, Ander Artola, et al.
Published: (2025)
by: Velasco, Ander Artola, et al.
Published: (2025)
Similar Items
-
What Breaks When LLMs Code? Characterizing Operational Safety Failures of Agentic Code Assistants
by: Hasan, Alif Al, et al.
Published: (2026) -
Refusal Behavior in Large Language Models: A Nonlinear Perspective
by: Hildebrandt, Fabian, et al.
Published: (2025) -
SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal
by: Xie, Tinghao, et al.
Published: (2024) -
Political Alignment in Large Language Models: A Multidimensional Audit of Psychometric Identity and Behavioral Bias
by: Sakhawat, Adib, et al.
Published: (2026) -
A Behavioral Fingerprint for Large Language Models: Provenance Tracking via Refusal Vectors
by: Xu, Zhenyu, et al.
Published: (2026)