The Refusal--Compliance Tradeoff: A Large-Scale Safety Behavior Audit of Large Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Hasan, Alif Al, Biswas, Sumon |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
What Breaks When LLMs Code? Characterizing Operational Safety Failures of Agentic Code Assistants
por: Hasan, Alif Al, et al.
Publicado: (2026)
por: Hasan, Alif Al, et al.
Publicado: (2026)
Refusal Behavior in Large Language Models: A Nonlinear Perspective
por: Hildebrandt, Fabian, et al.
Publicado: (2025)
por: Hildebrandt, Fabian, et al.
Publicado: (2025)
SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal
por: Xie, Tinghao, et al.
Publicado: (2024)
por: Xie, Tinghao, et al.
Publicado: (2024)
Political Alignment in Large Language Models: A Multidimensional Audit of Psychometric Identity and Behavioral Bias
por: Sakhawat, Adib, et al.
Publicado: (2026)
por: Sakhawat, Adib, et al.
Publicado: (2026)
A Behavioral Fingerprint for Large Language Models: Provenance Tracking via Refusal Vectors
por: Xu, Zhenyu, et al.
Publicado: (2026)
por: Xu, Zhenyu, et al.
Publicado: (2026)
Towards Automated Regulatory Compliance Verification in Financial Auditing with Large Language Models
por: Berger, Armin, et al.
Publicado: (2025)
por: Berger, Armin, et al.
Publicado: (2025)
Enhancing Construction Site Safety: A Lightweight Convolutional Network for Effective Helmet Detection
por: Alif, Mujadded Al Rabbani
Publicado: (2024)
por: Alif, Mujadded Al Rabbani
Publicado: (2024)
Unforgotten Safety: Preserving Safety Alignment of Large Language Models with Continual Learning
por: Alssum, Lama, et al.
Publicado: (2025)
por: Alssum, Lama, et al.
Publicado: (2025)
Measuring and Eliminating Refusals in Military Large Language Models
por: FitzGerald, Jack, et al.
Publicado: (2026)
por: FitzGerald, Jack, et al.
Publicado: (2026)
OR-Bench: An Over-Refusal Benchmark for Large Language Models
por: Cui, Justin, et al.
Publicado: (2024)
por: Cui, Justin, et al.
Publicado: (2024)
Think Before Refusal : Triggering Safety Reflection in LLMs to Mitigate False Refusal Behavior
por: Si, Shengyun, et al.
Publicado: (2025)
por: Si, Shengyun, et al.
Publicado: (2025)
AuditLLM: A Tool for Auditing Large Language Models Using Multiprobe Approach
por: Amirizaniani, Maryam, et al.
Publicado: (2024)
por: Amirizaniani, Maryam, et al.
Publicado: (2024)
Learn to Refuse: Making Large Language Models More Controllable and Reliable through Knowledge Scope Limitation and Refusal Mechanism
por: Cao, Lang
Publicado: (2023)
por: Cao, Lang
Publicado: (2023)
Distinguishable Deletion: Unifying Knowledge Erasure and Refusal for Large Language Model Unlearning
por: Yang, Puning, et al.
Publicado: (2026)
por: Yang, Puning, et al.
Publicado: (2026)
Privacy Auditing of Large Language Models
por: Panda, Ashwinee, et al.
Publicado: (2025)
por: Panda, Ashwinee, et al.
Publicado: (2025)
TRUST: A Decentralized Framework for Auditing Large Language Model Reasoning
por: Huang, Morris Yu-Chao, et al.
Publicado: (2025)
por: Huang, Morris Yu-Chao, et al.
Publicado: (2025)
Rule Encoding and Compliance in Large Language Models: An Information-Theoretic Analysis
por: Diederich, Joachim
Publicado: (2025)
por: Diederich, Joachim
Publicado: (2025)
AuditWen:An Open-Source Large Language Model for Audit
por: Huang, Jiajia, et al.
Publicado: (2024)
por: Huang, Jiajia, et al.
Publicado: (2024)
The Geometry of Refusal in Large Language Models: Concept Cones and Representational Independence
por: Wollschläger, Tom, et al.
Publicado: (2025)
por: Wollschläger, Tom, et al.
Publicado: (2025)
A Content-Based Framework for Cybersecurity Refusal Decisions in Large Language Models
por: Linder, Noa, et al.
Publicado: (2026)
por: Linder, Noa, et al.
Publicado: (2026)
Beyond I'm Sorry, I Can't: Dissecting Large Language Model Refusal
por: Prakash, Nirmalendu, et al.
Publicado: (2025)
por: Prakash, Nirmalendu, et al.
Publicado: (2025)
Compliance versus Sensibility: On the Reasoning Controllability in Large Language Models
por: Tan, Xingwei, et al.
Publicado: (2026)
por: Tan, Xingwei, et al.
Publicado: (2026)
Attribution-Driven Explainable Intrusion Detection with Encoder-Based Large Language Models
por: Biswas, Umesh, et al.
Publicado: (2026)
por: Biswas, Umesh, et al.
Publicado: (2026)
Enhancing Legal Compliance and Regulation Analysis with Large Language Models
por: Hassani, Shabnam
Publicado: (2024)
por: Hassani, Shabnam
Publicado: (2024)
CALM: Curiosity-Driven Auditing for Large Language Models
por: Zheng, Xiang, et al.
Publicado: (2025)
por: Zheng, Xiang, et al.
Publicado: (2025)
How Independent are Large Language Models? A Statistical Framework for Auditing Behavioral Entanglement and Reweighting Verifier Ensembles
por: Kuai, Chenchen, et al.
Publicado: (2026)
por: Kuai, Chenchen, et al.
Publicado: (2026)
LLMAuditor: A Framework for Auditing Large Language Models Using Human-in-the-Loop
por: Amirizaniani, Maryam, et al.
Publicado: (2024)
por: Amirizaniani, Maryam, et al.
Publicado: (2024)
How Propense Are Large Language Models at Producing Code Smells? A Benchmarking Study
por: Velasco, Alejandro, et al.
Publicado: (2024)
por: Velasco, Alejandro, et al.
Publicado: (2024)
When Safety Blocks Sense: Measuring Semantic Confusion in LLM Refusals
por: Anonto, Riad Ahmed, et al.
Publicado: (2025)
por: Anonto, Riad Ahmed, et al.
Publicado: (2025)
Refusing Safe Prompts for Multi-modal Large Language Models
por: Shao, Zedian, et al.
Publicado: (2024)
por: Shao, Zedian, et al.
Publicado: (2024)
Embedding with Large Language Models for Classification of HIPAA Safeguard Compliance Rules
por: Rahman, Md Abdur, et al.
Publicado: (2024)
por: Rahman, Md Abdur, et al.
Publicado: (2024)
Legal Compliance Evaluation of Smart Contracts Generated By Large Language Models
por: Wijayakoon, Chanuka, et al.
Publicado: (2025)
por: Wijayakoon, Chanuka, et al.
Publicado: (2025)
Explicit Cognitive Allocation: A Principle for Governed and Auditable Inference in Large Language Models
por: Manzanilla-Granados, Héctor Manuel, et al.
Publicado: (2026)
por: Manzanilla-Granados, Héctor Manuel, et al.
Publicado: (2026)
Brain Surgery: Ensuring GDPR Compliance in Large Language Models via Concept Erasure
por: Laurelli, Michele
Publicado: (2024)
por: Laurelli, Michele
Publicado: (2024)
Output Scouting: Auditing Large Language Models for Catastrophic Responses
por: Bell, Andrew, et al.
Publicado: (2024)
por: Bell, Andrew, et al.
Publicado: (2024)
Large Language Model-Driven Code Compliance Checking in Building Information Modeling
por: Madireddy, Soumya, et al.
Publicado: (2025)
por: Madireddy, Soumya, et al.
Publicado: (2025)
Blind Refusal: Language Models Refuse to Help Users Evade Unjust, Absurd, and Illegitimate Rules
por: Pattison, Cameron, et al.
Publicado: (2026)
por: Pattison, Cameron, et al.
Publicado: (2026)
Operationalizing Pluralistic Values in Large Language Model Alignment Reveals Trade-offs in Safety, Inclusivity, and Model Behavior
por: Ali, Dalia, et al.
Publicado: (2025)
por: Ali, Dalia, et al.
Publicado: (2025)
PRISM: A Methodology for Auditing Biases in Large Language Models
por: Azzopardi, Leif, et al.
Publicado: (2024)
por: Azzopardi, Leif, et al.
Publicado: (2024)
Auditing Pay-Per-Token in Large Language Models
por: Velasco, Ander Artola, et al.
Publicado: (2025)
por: Velasco, Ander Artola, et al.
Publicado: (2025)
Ejemplares similares
-
What Breaks When LLMs Code? Characterizing Operational Safety Failures of Agentic Code Assistants
por: Hasan, Alif Al, et al.
Publicado: (2026) -
Refusal Behavior in Large Language Models: A Nonlinear Perspective
por: Hildebrandt, Fabian, et al.
Publicado: (2025) -
SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal
por: Xie, Tinghao, et al.
Publicado: (2024) -
Political Alignment in Large Language Models: A Multidimensional Audit of Psychometric Identity and Behavioral Bias
por: Sakhawat, Adib, et al.
Publicado: (2026) -
A Behavioral Fingerprint for Large Language Models: Provenance Tracking via Refusal Vectors
por: Xu, Zhenyu, et al.
Publicado: (2026)