Role-Conditioned Refusals: Evaluating Access Control Reasoning in Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Klisura, Đorđe, Khoury, Joseph, Kundu, Ashish, Krishnan, Ram, Rios, Anthony |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Unmasking Database Vulnerabilities: Zero-Knowledge Schema Inference Attacks in Text-to-SQL Systems
by: Klisura, Đorđe, et al.
Published: (2024)
by: Klisura, Đorđe, et al.
Published: (2024)
A Multi-Agent Framework for Mitigating Dialect Biases in Privacy Policy Question-Answering Systems
by: Klisura, Đorđe, et al.
Published: (2025)
by: Klisura, Đorđe, et al.
Published: (2025)
STU-PID: Steering Token Usage via PID Controller for Efficient Large Language Model Reasoning
by: Bharadwaj, Aryasomayajula Ram
Published: (2025)
by: Bharadwaj, Aryasomayajula Ram
Published: (2025)
Refusal Tokens: A Simple Way to Calibrate Refusals in Large Language Models
by: Jain, Neel, et al.
Published: (2024)
by: Jain, Neel, et al.
Published: (2024)
Measuring and Eliminating Refusals in Military Large Language Models
by: FitzGerald, Jack, et al.
Published: (2026)
by: FitzGerald, Jack, et al.
Published: (2026)
Characterizing Selective Refusal Bias in Large Language Models
by: Khorramrouz, Adel, et al.
Published: (2025)
by: Khorramrouz, Adel, et al.
Published: (2025)
Learn to Refuse: Making Large Language Models More Controllable and Reliable through Knowledge Scope Limitation and Refusal Mechanism
by: Cao, Lang
Published: (2023)
by: Cao, Lang
Published: (2023)
RefusalBench: Generative Evaluation of Selective Refusal in Grounded Language Models
by: Muhamed, Aashiq, et al.
Published: (2025)
by: Muhamed, Aashiq, et al.
Published: (2025)
Evaluating the Ability of Large Language Models to Reason about Cardinal Directions
by: Cohn, Anthony G, et al.
Published: (2024)
by: Cohn, Anthony G, et al.
Published: (2024)
Evaluating the Ability of Large Language Models to Reason about Cardinal Directions, Revisited
by: Cohn, Anthony G, et al.
Published: (2025)
by: Cohn, Anthony G, et al.
Published: (2025)
Benchmarking Large Language Models for Quebec Insurance: From Closed-Book to Retrieval-Augmented Generation
by: Beauchemin, David, et al.
Published: (2026)
by: Beauchemin, David, et al.
Published: (2026)
OR-Bench: An Over-Refusal Benchmark for Large Language Models
by: Cui, Justin, et al.
Published: (2024)
by: Cui, Justin, et al.
Published: (2024)
There Is More to Refusal in Large Language Models than a Single Direction
by: Joad, Faaiz, et al.
Published: (2026)
by: Joad, Faaiz, et al.
Published: (2026)
Activation-Space Anchored Access Control for Multi-Class Permission Reasoning in Large Language Models
by: Zhang, Zhaopeng, et al.
Published: (2026)
by: Zhang, Zhaopeng, et al.
Published: (2026)
MATHSENSEI: A Tool-Augmented Large Language Model for Mathematical Reasoning
by: Das, Debrup, et al.
Published: (2024)
by: Das, Debrup, et al.
Published: (2024)
Automatic Pseudo-Harmful Prompt Generation for Evaluating False Refusals in Large Language Models
by: An, Bang, et al.
Published: (2024)
by: An, Bang, et al.
Published: (2024)
Evaluation of Deontic Conditional Reasoning in Large Language Models: The Case of Wason's Selection Task
by: Abe, Hirohiko, et al.
Published: (2026)
by: Abe, Hirohiko, et al.
Published: (2026)
Refusal Behavior in Large Language Models: A Nonlinear Perspective
by: Hildebrandt, Fabian, et al.
Published: (2025)
by: Hildebrandt, Fabian, et al.
Published: (2025)
Over-Refusal and Representation Subspaces: A Mechanistic Analysis of Task-Conditioned Refusal in Aligned LLMs
by: Maskey, Utsav, et al.
Published: (2026)
by: Maskey, Utsav, et al.
Published: (2026)
Where Do Reasoning Models Refuse?
by: Yamaguchi, Kureha, et al.
Published: (2025)
by: Yamaguchi, Kureha, et al.
Published: (2025)
Understanding Refusal in Language Models with Sparse Autoencoders
by: Yeo, Wei Jie, et al.
Published: (2025)
by: Yeo, Wei Jie, et al.
Published: (2025)
Analyzing Bias in False Refusal Behavior of Large Language Models for Hate Speech Detoxification
by: Im, Kyuri, et al.
Published: (2026)
by: Im, Kyuri, et al.
Published: (2026)
SEAL: Steerable Reasoning Calibration of Large Language Models for Free
by: Chen, Runjin, et al.
Published: (2025)
by: Chen, Runjin, et al.
Published: (2025)
Modeling Motivated Reasoning in Law: Evaluating Strategic Role Conditioning in LLM Summarization
by: Cho, Eunjung, et al.
Published: (2025)
by: Cho, Eunjung, et al.
Published: (2025)
Improving Expert Radiology Report Summarization by Prompting Large Language Models with a Layperson Summary
by: Zhao, Xingmeng, et al.
Published: (2024)
by: Zhao, Xingmeng, et al.
Published: (2024)
Can Large Language Models Reason about the Region Connection Calculus?
by: Cohn, Anthony G, et al.
Published: (2024)
by: Cohn, Anthony G, et al.
Published: (2024)
Are Large Language Models Good Essay Graders?
by: Kundu, Anindita, et al.
Published: (2024)
by: Kundu, Anindita, et al.
Published: (2024)
The Geometry of Refusal in Large Language Models: Concept Cones and Representational Independence
by: Wollschläger, Tom, et al.
Published: (2025)
by: Wollschläger, Tom, et al.
Published: (2025)
Evaluating Counterfactual Strategic Reasoning in Large Language Models
by: Georgousis, Dimitrios, et al.
Published: (2026)
by: Georgousis, Dimitrios, et al.
Published: (2026)
Evaluating Accounting Reasoning Capabilities of Large Language Models
by: Zhou, Jie, et al.
Published: (2026)
by: Zhou, Jie, et al.
Published: (2026)
Can Video LLMs Refuse to Answer? Alignment for Answerability in Video Large Language Models
by: Yoon, Eunseop, et al.
Published: (2025)
by: Yoon, Eunseop, et al.
Published: (2025)
Programming Refusal with Conditional Activation Steering
by: Lee, Bruce W., et al.
Published: (2024)
by: Lee, Bruce W., et al.
Published: (2024)
Role-Aware Language Models for Secure and Contextualized Access Control in Organizations
by: Almheiri, Saeed, et al.
Published: (2025)
by: Almheiri, Saeed, et al.
Published: (2025)
Beyond I'm Sorry, I Can't: Dissecting Large Language Model Refusal
by: Prakash, Nirmalendu, et al.
Published: (2025)
by: Prakash, Nirmalendu, et al.
Published: (2025)
Large Language Models are Algorithmically Blind
by: Venkatesh, Sohan, et al.
Published: (2026)
by: Venkatesh, Sohan, et al.
Published: (2026)
GroundCocoa: A Benchmark for Evaluating Compositional & Conditional Reasoning in Language Models
by: Kohli, Harsh, et al.
Published: (2024)
by: Kohli, Harsh, et al.
Published: (2024)
Trusted Uncertainty in Large Language Models: A Unified Framework for Confidence Calibration and Risk-Controlled Refusal
by: Oehri, Markus, et al.
Published: (2025)
by: Oehri, Markus, et al.
Published: (2025)
ETM: Modern Insights into Perspective on Text-to-SQL Evaluation in the Age of Large Language Models
by: Ascoli, Benjamin G., et al.
Published: (2024)
by: Ascoli, Benjamin G., et al.
Published: (2024)
Consistency of Large Reasoning Models Under Multi-Turn Attacks
by: Li, Yubo, et al.
Published: (2026)
by: Li, Yubo, et al.
Published: (2026)
RoleEval: A Bilingual Role Evaluation Benchmark for Large Language Models
by: Shen, Tianhao, et al.
Published: (2023)
by: Shen, Tianhao, et al.
Published: (2023)
Similar Items
-
Unmasking Database Vulnerabilities: Zero-Knowledge Schema Inference Attacks in Text-to-SQL Systems
by: Klisura, Đorđe, et al.
Published: (2024) -
A Multi-Agent Framework for Mitigating Dialect Biases in Privacy Policy Question-Answering Systems
by: Klisura, Đorđe, et al.
Published: (2025) -
STU-PID: Steering Token Usage via PID Controller for Efficient Large Language Model Reasoning
by: Bharadwaj, Aryasomayajula Ram
Published: (2025) -
Refusal Tokens: A Simple Way to Calibrate Refusals in Large Language Models
by: Jain, Neel, et al.
Published: (2024) -
Measuring and Eliminating Refusals in Military Large Language Models
by: FitzGerald, Jack, et al.
Published: (2026)