When Prohibitions Become Permissions: Auditing Negation Sensitivity in Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Elkins, Katherine, Chun, Jon |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Syntactic Framing Fragility: An Audit of Robustness in LLM Ethical Decisions
por: Elkins, Katherine, et al.
Publicado: (2025)
por: Elkins, Katherine, et al.
Publicado: (2025)
The Paradox of Robustness: Decoupling Rule-Based Logic from Affective Noise in High-Stakes Decision-Making
por: Chun, Jon, et al.
Publicado: (2026)
por: Chun, Jon, et al.
Publicado: (2026)
Informed AI Regulation: Comparing the Ethical Frameworks of Leading LLM Chatbots Using an Ethics-Based Audit to Assess Moral Reasoning and Normative Values
por: Chun, Jon, et al.
Publicado: (2024)
por: Chun, Jon, et al.
Publicado: (2024)
AgenticSimLaw: A Juvenile Courtroom Multi-Agent Debate Simulation for Explainable High-Stakes Tabular Decision Making
por: Chun, Jon, et al.
Publicado: (2026)
por: Chun, Jon, et al.
Publicado: (2026)
The AI Fiction Paradox
por: Elkins, Katherine
Publicado: (2026)
por: Elkins, Katherine
Publicado: (2026)
Permissive Information-Flow Analysis for Large Language Models
por: Siddiqui, Shoaib Ahmed, et al.
Publicado: (2024)
por: Siddiqui, Shoaib Ahmed, et al.
Publicado: (2024)
Comparative Global AI Regulation: Policy Perspectives from the EU, China, and the US
por: Chun, Jon, et al.
Publicado: (2024)
por: Chun, Jon, et al.
Publicado: (2024)
When Prompt Optimization Becomes Jailbreaking: Adaptive Red-Teaming of Large Language Models
por: Shamsi, Zafir, et al.
Publicado: (2026)
por: Shamsi, Zafir, et al.
Publicado: (2026)
Useful Memories Become Faulty When Continuously Updated by LLMs
por: Zhang, Dylan, et al.
Publicado: (2026)
por: Zhang, Dylan, et al.
Publicado: (2026)
Quantifying Gender Bias in Large Language Models: When ChatGPT Becomes a Hiring Manager
por: Gerszberg, Nina, et al.
Publicado: (2026)
por: Gerszberg, Nina, et al.
Publicado: (2026)
When Emotion Becomes Trigger: Emotion-style dynamic Backdoor Attack Parasitising Large Language Models
por: Liu, Ziyu, et al.
Publicado: (2026)
por: Liu, Ziyu, et al.
Publicado: (2026)
Permissioned LLMs: Enforcing Access Control in Large Language Models
por: Jayaraman, Bargav, et al.
Publicado: (2025)
por: Jayaraman, Bargav, et al.
Publicado: (2025)
When Helpfulness Becomes Sycophancy: Sycophancy is a Boundary Failure Between Social Alignment and Epistemic Integrity in Large Language Models
por: Li, Jiechen, et al.
Publicado: (2026)
por: Li, Jiechen, et al.
Publicado: (2026)
Generative Adversarial Reviews: When LLMs Become the Critic
por: Bougie, Nicolas, et al.
Publicado: (2024)
por: Bougie, Nicolas, et al.
Publicado: (2024)
Permissive-Washing in the Open AI Supply Chain: A Large-Scale Audit of License Integrity
por: Jewitt, James, et al.
Publicado: (2026)
por: Jewitt, James, et al.
Publicado: (2026)
When Individually Calibrated Models Become Collectively Miscalibrated
por: Wang, Zhaohui
Publicado: (2026)
por: Wang, Zhaohui
Publicado: (2026)
Confidential Guardian: Cryptographically Prohibiting the Abuse of Model Abstention
por: Rabanser, Stephan, et al.
Publicado: (2025)
por: Rabanser, Stephan, et al.
Publicado: (2025)
PromptAudit: Auditing Prompt Sensitivity in LLM-Based Vulnerability Detection
por: Camarato, Steffen J., et al.
Publicado: (2026)
por: Camarato, Steffen J., et al.
Publicado: (2026)
Permissible Knowledge Pooling
por: Dong, Huimin
Publicado: (2024)
por: Dong, Huimin
Publicado: (2024)
Agentive Permissions in Multiagent Systems
por: Shi, Qi
Publicado: (2024)
por: Shi, Qi
Publicado: (2024)
Judicial Permission
por: Governatori, Guido, et al.
Publicado: (2025)
por: Governatori, Guido, et al.
Publicado: (2025)
AuditLLM: A Tool for Auditing Large Language Models Using Multiprobe Approach
por: Amirizaniani, Maryam, et al.
Publicado: (2024)
por: Amirizaniani, Maryam, et al.
Publicado: (2024)
Auditing Disability Representation in Vision-Language Models
por: Panda, Srikant, et al.
Publicado: (2026)
por: Panda, Srikant, et al.
Publicado: (2026)
How Teachers Can Use Large Language Models and Bloom's Taxonomy to Create Educational Quizzes
por: Elkins, Sabina, et al.
Publicado: (2024)
por: Elkins, Sabina, et al.
Publicado: (2024)
When Choices Become Priors: Contrastive Decoding for Scientific Figure Multiple-Choice QA
por: Roh, Taeyun, et al.
Publicado: (2026)
por: Roh, Taeyun, et al.
Publicado: (2026)
When Chain-of-Thought Backfires: Evaluating Prompt Sensitivity in Medical Language Models
por: Sadanandan, Binesh, et al.
Publicado: (2026)
por: Sadanandan, Binesh, et al.
Publicado: (2026)
LLMs are Capable of Misaligned Behavior Under Explicit Prohibition and Surveillance
por: Ivanov, Igor
Publicado: (2025)
por: Ivanov, Igor
Publicado: (2025)
When Noise Lowers The Loss: Rethinking Likelihood-Based Evaluation in Music Large Language Models
por: Li, Xiaosha, et al.
Publicado: (2026)
por: Li, Xiaosha, et al.
Publicado: (2026)
When Benchmarks are Targets: Revealing the Sensitivity of Large Language Model Leaderboards
por: Alzahrani, Norah, et al.
Publicado: (2024)
por: Alzahrani, Norah, et al.
Publicado: (2024)
Maximally Permissive Reward Machines
por: Varricchione, Giovanni, et al.
Publicado: (2024)
por: Varricchione, Giovanni, et al.
Publicado: (2024)
Style Attack Disguise: When Fonts Become a Camouflage for Adversarial Intent
por: Zhang, Yangshijie, et al.
Publicado: (2025)
por: Zhang, Yangshijie, et al.
Publicado: (2025)
AuditWen:An Open-Source Large Language Model for Audit
por: Huang, Jiajia, et al.
Publicado: (2024)
por: Huang, Jiajia, et al.
Publicado: (2024)
When Reasoning Traces Become Performative: Step-Level Evidence that Chain-of-Thought Is an Imperfect Oversight Channel
por: Li, Wenkai, et al.
Publicado: (2026)
por: Li, Wenkai, et al.
Publicado: (2026)
Should AI Become an Intergenerational Civil Right?
por: Crowcroft, Jon, et al.
Publicado: (2025)
por: Crowcroft, Jon, et al.
Publicado: (2025)
When the Prompt Becomes Visual: Vision-Centric Jailbreak Attacks for Large Image Editing Models
por: Hou, Jiacheng, et al.
Publicado: (2026)
por: Hou, Jiacheng, et al.
Publicado: (2026)
TRUST: A Decentralized Framework for Auditing Large Language Model Reasoning
por: Huang, Morris Yu-Chao, et al.
Publicado: (2025)
por: Huang, Morris Yu-Chao, et al.
Publicado: (2025)
Weak Permission is not Well-Founded, Grounded and Stable
por: Governatori, Guido
Publicado: (2024)
por: Governatori, Guido
Publicado: (2024)
Privacy Auditing of Large Language Models
por: Panda, Ashwinee, et al.
Publicado: (2025)
por: Panda, Ashwinee, et al.
Publicado: (2025)
Auditing Language Model Unlearning via Information Decomposition
por: Goel, Anmol, et al.
Publicado: (2026)
por: Goel, Anmol, et al.
Publicado: (2026)
CALM: Curiosity-Driven Auditing for Large Language Models
por: Zheng, Xiang, et al.
Publicado: (2025)
por: Zheng, Xiang, et al.
Publicado: (2025)
Ejemplares similares
-
Syntactic Framing Fragility: An Audit of Robustness in LLM Ethical Decisions
por: Elkins, Katherine, et al.
Publicado: (2025) -
The Paradox of Robustness: Decoupling Rule-Based Logic from Affective Noise in High-Stakes Decision-Making
por: Chun, Jon, et al.
Publicado: (2026) -
Informed AI Regulation: Comparing the Ethical Frameworks of Leading LLM Chatbots Using an Ethics-Based Audit to Assess Moral Reasoning and Normative Values
por: Chun, Jon, et al.
Publicado: (2024) -
AgenticSimLaw: A Juvenile Courtroom Multi-Agent Debate Simulation for Explainable High-Stakes Tabular Decision Making
por: Chun, Jon, et al.
Publicado: (2026) -
The AI Fiction Paradox
por: Elkins, Katherine
Publicado: (2026)