There Is More to Refusal in Large Language Models than a Single Direction
Fuente:
arXiv
Saved in:
| Main Authors: | Joad, Faaiz, Hawasly, Majd, Boughorbel, Sabri, Durrani, Nadir, Sencar, Husrev Taha |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Beyond the Leaderboard: Understanding Performance Disparities in Large Language Models via Model Diffing
by: Boughorbel, Sabri, et al.
Published: (2025)
by: Boughorbel, Sabri, et al.
Published: (2025)
Improving Language Models Trained on Translated Data with Continual Pre-Training and Dictionary Learning Analysis
by: Boughorbel, Sabri, et al.
Published: (2024)
by: Boughorbel, Sabri, et al.
Published: (2024)
Scaling up Discovery of Latent Concepts in Deep NLP Models
by: Hawasly, Majd, et al.
Published: (2023)
by: Hawasly, Majd, et al.
Published: (2023)
FanarGuard: A Culturally-Aware Moderation Filter for Arabic Language Models
by: Fatehkia, Masoomali, et al.
Published: (2025)
by: Fatehkia, Masoomali, et al.
Published: (2025)
Do I Really Know? Learning Factual Self-Verification for Hallucination Reduction
by: Altinisik, Enes, et al.
Published: (2026)
by: Altinisik, Enes, et al.
Published: (2026)
Exploring Alignment in Shared Cross-lingual Spaces
by: Mousi, Basel, et al.
Published: (2024)
by: Mousi, Basel, et al.
Published: (2024)
Tool Calling for Arabic LLMs: Data Strategies and Instruction Tuning
by: Ersoy, Asim, et al.
Published: (2025)
by: Ersoy, Asim, et al.
Published: (2025)
PAM: Training Policy-Aligned Moderation Filters at Scale
by: Fatehkia, Masoomali, et al.
Published: (2025)
by: Fatehkia, Masoomali, et al.
Published: (2025)
Multimedia Forensics
by: Husrev Taha Sencar
by: Husrev Taha Sencar
LAraBench: Benchmarking Arabic AI with Large Language Models
by: Abdelali, Ahmed, et al.
Published: (2023)
by: Abdelali, Ahmed, et al.
Published: (2023)
Semantic Ranking for Automated Adversarial Technique Annotation in Security Text
by: Kumarasinghe, Udesh, et al.
Published: (2024)
by: Kumarasinghe, Udesh, et al.
Published: (2024)
Explaining the role of Intrinsic Dimensionality in Adversarial Training
by: Altinisik, Enes, et al.
Published: (2024)
by: Altinisik, Enes, et al.
Published: (2024)
LLMeBench: A Flexible Framework for Accelerating LLMs Benchmarking
by: Dalvi, Fahim, et al.
Published: (2023)
by: Dalvi, Fahim, et al.
Published: (2023)
The Landscape of Arabic Large Language Models (ALLMs): A New Era for Arabic Language Technology
by: Al-Khalifa, Shahad, et al.
Published: (2025)
by: Al-Khalifa, Shahad, et al.
Published: (2025)
Editing Across Languages: A Survey of Multilingual Knowledge Editing
by: Durrani, Nadir, et al.
Published: (2025)
by: Durrani, Nadir, et al.
Published: (2025)
Discovering Salient Neurons in Deep NLP Models
by: Durrani, Nadir, et al.
Published: (2022)
by: Durrani, Nadir, et al.
Published: (2022)
Refusal in Language Models Is Mediated by a Single Direction
by: Arditi, Andy, et al.
Published: (2024)
by: Arditi, Andy, et al.
Published: (2024)
An Exploration of Knowledge Editing for Arabic
by: Mousi, Basel, et al.
Published: (2025)
by: Mousi, Basel, et al.
Published: (2025)
Once Correct, Still Wrong: Counterfactual Hallucination in Multilingual Vision-Language Models
by: Mousi, Basel, et al.
Published: (2026)
by: Mousi, Basel, et al.
Published: (2026)
Learn to Refuse: Making Large Language Models More Controllable and Reliable through Knowledge Scope Limitation and Refusal Mechanism
by: Cao, Lang
Published: (2023)
by: Cao, Lang
Published: (2023)
Are Large Language Models More Empathetic than Humans?
by: Welivita, Anuradha, et al.
Published: (2024)
by: Welivita, Anuradha, et al.
Published: (2024)
From Text to Actionable Intelligence: Automating STIX Entity and Relationship Extraction
by: Lekssays, Ahmed, et al.
Published: (2025)
by: Lekssays, Ahmed, et al.
Published: (2025)
Latent Concept-based Explanation of NLP Models
by: Yu, Xuemin, et al.
Published: (2024)
by: Yu, Xuemin, et al.
Published: (2024)
Refusal Tokens: A Simple Way to Calibrate Refusals in Large Language Models
by: Jain, Neel, et al.
Published: (2024)
by: Jain, Neel, et al.
Published: (2024)
Self-Consistency from Only Two Samples: CoT-PoT Ensembling for Efficient LLM Reasoning
by: Saparkhan, Raman, et al.
Published: (2026)
by: Saparkhan, Raman, et al.
Published: (2026)
Characterizing Selective Refusal Bias in Large Language Models
by: Khorramrouz, Adel, et al.
Published: (2025)
by: Khorramrouz, Adel, et al.
Published: (2025)
Refusal Direction is Universal Across Safety-Aligned Languages
by: Wang, Xinpeng, et al.
Published: (2025)
by: Wang, Xinpeng, et al.
Published: (2025)
PalmX 2025: The First Shared Task on Benchmarking LLMs on Arabic and Islamic Culture
by: Alwajih, Fakhraddin, et al.
Published: (2025)
by: Alwajih, Fakhraddin, et al.
Published: (2025)
Measuring and Eliminating Refusals in Military Large Language Models
by: FitzGerald, Jack, et al.
Published: (2026)
by: FitzGerald, Jack, et al.
Published: (2026)
OR-Bench: An Over-Refusal Benchmark for Large Language Models
by: Cui, Justin, et al.
Published: (2024)
by: Cui, Justin, et al.
Published: (2024)
Refusal Behavior in Large Language Models: A Nonlinear Perspective
by: Hildebrandt, Fabian, et al.
Published: (2025)
by: Hildebrandt, Fabian, et al.
Published: (2025)
Should LLM Safety Be More Than Refusing Harmful Instructions?
by: Maskey, Utsav, et al.
Published: (2025)
by: Maskey, Utsav, et al.
Published: (2025)
Role-Conditioned Refusals: Evaluating Access Control Reasoning in Large Language Models
by: Klisura, Đorđe, et al.
Published: (2025)
by: Klisura, Đorđe, et al.
Published: (2025)
Large Language Models Assume People are More Rational than We Really are
by: Liu, Ryan, et al.
Published: (2024)
by: Liu, Ryan, et al.
Published: (2024)
Surgical, Cheap, and Flexible: Mitigating False Refusal in Language Models via Single Vector Ablation
by: Wang, Xinpeng, et al.
Published: (2024)
by: Wang, Xinpeng, et al.
Published: (2024)
Understanding Refusal in Language Models with Sparse Autoencoders
by: Yeo, Wei Jie, et al.
Published: (2025)
by: Yeo, Wei Jie, et al.
Published: (2025)
Anatomy of Neural Language Models
by: Saleh, Majd, et al.
Published: (2024)
by: Saleh, Majd, et al.
Published: (2024)
Analyzing Bias in False Refusal Behavior of Large Language Models for Hate Speech Detoxification
by: Im, Kyuri, et al.
Published: (2026)
by: Im, Kyuri, et al.
Published: (2026)
Metaphor and Large Language Models: When Surface Features Matter More than Deep Understanding
by: Sanchez-Bayona, Elisa, et al.
Published: (2025)
by: Sanchez-Bayona, Elisa, et al.
Published: (2025)
RefusalBench: Generative Evaluation of Selective Refusal in Grounded Language Models
by: Muhamed, Aashiq, et al.
Published: (2025)
by: Muhamed, Aashiq, et al.
Published: (2025)
Similar Items
-
Beyond the Leaderboard: Understanding Performance Disparities in Large Language Models via Model Diffing
by: Boughorbel, Sabri, et al.
Published: (2025) -
Improving Language Models Trained on Translated Data with Continual Pre-Training and Dictionary Learning Analysis
by: Boughorbel, Sabri, et al.
Published: (2024) -
Scaling up Discovery of Latent Concepts in Deep NLP Models
by: Hawasly, Majd, et al.
Published: (2023) -
FanarGuard: A Culturally-Aware Moderation Filter for Arabic Language Models
by: Fatehkia, Masoomali, et al.
Published: (2025) -
Do I Really Know? Learning Factual Self-Verification for Hallucination Reduction
by: Altinisik, Enes, et al.
Published: (2026)