Understanding Refusal in Language Models with Sparse Autoencoders
Fuente:
arXiv
Saved in:
| Main Authors: | Yeo, Wei Jie, Prakash, Nirmalendu, Neo, Clement, Lee, Roy Ka-Wei, Cambria, Erik, Satapathy, Ranjan |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Beyond I'm Sorry, I Can't: Dissecting Large Language Model Refusal
by: Prakash, Nirmalendu, et al.
Published: (2025)
by: Prakash, Nirmalendu, et al.
Published: (2025)
Towards Faithful Natural Language Explanations: A Study Using Activation Patching in Large Language Models
by: Yeo, Wei Jie, et al.
Published: (2024)
by: Yeo, Wei Jie, et al.
Published: (2024)
Plausible Extractive Rationalization through Semi-Supervised Entailment Signal
by: Yeo, Wei Jie, et al.
Published: (2024)
by: Yeo, Wei Jie, et al.
Published: (2024)
Mitigating Jailbreaks with Intent-Aware LLMs
by: Yeo, Wei Jie, et al.
Published: (2025)
by: Yeo, Wei Jie, et al.
Published: (2025)
Interpreting Bias in Large Language Models: A Feature-Based Approach
by: Prakash, Nirmalendu, et al.
Published: (2024)
by: Prakash, Nirmalendu, et al.
Published: (2024)
Self-training Large Language Models through Knowledge Detection
by: Yeo, Wei Jie, et al.
Published: (2024)
by: Yeo, Wei Jie, et al.
Published: (2024)
How Interpretable are Reasoning Explanations from Prompting Large Language Models?
by: Yeo, Wei Jie, et al.
Published: (2024)
by: Yeo, Wei Jie, et al.
Published: (2024)
Debiasing CLIP: Interpreting and Correcting Bias in Attention Heads
by: Yeo, Wei Jie, et al.
Published: (2025)
by: Yeo, Wei Jie, et al.
Published: (2025)
SGHateCheck: Functional Tests for Detecting Hate Speech in Low-Resource Languages of Singapore
by: Ng, Ri Chi, et al.
Published: (2024)
by: Ng, Ri Chi, et al.
Published: (2024)
Beyond Correlation: Refutation-Validated Aspect-Based Sentiment Analysis for Explainable Energy Market Returns
by: van der Heever, Wihan, et al.
Published: (2026)
by: van der Heever, Wihan, et al.
Published: (2026)
FinXABSA: Explainable Finance through Aspect-Based Sentiment Analysis
by: Ong, Keane, et al.
Published: (2023)
by: Ong, Keane, et al.
Published: (2023)
Explainable Natural Language Processing for Corporate Sustainability Analysis
by: Ong, Keane, et al.
Published: (2024)
by: Ong, Keane, et al.
Published: (2024)
ESGSenticNet: A Neurosymbolic Knowledge Base for Corporate Sustainability Analysis
by: Ong, Keane, et al.
Published: (2025)
by: Ong, Keane, et al.
Published: (2025)
Understanding Addition and Subtraction in Transformers
by: Quirke, Philip, et al.
Published: (2024)
by: Quirke, Philip, et al.
Published: (2024)
A Systematic Analysis of Biases in Large Language Models
by: Zhang, Xulang, et al.
Published: (2025)
by: Zhang, Xulang, et al.
Published: (2025)
Demystifying Hateful Content: Leveraging Large Multimodal Models for Hateful Meme Detection with Explainable Decisions
by: Hee, Ming Shan, et al.
Published: (2025)
by: Hee, Ming Shan, et al.
Published: (2025)
Understanding Fairness-Accuracy Trade-offs in Machine Learning Models: Does Promoting Fairness Undermine Performance?
by: Liu, Junhua, et al.
Published: (2024)
by: Liu, Junhua, et al.
Published: (2024)
Humor in Pixels: Benchmarking Large Multimodal Models Understanding of Online Comics
by: Ryan, Yuriel, et al.
Published: (2025)
by: Ryan, Yuriel, et al.
Published: (2025)
Examining the Influence of Political Bias on Large Language Model Performance in Stance Classification
by: Ng, Lynnette Hui Xian, et al.
Published: (2024)
by: Ng, Lynnette Hui Xian, et al.
Published: (2024)
SuperWriter: Reflection-Driven Long-Form Generation with Large Language Models
by: Wu, Yuhao, et al.
Published: (2025)
by: Wu, Yuhao, et al.
Published: (2025)
OR-Bench: An Over-Refusal Benchmark for Large Language Models
by: Cui, Justin, et al.
Published: (2024)
by: Cui, Justin, et al.
Published: (2024)
InstructAV: Instruction Fine-tuning Large Language Models for Authorship Verification
by: Hu, Yujia, et al.
Published: (2024)
by: Hu, Yujia, et al.
Published: (2024)
HateXScore: A Metric Suite for Evaluating Reasoning Quality in Hate Speech Explanations
by: Hu, Yujia, et al.
Published: (2026)
by: Hu, Yujia, et al.
Published: (2026)
SteerRM: Debiasing Reward Models via Sparse Autoencoders
by: Sun, Mengyuan, et al.
Published: (2026)
by: Sun, Mengyuan, et al.
Published: (2026)
SusGen-GPT: A Data-Centric LLM for Financial NLP and Sustainability Report Generation
by: Wu, Qilong, et al.
Published: (2024)
by: Wu, Qilong, et al.
Published: (2024)
Large Language Models for Automated Open-domain Scientific Hypotheses Discovery
by: Yang, Zonglin, et al.
Published: (2023)
by: Yang, Zonglin, et al.
Published: (2023)
SAFER: Probing Safety in Reward Models with Sparse Autoencoder
by: Shi, Wei, et al.
Published: (2025)
by: Shi, Wei, et al.
Published: (2025)
Large Language Models for Few-Shot Named Entity Recognition
by: Zhao, Yufei, et al.
Published: (2018)
by: Zhao, Yufei, et al.
Published: (2018)
Language Models as Inductive Reasoners
by: Yang, Zonglin, et al.
Published: (2022)
by: Yang, Zonglin, et al.
Published: (2022)
XAI meets LLMs: A Survey of the Relation between Explainable AI and Large Language Models
by: Cambria, Erik, et al.
Published: (2024)
by: Cambria, Erik, et al.
Published: (2024)
Toxicity Red-Teaming: Benchmarking LLM Safety in Singapore's Low-Resource Languages
by: Hu, Yujia, et al.
Published: (2025)
by: Hu, Yujia, et al.
Published: (2025)
Unveiling Language-Specific Features in Large Language Models via Sparse Autoencoders
by: Deng, Boyi, et al.
Published: (2025)
by: Deng, Boyi, et al.
Published: (2025)
Enhancing Language Models for Robust Greenwashing Detection
by: Braun, Neil Heinrich, et al.
Published: (2026)
by: Braun, Neil Heinrich, et al.
Published: (2026)
ToxiCloakCN: Evaluating Robustness of Offensive Language Detection in Chinese with Cloaking Perturbations
by: Xiao, Yunze, et al.
Published: (2024)
by: Xiao, Yunze, et al.
Published: (2024)
Bridging Modalities: Enhancing Cross-Modality Hate Speech Detection with Few-Shot In-Context Learning
by: Hee, Ming Shan, et al.
Published: (2024)
by: Hee, Ming Shan, et al.
Published: (2024)
Refusal Tokens: A Simple Way to Calibrate Refusals in Large Language Models
by: Jain, Neel, et al.
Published: (2024)
by: Jain, Neel, et al.
Published: (2024)
Modularized Networks for Few-shot Hateful Meme Detection
by: Cao, Rui, et al.
Published: (2024)
by: Cao, Rui, et al.
Published: (2024)
Towards Understanding the Robustness of Sparse Autoencoders
by: Saiyed, Ahson, et al.
Published: (2026)
by: Saiyed, Ahson, et al.
Published: (2026)
ProtSAE: Disentangling and Interpreting Protein Language Models via Semantically-Guided Sparse Autoencoders
by: Liu, Xiangyu, et al.
Published: (2025)
by: Liu, Xiangyu, et al.
Published: (2025)
SEAHateCheck: Functional Tests for Detecting Hate Speech in Low-Resource Languages of Southeast Asia
by: Ng, Ri Chi, et al.
Published: (2026)
by: Ng, Ri Chi, et al.
Published: (2026)
Similar Items
-
Beyond I'm Sorry, I Can't: Dissecting Large Language Model Refusal
by: Prakash, Nirmalendu, et al.
Published: (2025) -
Towards Faithful Natural Language Explanations: A Study Using Activation Patching in Large Language Models
by: Yeo, Wei Jie, et al.
Published: (2024) -
Plausible Extractive Rationalization through Semi-Supervised Entailment Signal
by: Yeo, Wei Jie, et al.
Published: (2024) -
Mitigating Jailbreaks with Intent-Aware LLMs
by: Yeo, Wei Jie, et al.
Published: (2025) -
Interpreting Bias in Large Language Models: A Feature-Based Approach
by: Prakash, Nirmalendu, et al.
Published: (2024)