Interpreting Bias in Large Language Models: A Feature-Based Approach
Fuente:
arXiv
Saved in:
| Main Authors: | Prakash, Nirmalendu, Roy, Lee Ka Wei |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Beyond I'm Sorry, I Can't: Dissecting Large Language Model Refusal
by: Prakash, Nirmalendu, et al.
Published: (2025)
by: Prakash, Nirmalendu, et al.
Published: (2025)
Understanding Refusal in Language Models with Sparse Autoencoders
by: Yeo, Wei Jie, et al.
Published: (2025)
by: Yeo, Wei Jie, et al.
Published: (2025)
SGHateCheck: Functional Tests for Detecting Hate Speech in Low-Resource Languages of Singapore
by: Ng, Ri Chi, et al.
Published: (2024)
by: Ng, Ri Chi, et al.
Published: (2024)
Examining the Influence of Political Bias on Large Language Model Performance in Stance Classification
by: Ng, Lynnette Hui Xian, et al.
Published: (2024)
by: Ng, Lynnette Hui Xian, et al.
Published: (2024)
Demystifying Hateful Content: Leveraging Large Multimodal Models for Hateful Meme Detection with Explainable Decisions
by: Hee, Ming Shan, et al.
Published: (2025)
by: Hee, Ming Shan, et al.
Published: (2025)
SuperWriter: Reflection-Driven Long-Form Generation with Large Language Models
by: Wu, Yuhao, et al.
Published: (2025)
by: Wu, Yuhao, et al.
Published: (2025)
InstructAV: Instruction Fine-tuning Large Language Models for Authorship Verification
by: Hu, Yujia, et al.
Published: (2024)
by: Hu, Yujia, et al.
Published: (2024)
Bias Attribution in Filipino Language Models: Extending a Bias Interpretability Metric for Application on Agglutinative Languages
by: Gamboa, Lance Calvin Lim, et al.
Published: (2025)
by: Gamboa, Lance Calvin Lim, et al.
Published: (2025)
Towards Resource Efficient and Interpretable Bias Mitigation in Large Language Models
by: Tong, Schrasing, et al.
Published: (2024)
by: Tong, Schrasing, et al.
Published: (2024)
How Quantization Shapes Bias in Large Language Models
by: Marcuzzi, Federico, et al.
Published: (2025)
by: Marcuzzi, Federico, et al.
Published: (2025)
HateXScore: A Metric Suite for Evaluating Reasoning Quality in Hate Speech Explanations
by: Hu, Yujia, et al.
Published: (2026)
by: Hu, Yujia, et al.
Published: (2026)
Automatically Interpreting Millions of Features in Large Language Models
by: Paulo, Gonçalo, et al.
Published: (2024)
by: Paulo, Gonçalo, et al.
Published: (2024)
Math-LLaVA: Bootstrapping Mathematical Reasoning for Multimodal Large Language Models
by: Shi, Wenhao, et al.
Published: (2024)
by: Shi, Wenhao, et al.
Published: (2024)
A Novel Interpretability Metric for Explaining Bias in Language Models: Applications on Multilingual Models from Southeast Asia
by: Gamboa, Lance Calvin Lim, et al.
Published: (2024)
by: Gamboa, Lance Calvin Lim, et al.
Published: (2024)
Enhancing Semantic Consistency of Large Language Models through Model Editing: An Interpretability-Oriented Approach
by: Yang, Jingyuan, et al.
Published: (2025)
by: Yang, Jingyuan, et al.
Published: (2025)
CLIMB: A Benchmark of Clinical Bias in Large Language Models
by: Zhang, Yubo, et al.
Published: (2024)
by: Zhang, Yubo, et al.
Published: (2024)
Detecting Bias in Large Language Models: Fine-tuned KcBERT
by: Lee, J. K., et al.
Published: (2024)
by: Lee, J. K., et al.
Published: (2024)
Bias in, Bias out: Annotation Bias in Multilingual Large Language Models
by: Cui, Xia, et al.
Published: (2025)
by: Cui, Xia, et al.
Published: (2025)
Toxicity Red-Teaming: Benchmarking LLM Safety in Singapore's Low-Resource Languages
by: Hu, Yujia, et al.
Published: (2025)
by: Hu, Yujia, et al.
Published: (2025)
Measuring Spiritual Values and Bias of Large Language Models
by: Liu, Songyuan, et al.
Published: (2024)
by: Liu, Songyuan, et al.
Published: (2024)
Humor in Pixels: Benchmarking Large Multimodal Models Understanding of Online Comics
by: Ryan, Yuriel, et al.
Published: (2025)
by: Ryan, Yuriel, et al.
Published: (2025)
Safe at the Margins: A General Approach to Safety Alignment in Low-Resource English Languages -- A Singlish Case Study
by: Lim, Isaac, et al.
Published: (2025)
by: Lim, Isaac, et al.
Published: (2025)
Acquiescence Bias in Large Language Models
by: Braun, Daniel
Published: (2025)
by: Braun, Daniel
Published: (2025)
Hearing the Order: Investigating Position Bias in Large Audio-Language Models
by: Lin, Yu-Xiang, et al.
Published: (2025)
by: Lin, Yu-Xiang, et al.
Published: (2025)
Flash Interpretability: Decoding Specialised Feature Neurons in Large Language Models with the LM-Head
by: Davies, Harry J
Published: (2025)
by: Davies, Harry J
Published: (2025)
I Have Covered All the Bases Here: Interpreting Reasoning Features in Large Language Models via Sparse Autoencoders
by: Galichin, Andrey, et al.
Published: (2025)
by: Galichin, Andrey, et al.
Published: (2025)
Recent Advances in Hate Speech Moderation: Multimodality and the Role of Large Models
by: Hee, Ming Shan, et al.
Published: (2024)
by: Hee, Ming Shan, et al.
Published: (2024)
ToxiCloakCN: Evaluating Robustness of Offensive Language Detection in Chinese with Cloaking Perturbations
by: Xiao, Yunze, et al.
Published: (2024)
by: Xiao, Yunze, et al.
Published: (2024)
Soft Inductive Bias Approach via Explicit Reasoning Perspectives in Inappropriate Utterance Detection Using Large Language Models
by: Kim, Ju-Young, et al.
Published: (2025)
by: Kim, Ju-Young, et al.
Published: (2025)
Semantic and Structural Analysis of Implicit Biases in Large Language Models: An Interpretable Approach
by: Zhang, Renhan, et al.
Published: (2025)
by: Zhang, Renhan, et al.
Published: (2025)
Interpreting and Improving Large Language Models in Arithmetic Calculation
by: Zhang, Wei, et al.
Published: (2024)
by: Zhang, Wei, et al.
Published: (2024)
Crafting Large Language Models for Enhanced Interpretability
by: Sun, Chung-En, et al.
Published: (2024)
by: Sun, Chung-En, et al.
Published: (2024)
Persuasiveness and Bias in LLM: Investigating the Impact of Persuasiveness and Reinforcement of Bias in Language Models
by: Roy, Saumya
Published: (2025)
by: Roy, Saumya
Published: (2025)
Evaluating Gender Bias in Large Language Models
by: Döll, Michael, et al.
Published: (2024)
by: Döll, Michael, et al.
Published: (2024)
Mitigating the Bias of Large Language Model Evaluation
by: Zhou, Hongli, et al.
Published: (2024)
by: Zhou, Hongli, et al.
Published: (2024)
BiasGuard: A Reasoning-enhanced Bias Detection Tool For Large Language Models
by: Fan, Zhiting, et al.
Published: (2025)
by: Fan, Zhiting, et al.
Published: (2025)
Prompt-Based Bias Calibration for Better Zero/Few-Shot Learning of Language Models
by: He, Kang, et al.
Published: (2024)
by: He, Kang, et al.
Published: (2024)
Bridging Modalities: Enhancing Cross-Modality Hate Speech Detection with Few-Shot In-Context Learning
by: Hee, Ming Shan, et al.
Published: (2024)
by: Hee, Ming Shan, et al.
Published: (2024)
Spoken Stereoset: On Evaluating Social Bias Toward Speaker in Speech Large Language Models
by: Lin, Yi-Cheng, et al.
Published: (2024)
by: Lin, Yi-Cheng, et al.
Published: (2024)
SEAHateCheck: Functional Tests for Detecting Hate Speech in Low-Resource Languages of Southeast Asia
by: Ng, Ri Chi, et al.
Published: (2026)
by: Ng, Ri Chi, et al.
Published: (2026)
Similar Items
-
Beyond I'm Sorry, I Can't: Dissecting Large Language Model Refusal
by: Prakash, Nirmalendu, et al.
Published: (2025) -
Understanding Refusal in Language Models with Sparse Autoencoders
by: Yeo, Wei Jie, et al.
Published: (2025) -
SGHateCheck: Functional Tests for Detecting Hate Speech in Low-Resource Languages of Singapore
by: Ng, Ri Chi, et al.
Published: (2024) -
Examining the Influence of Political Bias on Large Language Model Performance in Stance Classification
by: Ng, Lynnette Hui Xian, et al.
Published: (2024) -
Demystifying Hateful Content: Leveraging Large Multimodal Models for Hateful Meme Detection with Explainable Decisions
by: Hee, Ming Shan, et al.
Published: (2025)