BiasCause: Evaluate Socially Biased Causal Reasoning of Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Xie, Tian, Yin, Tongxin, Keshava, Vaishakh, Zhang, Xueru, Jonnalagadda, Siddhartha Reddy |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Backtracking for Safety
par: Sel, Bilgehan, et autres
Publié: (2025)
par: Sel, Bilgehan, et autres
Publié: (2025)
Evaluating and Mitigating Social Bias for Large Language Models in Open-ended Settings
par: Liu, Zhao, et autres
Publié: (2024)
par: Liu, Zhao, et autres
Publié: (2024)
Adversarial Reinforcement Learning for Large Language Model Agent Safety
par: Wang, Zizhao, et autres
Publié: (2025)
par: Wang, Zizhao, et autres
Publié: (2025)
JBBQ: Japanese Bias Benchmark for Analyzing Social Biases in Large Language Models
par: Yanaka, Hitomi, et autres
Publié: (2024)
par: Yanaka, Hitomi, et autres
Publié: (2024)
Multi-Dimensional Evaluation of Text Summarization with In-Context Learning
par: Jain, Sameer, et autres
Publié: (2023)
par: Jain, Sameer, et autres
Publié: (2023)
Exploring Causal Effect of Social Bias on Faithfulness Hallucinations in Large Language Models
par: Zhang, Zhenliang, et autres
Publié: (2025)
par: Zhang, Zhenliang, et autres
Publié: (2025)
Observations and Remedies for Large Language Model Bias in Self-Consuming Performative Loop
par: Wang, Yaxuan, et autres
Publié: (2026)
par: Wang, Yaxuan, et autres
Publié: (2026)
Cause and Effect: Can Large Language Models Truly Understand Causality?
par: Ashwani, Swagata, et autres
Publié: (2024)
par: Ashwani, Swagata, et autres
Publié: (2024)
VisBias: Measuring Explicit and Implicit Social Biases in Vision Language Models
par: Huang, Jen-tse, et autres
Publié: (2025)
par: Huang, Jen-tse, et autres
Publié: (2025)
Evaluating the Presence of Sex Bias in Clinical Reasoning by Large Language Models
par: Tsintsiper, Isabel, et autres
Publié: (2026)
par: Tsintsiper, Isabel, et autres
Publié: (2026)
Reinforcement Learning with Backtracking Feedback
par: Sel, Bilgehan, et autres
Publié: (2026)
par: Sel, Bilgehan, et autres
Publié: (2026)
A Trip Towards Fairness: Bias and De-Biasing in Large Language Models
par: Ranaldi, Leonardo, et autres
Publié: (2023)
par: Ranaldi, Leonardo, et autres
Publié: (2023)
Social Bias Evaluation for Large Language Models Requires Prompt Variations
par: Hida, Rem, et autres
Publié: (2024)
par: Hida, Rem, et autres
Publié: (2024)
Robust Evaluation Measures for Evaluating Social Biases in Masked Language Models
par: Liu, Yang
Publié: (2024)
par: Liu, Yang
Publié: (2024)
Mitigating Biases in Language Models via Bias Unlearning
par: Liu, Dianqing, et autres
Publié: (2025)
par: Liu, Dianqing, et autres
Publié: (2025)
Are Bias Evaluation Methods Biased ?
par: Berrayana, Lina, et autres
Publié: (2025)
par: Berrayana, Lina, et autres
Publié: (2025)
CARL-GT: Evaluating Causal Reasoning Capabilities of Large Language Models
par: Tu, Ruibo, et autres
Publié: (2024)
par: Tu, Ruibo, et autres
Publié: (2024)
Metamorphic Testing for Fairness Evaluation in Large Language Models: Identifying Intersectional Bias in LLaMA and GPT
par: Reddy, Harishwar, et autres
Publié: (2025)
par: Reddy, Harishwar, et autres
Publié: (2025)
Inference-Time Reasoning Selectively Reduces Implicit Social Bias in Large Language Models
par: Apsel, Molly, et autres
Publié: (2026)
par: Apsel, Molly, et autres
Publié: (2026)
IndiBias: A Benchmark Dataset to Measure Social Biases in Language Models for Indian Context
par: Sahoo, Nihar Ranjan, et autres
Publié: (2024)
par: Sahoo, Nihar Ranjan, et autres
Publié: (2024)
Quantifying and Mitigating Unimodal Biases in Multimodal Large Language Models: A Causal Perspective
par: Chen, Meiqi, et autres
Publié: (2024)
par: Chen, Meiqi, et autres
Publié: (2024)
Decomposing and Steering Functional Metacognition in Large Language Models
par: Li, Yanshi, et autres
Publié: (2026)
par: Li, Yanshi, et autres
Publié: (2026)
SocialMaze: A Benchmark for Evaluating Social Reasoning in Large Language Models
par: Xu, Zixiang, et autres
Publié: (2025)
par: Xu, Zixiang, et autres
Publié: (2025)
Evaluating Large Language Model Biases in Persona-Steered Generation
par: Liu, Andy, et autres
Publié: (2024)
par: Liu, Andy, et autres
Publié: (2024)
Do Large Language Models Show Biases in Causal Learning?
par: Carro, Maria Victoria, et autres
Publié: (2024)
par: Carro, Maria Victoria, et autres
Publié: (2024)
Enhancing Large Language Model with Decomposed Reasoning for Emotion Cause Pair Extraction
par: Wu, Jialiang, et autres
Publié: (2024)
par: Wu, Jialiang, et autres
Publié: (2024)
HCR-Reasoner: Synergizing Large Language Models and Theory for Human-like Causal Reasoning
par: Zhang, Yanxi, et autres
Publié: (2025)
par: Zhang, Yanxi, et autres
Publié: (2025)
Evaluating Gender Bias in Large Language Models
par: Döll, Michael, et autres
Publié: (2024)
par: Döll, Michael, et autres
Publié: (2024)
Mitigating the Bias of Large Language Model Evaluation
par: Zhou, Hongli, et autres
Publié: (2024)
par: Zhou, Hongli, et autres
Publié: (2024)
Separator Injection Attack: Uncovering Dialogue Biases in Large Language Models Caused by Role Separators
par: Li, Xitao, et autres
Publié: (2025)
par: Li, Xitao, et autres
Publié: (2025)
Subtle Biases Need Subtler Measures: Dual Metrics for Evaluating Representative and Affinity Bias in Large Language Models
par: Kumar, Abhishek, et autres
Publié: (2024)
par: Kumar, Abhishek, et autres
Publié: (2024)
BiasGuard: A Reasoning-enhanced Bias Detection Tool For Large Language Models
par: Fan, Zhiting, et autres
Publié: (2025)
par: Fan, Zhiting, et autres
Publié: (2025)
BiasDora: Exploring Hidden Biased Associations in Vision-Language Models
par: Raj, Chahat, et autres
Publié: (2024)
par: Raj, Chahat, et autres
Publié: (2024)
Breaking Bias, Building Bridges: Evaluation and Mitigation of Social Biases in LLMs via Contact Hypothesis
par: Raj, Chahat, et autres
Publié: (2024)
par: Raj, Chahat, et autres
Publié: (2024)
Reasoning Towards Fairness: Mitigating Bias in Language Models through Reasoning-Guided Fine-Tuning
par: Kabra, Sanchit, et autres
Publié: (2025)
par: Kabra, Sanchit, et autres
Publié: (2025)
METER: Evaluating Multi-Level Contextual Causal Reasoning in Large Language Models
par: Li, Pengfeng, et autres
Publié: (2026)
par: Li, Pengfeng, et autres
Publié: (2026)
BiasJailbreak:Analyzing Ethical Biases and Jailbreak Vulnerabilities in Large Language Models
par: Lee, Isack, et autres
Publié: (2024)
par: Lee, Isack, et autres
Publié: (2024)
Anchoring LLM Gender Bias to Human Baselines: A Cross-Lingual Audit
par: Choi, Jiwoo, et autres
Publié: (2026)
par: Choi, Jiwoo, et autres
Publié: (2026)
SocialEval: Evaluating Social Intelligence of Large Language Models
par: Zhou, Jinfeng, et autres
Publié: (2025)
par: Zhou, Jinfeng, et autres
Publié: (2025)
McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models
par: Lan, Tian, et autres
Publié: (2025)
par: Lan, Tian, et autres
Publié: (2025)
Documents similaires
-
Backtracking for Safety
par: Sel, Bilgehan, et autres
Publié: (2025) -
Evaluating and Mitigating Social Bias for Large Language Models in Open-ended Settings
par: Liu, Zhao, et autres
Publié: (2024) -
Adversarial Reinforcement Learning for Large Language Model Agent Safety
par: Wang, Zizhao, et autres
Publié: (2025) -
JBBQ: Japanese Bias Benchmark for Analyzing Social Biases in Large Language Models
par: Yanaka, Hitomi, et autres
Publié: (2024) -
Multi-Dimensional Evaluation of Text Summarization with In-Context Learning
par: Jain, Sameer, et autres
Publié: (2023)