Inference-Time Reasoning Selectively Reduces Implicit Social Bias in Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Apsel, Molly, Jones, Michael N. |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Measuring Implicit Bias in Explicitly Unbiased Large Language Models
par: Bai, Xuechunzi, et autres
Publié: (2024)
par: Bai, Xuechunzi, et autres
Publié: (2024)
Characterizing Selective Refusal Bias in Large Language Models
par: Khorramrouz, Adel, et autres
Publié: (2025)
par: Khorramrouz, Adel, et autres
Publié: (2025)
Covert Bias: The Severity of Social Views' Unalignment in Language Models Towards Implicit and Explicit Opinion
par: Aldayel, Abeer, et autres
Publié: (2024)
par: Aldayel, Abeer, et autres
Publié: (2024)
Translate With Care: Addressing Gender Bias, Neutrality, and Reasoning in Large Language Model Translations
par: Zahraei, Pardis Sadat, et autres
Publié: (2025)
par: Zahraei, Pardis Sadat, et autres
Publié: (2025)
Aligned but Blind: Alignment Increases Implicit Bias by Reducing Awareness of Race
par: Sun, Lihao, et autres
Publié: (2025)
par: Sun, Lihao, et autres
Publié: (2025)
Automated Item Neutralization for Non-Cognitive Scales: A Large Language Model Approach to Reducing Social-Desirability Bias
par: Wu, Sirui, et autres
Publié: (2025)
par: Wu, Sirui, et autres
Publié: (2025)
Assessing Judging Bias in Large Reasoning Models: An Empirical Study
par: Wang, Qian, et autres
Publié: (2025)
par: Wang, Qian, et autres
Publié: (2025)
Gender Bias in Emotion Recognition by Large Language Models
par: Herbert, Maureen, et autres
Publié: (2025)
par: Herbert, Maureen, et autres
Publié: (2025)
The Algorithmic Unconscious: Structural Mechanisms and Implicit Biases in Large Language Models
par: Boisnard, Philippe
Publié: (2026)
par: Boisnard, Philippe
Publié: (2026)
Walking in Others' Shoes: How Perspective-Taking Guides Large Language Models in Reducing Toxicity and Bias
par: Xu, Rongwu, et autres
Publié: (2024)
par: Xu, Rongwu, et autres
Publié: (2024)
Leveraging Large Language Models to Measure Gender Representation Bias in Gendered Language Corpora
par: Derner, Erik, et autres
Publié: (2024)
par: Derner, Erik, et autres
Publié: (2024)
Cross-Language Bias Examination in Large Language Models
par: Liang, Yuxuan, et autres
Publié: (2025)
par: Liang, Yuxuan, et autres
Publié: (2025)
MALIBU Benchmark: Multi-Agent LLM Implicit Bias Uncovered
par: Mirza, Imran, et autres
Publié: (2025)
par: Mirza, Imran, et autres
Publié: (2025)
Towards Equitable AI: Detecting Bias in Using Large Language Models for Marketing
par: Yilmaz, Berk, et autres
Publié: (2025)
par: Yilmaz, Berk, et autres
Publié: (2025)
Characterizing Bias: Benchmarking Large Language Models in Simplified versus Traditional Chinese
par: Lyu, Hanjia, et autres
Publié: (2025)
par: Lyu, Hanjia, et autres
Publié: (2025)
Towards Implicit Bias Detection and Mitigation in Multi-Agent LLM Interactions
par: Borah, Angana, et autres
Publié: (2024)
par: Borah, Angana, et autres
Publié: (2024)
Ask LLMs Directly, "What shapes your bias?": Measuring Social Bias in Large Language Models
par: Shin, Jisu, et autres
Publié: (2024)
par: Shin, Jisu, et autres
Publié: (2024)
Down the Toxicity Rabbit Hole: A Novel Framework to Bias Audit Large Language Models
par: Dutta, Arka, et autres
Publié: (2023)
par: Dutta, Arka, et autres
Publié: (2023)
Divine LLaMAs: Bias, Stereotypes, Stigmatization, and Emotion Representation of Religion in Large Language Models
par: Plaza-del-Arco, Flor Miriam, et autres
Publié: (2024)
par: Plaza-del-Arco, Flor Miriam, et autres
Publié: (2024)
WinoQueer: A Community-in-the-Loop Benchmark for Anti-LGBTQ+ Bias in Large Language Models
par: Felkner, Virginia K., et autres
Publié: (2023)
par: Felkner, Virginia K., et autres
Publié: (2023)
DECASTE: Unveiling Caste Stereotypes in Large Language Models through Multi-Dimensional Bias Analysis
par: Vijayaraghavan, Prashanth, et autres
Publié: (2025)
par: Vijayaraghavan, Prashanth, et autres
Publié: (2025)
Dual-Metric Evaluation of Social Bias in Large Language Models: Evidence from an Underrepresented Nepali Cultural Context
par: Pandey, Ashish, et autres
Publié: (2026)
par: Pandey, Ashish, et autres
Publié: (2026)
From Individuals to Interactions: Benchmarking Gender Bias in Multimodal Large Language Models from the Lens of Social Relationship
par: Xu, Yue, et autres
Publié: (2025)
par: Xu, Yue, et autres
Publié: (2025)
QSTN: A Modular Framework for Robust Questionnaire Inference with Large Language Models
par: Kreutner, Maximilian, et autres
Publié: (2025)
par: Kreutner, Maximilian, et autres
Publié: (2025)
AccessEval: Benchmarking Disability Bias in Large Language Models
par: Panda, Srikant, et autres
Publié: (2025)
par: Panda, Srikant, et autres
Publié: (2025)
Gender Bias in Machine Translation and The Era of Large Language Models
par: Vanmassenhove, Eva
Publié: (2024)
par: Vanmassenhove, Eva
Publié: (2024)
Large Language Models Show Human-like Social Desirability Biases in Survey Responses
par: Salecha, Aadesh, et autres
Publié: (2024)
par: Salecha, Aadesh, et autres
Publié: (2024)
SocialGaze: Improving the Integration of Human Social Norms in Large Language Models
par: Vijjini, Anvesh Rao, et autres
Publié: (2024)
par: Vijjini, Anvesh Rao, et autres
Publié: (2024)
Prompt Selection Matters: Enhancing Text Annotations for Social Sciences with Large Language Models
par: Abraham, Louis, et autres
Publié: (2024)
par: Abraham, Louis, et autres
Publié: (2024)
Only a Little to the Left: A Theory-grounded Measure of Political Bias in Large Language Models
par: Faulborn, Mats, et autres
Publié: (2025)
par: Faulborn, Mats, et autres
Publié: (2025)
Bias and Volatility: A Statistical Framework for Evaluating Large Language Model's Stereotypes and the Associated Generation Inconsistency
par: Liu, Yiran, et autres
Publié: (2024)
par: Liu, Yiran, et autres
Publié: (2024)
JobFair: A Framework for Benchmarking Gender Hiring Bias in Large Language Models
par: Wang, Ze, et autres
Publié: (2024)
par: Wang, Ze, et autres
Publié: (2024)
Identifying Implicit Social Biases in Vision-Language Models
par: Hamidieh, Kimia, et autres
Publié: (2024)
par: Hamidieh, Kimia, et autres
Publié: (2024)
JudgeMeNot: Personalizing Large Language Models to Emulate Judicial Reasoning in Hebrew
par: Razumenko, Itay, et autres
Publié: (2026)
par: Razumenko, Itay, et autres
Publié: (2026)
AesBiasBench: Evaluating Bias and Alignment in Multimodal Language Models for Personalized Image Aesthetic Assessment
par: Li, Kun, et autres
Publié: (2025)
par: Li, Kun, et autres
Publié: (2025)
More is More: Addition Bias in Large Language Models
par: Santagata, Luca, et autres
Publié: (2024)
par: Santagata, Luca, et autres
Publié: (2024)
On the Inevitability of Left-Leaning Political Bias in Aligned Language Models
par: Hagendorff, Thilo
Publié: (2025)
par: Hagendorff, Thilo
Publié: (2025)
Born With a Silver Spoon? Investigating Socioeconomic Bias in Large Language Models
par: Singh, Smriti, et autres
Publié: (2024)
par: Singh, Smriti, et autres
Publié: (2024)
Invisible Filters: Cultural Bias in Hiring Evaluations Using Large Language Models
par: Rao, Pooja S. B., et autres
Publié: (2025)
par: Rao, Pooja S. B., et autres
Publié: (2025)
Accuracy and Political Bias of News Source Credibility Ratings by Large Language Models
par: Yang, Kai-Cheng, et autres
Publié: (2023)
par: Yang, Kai-Cheng, et autres
Publié: (2023)
Documents similaires
-
Measuring Implicit Bias in Explicitly Unbiased Large Language Models
par: Bai, Xuechunzi, et autres
Publié: (2024) -
Characterizing Selective Refusal Bias in Large Language Models
par: Khorramrouz, Adel, et autres
Publié: (2025) -
Covert Bias: The Severity of Social Views' Unalignment in Language Models Towards Implicit and Explicit Opinion
par: Aldayel, Abeer, et autres
Publié: (2024) -
Translate With Care: Addressing Gender Bias, Neutrality, and Reasoning in Large Language Model Translations
par: Zahraei, Pardis Sadat, et autres
Publié: (2025) -
Aligned but Blind: Alignment Increases Implicit Bias by Reducing Awareness of Race
par: Sun, Lihao, et autres
Publié: (2025)