Characterizing Selective Refusal Bias in Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Khorramrouz, Adel, Levy, Sharon |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Down the Toxicity Rabbit Hole: A Novel Framework to Bias Audit Large Language Models
par: Dutta, Arka, et autres
Publié: (2023)
par: Dutta, Arka, et autres
Publié: (2023)
LLMs are Biased Teachers: Evaluating LLM Bias in Personalized Education
par: Weissburg, Iain, et autres
Publié: (2024)
par: Weissburg, Iain, et autres
Publié: (2024)
Characterizing Bias: Benchmarking Large Language Models in Simplified versus Traditional Chinese
par: Lyu, Hanjia, et autres
Publié: (2025)
par: Lyu, Hanjia, et autres
Publié: (2025)
Inference-Time Reasoning Selectively Reduces Implicit Social Bias in Large Language Models
par: Apsel, Molly, et autres
Publié: (2026)
par: Apsel, Molly, et autres
Publié: (2026)
Gender Bias in Emotion Recognition by Large Language Models
par: Herbert, Maureen, et autres
Publié: (2025)
par: Herbert, Maureen, et autres
Publié: (2025)
Measuring Implicit Bias in Explicitly Unbiased Large Language Models
par: Bai, Xuechunzi, et autres
Publié: (2024)
par: Bai, Xuechunzi, et autres
Publié: (2024)
Leveraging Large Language Models to Measure Gender Representation Bias in Gendered Language Corpora
par: Derner, Erik, et autres
Publié: (2024)
par: Derner, Erik, et autres
Publié: (2024)
Cross-Language Bias Examination in Large Language Models
par: Liang, Yuxuan, et autres
Publié: (2025)
par: Liang, Yuxuan, et autres
Publié: (2025)
Towards Equitable AI: Detecting Bias in Using Large Language Models for Marketing
par: Yilmaz, Berk, et autres
Publié: (2025)
par: Yilmaz, Berk, et autres
Publié: (2025)
Automatic Pseudo-Harmful Prompt Generation for Evaluating False Refusals in Large Language Models
par: An, Bang, et autres
Publié: (2024)
par: An, Bang, et autres
Publié: (2024)
Translate With Care: Addressing Gender Bias, Neutrality, and Reasoning in Large Language Model Translations
par: Zahraei, Pardis Sadat, et autres
Publié: (2025)
par: Zahraei, Pardis Sadat, et autres
Publié: (2025)
DECASTE: Unveiling Caste Stereotypes in Large Language Models through Multi-Dimensional Bias Analysis
par: Vijayaraghavan, Prashanth, et autres
Publié: (2025)
par: Vijayaraghavan, Prashanth, et autres
Publié: (2025)
Divine LLaMAs: Bias, Stereotypes, Stigmatization, and Emotion Representation of Religion in Large Language Models
par: Plaza-del-Arco, Flor Miriam, et autres
Publié: (2024)
par: Plaza-del-Arco, Flor Miriam, et autres
Publié: (2024)
WinoQueer: A Community-in-the-Loop Benchmark for Anti-LGBTQ+ Bias in Large Language Models
par: Felkner, Virginia K., et autres
Publié: (2023)
par: Felkner, Virginia K., et autres
Publié: (2023)
AccessEval: Benchmarking Disability Bias in Large Language Models
par: Panda, Srikant, et autres
Publié: (2025)
par: Panda, Srikant, et autres
Publié: (2025)
Gender Bias in Machine Translation and The Era of Large Language Models
par: Vanmassenhove, Eva
Publié: (2024)
par: Vanmassenhove, Eva
Publié: (2024)
Only a Little to the Left: A Theory-grounded Measure of Political Bias in Large Language Models
par: Faulborn, Mats, et autres
Publié: (2025)
par: Faulborn, Mats, et autres
Publié: (2025)
Bias and Volatility: A Statistical Framework for Evaluating Large Language Model's Stereotypes and the Associated Generation Inconsistency
par: Liu, Yiran, et autres
Publié: (2024)
par: Liu, Yiran, et autres
Publié: (2024)
Evaluating Implicit Biases in LLM Reasoning through Logic Grid Puzzles
par: Jahara, Fatima, et autres
Publié: (2025)
par: Jahara, Fatima, et autres
Publié: (2025)
Assessing Judging Bias in Large Reasoning Models: An Empirical Study
par: Wang, Qian, et autres
Publié: (2025)
par: Wang, Qian, et autres
Publié: (2025)
AesBiasBench: Evaluating Bias and Alignment in Multimodal Language Models for Personalized Image Aesthetic Assessment
par: Li, Kun, et autres
Publié: (2025)
par: Li, Kun, et autres
Publié: (2025)
More is More: Addition Bias in Large Language Models
par: Santagata, Luca, et autres
Publié: (2024)
par: Santagata, Luca, et autres
Publié: (2024)
On the Inevitability of Left-Leaning Political Bias in Aligned Language Models
par: Hagendorff, Thilo
Publié: (2025)
par: Hagendorff, Thilo
Publié: (2025)
Bias in, Bias out: Annotation Bias in Multilingual Large Language Models
par: Cui, Xia, et autres
Publié: (2025)
par: Cui, Xia, et autres
Publié: (2025)
Invisible Filters: Cultural Bias in Hiring Evaluations Using Large Language Models
par: Rao, Pooja S. B., et autres
Publié: (2025)
par: Rao, Pooja S. B., et autres
Publié: (2025)
LIBRA: Measuring Bias of Large Language Model from a Local Context
par: Pang, Bo, et autres
Publié: (2025)
par: Pang, Bo, et autres
Publié: (2025)
Born With a Silver Spoon? Investigating Socioeconomic Bias in Large Language Models
par: Singh, Smriti, et autres
Publié: (2024)
par: Singh, Smriti, et autres
Publié: (2024)
Accuracy and Political Bias of News Source Credibility Ratings by Large Language Models
par: Yang, Kai-Cheng, et autres
Publié: (2023)
par: Yang, Kai-Cheng, et autres
Publié: (2023)
Bias and Fairness in Large Language Models: A Survey
par: Gallegos, Isabel O., et autres
Publié: (2023)
par: Gallegos, Isabel O., et autres
Publié: (2023)
Linguistic Bias in ChatGPT: Language Models Reinforce Dialect Discrimination
par: Fleisig, Eve, et autres
Publié: (2024)
par: Fleisig, Eve, et autres
Publié: (2024)
Oyster-I: Beyond Refusal -- Constructive Safety Alignment for Responsible Language Models
par: Duan, Ranjie, et autres
Publié: (2025)
par: Duan, Ranjie, et autres
Publié: (2025)
BiasFreeBench: a Benchmark for Mitigating Bias in Large Language Model Responses
par: Xu, Xin, et autres
Publié: (2025)
par: Xu, Xin, et autres
Publié: (2025)
Position is Power: System Prompts as a Mechanism of Bias in Large Language Models (LLMs)
par: Neumann, Anna, et autres
Publié: (2025)
par: Neumann, Anna, et autres
Publié: (2025)
The Unequal Opportunities of Large Language Models: Revealing Demographic Bias through Job Recommendations
par: Salinas, Abel, et autres
Publié: (2023)
par: Salinas, Abel, et autres
Publié: (2023)
JobFair: A Framework for Benchmarking Gender Hiring Bias in Large Language Models
par: Wang, Ze, et autres
Publié: (2024)
par: Wang, Ze, et autres
Publié: (2024)
Harmful Speech Detection by Language Models Exhibits Gender-Queer Dialect Bias
par: Dorn, Rebecca, et autres
Publié: (2024)
par: Dorn, Rebecca, et autres
Publié: (2024)
Intrinsic Meets Extrinsic Fairness: Assessing the Downstream Impact of Bias Mitigation in Large Language Models
par: Arzaghi', 'Mina, et autres
Publié: (2025)
par: Arzaghi', 'Mina, et autres
Publié: (2025)
Political Alignment in Large Language Models: A Multidimensional Audit of Psychometric Identity and Behavioral Bias
par: Sakhawat, Adib, et autres
Publié: (2026)
par: Sakhawat, Adib, et autres
Publié: (2026)
Quantifying Risk Propensities of Large Language Models: Ethical Focus and Bias Detection through Role-Play
par: Zeng, Yifan, et autres
Publié: (2024)
par: Zeng, Yifan, et autres
Publié: (2024)
Ask LLMs Directly, "What shapes your bias?": Measuring Social Bias in Large Language Models
par: Shin, Jisu, et autres
Publié: (2024)
par: Shin, Jisu, et autres
Publié: (2024)
Documents similaires
-
Down the Toxicity Rabbit Hole: A Novel Framework to Bias Audit Large Language Models
par: Dutta, Arka, et autres
Publié: (2023) -
LLMs are Biased Teachers: Evaluating LLM Bias in Personalized Education
par: Weissburg, Iain, et autres
Publié: (2024) -
Characterizing Bias: Benchmarking Large Language Models in Simplified versus Traditional Chinese
par: Lyu, Hanjia, et autres
Publié: (2025) -
Inference-Time Reasoning Selectively Reduces Implicit Social Bias in Large Language Models
par: Apsel, Molly, et autres
Publié: (2026) -
Gender Bias in Emotion Recognition by Large Language Models
par: Herbert, Maureen, et autres
Publié: (2025)