A Taxonomy of Stereotype Content in Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Nicolas, Gandalf, Caliskan, Aylin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Gender, Race, and Intersectional Bias in Resume Screening via Language Model Retrieval
di: Wilson, Kyra, et al.
Pubblicazione: (2024)
di: Wilson, Kyra, et al.
Pubblicazione: (2024)
Identifying Features Associated with Bias Against 93 Stigmatized Groups in Language Models and Guardrail Model Safety Mitigation
di: Gueorguieva, Anna-Maria, et al.
Pubblicazione: (2025)
di: Gueorguieva, Anna-Maria, et al.
Pubblicazione: (2025)
Self-Debiasing Large Language Models: Zero-Shot Recognition and Reduction of Stereotypes
di: Gallegos, Isabel O., et al.
Pubblicazione: (2024)
di: Gallegos, Isabel O., et al.
Pubblicazione: (2024)
ChatGPT Perpetuates Gender Bias in Machine Translation and Ignores Non-Gendered Pronouns: Findings across Bengali and Five other Low-Resource Languages
di: Ghosh, Sourojit, et al.
Pubblicazione: (2023)
di: Ghosh, Sourojit, et al.
Pubblicazione: (2023)
BiasEdit: Debiasing Stereotyped Language Models via Model Editing
di: Xu, Xin, et al.
Pubblicazione: (2025)
di: Xu, Xin, et al.
Pubblicazione: (2025)
Topic Classification of Case Law Using a Large Language Model and a New Taxonomy for UK Law: AI Insights into Summary Judgment
di: Sargeant, Holli, et al.
Pubblicazione: (2024)
di: Sargeant, Holli, et al.
Pubblicazione: (2024)
On The Role of Reasoning in the Identification of Subtle Stereotypes in Natural Language
di: Tian, Jacob-Junqi, et al.
Pubblicazione: (2023)
di: Tian, Jacob-Junqi, et al.
Pubblicazione: (2023)
Bias and Fairness in Large Language Models: A Survey
di: Gallegos, Isabel O., et al.
Pubblicazione: (2023)
di: Gallegos, Isabel O., et al.
Pubblicazione: (2023)
Hypothesis Generation with Large Language Models
di: Zhou, Yangqiaoyu, et al.
Pubblicazione: (2024)
di: Zhou, Yangqiaoyu, et al.
Pubblicazione: (2024)
Large Language Models are Geographically Biased
di: Manvi, Rohin, et al.
Pubblicazione: (2024)
di: Manvi, Rohin, et al.
Pubblicazione: (2024)
Correlated Errors in Large Language Models
di: Kim, Elliot, et al.
Pubblicazione: (2025)
di: Kim, Elliot, et al.
Pubblicazione: (2025)
Psychological Counseling Ability of Large Language Models
di: Peng, Fangyu, et al.
Pubblicazione: (2025)
di: Peng, Fangyu, et al.
Pubblicazione: (2025)
Assessing Large Language Models on Climate Information
di: Bulian, Jannis, et al.
Pubblicazione: (2023)
di: Bulian, Jannis, et al.
Pubblicazione: (2023)
A Moral Imperative: The Need for Continual Superalignment of Large Language Models
di: Puthumanaillam, Gokul, et al.
Pubblicazione: (2024)
di: Puthumanaillam, Gokul, et al.
Pubblicazione: (2024)
Transforming Agency. On the mode of existence of Large Language Models
di: Barandiaran, Xabier E., et al.
Pubblicazione: (2024)
di: Barandiaran, Xabier E., et al.
Pubblicazione: (2024)
LLMCarbon: Modeling the end-to-end Carbon Footprint of Large Language Models
di: Faiz, Ahmad, et al.
Pubblicazione: (2023)
di: Faiz, Ahmad, et al.
Pubblicazione: (2023)
Predicting Learning Performance with Large Language Models: A Study in Adult Literacy
di: Zhang, Liang, et al.
Pubblicazione: (2024)
di: Zhang, Liang, et al.
Pubblicazione: (2024)
Siren's Song in the AI Ocean: A Survey on Hallucination in Large Language Models
di: Zhang, Yue, et al.
Pubblicazione: (2023)
di: Zhang, Yue, et al.
Pubblicazione: (2023)
ResumeAtlas: Revisiting Resume Classification with Large-Scale Datasets and Large Language Models
di: Heakl, Ahmed, et al.
Pubblicazione: (2024)
di: Heakl, Ahmed, et al.
Pubblicazione: (2024)
Foundational Challenges in Assuring Alignment and Safety of Large Language Models
di: Anwar, Usman, et al.
Pubblicazione: (2024)
di: Anwar, Usman, et al.
Pubblicazione: (2024)
Exploring Accuracy-Fairness Trade-off in Large Language Models
di: Zhang, Qingquan, et al.
Pubblicazione: (2024)
di: Zhang, Qingquan, et al.
Pubblicazione: (2024)
Are Large Language Models Chameleons? An Attempt to Simulate Social Surveys
di: Geng, Mingmeng, et al.
Pubblicazione: (2024)
di: Geng, Mingmeng, et al.
Pubblicazione: (2024)
Towards Large Language Models that Benefit for All: Benchmarking Group Fairness in Reward Models
di: Song, Kefan, et al.
Pubblicazione: (2025)
di: Song, Kefan, et al.
Pubblicazione: (2025)
REQUAL-LM: Reliability and Equity through Aggregation in Large Language Models
di: Ebrahimi, Sana, et al.
Pubblicazione: (2024)
di: Ebrahimi, Sana, et al.
Pubblicazione: (2024)
Emissions and Performance Trade-off Between Small and Large Language Models
di: Garg, Anandita, et al.
Pubblicazione: (2025)
di: Garg, Anandita, et al.
Pubblicazione: (2025)
Democratizing Diplomacy: A Harness for Evaluating Any Large Language Model on Full-Press Diplomacy
di: Duffy, Alexander, et al.
Pubblicazione: (2025)
di: Duffy, Alexander, et al.
Pubblicazione: (2025)
Fairer Preferences Elicit Improved Human-Aligned Large Language Model Judgments
di: Zhou, Han, et al.
Pubblicazione: (2024)
di: Zhou, Han, et al.
Pubblicazione: (2024)
What's in a Name? Auditing Large Language Models for Race and Gender Bias
di: Salinas, Alejandro, et al.
Pubblicazione: (2024)
di: Salinas, Alejandro, et al.
Pubblicazione: (2024)
Large Language Models Assume People are More Rational than We Really are
di: Liu, Ryan, et al.
Pubblicazione: (2024)
di: Liu, Ryan, et al.
Pubblicazione: (2024)
AXOLOTL: Fairness through Assisted Self-Debiasing of Large Language Model Outputs
di: Ebrahimi, Sana, et al.
Pubblicazione: (2024)
di: Ebrahimi, Sana, et al.
Pubblicazione: (2024)
SimBench: Benchmarking the Ability of Large Language Models to Simulate Human Behaviors
di: Hu, Tiancheng, et al.
Pubblicazione: (2025)
di: Hu, Tiancheng, et al.
Pubblicazione: (2025)
SUV: Scalable Large Language Model Copyright Compliance with Regularized Selective Unlearning
di: Xu, Tianyang, et al.
Pubblicazione: (2025)
di: Xu, Tianyang, et al.
Pubblicazione: (2025)
RedTopic: Toward Topic-Diverse Red Teaming of Large Language Models
di: Ding, Jiale, et al.
Pubblicazione: (2025)
di: Ding, Jiale, et al.
Pubblicazione: (2025)
Large Language Models Predict Functional Outcomes after Acute Ischemic Stroke
di: Kapoor, Anjali K., et al.
Pubblicazione: (2026)
di: Kapoor, Anjali K., et al.
Pubblicazione: (2026)
LangFair: A Python Package for Assessing Bias and Fairness in Large Language Model Use Cases
di: Bouchard, Dylan, et al.
Pubblicazione: (2025)
di: Bouchard, Dylan, et al.
Pubblicazione: (2025)
GreedLlama: Performance of Financial Value-Aligned Large Language Models in Moral Reasoning
di: Yu, Jeffy, et al.
Pubblicazione: (2024)
di: Yu, Jeffy, et al.
Pubblicazione: (2024)
Large Language Models as Urban Residents: An LLM Agent Framework for Personal Mobility Generation
di: Wang, Jiawei, et al.
Pubblicazione: (2024)
di: Wang, Jiawei, et al.
Pubblicazione: (2024)
Deconstructing The Ethics of Large Language Models from Long-standing Issues to New-emerging Dilemmas: A Survey
di: Deng, Chengyuan, et al.
Pubblicazione: (2024)
di: Deng, Chengyuan, et al.
Pubblicazione: (2024)
Reducing Large Language Model Safety Risks in Women's Health using Semantic Entropy
di: Penny-Dimri, Jahan C., et al.
Pubblicazione: (2025)
di: Penny-Dimri, Jahan C., et al.
Pubblicazione: (2025)
Contextual StereoSet: Stress-Testing Bias Alignment Robustness in Large Language Models
di: Basu, Abhinaba, et al.
Pubblicazione: (2026)
di: Basu, Abhinaba, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Gender, Race, and Intersectional Bias in Resume Screening via Language Model Retrieval
di: Wilson, Kyra, et al.
Pubblicazione: (2024) -
Identifying Features Associated with Bias Against 93 Stigmatized Groups in Language Models and Guardrail Model Safety Mitigation
di: Gueorguieva, Anna-Maria, et al.
Pubblicazione: (2025) -
Self-Debiasing Large Language Models: Zero-Shot Recognition and Reduction of Stereotypes
di: Gallegos, Isabel O., et al.
Pubblicazione: (2024) -
ChatGPT Perpetuates Gender Bias in Machine Translation and Ignores Non-Gendered Pronouns: Findings across Bengali and Five other Low-Resource Languages
di: Ghosh, Sourojit, et al.
Pubblicazione: (2023) -
BiasEdit: Debiasing Stereotyped Language Models via Model Editing
di: Xu, Xin, et al.
Pubblicazione: (2025)