Social Bias Probing: Fairness Benchmarking for Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Manerba, Marta Marchiori, Stańczak, Karolina, Guidotti, Riccardo, Augenstein, Isabelle |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
A Multilingual Perspective on Probing Gender Bias
di: Stańczak, Karolina
Pubblicazione: (2024)
di: Stańczak, Karolina
Pubblicazione: (2024)
Quantifying Gender Biases Towards Politicians on Reddit
di: Marjanovic, Sara, et al.
Pubblicazione: (2021)
di: Marjanovic, Sara, et al.
Pubblicazione: (2021)
FairBelief -- Assessing Harmful Beliefs in Language Models
di: Setzu, Mattia, et al.
Pubblicazione: (2024)
di: Setzu, Mattia, et al.
Pubblicazione: (2024)
A Latent-Variable Model for Intrinsic Probing
di: Stańczak, Karolina, et al.
Pubblicazione: (2022)
di: Stańczak, Karolina, et al.
Pubblicazione: (2022)
The Causal Influence of Grammatical Gender on Distributional Semantics
di: Stańczak, Karolina, et al.
Pubblicazione: (2023)
di: Stańczak, Karolina, et al.
Pubblicazione: (2023)
Probing Pre-Trained Language Models for Cross-Cultural Differences in Values
di: Arora, Arnav, et al.
Pubblicazione: (2022)
di: Arora, Arnav, et al.
Pubblicazione: (2022)
Measuring and Benchmarking Large Language Models' Capabilities to Generate Persuasive Language
di: Pauli, Amalie Brogaard, et al.
Pubblicazione: (2024)
di: Pauli, Amalie Brogaard, et al.
Pubblicazione: (2024)
Towards the Formalization of a Trustworthy AI for Mining Interpretable Models explOiting Sophisticated Algorithms
di: Guidotti, Riccardo, et al.
Pubblicazione: (2025)
di: Guidotti, Riccardo, et al.
Pubblicazione: (2025)
Invisible Women in Digital Diplomacy: A Multidimensional Framework for Online Gender Bias Against Women Ambassadors Worldwide
di: Golovchenko, Yevgeniy, et al.
Pubblicazione: (2023)
di: Golovchenko, Yevgeniy, et al.
Pubblicazione: (2023)
Understanding the Interplay between LLMs' Utilisation of Parametric and Contextual Knowledge: A keynote at ECIR 2025
di: Augenstein, Isabelle
Pubblicazione: (2026)
di: Augenstein, Isabelle
Pubblicazione: (2026)
Aggregating Soft Labels from Crowd Annotations Improves Uncertainty Estimation Under Distribution Shift
di: Wright, Dustin, et al.
Pubblicazione: (2022)
di: Wright, Dustin, et al.
Pubblicazione: (2022)
Probing for Reading Times
di: Tsipidi, Eleftheria, et al.
Pubblicazione: (2026)
di: Tsipidi, Eleftheria, et al.
Pubblicazione: (2026)
CUB: Benchmarking Context Utilisation Techniques for Language Models
di: Hagström, Lovisa, et al.
Pubblicazione: (2025)
di: Hagström, Lovisa, et al.
Pubblicazione: (2025)
Benchmarking Vision Language Models for Cultural Understanding
di: Nayak, Shravan, et al.
Pubblicazione: (2024)
di: Nayak, Shravan, et al.
Pubblicazione: (2024)
Can Transformers Learn $n$-gram Language Models?
di: Svete, Anej, et al.
Pubblicazione: (2024)
di: Svete, Anej, et al.
Pubblicazione: (2024)
Is Reasoning All You Need? Probing Bias in the Age of Reasoning Language Models
di: Cantini, Riccardo, et al.
Pubblicazione: (2025)
di: Cantini, Riccardo, et al.
Pubblicazione: (2025)
Revealing the Parametric Knowledge of Language Models: A Unified Framework for Attribution Methods
di: Yu, Haeun, et al.
Pubblicazione: (2024)
di: Yu, Haeun, et al.
Pubblicazione: (2024)
Expanding Computation Spaces of LLMs at Inference Time
di: Jang, Yoonna, et al.
Pubblicazione: (2025)
di: Jang, Yoonna, et al.
Pubblicazione: (2025)
Semantic Sensitivities and Inconsistent Predictions: Measuring the Fragility of NLI Models
di: Arakelyan, Erik, et al.
Pubblicazione: (2024)
di: Arakelyan, Erik, et al.
Pubblicazione: (2024)
Investigating the Impact of Model Instability on Explanations and Uncertainty
di: Marjanović, Sara Vera, et al.
Pubblicazione: (2024)
di: Marjanović, Sara Vera, et al.
Pubblicazione: (2024)
Claim Verification in the Age of Large Language Models: A Survey
di: Dmonte, Alphaeus, et al.
Pubblicazione: (2024)
di: Dmonte, Alphaeus, et al.
Pubblicazione: (2024)
Evaluation Framework for Highlight Explanations of Context Utilisation in Language Models
di: Sun, Jingyi, et al.
Pubblicazione: (2025)
di: Sun, Jingyi, et al.
Pubblicazione: (2025)
On Bias and Fairness in NLP: Investigating the Impact of Bias and Debiasing in Language Models on the Fairness of Toxicity Detection
di: Elsafoury, Fatma, et al.
Pubblicazione: (2023)
di: Elsafoury, Fatma, et al.
Pubblicazione: (2023)
Specializing Large Language Models to Simulate Survey Response Distributions for Global Populations
di: Cao, Yong, et al.
Pubblicazione: (2025)
di: Cao, Yong, et al.
Pubblicazione: (2025)
Mind the Style Gap: Meta-Evaluation of Style and Attribute Transfer Metrics
di: Pauli, Amalie Brogaard, et al.
Pubblicazione: (2025)
di: Pauli, Amalie Brogaard, et al.
Pubblicazione: (2025)
Show Me the Work: Fact-Checkers' Requirements for Explainable Automated Fact-Checking
di: Warren, Greta, et al.
Pubblicazione: (2025)
di: Warren, Greta, et al.
Pubblicazione: (2025)
JobFair: A Framework for Benchmarking Gender Hiring Bias in Large Language Models
di: Wang, Ze, et al.
Pubblicazione: (2024)
di: Wang, Ze, et al.
Pubblicazione: (2024)
Revealing Fine-Grained Values and Opinions in Large Language Models
di: Wright, Dustin, et al.
Pubblicazione: (2024)
di: Wright, Dustin, et al.
Pubblicazione: (2024)
Modeling Public Perceptions of Science in Media
di: Pei, Jiaxin, et al.
Pubblicazione: (2025)
di: Pei, Jiaxin, et al.
Pubblicazione: (2025)
SynDARin: Synthesising Datasets for Automated Reasoning in Low-Resource Languages
di: Ghazaryan, Gayane, et al.
Pubblicazione: (2024)
di: Ghazaryan, Gayane, et al.
Pubblicazione: (2024)
Surface Fairness, Deep Bias: A Comparative Study of Bias in Language Models
di: Sorokovikova, Aleksandra, et al.
Pubblicazione: (2025)
di: Sorokovikova, Aleksandra, et al.
Pubblicazione: (2025)
What Languages are Easy to Language-Model? A Perspective from Learning Probabilistic Regular Languages
di: Borenstein, Nadav, et al.
Pubblicazione: (2024)
di: Borenstein, Nadav, et al.
Pubblicazione: (2024)
Explaining Sources of Uncertainty in Automated Fact-Checking
di: Sun, Jingyi, et al.
Pubblicazione: (2025)
di: Sun, Jingyi, et al.
Pubblicazione: (2025)
Understanding Fine-grained Distortions in Reports of Scientific Findings
di: Wührl, Amelie, et al.
Pubblicazione: (2024)
di: Wührl, Amelie, et al.
Pubblicazione: (2024)
Why Should This Article Be Deleted? Transparent Stance Detection in Multilingual Wikipedia Editor Discussions
di: Kaffee, Lucie-Aimée, et al.
Pubblicazione: (2023)
di: Kaffee, Lucie-Aimée, et al.
Pubblicazione: (2023)
Interpretable Debiasing of Vision-Language Models for Social Fairness
di: An, Na Min, et al.
Pubblicazione: (2026)
di: An, Na Min, et al.
Pubblicazione: (2026)
JBBQ: Japanese Bias Benchmark for Analyzing Social Biases in Large Language Models
di: Yanaka, Hitomi, et al.
Pubblicazione: (2024)
di: Yanaka, Hitomi, et al.
Pubblicazione: (2024)
TriCon-Fair: Triplet Contrastive Learning for Mitigating Social Bias in Pre-trained Language Models
di: Lyu, Chong, et al.
Pubblicazione: (2025)
di: Lyu, Chong, et al.
Pubblicazione: (2025)
Fair-GPTQ: Bias-Aware Quantization for Large Language Models
di: Proskurina, Irina, et al.
Pubblicazione: (2025)
di: Proskurina, Irina, et al.
Pubblicazione: (2025)
Evaluating Input Feature Explanations through a Unified Diagnostic Evaluation Framework
di: Sun, Jingyi, et al.
Pubblicazione: (2024)
di: Sun, Jingyi, et al.
Pubblicazione: (2024)
Documenti analoghi
-
A Multilingual Perspective on Probing Gender Bias
di: Stańczak, Karolina
Pubblicazione: (2024) -
Quantifying Gender Biases Towards Politicians on Reddit
di: Marjanovic, Sara, et al.
Pubblicazione: (2021) -
FairBelief -- Assessing Harmful Beliefs in Language Models
di: Setzu, Mattia, et al.
Pubblicazione: (2024) -
A Latent-Variable Model for Intrinsic Probing
di: Stańczak, Karolina, et al.
Pubblicazione: (2022) -
The Causal Influence of Grammatical Gender on Distributional Semantics
di: Stańczak, Karolina, et al.
Pubblicazione: (2023)