Agree to Disagree? A Meta-Evaluation of LLM Misgendering
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Subramonian, Arjun, Gautam, Vagrant, Seshadri, Preethi, Klakow, Dietrich, Chang, Kai-Wei, Sun, Yizhou |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Understanding "Democratization" in NLP and ML Research
par: Subramonian, Arjun, et autres
Publié: (2024)
par: Subramonian, Arjun, et autres
Publié: (2024)
Stop! In the Name of Flaws: Disentangling Personal Names and Sociodemographic Attributes in NLP
par: Gautam, Vagrant, et autres
Publié: (2024)
par: Gautam, Vagrant, et autres
Publié: (2024)
Robust Pronoun Fidelity with English LLMs: Are they Reasoning, Repeating, or Just Biased?
par: Gautam, Vagrant, et autres
Publié: (2024)
par: Gautam, Vagrant, et autres
Publié: (2024)
Aligned Probing: Relating Toxic Behavior and Model Internals
par: Waldis, Andreas, et autres
Publié: (2025)
par: Waldis, Andreas, et autres
Publié: (2025)
From Insights to Actions: The Impact of Interpretability and Analysis Research on NLP
par: Mosbach, Marius, et autres
Publié: (2024)
par: Mosbach, Marius, et autres
Publié: (2024)
Decoding Partial Differential Equations: Cross-Modal Adaptation of Decoder-only Models to PDEs
par: García-de-Herreros, Paloma, et autres
Publié: (2025)
par: García-de-Herreros, Paloma, et autres
Publié: (2025)
WinoPron: Revisiting English Winogender Schemas for Consistency, Coverage, and Grammatical Case
par: Gautam, Vagrant, et autres
Publié: (2024)
par: Gautam, Vagrant, et autres
Publié: (2024)
Networked Inequality: Preferential Attachment Bias in Graph Neural Network Link Prediction
par: Subramonian, Arjun, et autres
Publié: (2023)
par: Subramonian, Arjun, et autres
Publié: (2023)
Teaching and Critiquing Conceptualization and Operationalization in NLP
par: Gautam, Vagrant
Publié: (2025)
par: Gautam, Vagrant
Publié: (2025)
Accept or Deny? Evaluating LLM Fairness and Performance in Loan Approval across Table-to-Text Serialization Approaches
par: Azime, Israel Abebe, et autres
Publié: (2025)
par: Azime, Israel Abebe, et autres
Publié: (2025)
Colombian Waitresses y Jueces canadienses: Gender and Country Biases in Occupation Recommendations from LLMs
par: Rodríguez, Elisa Forcada, et autres
Publié: (2025)
par: Rodríguez, Elisa Forcada, et autres
Publié: (2025)
What explains the success of cross-modal fine-tuning with ORCA?
par: García-de-Herreros, Paloma, et autres
Publié: (2024)
par: García-de-Herreros, Paloma, et autres
Publié: (2024)
For the Misgendered Chinese in Gender Bias Research: Multi-Task Learning with Knowledge Distillation for Pinyin Name-Gender Prediction
par: Du, Xiaocong, et autres
Publié: (2024)
par: Du, Xiaocong, et autres
Publié: (2024)
The Impact of Demonstrations on Multilingual In-Context Learning: A Multidimensional Analysis
par: Zhang, Miaoran, et autres
Publié: (2024)
par: Zhang, Miaoran, et autres
Publié: (2024)
GRUFF: LLM Pronoun Fidelity, Reasoning, and Biases in German
par: Mewes, Fabian, et autres
Publié: (2026)
par: Mewes, Fabian, et autres
Publié: (2026)
MisgenderMender: A Community-Informed Approach to Interventions for Misgendering
par: Hossain, Tamanna, et autres
Publié: (2024)
par: Hossain, Tamanna, et autres
Publié: (2024)
Agree, Disagree, Explain: Decomposing Human Label Variation in NLI through the Lens of Explanations
par: Hong, Pingjun, et autres
Publié: (2025)
par: Hong, Pingjun, et autres
Publié: (2025)
When Annotators Agree but Labels Disagree: The Projection Problem in Stance Detection
par: Zhang, Bowen
Publié: (2026)
par: Zhang, Bowen
Publié: (2026)
Are Models Biased on Text without Gender-related Language?
par: Belém, Catarina G, et autres
Publié: (2024)
par: Belém, Catarina G, et autres
Publié: (2024)
IGC: Integrating a Gated Calculator into an LLM to Solve Arithmetic Tasks Reliably and Efficiently
par: Dietz, Florian, et autres
Publié: (2025)
par: Dietz, Florian, et autres
Publié: (2025)
Whose Facts Win? LLM Source Preferences under Knowledge Conflicts
par: Schuster, Jakob, et autres
Publié: (2026)
par: Schuster, Jakob, et autres
Publié: (2026)
Diagnosing Hate Speech Classification: Where Do Humans and Machines Disagree, and Why?
par: Yang, Xilin
Publié: (2024)
par: Yang, Xilin
Publié: (2024)
Why They Disagree: Decoding Differences in Opinions about AI Risk on the Lex Fridman Podcast
par: Truong, Nghi, et autres
Publié: (2025)
par: Truong, Nghi, et autres
Publié: (2025)
Utilizing Multimodal Data for Edge Case Robust Call-sign Recognition and Understanding
par: Blatt, Alexander, et autres
Publié: (2024)
par: Blatt, Alexander, et autres
Publié: (2024)
Lost in Simulation: LLM-Simulated Users are Unreliable Proxies for Human Users in Agentic Evaluations
par: Seshadri, Preethi, et autres
Publié: (2026)
par: Seshadri, Preethi, et autres
Publié: (2026)
Your Multimodal Speech Model Says I Have a Face for Radio
par: Nachesa, Maya K., et autres
Publié: (2026)
par: Nachesa, Maya K., et autres
Publié: (2026)
Evaluating Intermediate Reasoning of Code-Assisted Large Language Models for Mathematics
par: Al-Khalili, Zena, et autres
Publié: (2025)
par: Al-Khalili, Zena, et autres
Publié: (2025)
Survey of Bias In Text-to-Image Generation: Definition, Evaluation, and Mitigation
par: Wan, Yixin, et autres
Publié: (2024)
par: Wan, Yixin, et autres
Publié: (2024)
A Multilingual, Culture-First Approach to Addressing Misgendering in LLM Applications
par: Sitaram, Sunayana, et autres
Publié: (2025)
par: Sitaram, Sunayana, et autres
Publié: (2025)
When Roles Fail: Epistemic Constraints on Advocate Role Fidelity in LLM-Based Political Statement Analysis
par: Dietrich, Juergen
Publié: (2026)
par: Dietrich, Juergen
Publié: (2026)
When Models Disagree: Rethinking LLM Evaluation for Public Comment Analysis
par: Najera, Aisha, et autres
Publié: (2026)
par: Najera, Aisha, et autres
Publié: (2026)
White Men Lead, Black Women Help? Benchmarking and Mitigating Language Agency Social Biases in LLMs
par: Wan, Yixin, et autres
Publié: (2024)
par: Wan, Yixin, et autres
Publié: (2024)
IYKYK (But AI Doesn't): Automated Content Moderation Does Not Capture Communities' Heterogeneous Attitudes Towards Reclaimed Language
par: Chance, Christina, et autres
Publié: (2026)
par: Chance, Christina, et autres
Publié: (2026)
Do These LLM Benchmarks Agree? Fixing Benchmark Evaluation with BenchBench
par: Perlitz, Yotam, et autres
Publié: (2024)
par: Perlitz, Yotam, et autres
Publié: (2024)
Task-Dependent Evaluation of LLM Output Homogenization: A Taxonomy-Guided Framework
par: Jain, Shomik, et autres
Publié: (2025)
par: Jain, Shomik, et autres
Publié: (2025)
An Effective Theory of Bias Amplification
par: Subramonian, Arjun, et autres
Publié: (2024)
par: Subramonian, Arjun, et autres
Publié: (2024)
LLMs are Biased Teachers: Evaluating LLM Bias in Personalized Education
par: Weissburg, Iain, et autres
Publié: (2024)
par: Weissburg, Iain, et autres
Publié: (2024)
InsideOut: Measuring and Mitigating Insider-Outsider Bias in Interview Script Generation
par: Wan, Yixin, et autres
Publié: (2025)
par: Wan, Yixin, et autres
Publié: (2025)
Modeling Motivated Reasoning in Law: Evaluating Strategic Role Conditioning in LLM Summarization
par: Cho, Eunjung, et autres
Publié: (2025)
par: Cho, Eunjung, et autres
Publié: (2025)
Disentangling Geometry, Performance, and Training in Language Models
par: Kulkarni, Atharva, et autres
Publié: (2026)
par: Kulkarni, Atharva, et autres
Publié: (2026)
Documents similaires
-
Understanding "Democratization" in NLP and ML Research
par: Subramonian, Arjun, et autres
Publié: (2024) -
Stop! In the Name of Flaws: Disentangling Personal Names and Sociodemographic Attributes in NLP
par: Gautam, Vagrant, et autres
Publié: (2024) -
Robust Pronoun Fidelity with English LLMs: Are they Reasoning, Repeating, or Just Biased?
par: Gautam, Vagrant, et autres
Publié: (2024) -
Aligned Probing: Relating Toxic Behavior and Model Internals
par: Waldis, Andreas, et autres
Publié: (2025) -
From Insights to Actions: The Impact of Interpretability and Analysis Research on NLP
par: Mosbach, Marius, et autres
Publié: (2024)