Bias Analysis and Mitigation through Protected Attribute Detection and Regard Classification
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Udagawa, Takuma, Zhao, Yang, Kanayama, Hiroshi, Bhattacharjee, Bishwaranjan |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Efficient Models for the Detection of Hate, Abuse and Profanity
par: Tillmann, Christoph, et autres
Publié: (2024)
par: Tillmann, Christoph, et autres
Publié: (2024)
Detection, Classification, and Mitigation of Gender Bias in Large Language Models
par: Cheng, Xiaoqing, et autres
Publié: (2025)
par: Cheng, Xiaoqing, et autres
Publié: (2025)
Robust ASR Error Correction with Conservative Data Filtering
par: Udagawa, Takuma, et autres
Publié: (2024)
par: Udagawa, Takuma, et autres
Publié: (2024)
LLM Bias Detection and Mitigation through the Lens of Desired Distributions
par: Shrestha, Ingroj, et autres
Publié: (2025)
par: Shrestha, Ingroj, et autres
Publié: (2025)
Detecting and Mitigating Bias in LLMs through Knowledge Graph-Augmented Training
par: Kumar, Rajeev, et autres
Publié: (2025)
par: Kumar, Rajeev, et autres
Publié: (2025)
BiasDPO: Mitigating Bias in Language Models through Direct Preference Optimization
par: Allam, Ahmed
Publié: (2024)
par: Allam, Ahmed
Publié: (2024)
NLPGuard: A Framework for Mitigating the Use of Protected Attributes by NLP Classifiers
par: Greco, Salvatore, et autres
Publié: (2024)
par: Greco, Salvatore, et autres
Publié: (2024)
Mitigating Bias in Text Classification via Prompt-Based Text Transformation
par: Barker, Charmaine, et autres
Publié: (2023)
par: Barker, Charmaine, et autres
Publié: (2023)
Mitigating the Bias of Large Language Model Evaluation
par: Zhou, Hongli, et autres
Publié: (2024)
par: Zhou, Hongli, et autres
Publié: (2024)
Unveiling and Mitigating Bias in Mental Health Analysis with Large Language Models
par: Wang, Yuqing, et autres
Publié: (2024)
par: Wang, Yuqing, et autres
Publié: (2024)
Can We Trust LLMs? Mitigate Overconfidence Bias in LLMs through Knowledge Transfer
par: Yang, Haoyan, et autres
Publié: (2024)
par: Yang, Haoyan, et autres
Publié: (2024)
Position Bias Mitigates Position Bias:Mitigate Position Bias Through Inter-Position Knowledge Distillation
par: Wang, Yifei, et autres
Publié: (2025)
par: Wang, Yifei, et autres
Publié: (2025)
Mitigating Extrinsic Gender Bias for Bangla Classification Tasks
par: Joy, Sajib Kumar Saha, et autres
Publié: (2024)
par: Joy, Sajib Kumar Saha, et autres
Publié: (2024)
UniBias: Unveiling and Mitigating LLM Bias through Internal Attention and FFN Manipulation
par: Zhou, Hanzhang, et autres
Publié: (2024)
par: Zhou, Hanzhang, et autres
Publié: (2024)
Towards Implicit Bias Detection and Mitigation in Multi-Agent LLM Interactions
par: Borah, Angana, et autres
Publié: (2024)
par: Borah, Angana, et autres
Publié: (2024)
Mitigating Length Bias in RLHF through a Causal Lens
par: Kim, Hyeonji, et autres
Publié: (2025)
par: Kim, Hyeonji, et autres
Publié: (2025)
Mitigating Copy Bias in In-Context Learning through Neuron Pruning
par: Ali, Ameen, et autres
Publié: (2024)
par: Ali, Ameen, et autres
Publié: (2024)
Attribution Techniques for Mitigating Hallucinated Information in RAG Systems: A Survey
par: Zhao, Yuqing, et autres
Publié: (2026)
par: Zhao, Yuqing, et autres
Publié: (2026)
Mitigating Judgment Preference Bias in Large Language Models through Group-Based Polling
par: Liu, Shuliang, et autres
Publié: (2025)
par: Liu, Shuliang, et autres
Publié: (2025)
Exploring the Jungle of Bias: Political Bias Attribution in Language Models via Dependency Analysis
par: Jenny, David F., et autres
Publié: (2023)
par: Jenny, David F., et autres
Publié: (2023)
Disclosure and Mitigation of Gender Bias in LLMs
par: Dong, Xiangjue, et autres
Publié: (2024)
par: Dong, Xiangjue, et autres
Publié: (2024)
Mitigating Bias in Locally Constrained Decoding via Tractable Proposals
par: Dang, Meihua, et autres
Publié: (2026)
par: Dang, Meihua, et autres
Publié: (2026)
Diagnosing and Mitigating Semantic Inconsistencies in Wikidata's Classification Hierarchy
par: Zhao, Shixiong, et autres
Publié: (2025)
par: Zhao, Shixiong, et autres
Publié: (2025)
Evaluating and Mitigating Social Bias for Large Language Models in Open-ended Settings
par: Liu, Zhao, et autres
Publié: (2024)
par: Liu, Zhao, et autres
Publié: (2024)
Mitigating Boundary Ambiguity and Inherent Bias for Text Classification in the Era of Large Language Models
par: Lu, Zhenyi, et autres
Publié: (2024)
par: Lu, Zhenyi, et autres
Publié: (2024)
Understanding and Mitigating Spurious Correlations in Text Classification with Neighborhood Analysis
par: Chew, Oscar, et autres
Publié: (2023)
par: Chew, Oscar, et autres
Publié: (2023)
Mitigating Bias for Question Answering Models by Tracking Bias Influence
par: Ma, Mingyu Derek, et autres
Publié: (2023)
par: Ma, Mingyu Derek, et autres
Publié: (2023)
Foundational Study on Authorship Attribution of Japanese Web Reviews for Actor Analysis
par: Matsubara, Hiroshi, et autres
Publié: (2026)
par: Matsubara, Hiroshi, et autres
Publié: (2026)
Mitigation of Gender and Ethnicity Bias in AI-Generated Stories through Model Explanations
par: Dimgba, Martha O., et autres
Publié: (2025)
par: Dimgba, Martha O., et autres
Publié: (2025)
Open-DeBias: Toward Mitigating Open-Set Bias in Language Models
par: Rani, Arti, et autres
Publié: (2025)
par: Rani, Arti, et autres
Publié: (2025)
Talent or Luck? Evaluating Attribution Bias in Large Language Models
par: Raj, Chahat, et autres
Publié: (2025)
par: Raj, Chahat, et autres
Publié: (2025)
VIGIL: An Extensible System for Real-Time Detection and Mitigation of Cognitive Bias Triggers
par: Kang, Bo, et autres
Publié: (2026)
par: Kang, Bo, et autres
Publié: (2026)
An Empirical Study on the Characteristics of Bias upon Context Length Variation for Bangla
par: Sadhu, Jayanta, et autres
Publié: (2024)
par: Sadhu, Jayanta, et autres
Publié: (2024)
Ask-Before-Detection: Identifying and Mitigating Conformity Bias in LLM-Powered Error Detector for Math Word Problem Solutions
par: Li, Hang, et autres
Publié: (2024)
par: Li, Hang, et autres
Publié: (2024)
Topic Bias in Emotion Classification
par: Wegge, Maximilian, et autres
Publié: (2023)
par: Wegge, Maximilian, et autres
Publié: (2023)
Bias Attribution in Filipino Language Models: Extending a Bias Interpretability Metric for Application on Agglutinative Languages
par: Gamboa, Lance Calvin Lim, et autres
Publié: (2025)
par: Gamboa, Lance Calvin Lim, et autres
Publié: (2025)
Language Bias in LVLMs: From In-Depth Analysis to Simple and Effective Mitigation
par: Chen, Yangneng, et autres
Publié: (2026)
par: Chen, Yangneng, et autres
Publié: (2026)
Fine-grained Analysis of Brain-LLM Alignment through Input Attribution
par: Proietti, Michela, et autres
Publié: (2025)
par: Proietti, Michela, et autres
Publié: (2025)
DepFlow: Disentangled Speech Generation to Mitigate Semantic Bias in Depression Detection
par: Li, Yuxin, et autres
Publié: (2026)
par: Li, Yuxin, et autres
Publié: (2026)
Analyzing and Mitigating Object Hallucination: A Training Bias Perspective
par: Li, Yifan, et autres
Publié: (2025)
par: Li, Yifan, et autres
Publié: (2025)
Documents similaires
-
Efficient Models for the Detection of Hate, Abuse and Profanity
par: Tillmann, Christoph, et autres
Publié: (2024) -
Detection, Classification, and Mitigation of Gender Bias in Large Language Models
par: Cheng, Xiaoqing, et autres
Publié: (2025) -
Robust ASR Error Correction with Conservative Data Filtering
par: Udagawa, Takuma, et autres
Publié: (2024) -
LLM Bias Detection and Mitigation through the Lens of Desired Distributions
par: Shrestha, Ingroj, et autres
Publié: (2025) -
Detecting and Mitigating Bias in LLMs through Knowledge Graph-Augmented Training
par: Kumar, Rajeev, et autres
Publié: (2025)