MABR: Multilayer Adversarial Bias Removal Without Prior Bias Knowledge
Fuente:
arXiv
Salvato in:
| Autori principali: | Yin, Maxwell J., Wang, Boyu, Ling, Charles |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Measuring Mechanistic Independence: Can Bias Be Removed Without Erasing Demographics?
di: Shan, Zhengyang, et al.
Pubblicazione: (2025)
di: Shan, Zhengyang, et al.
Pubblicazione: (2025)
Position Bias Mitigates Position Bias:Mitigate Position Bias Through Inter-Position Knowledge Distillation
di: Wang, Yifei, et al.
Pubblicazione: (2025)
di: Wang, Yifei, et al.
Pubblicazione: (2025)
Enhancing Generalization in Chain of Thought Reasoning for Smaller Models
di: Yin, Maxwell J., et al.
Pubblicazione: (2025)
di: Yin, Maxwell J., et al.
Pubblicazione: (2025)
The Bias is in the Details: An Assessment of Cognitive Bias in LLMs
di: Knipper, R. Alexander, et al.
Pubblicazione: (2025)
di: Knipper, R. Alexander, et al.
Pubblicazione: (2025)
Alleviating Choice Supportive Bias in LLM with Reasoning Dependency Generation
di: Zhuang, Nan, et al.
Pubblicazione: (2025)
di: Zhuang, Nan, et al.
Pubblicazione: (2025)
Diagnosing Retrieval Bias Under Multiple In-Context Knowledge Updates in Large Language Models
di: Qiao, Boyu, et al.
Pubblicazione: (2026)
di: Qiao, Boyu, et al.
Pubblicazione: (2026)
AdvSumm: Adversarial Training for Bias Mitigation in Text Summarization
di: Gupta, Mukur, et al.
Pubblicazione: (2025)
di: Gupta, Mukur, et al.
Pubblicazione: (2025)
Bias in, Bias out: Annotation Bias in Multilingual Large Language Models
di: Cui, Xia, et al.
Pubblicazione: (2025)
di: Cui, Xia, et al.
Pubblicazione: (2025)
Are Large Language Models Really Bias-Free? Jailbreak Prompts for Assessing Adversarial Robustness to Bias Elicitation
di: Cantini, Riccardo, et al.
Pubblicazione: (2024)
di: Cantini, Riccardo, et al.
Pubblicazione: (2024)
More Bias, Less Bias: BiasPrompting for Enhanced Multiple-Choice Question Answering
di: Vu, Duc Anh, et al.
Pubblicazione: (2025)
di: Vu, Duc Anh, et al.
Pubblicazione: (2025)
Format as a Prior: Quantifying and Analyzing Bias in LLMs for Heterogeneous Data
di: Liu, Jiacheng, et al.
Pubblicazione: (2025)
di: Liu, Jiacheng, et al.
Pubblicazione: (2025)
DIF: A Framework for Benchmarking and Verifying Implicit Bias in LLMs
di: Yin, Lake, et al.
Pubblicazione: (2025)
di: Yin, Lake, et al.
Pubblicazione: (2025)
RuBia: A Russian Language Bias Detection Dataset
di: Grigoreva, Veronika, et al.
Pubblicazione: (2024)
di: Grigoreva, Veronika, et al.
Pubblicazione: (2024)
Decoding News Bias: Multi Bias Detection in News Articles
di: Shah, Bhushan Santosh, et al.
Pubblicazione: (2025)
di: Shah, Bhushan Santosh, et al.
Pubblicazione: (2025)
Identifying and Mitigating Social Bias Knowledge in Language Models
di: Chen, Ruizhe, et al.
Pubblicazione: (2024)
di: Chen, Ruizhe, et al.
Pubblicazione: (2024)
Take Care of Your Prompt Bias! Investigating and Mitigating Prompt Bias in Factual Knowledge Extraction
di: Xu, Ziyang, et al.
Pubblicazione: (2024)
di: Xu, Ziyang, et al.
Pubblicazione: (2024)
Can We Trust LLMs? Mitigate Overconfidence Bias in LLMs through Knowledge Transfer
di: Yang, Haoyan, et al.
Pubblicazione: (2024)
di: Yang, Haoyan, et al.
Pubblicazione: (2024)
Tuning Into Bias: A Computational Study of Gender Bias in Song Lyrics
di: Chen, Danqing, et al.
Pubblicazione: (2024)
di: Chen, Danqing, et al.
Pubblicazione: (2024)
The Lifecycle of "Facts": A Survey of Social Bias in Knowledge Graphs
di: Kraft, Angelie, et al.
Pubblicazione: (2022)
di: Kraft, Angelie, et al.
Pubblicazione: (2022)
Sycophancy under Pressure: Evaluating and Mitigating Sycophantic Bias via Adversarial Dialogues in Scientific QA
di: Zhang, Kaiwei, et al.
Pubblicazione: (2025)
di: Zhang, Kaiwei, et al.
Pubblicazione: (2025)
RAZOR: Sharpening Knowledge by Cutting Bias with Unsupervised Text Rewriting
di: Yang, Shuo, et al.
Pubblicazione: (2024)
di: Yang, Shuo, et al.
Pubblicazione: (2024)
BiasDPO: Mitigating Bias in Language Models through Direct Preference Optimization
di: Allam, Ahmed
Pubblicazione: (2024)
di: Allam, Ahmed
Pubblicazione: (2024)
BiasAlert: A Plug-and-play Tool for Social Bias Detection in LLMs
di: Fan, Zhiting, et al.
Pubblicazione: (2024)
di: Fan, Zhiting, et al.
Pubblicazione: (2024)
Bias Amplification in RAG: Poisoning Knowledge Retrieval to Steer LLMs
di: Wang, Linlin, et al.
Pubblicazione: (2025)
di: Wang, Linlin, et al.
Pubblicazione: (2025)
Surface Fairness, Deep Bias: A Comparative Study of Bias in Language Models
di: Sorokovikova, Aleksandra, et al.
Pubblicazione: (2025)
di: Sorokovikova, Aleksandra, et al.
Pubblicazione: (2025)
Open-DeBias: Toward Mitigating Open-Set Bias in Language Models
di: Rani, Arti, et al.
Pubblicazione: (2025)
di: Rani, Arti, et al.
Pubblicazione: (2025)
Disclosure and Mitigation of Gender Bias in LLMs
di: Dong, Xiangjue, et al.
Pubblicazione: (2024)
di: Dong, Xiangjue, et al.
Pubblicazione: (2024)
To Bias or Not to Bias: Detecting bias in News with bias-detector
di: Ghosh, Himel, et al.
Pubblicazione: (2025)
di: Ghosh, Himel, et al.
Pubblicazione: (2025)
IndiVec: An Exploration of Leveraging Large Language Models for Media Bias Detection with Fine-Grained Bias Indicators
di: Lin, Luyang, et al.
Pubblicazione: (2024)
di: Lin, Luyang, et al.
Pubblicazione: (2024)
Social Bias in Large Language Models For Bangla: An Empirical Study on Gender and Religious Bias
di: Sadhu, Jayanta, et al.
Pubblicazione: (2024)
di: Sadhu, Jayanta, et al.
Pubblicazione: (2024)
Akal Badi ya Bias: An Exploratory Study of Gender Bias in Hindi Language Technology
di: Hada, Rishav, et al.
Pubblicazione: (2024)
di: Hada, Rishav, et al.
Pubblicazione: (2024)
Bias A-head? Analyzing Bias in Transformer-Based Language Model Attention Heads
di: Yang, Yi, et al.
Pubblicazione: (2023)
di: Yang, Yi, et al.
Pubblicazione: (2023)
Obscured but Not Erased: Evaluating Nationality Bias in LLMs via Name-Based Bias Benchmarks
di: Pelosio, Giulio, et al.
Pubblicazione: (2025)
di: Pelosio, Giulio, et al.
Pubblicazione: (2025)
BiasGuard: A Reasoning-enhanced Bias Detection Tool For Large Language Models
di: Fan, Zhiting, et al.
Pubblicazione: (2025)
di: Fan, Zhiting, et al.
Pubblicazione: (2025)
Mitigating Bias for Question Answering Models by Tracking Bias Influence
di: Ma, Mingyu Derek, et al.
Pubblicazione: (2023)
di: Ma, Mingyu Derek, et al.
Pubblicazione: (2023)
Who Relies More on World Knowledge and Bias for Syntactic Ambiguity Resolution: Humans or LLMs?
di: Lee, So Young, et al.
Pubblicazione: (2025)
di: Lee, So Young, et al.
Pubblicazione: (2025)
More Thinking, More Bias: Length-Driven Position Bias in Reasoning Models
di: Wang, Xiao
Pubblicazione: (2026)
di: Wang, Xiao
Pubblicazione: (2026)
BiasGym: A Simple and Generalizable Framework for Analyzing and Removing Biases through Elicitation
di: Islam, Sekh Mainul, et al.
Pubblicazione: (2025)
di: Islam, Sekh Mainul, et al.
Pubblicazione: (2025)
Where is the answer? Investigating Positional Bias in Language Model Knowledge Extraction
di: Saito, Kuniaki, et al.
Pubblicazione: (2024)
di: Saito, Kuniaki, et al.
Pubblicazione: (2024)
Large Language Model Bias Mitigation from the Perspective of Knowledge Editing
di: Chen, Ruizhe, et al.
Pubblicazione: (2024)
di: Chen, Ruizhe, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Measuring Mechanistic Independence: Can Bias Be Removed Without Erasing Demographics?
di: Shan, Zhengyang, et al.
Pubblicazione: (2025) -
Position Bias Mitigates Position Bias:Mitigate Position Bias Through Inter-Position Knowledge Distillation
di: Wang, Yifei, et al.
Pubblicazione: (2025) -
Enhancing Generalization in Chain of Thought Reasoning for Smaller Models
di: Yin, Maxwell J., et al.
Pubblicazione: (2025) -
The Bias is in the Details: An Assessment of Cognitive Bias in LLMs
di: Knipper, R. Alexander, et al.
Pubblicazione: (2025) -
Alleviating Choice Supportive Bias in LLM with Reasoning Dependency Generation
di: Zhuang, Nan, et al.
Pubblicazione: (2025)