MABR: Multilayer Adversarial Bias Removal Without Prior Bias Knowledge
Fuente:
arXiv
Guardado en:
| Autores principales: | Yin, Maxwell J., Wang, Boyu, Ling, Charles |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Measuring Mechanistic Independence: Can Bias Be Removed Without Erasing Demographics?
por: Shan, Zhengyang, et al.
Publicado: (2025)
por: Shan, Zhengyang, et al.
Publicado: (2025)
Position Bias Mitigates Position Bias:Mitigate Position Bias Through Inter-Position Knowledge Distillation
por: Wang, Yifei, et al.
Publicado: (2025)
por: Wang, Yifei, et al.
Publicado: (2025)
Enhancing Generalization in Chain of Thought Reasoning for Smaller Models
por: Yin, Maxwell J., et al.
Publicado: (2025)
por: Yin, Maxwell J., et al.
Publicado: (2025)
The Bias is in the Details: An Assessment of Cognitive Bias in LLMs
por: Knipper, R. Alexander, et al.
Publicado: (2025)
por: Knipper, R. Alexander, et al.
Publicado: (2025)
Alleviating Choice Supportive Bias in LLM with Reasoning Dependency Generation
por: Zhuang, Nan, et al.
Publicado: (2025)
por: Zhuang, Nan, et al.
Publicado: (2025)
Diagnosing Retrieval Bias Under Multiple In-Context Knowledge Updates in Large Language Models
por: Qiao, Boyu, et al.
Publicado: (2026)
por: Qiao, Boyu, et al.
Publicado: (2026)
AdvSumm: Adversarial Training for Bias Mitigation in Text Summarization
por: Gupta, Mukur, et al.
Publicado: (2025)
por: Gupta, Mukur, et al.
Publicado: (2025)
Bias in, Bias out: Annotation Bias in Multilingual Large Language Models
por: Cui, Xia, et al.
Publicado: (2025)
por: Cui, Xia, et al.
Publicado: (2025)
Are Large Language Models Really Bias-Free? Jailbreak Prompts for Assessing Adversarial Robustness to Bias Elicitation
por: Cantini, Riccardo, et al.
Publicado: (2024)
por: Cantini, Riccardo, et al.
Publicado: (2024)
More Bias, Less Bias: BiasPrompting for Enhanced Multiple-Choice Question Answering
por: Vu, Duc Anh, et al.
Publicado: (2025)
por: Vu, Duc Anh, et al.
Publicado: (2025)
Format as a Prior: Quantifying and Analyzing Bias in LLMs for Heterogeneous Data
por: Liu, Jiacheng, et al.
Publicado: (2025)
por: Liu, Jiacheng, et al.
Publicado: (2025)
DIF: A Framework for Benchmarking and Verifying Implicit Bias in LLMs
por: Yin, Lake, et al.
Publicado: (2025)
por: Yin, Lake, et al.
Publicado: (2025)
RuBia: A Russian Language Bias Detection Dataset
por: Grigoreva, Veronika, et al.
Publicado: (2024)
por: Grigoreva, Veronika, et al.
Publicado: (2024)
Decoding News Bias: Multi Bias Detection in News Articles
por: Shah, Bhushan Santosh, et al.
Publicado: (2025)
por: Shah, Bhushan Santosh, et al.
Publicado: (2025)
Identifying and Mitigating Social Bias Knowledge in Language Models
por: Chen, Ruizhe, et al.
Publicado: (2024)
por: Chen, Ruizhe, et al.
Publicado: (2024)
Take Care of Your Prompt Bias! Investigating and Mitigating Prompt Bias in Factual Knowledge Extraction
por: Xu, Ziyang, et al.
Publicado: (2024)
por: Xu, Ziyang, et al.
Publicado: (2024)
Can We Trust LLMs? Mitigate Overconfidence Bias in LLMs through Knowledge Transfer
por: Yang, Haoyan, et al.
Publicado: (2024)
por: Yang, Haoyan, et al.
Publicado: (2024)
Tuning Into Bias: A Computational Study of Gender Bias in Song Lyrics
por: Chen, Danqing, et al.
Publicado: (2024)
por: Chen, Danqing, et al.
Publicado: (2024)
The Lifecycle of "Facts": A Survey of Social Bias in Knowledge Graphs
por: Kraft, Angelie, et al.
Publicado: (2022)
por: Kraft, Angelie, et al.
Publicado: (2022)
Sycophancy under Pressure: Evaluating and Mitigating Sycophantic Bias via Adversarial Dialogues in Scientific QA
por: Zhang, Kaiwei, et al.
Publicado: (2025)
por: Zhang, Kaiwei, et al.
Publicado: (2025)
RAZOR: Sharpening Knowledge by Cutting Bias with Unsupervised Text Rewriting
por: Yang, Shuo, et al.
Publicado: (2024)
por: Yang, Shuo, et al.
Publicado: (2024)
BiasDPO: Mitigating Bias in Language Models through Direct Preference Optimization
por: Allam, Ahmed
Publicado: (2024)
por: Allam, Ahmed
Publicado: (2024)
BiasAlert: A Plug-and-play Tool for Social Bias Detection in LLMs
por: Fan, Zhiting, et al.
Publicado: (2024)
por: Fan, Zhiting, et al.
Publicado: (2024)
Bias Amplification in RAG: Poisoning Knowledge Retrieval to Steer LLMs
por: Wang, Linlin, et al.
Publicado: (2025)
por: Wang, Linlin, et al.
Publicado: (2025)
Surface Fairness, Deep Bias: A Comparative Study of Bias in Language Models
por: Sorokovikova, Aleksandra, et al.
Publicado: (2025)
por: Sorokovikova, Aleksandra, et al.
Publicado: (2025)
Open-DeBias: Toward Mitigating Open-Set Bias in Language Models
por: Rani, Arti, et al.
Publicado: (2025)
por: Rani, Arti, et al.
Publicado: (2025)
Disclosure and Mitigation of Gender Bias in LLMs
por: Dong, Xiangjue, et al.
Publicado: (2024)
por: Dong, Xiangjue, et al.
Publicado: (2024)
To Bias or Not to Bias: Detecting bias in News with bias-detector
por: Ghosh, Himel, et al.
Publicado: (2025)
por: Ghosh, Himel, et al.
Publicado: (2025)
IndiVec: An Exploration of Leveraging Large Language Models for Media Bias Detection with Fine-Grained Bias Indicators
por: Lin, Luyang, et al.
Publicado: (2024)
por: Lin, Luyang, et al.
Publicado: (2024)
Social Bias in Large Language Models For Bangla: An Empirical Study on Gender and Religious Bias
por: Sadhu, Jayanta, et al.
Publicado: (2024)
por: Sadhu, Jayanta, et al.
Publicado: (2024)
Akal Badi ya Bias: An Exploratory Study of Gender Bias in Hindi Language Technology
por: Hada, Rishav, et al.
Publicado: (2024)
por: Hada, Rishav, et al.
Publicado: (2024)
Bias A-head? Analyzing Bias in Transformer-Based Language Model Attention Heads
por: Yang, Yi, et al.
Publicado: (2023)
por: Yang, Yi, et al.
Publicado: (2023)
Obscured but Not Erased: Evaluating Nationality Bias in LLMs via Name-Based Bias Benchmarks
por: Pelosio, Giulio, et al.
Publicado: (2025)
por: Pelosio, Giulio, et al.
Publicado: (2025)
BiasGuard: A Reasoning-enhanced Bias Detection Tool For Large Language Models
por: Fan, Zhiting, et al.
Publicado: (2025)
por: Fan, Zhiting, et al.
Publicado: (2025)
Mitigating Bias for Question Answering Models by Tracking Bias Influence
por: Ma, Mingyu Derek, et al.
Publicado: (2023)
por: Ma, Mingyu Derek, et al.
Publicado: (2023)
Who Relies More on World Knowledge and Bias for Syntactic Ambiguity Resolution: Humans or LLMs?
por: Lee, So Young, et al.
Publicado: (2025)
por: Lee, So Young, et al.
Publicado: (2025)
More Thinking, More Bias: Length-Driven Position Bias in Reasoning Models
por: Wang, Xiao
Publicado: (2026)
por: Wang, Xiao
Publicado: (2026)
BiasGym: A Simple and Generalizable Framework for Analyzing and Removing Biases through Elicitation
por: Islam, Sekh Mainul, et al.
Publicado: (2025)
por: Islam, Sekh Mainul, et al.
Publicado: (2025)
Where is the answer? Investigating Positional Bias in Language Model Knowledge Extraction
por: Saito, Kuniaki, et al.
Publicado: (2024)
por: Saito, Kuniaki, et al.
Publicado: (2024)
Large Language Model Bias Mitigation from the Perspective of Knowledge Editing
por: Chen, Ruizhe, et al.
Publicado: (2024)
por: Chen, Ruizhe, et al.
Publicado: (2024)
Ejemplares similares
-
Measuring Mechanistic Independence: Can Bias Be Removed Without Erasing Demographics?
por: Shan, Zhengyang, et al.
Publicado: (2025) -
Position Bias Mitigates Position Bias:Mitigate Position Bias Through Inter-Position Knowledge Distillation
por: Wang, Yifei, et al.
Publicado: (2025) -
Enhancing Generalization in Chain of Thought Reasoning for Smaller Models
por: Yin, Maxwell J., et al.
Publicado: (2025) -
The Bias is in the Details: An Assessment of Cognitive Bias in LLMs
por: Knipper, R. Alexander, et al.
Publicado: (2025) -
Alleviating Choice Supportive Bias in LLM with Reasoning Dependency Generation
por: Zhuang, Nan, et al.
Publicado: (2025)