Mitigating Biases in Language Models via Bias Unlearning
Fuente:
arXiv
Salvato in:
| Autori principali: | Liu, Dianqing, Liu, Yi, Jin, Guoqing, Mao, Zhendong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Leveraging Importance Sampling to Detach Alignment Modules from Large Language Models
di: Liu, Yi, et al.
Pubblicazione: (2025)
di: Liu, Yi, et al.
Pubblicazione: (2025)
Mitigating Social Biases in Language Models through Unlearning
di: Dige, Omkar, et al.
Pubblicazione: (2024)
di: Dige, Omkar, et al.
Pubblicazione: (2024)
Multi-Persona Thinking for Bias Mitigation in Large Language Models
di: Chen, Yuxing, et al.
Pubblicazione: (2026)
di: Chen, Yuxing, et al.
Pubblicazione: (2026)
Mitigating Biases for Instruction-following Language Models via Bias Neurons Elimination
di: Yang, Nakyeong, et al.
Pubblicazione: (2023)
di: Yang, Nakyeong, et al.
Pubblicazione: (2023)
Bias Vector: Mitigating Biases in Language Models with Task Arithmetic Approach
di: Shirafuji, Daiki, et al.
Pubblicazione: (2024)
di: Shirafuji, Daiki, et al.
Pubblicazione: (2024)
The Devil is in the Neurons: Interpreting and Mitigating Social Biases in Pre-trained Language Models
di: Liu, Yan, et al.
Pubblicazione: (2024)
di: Liu, Yan, et al.
Pubblicazione: (2024)
Investigating Thinking Behaviours of Reasoning-Based Language Models for Social Bias Mitigation
di: Luo, Guoqing, et al.
Pubblicazione: (2025)
di: Luo, Guoqing, et al.
Pubblicazione: (2025)
No Free Lunch in Language Model Bias Mitigation? Targeted Bias Reduction Can Exacerbate Unmitigated LLM Biases
di: Chand, Shireen, et al.
Pubblicazione: (2025)
di: Chand, Shireen, et al.
Pubblicazione: (2025)
Benchmarking Large Language Models on Controllable Generation under Diversified Instructions
di: Chen, Yihan, et al.
Pubblicazione: (2024)
di: Chen, Yihan, et al.
Pubblicazione: (2024)
Feature-Adaptive and Data-Scalable In-Context Learning
di: Li, Jiahao, et al.
Pubblicazione: (2024)
di: Li, Jiahao, et al.
Pubblicazione: (2024)
Breaking Bias, Building Bridges: Evaluation and Mitigation of Social Biases in LLMs via Contact Hypothesis
di: Raj, Chahat, et al.
Pubblicazione: (2024)
di: Raj, Chahat, et al.
Pubblicazione: (2024)
Investigating the Feasibility of Mitigating Potential Copyright Infringement via Large Language Model Unlearning
di: Dou, Guangyao
Pubblicazione: (2024)
di: Dou, Guangyao
Pubblicazione: (2024)
In-Context Learning (and Unlearning) of Length Biases
di: Schoch, Stephanie, et al.
Pubblicazione: (2025)
di: Schoch, Stephanie, et al.
Pubblicazione: (2025)
Evaluating and Mitigating Social Bias for Large Language Models in Open-ended Settings
di: Liu, Zhao, et al.
Pubblicazione: (2024)
di: Liu, Zhao, et al.
Pubblicazione: (2024)
Locating and Mitigating Gender Bias in Large Language Models
di: Cai, Yuchen, et al.
Pubblicazione: (2024)
di: Cai, Yuchen, et al.
Pubblicazione: (2024)
Tokens for Learning, Tokens for Unlearning: Mitigating Membership Inference Attacks in Large Language Models via Dual-Purpose Training
di: Tran, Toan, et al.
Pubblicazione: (2025)
di: Tran, Toan, et al.
Pubblicazione: (2025)
Identifying and Mitigating Social Bias Knowledge in Language Models
di: Chen, Ruizhe, et al.
Pubblicazione: (2024)
di: Chen, Ruizhe, et al.
Pubblicazione: (2024)
BiasDora: Exploring Hidden Biased Associations in Vision-Language Models
di: Raj, Chahat, et al.
Pubblicazione: (2024)
di: Raj, Chahat, et al.
Pubblicazione: (2024)
Studying and Mitigating Biases in Sign Language Understanding Models
di: Atwell, Katherine, et al.
Pubblicazione: (2024)
di: Atwell, Katherine, et al.
Pubblicazione: (2024)
Avoiding Copyright Infringement via Large Language Model Unlearning
di: Dou, Guangyao, et al.
Pubblicazione: (2024)
di: Dou, Guangyao, et al.
Pubblicazione: (2024)
Mitigating the Bias of Large Language Model Evaluation
di: Zhou, Hongli, et al.
Pubblicazione: (2024)
di: Zhou, Hongli, et al.
Pubblicazione: (2024)
Towards Transfer Unlearning: Empirical Evidence of Cross-Domain Bias Mitigation
di: Lu, Huimin, et al.
Pubblicazione: (2024)
di: Lu, Huimin, et al.
Pubblicazione: (2024)
Bias in Large Language Models: Origin, Evaluation, and Mitigation
di: Guo, Yufei, et al.
Pubblicazione: (2024)
di: Guo, Yufei, et al.
Pubblicazione: (2024)
Mitigating Judgment Preference Bias in Large Language Models through Group-Based Polling
di: Liu, Shuliang, et al.
Pubblicazione: (2025)
di: Liu, Shuliang, et al.
Pubblicazione: (2025)
Mitigating Gender Bias in Code Large Language Models via Model Editing
di: Qin, Zhanyue, et al.
Pubblicazione: (2024)
di: Qin, Zhanyue, et al.
Pubblicazione: (2024)
Measuring Stereotype and Deviation Biases in Large Language Models
di: Wang, Daniel, et al.
Pubblicazione: (2025)
di: Wang, Daniel, et al.
Pubblicazione: (2025)
BiasCause: Evaluate Socially Biased Causal Reasoning of Large Language Models
di: Xie, Tian, et al.
Pubblicazione: (2025)
di: Xie, Tian, et al.
Pubblicazione: (2025)
A Trip Towards Fairness: Bias and De-Biasing in Large Language Models
di: Ranaldi, Leonardo, et al.
Pubblicazione: (2023)
di: Ranaldi, Leonardo, et al.
Pubblicazione: (2023)
JBBQ: Japanese Bias Benchmark for Analyzing Social Biases in Large Language Models
di: Yanaka, Hitomi, et al.
Pubblicazione: (2024)
di: Yanaka, Hitomi, et al.
Pubblicazione: (2024)
Large Language Model Bias Mitigation from the Perspective of Knowledge Editing
di: Chen, Ruizhe, et al.
Pubblicazione: (2024)
di: Chen, Ruizhe, et al.
Pubblicazione: (2024)
On-the-fly Preference Alignment via Principle-Guided Decoding
di: Zhu, Mingye, et al.
Pubblicazione: (2025)
di: Zhu, Mingye, et al.
Pubblicazione: (2025)
Open-DeBias: Toward Mitigating Open-Set Bias in Language Models
di: Rani, Arti, et al.
Pubblicazione: (2025)
di: Rani, Arti, et al.
Pubblicazione: (2025)
BiasDPO: Mitigating Bias in Language Models through Direct Preference Optimization
di: Allam, Ahmed
Pubblicazione: (2024)
di: Allam, Ahmed
Pubblicazione: (2024)
Mitigating Label Length Bias in Large Language Models
di: Sanz-Guerrero, Mario, et al.
Pubblicazione: (2025)
di: Sanz-Guerrero, Mario, et al.
Pubblicazione: (2025)
LLMs Are Biased Towards Output Formats! Systematically Evaluating and Mitigating Output Format Bias of LLMs
di: Long, Do Xuan, et al.
Pubblicazione: (2024)
di: Long, Do Xuan, et al.
Pubblicazione: (2024)
Mitigating Biases of Large Language Models in Stance Detection with Counterfactual Augmented Calibration
di: Li, Ang, et al.
Pubblicazione: (2024)
di: Li, Ang, et al.
Pubblicazione: (2024)
A Systematic Analysis of Biases in Large Language Models
di: Zhang, Xulang, et al.
Pubblicazione: (2025)
di: Zhang, Xulang, et al.
Pubblicazione: (2025)
Context-Aware Counterfactual Data Augmentation for Gender Bias Mitigation in Language Models
di: Parihar, Shweta, et al.
Pubblicazione: (2026)
di: Parihar, Shweta, et al.
Pubblicazione: (2026)
Large Language Model Unlearning via Embedding-Corrupted Prompts
di: Liu, Chris Yuhao, et al.
Pubblicazione: (2024)
di: Liu, Chris Yuhao, et al.
Pubblicazione: (2024)
Robust Evaluation Measures for Evaluating Social Biases in Masked Language Models
di: Liu, Yang
Pubblicazione: (2024)
di: Liu, Yang
Pubblicazione: (2024)
Documenti analoghi
-
Leveraging Importance Sampling to Detach Alignment Modules from Large Language Models
di: Liu, Yi, et al.
Pubblicazione: (2025) -
Mitigating Social Biases in Language Models through Unlearning
di: Dige, Omkar, et al.
Pubblicazione: (2024) -
Multi-Persona Thinking for Bias Mitigation in Large Language Models
di: Chen, Yuxing, et al.
Pubblicazione: (2026) -
Mitigating Biases for Instruction-following Language Models via Bias Neurons Elimination
di: Yang, Nakyeong, et al.
Pubblicazione: (2023) -
Bias Vector: Mitigating Biases in Language Models with Task Arithmetic Approach
di: Shirafuji, Daiki, et al.
Pubblicazione: (2024)