BiasDPO: Mitigating Bias in Language Models through Direct Preference Optimization
Fuente:
arXiv
Gespeichert in:
| 1. Verfasser: | Allam, Ahmed |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Mitigating Judgment Preference Bias in Large Language Models through Group-Based Polling
von: Liu, Shuliang, et al.
Veröffentlicht: (2025)
von: Liu, Shuliang, et al.
Veröffentlicht: (2025)
Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment
von: Xiao, Teng, et al.
Veröffentlicht: (2024)
von: Xiao, Teng, et al.
Veröffentlicht: (2024)
DSO: Direct Steering Optimization for Bias Mitigation
von: Paes, Lucas Monteiro, et al.
Veröffentlicht: (2025)
von: Paes, Lucas Monteiro, et al.
Veröffentlicht: (2025)
DPO-Shift: Shifting the Distribution of Direct Preference Optimization
von: Yang, Xiliang, et al.
Veröffentlicht: (2025)
von: Yang, Xiliang, et al.
Veröffentlicht: (2025)
GroupDPO: Memory efficient Group-wise Direct Preference Optimization
von: Leng, Jixuan, et al.
Veröffentlicht: (2026)
von: Leng, Jixuan, et al.
Veröffentlicht: (2026)
Open-DeBias: Toward Mitigating Open-Set Bias in Language Models
von: Rani, Arti, et al.
Veröffentlicht: (2025)
von: Rani, Arti, et al.
Veröffentlicht: (2025)
Mitigating the Bias of Large Language Model Evaluation
von: Zhou, Hongli, et al.
Veröffentlicht: (2024)
von: Zhou, Hongli, et al.
Veröffentlicht: (2024)
DiaTool-DPO: Multi-Turn Direct Preference Optimization for Tool-Augmented Large Language Models
von: Jung, Sunghee, et al.
Veröffentlicht: (2025)
von: Jung, Sunghee, et al.
Veröffentlicht: (2025)
Can Large Language Models be Good Emotional Supporter? Mitigating Preference Bias on Emotional Support Conversation
von: Kang, Dongjin, et al.
Veröffentlicht: (2024)
von: Kang, Dongjin, et al.
Veröffentlicht: (2024)
AlphaDPO: Adaptive Reward Margin for Direct Preference Optimization
von: Wu, Junkang, et al.
Veröffentlicht: (2024)
von: Wu, Junkang, et al.
Veröffentlicht: (2024)
Aligning Model Evaluations with Human Preferences: Mitigating Token Count Bias in Language Model Assessments
von: Daynauth, Roland, et al.
Veröffentlicht: (2024)
von: Daynauth, Roland, et al.
Veröffentlicht: (2024)
Sem-DPO: Mitigating Semantic Inconsistency in Preference Optimization for Prompt Engineering
von: Mohamed, Anas, et al.
Veröffentlicht: (2025)
von: Mohamed, Anas, et al.
Veröffentlicht: (2025)
Mitigating Label Length Bias in Large Language Models
von: Sanz-Guerrero, Mario, et al.
Veröffentlicht: (2025)
von: Sanz-Guerrero, Mario, et al.
Veröffentlicht: (2025)
Mitigating Biases in Language Models via Bias Unlearning
von: Liu, Dianqing, et al.
Veröffentlicht: (2025)
von: Liu, Dianqing, et al.
Veröffentlicht: (2025)
MCM-DPO: Multifaceted Cross-Modal Direct Preference Optimization for Alt-text Generation
von: Fu, Jinlan, et al.
Veröffentlicht: (2025)
von: Fu, Jinlan, et al.
Veröffentlicht: (2025)
Pre-DPO: Improving Data Utilization in Direct Preference Optimization Using a Guiding Reference Model
von: Pan, Junshu, et al.
Veröffentlicht: (2025)
von: Pan, Junshu, et al.
Veröffentlicht: (2025)
Assistant-Guided Mitigation of Teacher Preference Bias in LLM-as-a-Judge
von: Liu, Zhuo, et al.
Veröffentlicht: (2025)
von: Liu, Zhuo, et al.
Veröffentlicht: (2025)
Position Bias Mitigates Position Bias:Mitigate Position Bias Through Inter-Position Knowledge Distillation
von: Wang, Yifei, et al.
Veröffentlicht: (2025)
von: Wang, Yifei, et al.
Veröffentlicht: (2025)
2D-DPO: Scaling Direct Preference Optimization with 2-Dimensional Supervision
von: Li, Shilong, et al.
Veröffentlicht: (2024)
von: Li, Shilong, et al.
Veröffentlicht: (2024)
AdaDPO: Self-Adaptive Direct Preference Optimization with Balanced Gradient Updates
von: Chen, Shaolong, et al.
Veröffentlicht: (2026)
von: Chen, Shaolong, et al.
Veröffentlicht: (2026)
Online DPO: Online Direct Preference Optimization with Fast-Slow Chasing
von: Qi, Biqing, et al.
Veröffentlicht: (2024)
von: Qi, Biqing, et al.
Veröffentlicht: (2024)
Quantifying and Mitigating Self-Preference Bias of LLM Judges
von: Yang, Jinming, et al.
Veröffentlicht: (2026)
von: Yang, Jinming, et al.
Veröffentlicht: (2026)
Do Multilingual Large Language Models Mitigate Stereotype Bias?
von: Nie, Shangrui, et al.
Veröffentlicht: (2024)
von: Nie, Shangrui, et al.
Veröffentlicht: (2024)
Detection, Classification, and Mitigation of Gender Bias in Large Language Models
von: Cheng, Xiaoqing, et al.
Veröffentlicht: (2025)
von: Cheng, Xiaoqing, et al.
Veröffentlicht: (2025)
Identifying and Mitigating Social Bias Knowledge in Language Models
von: Chen, Ruizhe, et al.
Veröffentlicht: (2024)
von: Chen, Ruizhe, et al.
Veröffentlicht: (2024)
Locating and Mitigating Gender Bias in Large Language Models
von: Cai, Yuchen, et al.
Veröffentlicht: (2024)
von: Cai, Yuchen, et al.
Veröffentlicht: (2024)
Bias in Large Language Models: Origin, Evaluation, and Mitigation
von: Guo, Yufei, et al.
Veröffentlicht: (2024)
von: Guo, Yufei, et al.
Veröffentlicht: (2024)
mDPO: Conditional Preference Optimization for Multimodal Large Language Models
von: Wang, Fei, et al.
Veröffentlicht: (2024)
von: Wang, Fei, et al.
Veröffentlicht: (2024)
Mitigating Strategy Preference Bias in Emotional Support Conversation via Uncertainty Estimations
von: Zhou, Yougen, et al.
Veröffentlicht: (2025)
von: Zhou, Yougen, et al.
Veröffentlicht: (2025)
Bias in, Bias out: Annotation Bias in Multilingual Large Language Models
von: Cui, Xia, et al.
Veröffentlicht: (2025)
von: Cui, Xia, et al.
Veröffentlicht: (2025)
Understanding and Mitigating Tokenization Bias in Language Models
von: Phan, Buu, et al.
Veröffentlicht: (2024)
von: Phan, Buu, et al.
Veröffentlicht: (2024)
BiasFreeBench: a Benchmark for Mitigating Bias in Large Language Model Responses
von: Xu, Xin, et al.
Veröffentlicht: (2025)
von: Xu, Xin, et al.
Veröffentlicht: (2025)
Bias A-head? Analyzing Bias in Transformer-Based Language Model Attention Heads
von: Yang, Yi, et al.
Veröffentlicht: (2023)
von: Yang, Yi, et al.
Veröffentlicht: (2023)
RS-DPO: A Hybrid Rejection Sampling and Direct Preference Optimization Method for Alignment of Large Language Models
von: Khaki, Saeed, et al.
Veröffentlicht: (2024)
von: Khaki, Saeed, et al.
Veröffentlicht: (2024)
UniBias: Unveiling and Mitigating LLM Bias through Internal Attention and FFN Manipulation
von: Zhou, Hanzhang, et al.
Veröffentlicht: (2024)
von: Zhou, Hanzhang, et al.
Veröffentlicht: (2024)
DreamDPO: Aligning Text-to-3D Generation with Human Preferences via Direct Preference Optimization
von: Zhou, Zhenglin, et al.
Veröffentlicht: (2025)
von: Zhou, Zhenglin, et al.
Veröffentlicht: (2025)
Projective Methods for Mitigating Gender Bias in Pre-trained Language Models
von: Dawkins, Hillary, et al.
Veröffentlicht: (2024)
von: Dawkins, Hillary, et al.
Veröffentlicht: (2024)
Towards Resource Efficient and Interpretable Bias Mitigation in Large Language Models
von: Tong, Schrasing, et al.
Veröffentlicht: (2024)
von: Tong, Schrasing, et al.
Veröffentlicht: (2024)
MBIAS: Mitigating Bias in Large Language Models While Retaining Context
von: Raza, Shaina, et al.
Veröffentlicht: (2024)
von: Raza, Shaina, et al.
Veröffentlicht: (2024)
Unveiling and Mitigating Bias in Mental Health Analysis with Large Language Models
von: Wang, Yuqing, et al.
Veröffentlicht: (2024)
von: Wang, Yuqing, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Mitigating Judgment Preference Bias in Large Language Models through Group-Based Polling
von: Liu, Shuliang, et al.
Veröffentlicht: (2025) -
Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment
von: Xiao, Teng, et al.
Veröffentlicht: (2024) -
DSO: Direct Steering Optimization for Bias Mitigation
von: Paes, Lucas Monteiro, et al.
Veröffentlicht: (2025) -
DPO-Shift: Shifting the Distribution of Direct Preference Optimization
von: Yang, Xiliang, et al.
Veröffentlicht: (2025) -
GroupDPO: Memory efficient Group-wise Direct Preference Optimization
von: Leng, Jixuan, et al.
Veröffentlicht: (2026)