Compositional Bias Control in Large Language Models: Preference Learning Fails, Supervision Succeeds
Fuente:
arXiv
Gespeichert in:
| 1. Verfasser: | Mahesh, Atij |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Why Supervised Fine-Tuning Fails to Learn: A Systematic Study of Incomplete Learning in Large Language Models
von: Xue, Chao, et al.
Veröffentlicht: (2026)
von: Xue, Chao, et al.
Veröffentlicht: (2026)
Plausibility as Commonsense Reasoning: Humans Succeed, Large Language Models Do not
von: Karakaş, Sercan
Veröffentlicht: (2026)
von: Karakaş, Sercan
Veröffentlicht: (2026)
When Retrieval Succeeds and Fails: Rethinking Retrieval-Augmented Generation for LLMs
von: Wang, Yongjie, et al.
Veröffentlicht: (2025)
von: Wang, Yongjie, et al.
Veröffentlicht: (2025)
Correcting Selection Bias in Sparse User Feedback for Large Language Model Quality Estimation: A Multi-Agent Hierarchical Bayesian Approach
von: Morandi, Andrea, et al.
Veröffentlicht: (2026)
von: Morandi, Andrea, et al.
Veröffentlicht: (2026)
Failing to Falsify: Evaluating and Mitigating Confirmation Bias in Language Models
von: Jhaveri, Ayush Rajesh, et al.
Veröffentlicht: (2026)
von: Jhaveri, Ayush Rajesh, et al.
Veröffentlicht: (2026)
Self-Preference Bias in Rubric-Based Evaluation of Large Language Models
von: Pombal, José, et al.
Veröffentlicht: (2026)
von: Pombal, José, et al.
Veröffentlicht: (2026)
Mitigating Judgment Preference Bias in Large Language Models through Group-Based Polling
von: Liu, Shuliang, et al.
Veröffentlicht: (2025)
von: Liu, Shuliang, et al.
Veröffentlicht: (2025)
Deployability-Centric Infrastructure-as-Code Generation: Fail, Learn, Refine, and Succeed through LLM-Empowered DevOps Simulation
von: Zhang, Tianyi, et al.
Veröffentlicht: (2025)
von: Zhang, Tianyi, et al.
Veröffentlicht: (2025)
BiasDPO: Mitigating Bias in Language Models through Direct Preference Optimization
von: Allam, Ahmed
Veröffentlicht: (2024)
von: Allam, Ahmed
Veröffentlicht: (2024)
Scaling Up Membership Inference: When and How Attacks Succeed on Large Language Models
von: Puerto, Haritz, et al.
Veröffentlicht: (2024)
von: Puerto, Haritz, et al.
Veröffentlicht: (2024)
Preference-Oriented Supervised Fine-Tuning: Favoring Target Model Over Aligned Large Language Models
von: Fan, Yuchen, et al.
Veröffentlicht: (2024)
von: Fan, Yuchen, et al.
Veröffentlicht: (2024)
Can Large Language Models be Good Emotional Supporter? Mitigating Preference Bias on Emotional Support Conversation
von: Kang, Dongjin, et al.
Veröffentlicht: (2024)
von: Kang, Dongjin, et al.
Veröffentlicht: (2024)
Bias in, Bias out: Annotation Bias in Multilingual Large Language Models
von: Cui, Xia, et al.
Veröffentlicht: (2025)
von: Cui, Xia, et al.
Veröffentlicht: (2025)
Evaluating Large Language Models with Tests of Spanish as a Foreign Language: Pass or Fail?
von: Mayor-Rocher, Marina, et al.
Veröffentlicht: (2024)
von: Mayor-Rocher, Marina, et al.
Veröffentlicht: (2024)
A Survey on Human Preference Learning for Large Language Models
von: Jiang, Ruili, et al.
Veröffentlicht: (2024)
von: Jiang, Ruili, et al.
Veröffentlicht: (2024)
Acquiescence Bias in Large Language Models
von: Braun, Daniel
Veröffentlicht: (2025)
von: Braun, Daniel
Veröffentlicht: (2025)
Large Language Models for Ingredient Substitution in Food Recipes using Supervised Fine-tuning and Direct Preference Optimization
von: Senath, Thevin, et al.
Veröffentlicht: (2024)
von: Senath, Thevin, et al.
Veröffentlicht: (2024)
Active Preference Learning for Large Language Models
von: Muldrew, William, et al.
Veröffentlicht: (2024)
von: Muldrew, William, et al.
Veröffentlicht: (2024)
Evaluating Gender Bias in Large Language Models
von: Döll, Michael, et al.
Veröffentlicht: (2024)
von: Döll, Michael, et al.
Veröffentlicht: (2024)
Mitigating the Bias of Large Language Model Evaluation
von: Zhou, Hongli, et al.
Veröffentlicht: (2024)
von: Zhou, Hongli, et al.
Veröffentlicht: (2024)
Predicting Where Steering Vectors Succeed
von: Billa, Jayadev
Veröffentlicht: (2026)
von: Billa, Jayadev
Veröffentlicht: (2026)
Why do Large Language Models Fail in Low-resource Translation? Unraveling the Token Dynamics of Large Language Models for Machine Translation
von: Qian, Shenbin, et al.
Veröffentlicht: (2026)
von: Qian, Shenbin, et al.
Veröffentlicht: (2026)
Understanding When Tree of Thoughts Succeeds: Larger Models Excel in Generation, Not Discrimination
von: Chen, Qiqi, et al.
Veröffentlicht: (2024)
von: Chen, Qiqi, et al.
Veröffentlicht: (2024)
Deep Bayesian Active Learning for Preference Modeling in Large Language Models
von: Melo, Luckeciano C., et al.
Veröffentlicht: (2024)
von: Melo, Luckeciano C., et al.
Veröffentlicht: (2024)
Gender Bias in Large Language Models across Multiple Languages
von: Zhao, Jinman, et al.
Veröffentlicht: (2024)
von: Zhao, Jinman, et al.
Veröffentlicht: (2024)
Ask Again, Then Fail: Large Language Models' Vacillations in Judgment
von: Xie, Qiming, et al.
Veröffentlicht: (2023)
von: Xie, Qiming, et al.
Veröffentlicht: (2023)
Preference Packing: Efficient Preference Optimization for Large Language Models
von: Cho, Jaekyung
Veröffentlicht: (2026)
von: Cho, Jaekyung
Veröffentlicht: (2026)
Regional Bias in Large Language Models
von: Gopinadh, M P V S, et al.
Veröffentlicht: (2026)
von: Gopinadh, M P V S, et al.
Veröffentlicht: (2026)
Fine-Tuning or Fine-Failing? Debunking Performance Myths in Large Language Models
von: Barnett, Scott, et al.
Veröffentlicht: (2024)
von: Barnett, Scott, et al.
Veröffentlicht: (2024)
Mitigating Label Length Bias in Large Language Models
von: Sanz-Guerrero, Mario, et al.
Veröffentlicht: (2025)
von: Sanz-Guerrero, Mario, et al.
Veröffentlicht: (2025)
Direct Preference Knowledge Distillation for Large Language Models
von: Li, Yixing, et al.
Veröffentlicht: (2024)
von: Li, Yixing, et al.
Veröffentlicht: (2024)
In-Contextual Gender Bias Suppression for Large Language Models
von: Oba, Daisuke, et al.
Veröffentlicht: (2023)
von: Oba, Daisuke, et al.
Veröffentlicht: (2023)
Anchoring Bias in Large Language Models: An Experimental Study
von: Lou, Jiaxu, et al.
Veröffentlicht: (2024)
von: Lou, Jiaxu, et al.
Veröffentlicht: (2024)
Measuring Spiritual Values and Bias of Large Language Models
von: Liu, Songyuan, et al.
Veröffentlicht: (2024)
von: Liu, Songyuan, et al.
Veröffentlicht: (2024)
Problematic Tokens: Tokenizer Bias in Large Language Models
von: Yang, Jin, et al.
Veröffentlicht: (2024)
von: Yang, Jin, et al.
Veröffentlicht: (2024)
Characterizing Selective Refusal Bias in Large Language Models
von: Khorramrouz, Adel, et al.
Veröffentlicht: (2025)
von: Khorramrouz, Adel, et al.
Veröffentlicht: (2025)
Gender Bias in Emotion Recognition by Large Language Models
von: Herbert, Maureen, et al.
Veröffentlicht: (2025)
von: Herbert, Maureen, et al.
Veröffentlicht: (2025)
BiasGuard: A Reasoning-enhanced Bias Detection Tool For Large Language Models
von: Fan, Zhiting, et al.
Veröffentlicht: (2025)
von: Fan, Zhiting, et al.
Veröffentlicht: (2025)
Social Bias in Large Language Models For Bangla: An Empirical Study on Gender and Religious Bias
von: Sadhu, Jayanta, et al.
Veröffentlicht: (2024)
von: Sadhu, Jayanta, et al.
Veröffentlicht: (2024)
Disentangling Length Bias In Preference Learning Via Response-Conditioned Modeling
von: Cai, Jianfeng, et al.
Veröffentlicht: (2025)
von: Cai, Jianfeng, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Why Supervised Fine-Tuning Fails to Learn: A Systematic Study of Incomplete Learning in Large Language Models
von: Xue, Chao, et al.
Veröffentlicht: (2026) -
Plausibility as Commonsense Reasoning: Humans Succeed, Large Language Models Do not
von: Karakaş, Sercan
Veröffentlicht: (2026) -
When Retrieval Succeeds and Fails: Rethinking Retrieval-Augmented Generation for LLMs
von: Wang, Yongjie, et al.
Veröffentlicht: (2025) -
Correcting Selection Bias in Sparse User Feedback for Large Language Model Quality Estimation: A Multi-Agent Hierarchical Bayesian Approach
von: Morandi, Andrea, et al.
Veröffentlicht: (2026) -
Failing to Falsify: Evaluating and Mitigating Confirmation Bias in Language Models
von: Jhaveri, Ayush Rajesh, et al.
Veröffentlicht: (2026)