AGR: Age Group fairness Reward for Bias Mitigation in LLMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Cao, Shuirong, Cheng, Ruoxi, Wang, Zhiqiang |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Inverse Reinforcement Learning with Dynamic Reward Scaling for LLM Alignment
par: Cheng, Ruoxi, et autres
Publié: (2025)
par: Cheng, Ruoxi, et autres
Publié: (2025)
Reward Shaping to Mitigate Reward Hacking in RLHF
par: Fu, Jiayi, et autres
Publié: (2025)
par: Fu, Jiayi, et autres
Publié: (2025)
Shifting Perspectives: Steering Vectors for Robust Bias Mitigation in LLMs
par: Siddique, Zara, et autres
Publié: (2025)
par: Siddique, Zara, et autres
Publié: (2025)
Low-rank finetuning for LLMs: A fairness perspective
par: Das, Saswat, et autres
Publié: (2024)
par: Das, Saswat, et autres
Publié: (2024)
Reward-Robust RLHF in LLMs
par: Yan, Yuzi, et autres
Publié: (2024)
par: Yan, Yuzi, et autres
Publié: (2024)
Identifying Features Associated with Bias Against 93 Stigmatized Groups in Language Models and Guardrail Model Safety Mitigation
par: Gueorguieva, Anna-Maria, et autres
Publié: (2025)
par: Gueorguieva, Anna-Maria, et autres
Publié: (2025)
ODIN: Disentangled Reward Mitigates Hacking in RLHF
par: Chen, Lichang, et autres
Publié: (2024)
par: Chen, Lichang, et autres
Publié: (2024)
Reward Is Enough: LLMs Are In-Context Reinforcement Learners
par: Song, Kefan, et autres
Publié: (2025)
par: Song, Kefan, et autres
Publié: (2025)
Mitigating Bias for Question Answering Models by Tracking Bias Influence
par: Ma, Mingyu Derek, et autres
Publié: (2023)
par: Ma, Mingyu Derek, et autres
Publié: (2023)
MoESD: Mixture of Experts Stable Diffusion to Mitigate Gender Bias
par: Wang, Guorun, et autres
Publié: (2024)
par: Wang, Guorun, et autres
Publié: (2024)
Understanding and Mitigating Tokenization Bias in Language Models
par: Phan, Buu, et autres
Publié: (2024)
par: Phan, Buu, et autres
Publié: (2024)
Reinforcement Learning from Multi-role Debates as Feedback for Bias Mitigation in LLMs
par: Cheng, Ruoxi, et autres
Publié: (2024)
par: Cheng, Ruoxi, et autres
Publié: (2024)
Temper and Tilt Lead to SLOP: Reward Hacking Mitigation with Inference-Time Alignment
par: Wang, Ye, et autres
Publié: (2026)
par: Wang, Ye, et autres
Publié: (2026)
Relative Bias: A Comparative Framework for Quantifying Bias in LLMs
par: Arbabi, Alireza, et autres
Publié: (2025)
par: Arbabi, Alireza, et autres
Publié: (2025)
DRAG: Distilling RAG for SLMs from LLMs to Transfer Knowledge and Mitigate Hallucination via Evidence and Graph-based Distillation
par: Chen, Jennifer, et autres
Publié: (2025)
par: Chen, Jennifer, et autres
Publié: (2025)
Mitigating Extrinsic Gender Bias for Bangla Classification Tasks
par: Joy, Sajib Kumar Saha, et autres
Publié: (2024)
par: Joy, Sajib Kumar Saha, et autres
Publié: (2024)
Quantifying and Mitigating Self-Preference Bias of LLM Judges
par: Yang, Jinming, et autres
Publié: (2026)
par: Yang, Jinming, et autres
Publié: (2026)
Iterative Data Smoothing: Mitigating Reward Overfitting and Overoptimization in RLHF
par: Zhu, Banghua, et autres
Publié: (2024)
par: Zhu, Banghua, et autres
Publié: (2024)
Mitigating Reward Hacking in RLHF via Advantage Sign Robustness
par: Ono, Shinnosuke, et autres
Publié: (2026)
par: Ono, Shinnosuke, et autres
Publié: (2026)
KARL: Mitigating Hallucinations in LLMs via Knowledge-Boundary-Aware Reinforcement Learning
par: Gao, Cheng, et autres
Publié: (2026)
par: Gao, Cheng, et autres
Publié: (2026)
Understanding and Mitigating Bias Inheritance in LLM-based Data Augmentation on Downstream Tasks
par: Li, Miaomiao, et autres
Publié: (2025)
par: Li, Miaomiao, et autres
Publié: (2025)
Mitigating Lost in Multi-turn Conversation via Curriculum RL with Verifiable Accuracy and Abstention Rewards
par: Li, Ming, et autres
Publié: (2025)
par: Li, Ming, et autres
Publié: (2025)
The Impact of Inference Acceleration on Bias of LLMs
par: Kirsten, Elisabeth, et autres
Publié: (2024)
par: Kirsten, Elisabeth, et autres
Publié: (2024)
Attention Speaks Volumes: Localizing and Mitigating Bias in Language Models
par: Adiga, Rishabh, et autres
Publié: (2024)
par: Adiga, Rishabh, et autres
Publié: (2024)
When Distance Distracts: Representation Distance Bias in BT-Loss for Reward Models
par: Xie, Tong, et autres
Publié: (2025)
par: Xie, Tong, et autres
Publié: (2025)
Skin-in-the-Game: Decision Making via Multi-Stakeholder Alignment in LLMs
par: Sel, Bilgehan, et autres
Publié: (2024)
par: Sel, Bilgehan, et autres
Publié: (2024)
TIPS: Turn-Level Information-Potential Reward Shaping for Search-Augmented LLMs
par: Xie, Yutao, et autres
Publié: (2026)
par: Xie, Yutao, et autres
Publié: (2026)
AutoScale: Scale-Aware Data Mixing for Pre-Training LLMs
par: Kang, Feiyang, et autres
Publié: (2024)
par: Kang, Feiyang, et autres
Publié: (2024)
Reinforcement Learning with Conditional Expectation Reward
par: Xiao, Changyi, et autres
Publié: (2026)
par: Xiao, Changyi, et autres
Publié: (2026)
BiasFreeBench: a Benchmark for Mitigating Bias in Large Language Model Responses
par: Xu, Xin, et autres
Publié: (2025)
par: Xu, Xin, et autres
Publié: (2025)
Mitigating Degree Bias Adaptively with Hard-to-Learn Nodes in Graph Contrastive Learning
par: Hu, Jingyu, et autres
Publié: (2025)
par: Hu, Jingyu, et autres
Publié: (2025)
Mitigating Selection Bias in Large Language Models via Permutation-Aware GRPO
par: Zheng, Jinquan, et autres
Publié: (2026)
par: Zheng, Jinquan, et autres
Publié: (2026)
Mitigating Biases for Instruction-following Language Models via Bias Neurons Elimination
par: Yang, Nakyeong, et autres
Publié: (2023)
par: Yang, Nakyeong, et autres
Publié: (2023)
What is in a name? Mitigating Name Bias in Text Embeddings via Anonymization
par: Manchanda, Sahil, et autres
Publié: (2025)
par: Manchanda, Sahil, et autres
Publié: (2025)
Attention Is All You Need for KV Cache in Diffusion LLMs
par: Nguyen-Tri, Quan, et autres
Publié: (2025)
par: Nguyen-Tri, Quan, et autres
Publié: (2025)
Rewarding Graph Reasoning Process makes LLMs more Generalized Reasoners
par: Peng, Miao, et autres
Publié: (2025)
par: Peng, Miao, et autres
Publié: (2025)
LoRe: Personalizing LLMs via Low-Rank Reward Modeling
par: Bose, Avinandan, et autres
Publié: (2025)
par: Bose, Avinandan, et autres
Publié: (2025)
FBI-LLM: Scaling Up Fully Binarized LLMs from Scratch via Autoregressive Distillation
par: Ma, Liqun, et autres
Publié: (2024)
par: Ma, Liqun, et autres
Publié: (2024)
Arithmetic Control of LLMs for Diverse User Preferences: Directional Preference Alignment with Multi-Objective Rewards
par: Wang, Haoxiang, et autres
Publié: (2024)
par: Wang, Haoxiang, et autres
Publié: (2024)
When Bias Pretends to Be Truth: How Spurious Correlations Undermine Hallucination Detection in LLMs
par: Wang, Shaowen, et autres
Publié: (2025)
par: Wang, Shaowen, et autres
Publié: (2025)
Documents similaires
-
Inverse Reinforcement Learning with Dynamic Reward Scaling for LLM Alignment
par: Cheng, Ruoxi, et autres
Publié: (2025) -
Reward Shaping to Mitigate Reward Hacking in RLHF
par: Fu, Jiayi, et autres
Publié: (2025) -
Shifting Perspectives: Steering Vectors for Robust Bias Mitigation in LLMs
par: Siddique, Zara, et autres
Publié: (2025) -
Low-rank finetuning for LLMs: A fairness perspective
par: Das, Saswat, et autres
Publié: (2024) -
Reward-Robust RLHF in LLMs
par: Yan, Yuzi, et autres
Publié: (2024)