Balancing the Scales: Reinforcement Learning for Fair Classification
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Eshuijs, Leon, Wang, Shihan, Fokkens, Antske |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Short-circuiting Shortcuts: Mechanistic Investigation of Shortcuts in Text Classification
par: Eshuijs, Leon, et autres
Publié: (2025)
par: Eshuijs, Leon, et autres
Publié: (2025)
Safety Training Modulates Harmful Misalignment Under On-Policy RL, But Direction Depends on Environment Design
par: Eshuijs, Leon, et autres
Publié: (2026)
par: Eshuijs, Leon, et autres
Publié: (2026)
Control the Temperature: Selective Sampling for Diverse and High-Quality LLM Outputs
par: Troshin, Sergey, et autres
Publié: (2025)
par: Troshin, Sergey, et autres
Publié: (2025)
Strategic Demonstration Selection for Improved Fairness in LLM In-Context Learning
par: Hu, Jingyu, et autres
Publié: (2024)
par: Hu, Jingyu, et autres
Publié: (2024)
Datasets for Fairness in Language Models: An In-Depth Survey
par: Zhang, Jiale, et autres
Publié: (2025)
par: Zhang, Jiale, et autres
Publié: (2025)
Group Fairness Meets the Black Box: Enabling Fair Algorithms on Closed LLMs via Post-Processing
par: Xian, Ruicheng, et autres
Publié: (2025)
par: Xian, Ruicheng, et autres
Publié: (2025)
Learning from Sufficient Rationales: Analysing the Relationship Between Explanation Faithfulness and Token-level Regularisation Strategies
par: Kamp, Jonathan, et autres
Publié: (2025)
par: Kamp, Jonathan, et autres
Publié: (2025)
Investigating the Robustness of Modelling Decisions for Few-Shot Cross-Topic Stance Detection: A Preregistered Study
par: Reuver, Myrthe, et autres
Publié: (2024)
par: Reuver, Myrthe, et autres
Publié: (2024)
DefVerify: Do Hate Speech Models Reflect Their Dataset's Definition?
par: Khurana, Urja, et autres
Publié: (2024)
par: Khurana, Urja, et autres
Publié: (2024)
On the Low-Rank Parametrization of Reward Models for Controlled Language Generation
par: Troshin, Sergey, et autres
Publié: (2024)
par: Troshin, Sergey, et autres
Publié: (2024)
Automatic Evaluation Metrics for Artificially Generated Scientific Research
par: Höpner, Niklas, et autres
Publié: (2025)
par: Höpner, Niklas, et autres
Publié: (2025)
Addressing Both Statistical and Causal Gender Fairness in NLP Models
par: Chen, Hannah, et autres
Publié: (2024)
par: Chen, Hannah, et autres
Publié: (2024)
Fair Representation in Parliamentary Summaries: Measuring and Mitigating Inclusion Bias
par: Cunningham, Eoghan, et autres
Publié: (2025)
par: Cunningham, Eoghan, et autres
Publié: (2025)
FairPair: A Robust Evaluation of Biases in Language Models through Paired Perturbations
par: Dwivedi-Yu, Jane, et autres
Publié: (2024)
par: Dwivedi-Yu, Jane, et autres
Publié: (2024)
BadFair: Backdoored Fairness Attacks with Group-conditioned Triggers
par: Xue, Jiaqi, et autres
Publié: (2024)
par: Xue, Jiaqi, et autres
Publié: (2024)
Audit Me If You Can: Query-Efficient Active Fairness Auditing of Black-Box LLMs
par: Hartmann, David, et autres
Publié: (2026)
par: Hartmann, David, et autres
Publié: (2026)
Intrinsic Meets Extrinsic Fairness: Assessing the Downstream Impact of Bias Mitigation in Large Language Models
par: Arzaghi', 'Mina, et autres
Publié: (2025)
par: Arzaghi', 'Mina, et autres
Publié: (2025)
The Role of Syntactic Span Preferences in Post-Hoc Explanation Disagreement
par: Kamp, Jonathan, et autres
Publié: (2024)
par: Kamp, Jonathan, et autres
Publié: (2024)
Improving Causal Interventions in Amnesic Probing with Mean Projection or LEACE
par: Dobrzeniecka, Alicja, et autres
Publié: (2025)
par: Dobrzeniecka, Alicja, et autres
Publié: (2025)
Accept or Deny? Evaluating LLM Fairness and Performance in Loan Approval across Table-to-Text Serialization Approaches
par: Azime, Israel Abebe, et autres
Publié: (2025)
par: Azime, Israel Abebe, et autres
Publié: (2025)
Fairness of ChatGPT
par: Li, Yunqi, et autres
Publié: (2023)
par: Li, Yunqi, et autres
Publié: (2023)
Balancing Fairness and Accuracy in Data-Restricted Binary Classification
par: Lazri, Zachary McBride, et autres
Publié: (2024)
par: Lazri, Zachary McBride, et autres
Publié: (2024)
Fairness in Reinforcement Learning with Bisimulation Metrics
par: Rezaei-Shoshtari, Sahand, et autres
Publié: (2024)
par: Rezaei-Shoshtari, Sahand, et autres
Publié: (2024)
Whose Preferences? Differences in Fairness Preferences and Their Impact on the Fairness of AI Utilizing Human Feedback
par: Lerner, Emilia Agis, et autres
Publié: (2024)
par: Lerner, Emilia Agis, et autres
Publié: (2024)
ResumeAtlas: Revisiting Resume Classification with Large-Scale Datasets and Large Language Models
par: Heakl, Ahmed, et autres
Publié: (2024)
par: Heakl, Ahmed, et autres
Publié: (2024)
LangFair: A Python Package for Assessing Bias and Fairness in Large Language Model Use Cases
par: Bouchard, Dylan, et autres
Publié: (2025)
par: Bouchard, Dylan, et autres
Publié: (2025)
Diagnosing Hate Speech Classification: Where Do Humans and Machines Disagree, and Why?
par: Yang, Xilin
Publié: (2024)
par: Yang, Xilin
Publié: (2024)
Why Don't Prompt-Based Fairness Metrics Correlate?
par: Zayed, Abdelrahman, et autres
Publié: (2024)
par: Zayed, Abdelrahman, et autres
Publié: (2024)
Bias and Fairness in Large Language Models: A Survey
par: Gallegos, Isabel O., et autres
Publié: (2023)
par: Gallegos, Isabel O., et autres
Publié: (2023)
KPoEM: A Human-Annotated Dataset for Emotion Classification and RAG-Based Poetry Generation in Korean Modern Poetry
par: Lim, Iro, et autres
Publié: (2025)
par: Lim, Iro, et autres
Publié: (2025)
Balancing Fairness and Performance in Healthcare AI: A Gradient Reconciliation Approach
par: Wang, Xiaoyang, et autres
Publié: (2025)
par: Wang, Xiaoyang, et autres
Publié: (2025)
Laissez-Faire Harms: Algorithmic Biases in Generative Language Models
par: Shieh, Evan, et autres
Publié: (2024)
par: Shieh, Evan, et autres
Publié: (2024)
LLM-Assisted Content Conditional Debiasing for Fair Text Embedding
par: Deng, Wenlong, et autres
Publié: (2024)
par: Deng, Wenlong, et autres
Publié: (2024)
Exploring Accuracy-Fairness Trade-off in Large Language Models
par: Zhang, Qingquan, et autres
Publié: (2024)
par: Zhang, Qingquan, et autres
Publié: (2024)
In the Name of Fairness: Assessing the Bias in Clinical Record De-identification
par: Xiao, Yuxin, et autres
Publié: (2023)
par: Xiao, Yuxin, et autres
Publié: (2023)
Should We Attend More or Less? Modulating Attention for Fairness
par: Zayed, Abdelrahman, et autres
Publié: (2023)
par: Zayed, Abdelrahman, et autres
Publié: (2023)
Crowd-Calibrator: Can Annotator Disagreement Inform Calibration in Subjective Tasks?
par: Khurana, Urja, et autres
Publié: (2024)
par: Khurana, Urja, et autres
Publié: (2024)
Asking a Language Model for Diverse Responses
par: Troshin, Sergey, et autres
Publié: (2025)
par: Troshin, Sergey, et autres
Publié: (2025)
Data Acquisition for Improving Model Fairness using Reinforcement Learning
par: Hasan, Jahid, et autres
Publié: (2024)
par: Hasan, Jahid, et autres
Publié: (2024)
AXOLOTL: Fairness through Assisted Self-Debiasing of Large Language Model Outputs
par: Ebrahimi, Sana, et autres
Publié: (2024)
par: Ebrahimi, Sana, et autres
Publié: (2024)
Documents similaires
-
Short-circuiting Shortcuts: Mechanistic Investigation of Shortcuts in Text Classification
par: Eshuijs, Leon, et autres
Publié: (2025) -
Safety Training Modulates Harmful Misalignment Under On-Policy RL, But Direction Depends on Environment Design
par: Eshuijs, Leon, et autres
Publié: (2026) -
Control the Temperature: Selective Sampling for Diverse and High-Quality LLM Outputs
par: Troshin, Sergey, et autres
Publié: (2025) -
Strategic Demonstration Selection for Improved Fairness in LLM In-Context Learning
par: Hu, Jingyu, et autres
Publié: (2024) -
Datasets for Fairness in Language Models: An In-Depth Survey
par: Zhang, Jiale, et autres
Publié: (2025)