Debiasing Text Safety Classifiers through a Fairness-Aware Ensemble
Fuente:
arXiv
Salvato in:
| Autori principali: | Sturman, Olivia, Joshi, Aparna, Radharapu, Bhaktipriya, Kumar, Piyush, Shelby, Renee |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
ShieldGemma: Generative AI Content Moderation Based on Gemma
di: Zeng, Wenjun, et al.
Pubblicazione: (2024)
di: Zeng, Wenjun, et al.
Pubblicazione: (2024)
LLM-Assisted Content Conditional Debiasing for Fair Text Embedding
di: Deng, Wenlong, et al.
Pubblicazione: (2024)
di: Deng, Wenlong, et al.
Pubblicazione: (2024)
Improving LLM Safety and Helpfulness using SFT and DPO: A Study on OPT-350M
di: Pant, Piyush
Pubblicazione: (2025)
di: Pant, Piyush
Pubblicazione: (2025)
AXOLOTL: Fairness through Assisted Self-Debiasing of Large Language Model Outputs
di: Ebrahimi, Sana, et al.
Pubblicazione: (2024)
di: Ebrahimi, Sana, et al.
Pubblicazione: (2024)
Debiasing Algorithm through Model Adaptation
di: Limisiewicz, Tomasz, et al.
Pubblicazione: (2023)
di: Limisiewicz, Tomasz, et al.
Pubblicazione: (2023)
Vulnerability Mitigation for Safety-Aligned Language Models via Debiasing
di: Tran, Thien Q., et al.
Pubblicazione: (2025)
di: Tran, Thien Q., et al.
Pubblicazione: (2025)
Calibrating LLM Judges: Linear Probes for Fast and Reliable Uncertainty Estimation
di: Radharapu, Bhaktipriya, et al.
Pubblicazione: (2025)
di: Radharapu, Bhaktipriya, et al.
Pubblicazione: (2025)
RealSeal: Revolutionizing Media Authentication with Real-Time Realism Scoring
di: Radharapu, Bhaktipriya, et al.
Pubblicazione: (2024)
di: Radharapu, Bhaktipriya, et al.
Pubblicazione: (2024)
MedAidDialog: A Multilingual Multi-Turn Medical Dialogue Dataset for Accessible Healthcare
di: Nigam, Shubham Kumar, et al.
Pubblicazione: (2026)
di: Nigam, Shubham Kumar, et al.
Pubblicazione: (2026)
Is Your Model Fairly Certain? Uncertainty-Aware Fairness Evaluation for LLMs
di: Wang, Yinong Oliver, et al.
Pubblicazione: (2025)
di: Wang, Yinong Oliver, et al.
Pubblicazione: (2025)
Large Language Models in the Task of Automatic Validation of Text Classifier Predictions
di: Tsymbalov, Aleksandr, et al.
Pubblicazione: (2025)
di: Tsymbalov, Aleksandr, et al.
Pubblicazione: (2025)
Autonomous Data Selection with Zero-shot Generative Classifiers for Mathematical Texts
di: Zhang, Yifan, et al.
Pubblicazione: (2024)
di: Zhang, Yifan, et al.
Pubblicazione: (2024)
Towards LLM-guided Causal Explainability for Black-box Text Classifiers
di: Bhattacharjee, Amrita, et al.
Pubblicazione: (2023)
di: Bhattacharjee, Amrita, et al.
Pubblicazione: (2023)
Domain Gating Ensemble Networks for AI-Generated Text Detection
di: Tripathi, Arihant, et al.
Pubblicazione: (2025)
di: Tripathi, Arihant, et al.
Pubblicazione: (2025)
Contrast-CAT: Contrasting Activations for Enhanced Interpretability in Transformer-based Text Classifiers
di: Han, Sungmin, et al.
Pubblicazione: (2025)
di: Han, Sungmin, et al.
Pubblicazione: (2025)
Debiasing Multilingual LLMs in Cross-lingual Latent Space
di: Peng, Qiwei, et al.
Pubblicazione: (2025)
di: Peng, Qiwei, et al.
Pubblicazione: (2025)
Ensemble Learning for Large Language Models in Text and Code Generation: A Survey
di: Ashiga, Mari, et al.
Pubblicazione: (2025)
di: Ashiga, Mari, et al.
Pubblicazione: (2025)
Uncertainty-Aware Fusion: An Ensemble Framework for Mitigating Hallucinations in Large Language Models
di: Dey, Prasenjit, et al.
Pubblicazione: (2025)
di: Dey, Prasenjit, et al.
Pubblicazione: (2025)
FairFlow: Mitigating Dataset Biases through Undecided Learning
di: Cheng, Jiali, et al.
Pubblicazione: (2025)
di: Cheng, Jiali, et al.
Pubblicazione: (2025)
Exploring the Trade-off Between Model Performance and Explanation Plausibility of Text Classifiers Using Human Rationales
di: Resck, Lucas E., et al.
Pubblicazione: (2024)
di: Resck, Lucas E., et al.
Pubblicazione: (2024)
A Multi-LLM Debiasing Framework
di: Owens, Deonna M., et al.
Pubblicazione: (2024)
di: Owens, Deonna M., et al.
Pubblicazione: (2024)
Probabilistic Consensus through Ensemble Validation: A Framework for LLM Reliability
di: Naik, Ninad
Pubblicazione: (2024)
di: Naik, Ninad
Pubblicazione: (2024)
Enhancing Trust in Large Language Models via Uncertainty-Calibrated Fine-Tuning
di: Krishnan, Ranganath, et al.
Pubblicazione: (2024)
di: Krishnan, Ranganath, et al.
Pubblicazione: (2024)
Parity-Aware Byte-Pair Encoding: Improving Cross-lingual Fairness in Tokenization
di: Foroutan, Negar, et al.
Pubblicazione: (2025)
di: Foroutan, Negar, et al.
Pubblicazione: (2025)
IndicMedDialog: A Parallel Multi-Turn Medical Dialogue Dataset for Accessible Healthcare in Indic Languages
di: Nigam, Shubham Kumar, et al.
Pubblicazione: (2026)
di: Nigam, Shubham Kumar, et al.
Pubblicazione: (2026)
IL-TUR: Benchmark for Indian Legal Text Understanding and Reasoning
di: Joshi, Abhinav, et al.
Pubblicazione: (2024)
di: Joshi, Abhinav, et al.
Pubblicazione: (2024)
Hallucination Diversity-Aware Active Learning for Text Summarization
di: Xia, Yu, et al.
Pubblicazione: (2024)
di: Xia, Yu, et al.
Pubblicazione: (2024)
Internal Planning in Language Models: Characterizing Horizon and Branch Awareness
di: Ustaomeroglu, Muhammed, et al.
Pubblicazione: (2025)
di: Ustaomeroglu, Muhammed, et al.
Pubblicazione: (2025)
PromptMind Team at MEDIQA-CORR 2024: Improving Clinical Text Correction with Error Categorization and LLM Ensembles
di: Gundabathula, Satya Kesav, et al.
Pubblicazione: (2024)
di: Gundabathula, Satya Kesav, et al.
Pubblicazione: (2024)
CoLD: Counterfactually-Guided Length Debiasing for Process Reward Models in Mathematical Reasoning
di: Zheng, Congmin, et al.
Pubblicazione: (2025)
di: Zheng, Congmin, et al.
Pubblicazione: (2025)
Multilinguality in LLM-Designed Reward Functions for Restless Bandits: Effects on Task Performance and Fairness
di: Parthasarathy, Ambreesh, et al.
Pubblicazione: (2025)
di: Parthasarathy, Ambreesh, et al.
Pubblicazione: (2025)
Reasoning Towards Fairness: Mitigating Bias in Language Models through Reasoning-Guided Fine-Tuning
di: Kabra, Sanchit, et al.
Pubblicazione: (2025)
di: Kabra, Sanchit, et al.
Pubblicazione: (2025)
AMUSED: A Multi-Stream Vector Representation Method for Use in Natural Dialogue
di: Kumar, Gaurav, et al.
Pubblicazione: (2019)
di: Kumar, Gaurav, et al.
Pubblicazione: (2019)
On the Effectiveness and Generalization of Race Representations for Debiasing High-Stakes Decisions
di: Nguyen, Dang, et al.
Pubblicazione: (2025)
di: Nguyen, Dang, et al.
Pubblicazione: (2025)
TopicProphet: Prophesies on Temporal Topic Trends and Stocks
di: Kim, Olivia
Pubblicazione: (2025)
di: Kim, Olivia
Pubblicazione: (2025)
xRouter: Training Cost-Aware LLMs Orchestration System via Reinforcement Learning
di: Qian, Cheng, et al.
Pubblicazione: (2025)
di: Qian, Cheng, et al.
Pubblicazione: (2025)
In Vino Veritas and Vulnerabilities: Examining LLM Safety via Drunk Language Inducement
di: Shetty, Anudeex, et al.
Pubblicazione: (2026)
di: Shetty, Anudeex, et al.
Pubblicazione: (2026)
LightPneumoNet: Lightweight Pneumonia Classifier
di: Chauhan, Neilansh, et al.
Pubblicazione: (2025)
di: Chauhan, Neilansh, et al.
Pubblicazione: (2025)
BiasEdit: Debiasing Stereotyped Language Models via Model Editing
di: Xu, Xin, et al.
Pubblicazione: (2025)
di: Xu, Xin, et al.
Pubblicazione: (2025)
Clip Your Sequences Fairly: Enforcing Length Fairness for Sequence-Level RL
di: Mao, Hanyi, et al.
Pubblicazione: (2025)
di: Mao, Hanyi, et al.
Pubblicazione: (2025)
Documenti analoghi
-
ShieldGemma: Generative AI Content Moderation Based on Gemma
di: Zeng, Wenjun, et al.
Pubblicazione: (2024) -
LLM-Assisted Content Conditional Debiasing for Fair Text Embedding
di: Deng, Wenlong, et al.
Pubblicazione: (2024) -
Improving LLM Safety and Helpfulness using SFT and DPO: A Study on OPT-350M
di: Pant, Piyush
Pubblicazione: (2025) -
AXOLOTL: Fairness through Assisted Self-Debiasing of Large Language Model Outputs
di: Ebrahimi, Sana, et al.
Pubblicazione: (2024) -
Debiasing Algorithm through Model Adaptation
di: Limisiewicz, Tomasz, et al.
Pubblicazione: (2023)