Inference-Time Selective Debiasing to Enhance Fairness in Text Classification Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Kuzmin, Gleb, Yadav, Neemesh, Smirnov, Ivan, Baldwin, Timothy, Shelmanov, Artem |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Exploring Large Language Models for Detecting Mental Disorders
par: Kuzmin, Gleb, et autres
Publié: (2024)
par: Kuzmin, Gleb, et autres
Publié: (2024)
Fact-Checking the Output of Large Language Models via Token-Level Uncertainty Quantification
par: Fadeeva, Ekaterina, et autres
Publié: (2024)
par: Fadeeva, Ekaterina, et autres
Publié: (2024)
Uncertainty Quantification for Large Language Diffusion Models
par: Vazhentsev, Artem, et autres
Publié: (2026)
par: Vazhentsev, Artem, et autres
Publié: (2026)
ReProbe: Efficient Test-Time Scaling of Multi-Step Reasoning by Probing Internal States of Large Language Models
par: Ni, Jingwei, et autres
Publié: (2025)
par: Ni, Jingwei, et autres
Publié: (2025)
A Head to Predict and a Head to Question: Pre-trained Uncertainty Quantification Heads for Hallucination Detection in LLM Outputs
par: Shelmanov, Artem, et autres
Publié: (2025)
par: Shelmanov, Artem, et autres
Publié: (2025)
Unconditional Truthfulness: Learning Unconditional Uncertainty of Large Language Models
par: Vazhentsev, Artem, et autres
Publié: (2024)
par: Vazhentsev, Artem, et autres
Publié: (2024)
Vikhr: The Family of Open-Source Instruction-Tuned Large Language Models for Russian
par: Nikolich, Aleksandr, et autres
Publié: (2024)
par: Nikolich, Aleksandr, et autres
Publié: (2024)
Effects of Theory of Mind and Prosocial Beliefs on Steering Human-Aligned Behaviors of LLMs in Ultimatum Games
par: Yadav, Neemesh, et autres
Publié: (2025)
par: Yadav, Neemesh, et autres
Publié: (2025)
Debiasing Reward Models via Causally Motivated Inference-Time Intervention
par: Shinoda, Kazutoshi, et autres
Publié: (2026)
par: Shinoda, Kazutoshi, et autres
Publié: (2026)
MHSafeEval: Role-Aware Interaction-Level Evaluation of Mental Health Safety in Large Language Models
par: Lee, Suhyun, et autres
Publié: (2026)
par: Lee, Suhyun, et autres
Publié: (2026)
LLM-Assisted Content Conditional Debiasing for Fair Text Embedding
par: Deng, Wenlong, et autres
Publié: (2024)
par: Deng, Wenlong, et autres
Publié: (2024)
Debiasing Text Safety Classifiers through a Fairness-Aware Ensemble
par: Sturman, Olivia, et autres
Publié: (2024)
par: Sturman, Olivia, et autres
Publié: (2024)
Social Debiasing for Fair Multi-modal LLMs
par: Cheng, Harry, et autres
Publié: (2024)
par: Cheng, Harry, et autres
Publié: (2024)
ATGen: A Framework for Active Text Generation
par: Tsvigun, Akim, et autres
Publié: (2025)
par: Tsvigun, Akim, et autres
Publié: (2025)
Uncertainty-Aware Attention Heads: Efficient Unsupervised Uncertainty Quantification for LLMs
par: Vazhentsev, Artem, et autres
Publié: (2025)
par: Vazhentsev, Artem, et autres
Publié: (2025)
Dual Debiasing: Remove Stereotypes and Keep Factual Gender for Fair Language Modeling and Translation
par: Limisiewicz, Tomasz, et autres
Publié: (2025)
par: Limisiewicz, Tomasz, et autres
Publié: (2025)
Exploring the Hidden Capacity of LLMs for One-Step Text Generation
par: Mezentsev, Gleb, et autres
Publié: (2025)
par: Mezentsev, Gleb, et autres
Publié: (2025)
Token-Level Density-Based Uncertainty Quantification Methods for Eliciting Truthfulness of Large Language Models
par: Vazhentsev, Artem, et autres
Publié: (2025)
par: Vazhentsev, Artem, et autres
Publié: (2025)
Psychometric Predictive Power of Large Language Models
par: Kuribayashi, Tatsuki, et autres
Publié: (2023)
par: Kuribayashi, Tatsuki, et autres
Publié: (2023)
Uncertainty-aware abstention in medical diagnosis based on medical texts
par: Vazhentsev, Artem, et autres
Publié: (2025)
par: Vazhentsev, Artem, et autres
Publié: (2025)
CatRAG: Functor-Guided Structural Debiasing with Retrieval Augmentation for Fair LLMs
par: Ranjan, Ravi, et autres
Publié: (2026)
par: Ranjan, Ravi, et autres
Publié: (2026)
Target-oriented Multimodal Sentiment Classification with Counterfactual-enhanced Debiasing
par: Liu, Zhiyue, et autres
Publié: (2025)
par: Liu, Zhiyue, et autres
Publié: (2025)
Enhancing the QA Model through a Multi-domain Debiasing Framework
par: Wang, Yuefeng, et autres
Publié: (2026)
par: Wang, Yuefeng, et autres
Publié: (2026)
AXOLOTL: Fairness through Assisted Self-Debiasing of Large Language Model Outputs
par: Ebrahimi, Sana, et autres
Publié: (2024)
par: Ebrahimi, Sana, et autres
Publié: (2024)
General Phrase Debiaser: Debiasing Masked Language Models at a Multi-Token Level
par: Shi, Bingkang, et autres
Publié: (2023)
par: Shi, Bingkang, et autres
Publié: (2023)
DINER: Debiasing Aspect-based Sentiment Analysis with Multi-variable Causal Inference
par: Wu, Jialong, et autres
Publié: (2024)
par: Wu, Jialong, et autres
Publié: (2024)
Amplifying, Not Learning: Fine-Tuned AI Text Detectors Amplify a Pretrained Direction
par: Smirnov, Alexander
Publié: (2026)
par: Smirnov, Alexander
Publié: (2026)
L2D-Clinical: Learning to Defer for Adaptive Model Selection in Clinical Text Classification
par: Kondadadi, Rishik, et autres
Publié: (2026)
par: Kondadadi, Rishik, et autres
Publié: (2026)
Potential and Challenges of Model Editing for Social Debiasing
par: Yan, Jianhao, et autres
Publié: (2024)
par: Yan, Jianhao, et autres
Publié: (2024)
Evaluating Evidence Attribution in Generated Fact Checking Explanations
par: Xing, Rui, et autres
Publié: (2024)
par: Xing, Rui, et autres
Publié: (2024)
Selecting Between BERT and GPT for Text Classification in Political Science Research
par: Wang, Yu, et autres
Publié: (2024)
par: Wang, Yu, et autres
Publié: (2024)
SparseGrad: A Selective Method for Efficient Fine-tuning of MLP Layers
par: Chekalina, Viktoriia, et autres
Publié: (2024)
par: Chekalina, Viktoriia, et autres
Publié: (2024)
BayesPrompt: Prompting Large-Scale Pre-Trained Language Models on Few-shot Inference via Debiased Domain Abstraction
par: Li, Jiangmeng, et autres
Publié: (2024)
par: Li, Jiangmeng, et autres
Publié: (2024)
A Simple Ensemble Strategy for LLM Inference: Towards More Stable Text Classification
par: Niimi, Junichiro
Publié: (2025)
par: Niimi, Junichiro
Publié: (2025)
With Greater Text Comes Greater Necessity: Inference-Time Training Helps Long Text Generation
par: Wang, Y., et autres
Publié: (2024)
par: Wang, Y., et autres
Publié: (2024)
Enhancing LLM-Based Text Classification in Political Science: Automatic Prompt Optimization and Dynamic Exemplar Selection for Few-Shot Learning
par: Liu, Menglin, et autres
Publié: (2024)
par: Liu, Menglin, et autres
Publié: (2024)
Speculative Thinking: Enhancing Small-Model Reasoning with Large Model Guidance at Inference Time
par: Yang, Wang, et autres
Publié: (2025)
par: Yang, Wang, et autres
Publié: (2025)
Label Distribution Learning-Enhanced Dual-KNN for Text Classification
par: Yuan, Bo, et autres
Publié: (2025)
par: Yuan, Bo, et autres
Publié: (2025)
Interdisciplinary Fairness in Imbalanced Research Proposal Topic Inference: A Hierarchical Transformer-based Method with Selective Interpolation
par: Xiao, Meng, et autres
Publié: (2023)
par: Xiao, Meng, et autres
Publié: (2023)
Selective Attention Federated Learning: Improving Privacy and Efficiency for Clinical Text Classification
par: Li, Yue, et autres
Publié: (2025)
par: Li, Yue, et autres
Publié: (2025)
Documents similaires
-
Exploring Large Language Models for Detecting Mental Disorders
par: Kuzmin, Gleb, et autres
Publié: (2024) -
Fact-Checking the Output of Large Language Models via Token-Level Uncertainty Quantification
par: Fadeeva, Ekaterina, et autres
Publié: (2024) -
Uncertainty Quantification for Large Language Diffusion Models
par: Vazhentsev, Artem, et autres
Publié: (2026) -
ReProbe: Efficient Test-Time Scaling of Multi-Step Reasoning by Probing Internal States of Large Language Models
par: Ni, Jingwei, et autres
Publié: (2025) -
A Head to Predict and a Head to Question: Pre-trained Uncertainty Quantification Heads for Hallucination Detection in LLM Outputs
par: Shelmanov, Artem, et autres
Publié: (2025)