Mitigating Social Biases in Language Models through Unlearning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Dige, Omkar, Singh, Diljot, Yau, Tsz Fung, Zhang, Qixuan, Bolandraftar, Borna, Zhu, Xiaodan, Khattak, Faiza Khan |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
On The Role of Reasoning in the Identification of Subtle Stereotypes in Natural Language
par: Tian, Jacob-Junqi, et autres
Publié: (2023)
par: Tian, Jacob-Junqi, et autres
Publié: (2023)
Soft-prompt Tuning for Large Language Models to Evaluate Bias
par: Tian, Jacob-Junqi, et autres
Publié: (2023)
par: Tian, Jacob-Junqi, et autres
Publié: (2023)
Intent-Aware Self-Correction for Mitigating Social Biases in Large Language Models
par: Anantaprayoon, Panatchakorn, et autres
Publié: (2025)
par: Anantaprayoon, Panatchakorn, et autres
Publié: (2025)
Bias Vector: Mitigating Biases in Language Models with Task Arithmetic Approach
par: Shirafuji, Daiki, et autres
Publié: (2024)
par: Shirafuji, Daiki, et autres
Publié: (2024)
Cognitive Biases in Large Language Models: A Survey and Mitigation Experiments
par: Sumita, Yasuaki, et autres
Publié: (2024)
par: Sumita, Yasuaki, et autres
Publié: (2024)
Balancing Rigor and Utility: Mitigating Cognitive Biases in Large Language Models for Multiple-Choice Questions
par: Zhong, Hanyang, et autres
Publié: (2024)
par: Zhong, Hanyang, et autres
Publié: (2024)
RePAIR: Interactive Machine Unlearning through Prompt-Aware Model Repair
par: Rachapudi, Jagadeesh, et autres
Publié: (2026)
par: Rachapudi, Jagadeesh, et autres
Publié: (2026)
FairFlow: Mitigating Dataset Biases through Undecided Learning
par: Cheng, Jiali, et autres
Publié: (2025)
par: Cheng, Jiali, et autres
Publié: (2025)
Deciphering the Impact of Pretraining Data on Large Language Models through Machine Unlearning
par: Zhao, Yang, et autres
Publié: (2024)
par: Zhao, Yang, et autres
Publié: (2024)
Mitigating Biases for Instruction-following Language Models via Bias Neurons Elimination
par: Yang, Nakyeong, et autres
Publié: (2023)
par: Yang, Nakyeong, et autres
Publié: (2023)
White Men Lead, Black Women Help? Benchmarking and Mitigating Language Agency Social Biases in LLMs
par: Wan, Yixin, et autres
Publié: (2024)
par: Wan, Yixin, et autres
Publié: (2024)
Hierarchical Federated Unlearning for Large Language Models
par: Zhong, Yisheng, et autres
Publié: (2025)
par: Zhong, Yisheng, et autres
Publié: (2025)
Deep Contrastive Unlearning for Language Models
par: He, Estrid, et autres
Publié: (2025)
par: He, Estrid, et autres
Publié: (2025)
Machine Unlearning in Large Language Models
par: Gundavarapu, Saaketh Koundinya, et autres
Publié: (2024)
par: Gundavarapu, Saaketh Koundinya, et autres
Publié: (2024)
OFFSIDE: Benchmarking Unlearning Misinformation in Multimodal Large Language Models
par: Zheng, Hao, et autres
Publié: (2025)
par: Zheng, Hao, et autres
Publié: (2025)
Identifying and Mitigating Social Bias Knowledge in Language Models
par: Chen, Ruizhe, et autres
Publié: (2024)
par: Chen, Ruizhe, et autres
Publié: (2024)
Self-Blinding and Counterfactual Self-Simulation Mitigate Biases and Sycophancy in Large Language Models
par: Christian, Brian, et autres
Publié: (2026)
par: Christian, Brian, et autres
Publié: (2026)
FairPy: A Toolkit for Evaluation of Prediction Biases and their Mitigation in Large Language Models
par: Viswanath, Hrishikesh, et autres
Publié: (2023)
par: Viswanath, Hrishikesh, et autres
Publié: (2023)
A Neuro-inspired Interpretation of Unlearning in Large Language Models through Sample-level Unlearning Difficulty
par: Feng, Xiaohua, et autres
Publié: (2025)
par: Feng, Xiaohua, et autres
Publié: (2025)
Large Language Models are Biased Because They Are Large Language Models
par: Resnik, Philip
Publié: (2024)
par: Resnik, Philip
Publié: (2024)
PersonaMatrix: A Recipe for Persona-Aware Evaluation of Legal Summarization
par: Pang, Tsz Fung, et autres
Publié: (2025)
par: Pang, Tsz Fung, et autres
Publié: (2025)
CURE: Controlled Unlearning for Robust Embeddings -- Mitigating Conceptual Shortcuts in Pre-Trained Language Models
par: Kocak, Aysenur, et autres
Publié: (2025)
par: Kocak, Aysenur, et autres
Publié: (2025)
Invisible Influences: Investigating Implicit Intersectional Biases through Persona Engineering in Large Language Models
par: Arimanda, Nandini, et autres
Publié: (2026)
par: Arimanda, Nandini, et autres
Publié: (2026)
Understanding the Dilemma of Unlearning for Large Language Models
par: Zhang, Qingjie, et autres
Publié: (2025)
par: Zhang, Qingjie, et autres
Publié: (2025)
Learning and Unlearning of Fabricated Knowledge in Language Models
par: Sun, Chen, et autres
Publié: (2024)
par: Sun, Chen, et autres
Publié: (2024)
CodeUnlearn: Amortized Zero-Shot Machine Unlearning in Language Models Using Discrete Concept
par: Wu, YuXuan, et autres
Publié: (2024)
par: Wu, YuXuan, et autres
Publié: (2024)
ASRU: Activation Steering Meets Reinforcement Unlearning for Multimodal Large Language Models
par: Guang, Jiahui, et autres
Publié: (2026)
par: Guang, Jiahui, et autres
Publié: (2026)
Exploring the Role of Reasoning Structures for Constructing Proofs in Multi-Step Natural Language Reasoning with Large Language Models
par: Zheng, Zi'ou, et autres
Publié: (2024)
par: Zheng, Zi'ou, et autres
Publié: (2024)
Towards Reasoning-Preserving Unlearning in Multimodal Large Language Models
par: Li, Hongji, et autres
Publié: (2025)
par: Li, Hongji, et autres
Publié: (2025)
Chat-TS: Enhancing Multi-Modal Reasoning Over Time-Series and Natural Language Data
par: Quinlan, Paul, et autres
Publié: (2025)
par: Quinlan, Paul, et autres
Publié: (2025)
Large Language Model Unlearning
par: Yao, Yuanshun, et autres
Publié: (2023)
par: Yao, Yuanshun, et autres
Publié: (2023)
Unlearning Traces the Influential Training Data of Language Models
par: Isonuma, Masaru, et autres
Publié: (2024)
par: Isonuma, Masaru, et autres
Publié: (2024)
Multilingual Performance Biases of Large Language Models in Education
par: Gupta, Vansh, et autres
Publié: (2025)
par: Gupta, Vansh, et autres
Publié: (2025)
Large Language Models Develop Novel Social Biases Through Adaptive Exploration
par: Wu, Addison J., et autres
Publié: (2025)
par: Wu, Addison J., et autres
Publié: (2025)
Fine-Tuning Language Models with Differential Privacy through Adaptive Noise Allocation
par: Li, Xianzhi, et autres
Publié: (2024)
par: Li, Xianzhi, et autres
Publié: (2024)
ZeroUnlearn: Few-Shot Knowledge Unlearning in Large Language Models
par: Lin, Yujie, et autres
Publié: (2026)
par: Lin, Yujie, et autres
Publié: (2026)
Learn while Unlearn: An Iterative Unlearning Framework for Generative Language Models
par: Tang, Haoyu, et autres
Publié: (2024)
par: Tang, Haoyu, et autres
Publié: (2024)
Empathetic Cascading Networks: A Multi-Stage Prompting Technique for Reducing Social Biases in Large Language Models
par: Xin, Wangjiaxuan
Publié: (2025)
par: Xin, Wangjiaxuan
Publié: (2025)
Mitigating Memorization In Language Models
par: Sakarvadia, Mansi, et autres
Publié: (2024)
par: Sakarvadia, Mansi, et autres
Publié: (2024)
No Free Lunch in Language Model Bias Mitigation? Targeted Bias Reduction Can Exacerbate Unmitigated LLM Biases
par: Chand, Shireen, et autres
Publié: (2025)
par: Chand, Shireen, et autres
Publié: (2025)
Documents similaires
-
On The Role of Reasoning in the Identification of Subtle Stereotypes in Natural Language
par: Tian, Jacob-Junqi, et autres
Publié: (2023) -
Soft-prompt Tuning for Large Language Models to Evaluate Bias
par: Tian, Jacob-Junqi, et autres
Publié: (2023) -
Intent-Aware Self-Correction for Mitigating Social Biases in Large Language Models
par: Anantaprayoon, Panatchakorn, et autres
Publié: (2025) -
Bias Vector: Mitigating Biases in Language Models with Task Arithmetic Approach
par: Shirafuji, Daiki, et autres
Publié: (2024) -
Cognitive Biases in Large Language Models: A Survey and Mitigation Experiments
par: Sumita, Yasuaki, et autres
Publié: (2024)