AdvSumm: Adversarial Training for Bias Mitigation in Text Summarization

Fuente: arXiv
Salvato in:
Dettagli Bibliografici
Autori principali: Gupta, Mukur, Varimalla, Nikhil Reddy, Deas, Nicholas, Subbiah, Melanie, McKeown, Kathleen
Natura: Preprint
Pubblicazione: 2025
Soggetti:
Accesso online:
Tags: Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
_version_ 1866918144642121728
author Gupta, Mukur
Varimalla, Nikhil Reddy
Deas, Nicholas
Subbiah, Melanie
McKeown, Kathleen
author_facet Gupta, Mukur
Varimalla, Nikhil Reddy
Deas, Nicholas
Subbiah, Melanie
McKeown, Kathleen
contents Large Language Models (LLMs) have achieved impressive performance in text summarization and are increasingly deployed in real-world applications. However, these systems often inherit associative and framing biases from pre-training data, leading to inappropriate or unfair outputs in downstream tasks. In this work, we present AdvSumm (Adversarial Summarization), a domain-agnostic training framework designed to mitigate bias in text summarization through improved generalization. Inspired by adversarial robustness, AdvSumm introduces a novel Perturber component that applies gradient-guided perturbations at the embedding level of Sequence-to-Sequence models, enhancing the model's robustness to input variations. We empirically demonstrate that AdvSumm effectively reduces different types of bias in summarization-specifically, name-nationality bias and political framing bias-without compromising summarization quality. Compared to standard transformers and data augmentation techniques like back-translation, AdvSumm achieves stronger bias mitigation performance across benchmark datasets.
format Preprint
id arxiv_https___arxiv_org_abs_2506_06273
institution arXiv
publishDate 2025
record_format arxiv
spellingShingle AdvSumm: Adversarial Training for Bias Mitigation in Text Summarization
Gupta, Mukur
Varimalla, Nikhil Reddy
Deas, Nicholas
Subbiah, Melanie
McKeown, Kathleen
Computation and Language
Large Language Models (LLMs) have achieved impressive performance in text summarization and are increasingly deployed in real-world applications. However, these systems often inherit associative and framing biases from pre-training data, leading to inappropriate or unfair outputs in downstream tasks. In this work, we present AdvSumm (Adversarial Summarization), a domain-agnostic training framework designed to mitigate bias in text summarization through improved generalization. Inspired by adversarial robustness, AdvSumm introduces a novel Perturber component that applies gradient-guided perturbations at the embedding level of Sequence-to-Sequence models, enhancing the model's robustness to input variations. We empirically demonstrate that AdvSumm effectively reduces different types of bias in summarization-specifically, name-nationality bias and political framing bias-without compromising summarization quality. Compared to standard transformers and data augmentation techniques like back-translation, AdvSumm achieves stronger bias mitigation performance across benchmark datasets.
title AdvSumm: Adversarial Training for Bias Mitigation in Text Summarization
topic Computation and Language
url https://arxiv.org/abs/2506.06273