Multi-Dimensional Optimization for Text Summarization via Reinforcement Learning

Fuente: arXiv
Saved in:
Bibliographic Details
Main Authors: Ryu, Sangwon, Do, Heejin, Kim, Yunsu, Lee, Gary Geunbae, Ok, Jungseul
Format: Preprint
Published: 2024
Subjects:
Online Access:
Tags: Add Tag
No Tags, Be the first to tag this record!
_version_ 1866929369316851712
author Ryu, Sangwon
Do, Heejin
Kim, Yunsu
Lee, Gary Geunbae
Ok, Jungseul
author_facet Ryu, Sangwon
Do, Heejin
Kim, Yunsu
Lee, Gary Geunbae
Ok, Jungseul
contents The evaluation of summary quality encompasses diverse dimensions such as consistency, coherence, relevance, and fluency. However, existing summarization methods often target a specific dimension, facing challenges in generating well-balanced summaries across multiple dimensions. In this paper, we propose multi-objective reinforcement learning tailored to generate balanced summaries across all four dimensions. We introduce two multi-dimensional optimization (MDO) strategies for adaptive learning: 1) MDO_min, rewarding the current lowest dimension score, and 2) MDO_pro, optimizing multiple dimensions similar to multi-task learning, resolves conflicting gradients across dimensions through gradient projection. Unlike prior ROUGE-based rewards relying on reference summaries, we use a QA-based reward model that aligns with human preferences. Further, we discover the capability to regulate the length of summaries by adjusting the discount factor, seeking the generation of concise yet informative summaries that encapsulate crucial points. Our approach achieved substantial performance gains compared to baseline models on representative summarization datasets, particularly in the overlooked dimensions.
format Preprint
id arxiv_https___arxiv_org_abs_2406_00303
institution arXiv
publishDate 2024
record_format arxiv
spellingShingle Multi-Dimensional Optimization for Text Summarization via Reinforcement Learning
Ryu, Sangwon
Do, Heejin
Kim, Yunsu
Lee, Gary Geunbae
Ok, Jungseul
Computation and Language
Artificial Intelligence
The evaluation of summary quality encompasses diverse dimensions such as consistency, coherence, relevance, and fluency. However, existing summarization methods often target a specific dimension, facing challenges in generating well-balanced summaries across multiple dimensions. In this paper, we propose multi-objective reinforcement learning tailored to generate balanced summaries across all four dimensions. We introduce two multi-dimensional optimization (MDO) strategies for adaptive learning: 1) MDO_min, rewarding the current lowest dimension score, and 2) MDO_pro, optimizing multiple dimensions similar to multi-task learning, resolves conflicting gradients across dimensions through gradient projection. Unlike prior ROUGE-based rewards relying on reference summaries, we use a QA-based reward model that aligns with human preferences. Further, we discover the capability to regulate the length of summaries by adjusting the discount factor, seeking the generation of concise yet informative summaries that encapsulate crucial points. Our approach achieved substantial performance gains compared to baseline models on representative summarization datasets, particularly in the overlooked dimensions.
title Multi-Dimensional Optimization for Text Summarization via Reinforcement Learning
topic Computation and Language
Artificial Intelligence
url https://arxiv.org/abs/2406.00303