Balancing Rewards in Text Summarization: Multi-Objective Reinforcement Learning via HyperVolume Optimization
Fuente:
arXiv
Saved in:
| Main Authors: | Song, Junjie, Liu, Yiwen, Li, Dapeng, Sun, Yin, Fu, Shukun, Chen, Siqi, Cao, Yuji |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Multi-Dimensional Optimization for Text Summarization via Reinforcement Learning
by: Ryu, Sangwon, et al.
Published: (2024)
by: Ryu, Sangwon, et al.
Published: (2024)
Multi-Objective and Mixed-Reward Reinforcement Learning via Reward-Decorrelated Policy Optimization
by: Bai, Yang, et al.
Published: (2026)
by: Bai, Yang, et al.
Published: (2026)
Learning to Optimize Multi-Objective Alignment Through Dynamic Reward Weighting
by: Lu, Yining, et al.
Published: (2025)
by: Lu, Yining, et al.
Published: (2025)
Graph-Reward-SQL: Execution-Free Reinforcement Learning for Text-to-SQL via Graph Matching and Stepwise Reward
by: Weng, Han, et al.
Published: (2025)
by: Weng, Han, et al.
Published: (2025)
MODABS: Multi-Objective Learning for Dynamic Aspect-Based Summarization
by: Guo, Xiaobo, et al.
Published: (2024)
by: Guo, Xiaobo, et al.
Published: (2024)
Aligning Text, Code, and Vision: A Multi-Objective Reinforcement Learning Framework for Text-to-Visualization
by: Rahman, Mizanur, et al.
Published: (2026)
by: Rahman, Mizanur, et al.
Published: (2026)
Optimizing Safe and Aligned Language Generation: A Multi-Objective GRPO Approach
by: Li, Xuying, et al.
Published: (2025)
by: Li, Xuying, et al.
Published: (2025)
Multi-LLM Text Summarization
by: Fang, Jiangnan, et al.
Published: (2024)
by: Fang, Jiangnan, et al.
Published: (2024)
Multi-Dimensional Evaluation of Text Summarization with In-Context Learning
by: Jain, Sameer, et al.
Published: (2023)
by: Jain, Sameer, et al.
Published: (2023)
Mending the Holes: Mitigating Reward Hacking in Reinforcement Learning for Multilingual Translation
by: Liu, Yifeng, et al.
Published: (2026)
by: Liu, Yifeng, et al.
Published: (2026)
OpenReward: Learning to Reward Long-form Agentic Tasks via Reinforcement Learning
by: Hu, Ziyou, et al.
Published: (2025)
by: Hu, Ziyou, et al.
Published: (2025)
MOPO: Multi-Objective Prompt Optimization for Affective Text Generation
by: Resendiz, Yarik Menchaca, et al.
Published: (2024)
by: Resendiz, Yarik Menchaca, et al.
Published: (2024)
MORL-Prompt: An Empirical Analysis of Multi-Objective Reinforcement Learning for Discrete Prompt Optimization
by: Jafari, Yasaman, et al.
Published: (2024)
by: Jafari, Yasaman, et al.
Published: (2024)
Prompt Chaining or Stepwise Prompt? Refinement in Text Summarization
by: Sun, Shichao, et al.
Published: (2024)
by: Sun, Shichao, et al.
Published: (2024)
Interpretable Preferences via Multi-Objective Reward Modeling and Mixture-of-Experts
by: Wang, Haoxiang, et al.
Published: (2024)
by: Wang, Haoxiang, et al.
Published: (2024)
InfoFlow: Reinforcing Search Agent Via Reward Density Optimization
by: Luo, Kun, et al.
Published: (2025)
by: Luo, Kun, et al.
Published: (2025)
Beyond Sparse Rewards: Enhancing Reinforcement Learning with Language Model Critique in Text Generation
by: Cao, Meng, et al.
Published: (2024)
by: Cao, Meng, et al.
Published: (2024)
Text2Reward: Reward Shaping with Language Models for Reinforcement Learning
by: Xie, Tianbao, et al.
Published: (2023)
by: Xie, Tianbao, et al.
Published: (2023)
Topic-Guided Reinforcement Learning with LLMs for Enhancing Multi-Document Summarization
by: Li, Chuyuan, et al.
Published: (2025)
by: Li, Chuyuan, et al.
Published: (2025)
FACTS: Table Summarization via Offline Template Generation with Agentic Workflows
by: Yuan, Ye, et al.
Published: (2025)
by: Yuan, Ye, et al.
Published: (2025)
Reinforcement Learning with Conditional Expectation Reward
by: Xiao, Changyi, et al.
Published: (2026)
by: Xiao, Changyi, et al.
Published: (2026)
ACE-RL: Adaptive Constraint-Enhanced Reward for Long-form Generation Reinforcement Learning
by: Chen, Jianghao, et al.
Published: (2025)
by: Chen, Jianghao, et al.
Published: (2025)
STEER: Structured Event Evidence for Video Reasoning via Multi-Objective Reinforcement Learning
by: Li, Zinuo, et al.
Published: (2026)
by: Li, Zinuo, et al.
Published: (2026)
Query-OPT: Optimizing Inference of Large Language Models via Multi-Query Instructions in Meeting Summarization
by: Laskar, Md Tahmid Rahman, et al.
Published: (2024)
by: Laskar, Md Tahmid Rahman, et al.
Published: (2024)
Segmenting Text and Learning Their Rewards for Improved RLHF in Language Model
by: Yin, Yueqin, et al.
Published: (2025)
by: Yin, Yueqin, et al.
Published: (2025)
R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning
by: Zhao, Qingfei, et al.
Published: (2025)
by: Zhao, Qingfei, et al.
Published: (2025)
Bradley-Terry and Multi-Objective Reward Modeling Are Complementary
by: Zhang, Zhiwei, et al.
Published: (2025)
by: Zhang, Zhiwei, et al.
Published: (2025)
Language Models as Efficient Reward Function Searchers for Custom-Environment Multi-Objective Reinforcement
by: Xie, Guanwen, et al.
Published: (2024)
by: Xie, Guanwen, et al.
Published: (2024)
Acquiring Pronunciation Knowledge from Transcribed Speech Audio via Multi-task Learning
by: Sun, Siqi, et al.
Published: (2024)
by: Sun, Siqi, et al.
Published: (2024)
Design and Optimization of Reinforcement Learning-Based Agents in Text-Based Games
by: Wang, Haonan, et al.
Published: (2025)
by: Wang, Haonan, et al.
Published: (2025)
FinRpt: Dataset, Evaluation System and LLM-based Multi-agent Framework for Equity Research Report Generation
by: Jin, Song, et al.
Published: (2025)
by: Jin, Song, et al.
Published: (2025)
Multi-Objective Reinforcement Learning for Large Language Model Optimization: Visionary Perspective
by: Kong, Lingxiao, et al.
Published: (2025)
by: Kong, Lingxiao, et al.
Published: (2025)
Dynamic Reward Adjustment in Multi-Reward Reinforcement Learning for Counselor Reflection Generation
by: Min, Do June, et al.
Published: (2024)
by: Min, Do June, et al.
Published: (2024)
Stabilizing Long-term Multi-turn Reinforcement Learning with Gated Rewards
by: Sun, Zetian, et al.
Published: (2025)
by: Sun, Zetian, et al.
Published: (2025)
Prompt-tuning for Clickbait Detection via Text Summarization
by: Deng, Haoxiang, et al.
Published: (2024)
by: Deng, Haoxiang, et al.
Published: (2024)
MENTOR: A Reinforcement Learning Framework for Enabling Tool Use in Small Models via Teacher-Optimized Rewards
by: Choi, ChangSu, et al.
Published: (2025)
by: Choi, ChangSu, et al.
Published: (2025)
Advancing Speech Summarization in Multi-modal LLMs with Reinforcement Learning
by: Ling, Shaoshi, et al.
Published: (2025)
by: Ling, Shaoshi, et al.
Published: (2025)
UniPoll: A Unified Social Media Poll Generation Framework via Multi-Objective Optimization
by: Li, Yixia, et al.
Published: (2023)
by: Li, Yixia, et al.
Published: (2023)
CSRP: Chain-of-Thought Reasoning for Chinese Text Correction via Reinforcement Learning with Efficiency-Aware Rewards
by: Tian, Wei, et al.
Published: (2026)
by: Tian, Wei, et al.
Published: (2026)
Thinking Forward and Backward: Multi-Objective Reinforcement Learning for Retrieval-Augmented Reasoning
by: Wei, Wenda, et al.
Published: (2025)
by: Wei, Wenda, et al.
Published: (2025)
Similar Items
-
Multi-Dimensional Optimization for Text Summarization via Reinforcement Learning
by: Ryu, Sangwon, et al.
Published: (2024) -
Multi-Objective and Mixed-Reward Reinforcement Learning via Reward-Decorrelated Policy Optimization
by: Bai, Yang, et al.
Published: (2026) -
Learning to Optimize Multi-Objective Alignment Through Dynamic Reward Weighting
by: Lu, Yining, et al.
Published: (2025) -
Graph-Reward-SQL: Execution-Free Reinforcement Learning for Text-to-SQL via Graph Matching and Stepwise Reward
by: Weng, Han, et al.
Published: (2025) -
MODABS: Multi-Objective Learning for Dynamic Aspect-Based Summarization
by: Guo, Xiaobo, et al.
Published: (2024)