Balancing Rewards in Text Summarization: Multi-Objective Reinforcement Learning via HyperVolume Optimization
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Song, Junjie, Liu, Yiwen, Li, Dapeng, Sun, Yin, Fu, Shukun, Chen, Siqi, Cao, Yuji |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Multi-Dimensional Optimization for Text Summarization via Reinforcement Learning
von: Ryu, Sangwon, et al.
Veröffentlicht: (2024)
von: Ryu, Sangwon, et al.
Veröffentlicht: (2024)
Multi-Objective and Mixed-Reward Reinforcement Learning via Reward-Decorrelated Policy Optimization
von: Bai, Yang, et al.
Veröffentlicht: (2026)
von: Bai, Yang, et al.
Veröffentlicht: (2026)
Learning to Optimize Multi-Objective Alignment Through Dynamic Reward Weighting
von: Lu, Yining, et al.
Veröffentlicht: (2025)
von: Lu, Yining, et al.
Veröffentlicht: (2025)
Graph-Reward-SQL: Execution-Free Reinforcement Learning for Text-to-SQL via Graph Matching and Stepwise Reward
von: Weng, Han, et al.
Veröffentlicht: (2025)
von: Weng, Han, et al.
Veröffentlicht: (2025)
MODABS: Multi-Objective Learning for Dynamic Aspect-Based Summarization
von: Guo, Xiaobo, et al.
Veröffentlicht: (2024)
von: Guo, Xiaobo, et al.
Veröffentlicht: (2024)
Aligning Text, Code, and Vision: A Multi-Objective Reinforcement Learning Framework for Text-to-Visualization
von: Rahman, Mizanur, et al.
Veröffentlicht: (2026)
von: Rahman, Mizanur, et al.
Veröffentlicht: (2026)
Optimizing Safe and Aligned Language Generation: A Multi-Objective GRPO Approach
von: Li, Xuying, et al.
Veröffentlicht: (2025)
von: Li, Xuying, et al.
Veröffentlicht: (2025)
Multi-LLM Text Summarization
von: Fang, Jiangnan, et al.
Veröffentlicht: (2024)
von: Fang, Jiangnan, et al.
Veröffentlicht: (2024)
Multi-Dimensional Evaluation of Text Summarization with In-Context Learning
von: Jain, Sameer, et al.
Veröffentlicht: (2023)
von: Jain, Sameer, et al.
Veröffentlicht: (2023)
Mending the Holes: Mitigating Reward Hacking in Reinforcement Learning for Multilingual Translation
von: Liu, Yifeng, et al.
Veröffentlicht: (2026)
von: Liu, Yifeng, et al.
Veröffentlicht: (2026)
OpenReward: Learning to Reward Long-form Agentic Tasks via Reinforcement Learning
von: Hu, Ziyou, et al.
Veröffentlicht: (2025)
von: Hu, Ziyou, et al.
Veröffentlicht: (2025)
MOPO: Multi-Objective Prompt Optimization for Affective Text Generation
von: Resendiz, Yarik Menchaca, et al.
Veröffentlicht: (2024)
von: Resendiz, Yarik Menchaca, et al.
Veröffentlicht: (2024)
MORL-Prompt: An Empirical Analysis of Multi-Objective Reinforcement Learning for Discrete Prompt Optimization
von: Jafari, Yasaman, et al.
Veröffentlicht: (2024)
von: Jafari, Yasaman, et al.
Veröffentlicht: (2024)
Prompt Chaining or Stepwise Prompt? Refinement in Text Summarization
von: Sun, Shichao, et al.
Veröffentlicht: (2024)
von: Sun, Shichao, et al.
Veröffentlicht: (2024)
Interpretable Preferences via Multi-Objective Reward Modeling and Mixture-of-Experts
von: Wang, Haoxiang, et al.
Veröffentlicht: (2024)
von: Wang, Haoxiang, et al.
Veröffentlicht: (2024)
InfoFlow: Reinforcing Search Agent Via Reward Density Optimization
von: Luo, Kun, et al.
Veröffentlicht: (2025)
von: Luo, Kun, et al.
Veröffentlicht: (2025)
Beyond Sparse Rewards: Enhancing Reinforcement Learning with Language Model Critique in Text Generation
von: Cao, Meng, et al.
Veröffentlicht: (2024)
von: Cao, Meng, et al.
Veröffentlicht: (2024)
Text2Reward: Reward Shaping with Language Models for Reinforcement Learning
von: Xie, Tianbao, et al.
Veröffentlicht: (2023)
von: Xie, Tianbao, et al.
Veröffentlicht: (2023)
Topic-Guided Reinforcement Learning with LLMs for Enhancing Multi-Document Summarization
von: Li, Chuyuan, et al.
Veröffentlicht: (2025)
von: Li, Chuyuan, et al.
Veröffentlicht: (2025)
FACTS: Table Summarization via Offline Template Generation with Agentic Workflows
von: Yuan, Ye, et al.
Veröffentlicht: (2025)
von: Yuan, Ye, et al.
Veröffentlicht: (2025)
Reinforcement Learning with Conditional Expectation Reward
von: Xiao, Changyi, et al.
Veröffentlicht: (2026)
von: Xiao, Changyi, et al.
Veröffentlicht: (2026)
ACE-RL: Adaptive Constraint-Enhanced Reward for Long-form Generation Reinforcement Learning
von: Chen, Jianghao, et al.
Veröffentlicht: (2025)
von: Chen, Jianghao, et al.
Veröffentlicht: (2025)
STEER: Structured Event Evidence for Video Reasoning via Multi-Objective Reinforcement Learning
von: Li, Zinuo, et al.
Veröffentlicht: (2026)
von: Li, Zinuo, et al.
Veröffentlicht: (2026)
Query-OPT: Optimizing Inference of Large Language Models via Multi-Query Instructions in Meeting Summarization
von: Laskar, Md Tahmid Rahman, et al.
Veröffentlicht: (2024)
von: Laskar, Md Tahmid Rahman, et al.
Veröffentlicht: (2024)
Segmenting Text and Learning Their Rewards for Improved RLHF in Language Model
von: Yin, Yueqin, et al.
Veröffentlicht: (2025)
von: Yin, Yueqin, et al.
Veröffentlicht: (2025)
R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning
von: Zhao, Qingfei, et al.
Veröffentlicht: (2025)
von: Zhao, Qingfei, et al.
Veröffentlicht: (2025)
Bradley-Terry and Multi-Objective Reward Modeling Are Complementary
von: Zhang, Zhiwei, et al.
Veröffentlicht: (2025)
von: Zhang, Zhiwei, et al.
Veröffentlicht: (2025)
Language Models as Efficient Reward Function Searchers for Custom-Environment Multi-Objective Reinforcement
von: Xie, Guanwen, et al.
Veröffentlicht: (2024)
von: Xie, Guanwen, et al.
Veröffentlicht: (2024)
Acquiring Pronunciation Knowledge from Transcribed Speech Audio via Multi-task Learning
von: Sun, Siqi, et al.
Veröffentlicht: (2024)
von: Sun, Siqi, et al.
Veröffentlicht: (2024)
Design and Optimization of Reinforcement Learning-Based Agents in Text-Based Games
von: Wang, Haonan, et al.
Veröffentlicht: (2025)
von: Wang, Haonan, et al.
Veröffentlicht: (2025)
FinRpt: Dataset, Evaluation System and LLM-based Multi-agent Framework for Equity Research Report Generation
von: Jin, Song, et al.
Veröffentlicht: (2025)
von: Jin, Song, et al.
Veröffentlicht: (2025)
Multi-Objective Reinforcement Learning for Large Language Model Optimization: Visionary Perspective
von: Kong, Lingxiao, et al.
Veröffentlicht: (2025)
von: Kong, Lingxiao, et al.
Veröffentlicht: (2025)
Dynamic Reward Adjustment in Multi-Reward Reinforcement Learning for Counselor Reflection Generation
von: Min, Do June, et al.
Veröffentlicht: (2024)
von: Min, Do June, et al.
Veröffentlicht: (2024)
Stabilizing Long-term Multi-turn Reinforcement Learning with Gated Rewards
von: Sun, Zetian, et al.
Veröffentlicht: (2025)
von: Sun, Zetian, et al.
Veröffentlicht: (2025)
Prompt-tuning for Clickbait Detection via Text Summarization
von: Deng, Haoxiang, et al.
Veröffentlicht: (2024)
von: Deng, Haoxiang, et al.
Veröffentlicht: (2024)
MENTOR: A Reinforcement Learning Framework for Enabling Tool Use in Small Models via Teacher-Optimized Rewards
von: Choi, ChangSu, et al.
Veröffentlicht: (2025)
von: Choi, ChangSu, et al.
Veröffentlicht: (2025)
Advancing Speech Summarization in Multi-modal LLMs with Reinforcement Learning
von: Ling, Shaoshi, et al.
Veröffentlicht: (2025)
von: Ling, Shaoshi, et al.
Veröffentlicht: (2025)
UniPoll: A Unified Social Media Poll Generation Framework via Multi-Objective Optimization
von: Li, Yixia, et al.
Veröffentlicht: (2023)
von: Li, Yixia, et al.
Veröffentlicht: (2023)
CSRP: Chain-of-Thought Reasoning for Chinese Text Correction via Reinforcement Learning with Efficiency-Aware Rewards
von: Tian, Wei, et al.
Veröffentlicht: (2026)
von: Tian, Wei, et al.
Veröffentlicht: (2026)
Thinking Forward and Backward: Multi-Objective Reinforcement Learning for Retrieval-Augmented Reasoning
von: Wei, Wenda, et al.
Veröffentlicht: (2025)
von: Wei, Wenda, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Multi-Dimensional Optimization for Text Summarization via Reinforcement Learning
von: Ryu, Sangwon, et al.
Veröffentlicht: (2024) -
Multi-Objective and Mixed-Reward Reinforcement Learning via Reward-Decorrelated Policy Optimization
von: Bai, Yang, et al.
Veröffentlicht: (2026) -
Learning to Optimize Multi-Objective Alignment Through Dynamic Reward Weighting
von: Lu, Yining, et al.
Veröffentlicht: (2025) -
Graph-Reward-SQL: Execution-Free Reinforcement Learning for Text-to-SQL via Graph Matching and Stepwise Reward
von: Weng, Han, et al.
Veröffentlicht: (2025) -
MODABS: Multi-Objective Learning for Dynamic Aspect-Based Summarization
von: Guo, Xiaobo, et al.
Veröffentlicht: (2024)