Salvato in:
| Autori principali: | Song, Junjie, Liu, Yiwen, Li, Dapeng, Sun, Yin, Fu, Shukun, Chen, Siqi, Cao, Yuji |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2510.19325 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Multi-Dimensional Optimization for Text Summarization via Reinforcement Learning
di: Ryu, Sangwon, et al.
Pubblicazione: (2024)
di: Ryu, Sangwon, et al.
Pubblicazione: (2024)
Multi-Objective and Mixed-Reward Reinforcement Learning via Reward-Decorrelated Policy Optimization
di: Bai, Yang, et al.
Pubblicazione: (2026)
di: Bai, Yang, et al.
Pubblicazione: (2026)
Learning to Optimize Multi-Objective Alignment Through Dynamic Reward Weighting
di: Lu, Yining, et al.
Pubblicazione: (2025)
di: Lu, Yining, et al.
Pubblicazione: (2025)
Graph-Reward-SQL: Execution-Free Reinforcement Learning for Text-to-SQL via Graph Matching and Stepwise Reward
di: Weng, Han, et al.
Pubblicazione: (2025)
di: Weng, Han, et al.
Pubblicazione: (2025)
MODABS: Multi-Objective Learning for Dynamic Aspect-Based Summarization
di: Guo, Xiaobo, et al.
Pubblicazione: (2024)
di: Guo, Xiaobo, et al.
Pubblicazione: (2024)
Optimizing Safe and Aligned Language Generation: A Multi-Objective GRPO Approach
di: Li, Xuying, et al.
Pubblicazione: (2025)
di: Li, Xuying, et al.
Pubblicazione: (2025)
Aligning Text, Code, and Vision: A Multi-Objective Reinforcement Learning Framework for Text-to-Visualization
di: Rahman, Mizanur, et al.
Pubblicazione: (2026)
di: Rahman, Mizanur, et al.
Pubblicazione: (2026)
Mending the Holes: Mitigating Reward Hacking in Reinforcement Learning for Multilingual Translation
di: Liu, Yifeng, et al.
Pubblicazione: (2026)
di: Liu, Yifeng, et al.
Pubblicazione: (2026)
Multi-LLM Text Summarization
di: Fang, Jiangnan, et al.
Pubblicazione: (2024)
di: Fang, Jiangnan, et al.
Pubblicazione: (2024)
Multi-Dimensional Evaluation of Text Summarization with In-Context Learning
di: Jain, Sameer, et al.
Pubblicazione: (2023)
di: Jain, Sameer, et al.
Pubblicazione: (2023)
OpenReward: Learning to Reward Long-form Agentic Tasks via Reinforcement Learning
di: Hu, Ziyou, et al.
Pubblicazione: (2025)
di: Hu, Ziyou, et al.
Pubblicazione: (2025)
Prompt Chaining or Stepwise Prompt? Refinement in Text Summarization
di: Sun, Shichao, et al.
Pubblicazione: (2024)
di: Sun, Shichao, et al.
Pubblicazione: (2024)
InfoFlow: Reinforcing Search Agent Via Reward Density Optimization
di: Luo, Kun, et al.
Pubblicazione: (2025)
di: Luo, Kun, et al.
Pubblicazione: (2025)
MOPO: Multi-Objective Prompt Optimization for Affective Text Generation
di: Resendiz, Yarik Menchaca, et al.
Pubblicazione: (2024)
di: Resendiz, Yarik Menchaca, et al.
Pubblicazione: (2024)
Beyond Sparse Rewards: Enhancing Reinforcement Learning with Language Model Critique in Text Generation
di: Cao, Meng, et al.
Pubblicazione: (2024)
di: Cao, Meng, et al.
Pubblicazione: (2024)
Text2Reward: Reward Shaping with Language Models for Reinforcement Learning
di: Xie, Tianbao, et al.
Pubblicazione: (2023)
di: Xie, Tianbao, et al.
Pubblicazione: (2023)
Interpretable Preferences via Multi-Objective Reward Modeling and Mixture-of-Experts
di: Wang, Haoxiang, et al.
Pubblicazione: (2024)
di: Wang, Haoxiang, et al.
Pubblicazione: (2024)
MORL-Prompt: An Empirical Analysis of Multi-Objective Reinforcement Learning for Discrete Prompt Optimization
di: Jafari, Yasaman, et al.
Pubblicazione: (2024)
di: Jafari, Yasaman, et al.
Pubblicazione: (2024)
FACTS: Table Summarization via Offline Template Generation with Agentic Workflows
di: Yuan, Ye, et al.
Pubblicazione: (2025)
di: Yuan, Ye, et al.
Pubblicazione: (2025)
FinRpt: Dataset, Evaluation System and LLM-based Multi-agent Framework for Equity Research Report Generation
di: Jin, Song, et al.
Pubblicazione: (2025)
di: Jin, Song, et al.
Pubblicazione: (2025)
Reinforcement Learning with Conditional Expectation Reward
di: Xiao, Changyi, et al.
Pubblicazione: (2026)
di: Xiao, Changyi, et al.
Pubblicazione: (2026)
asLLR: LLM based Leads Ranking in Auto Sales
di: Sun, Yin, et al.
Pubblicazione: (2025)
di: Sun, Yin, et al.
Pubblicazione: (2025)
ACE-RL: Adaptive Constraint-Enhanced Reward for Long-form Generation Reinforcement Learning
di: Chen, Jianghao, et al.
Pubblicazione: (2025)
di: Chen, Jianghao, et al.
Pubblicazione: (2025)
Segmenting Text and Learning Their Rewards for Improved RLHF in Language Model
di: Yin, Yueqin, et al.
Pubblicazione: (2025)
di: Yin, Yueqin, et al.
Pubblicazione: (2025)
Topic-Guided Reinforcement Learning with LLMs for Enhancing Multi-Document Summarization
di: Li, Chuyuan, et al.
Pubblicazione: (2025)
di: Li, Chuyuan, et al.
Pubblicazione: (2025)
Acquiring Pronunciation Knowledge from Transcribed Speech Audio via Multi-task Learning
di: Sun, Siqi, et al.
Pubblicazione: (2024)
di: Sun, Siqi, et al.
Pubblicazione: (2024)
Language Models as Efficient Reward Function Searchers for Custom-Environment Multi-Objective Reinforcement
di: Xie, Guanwen, et al.
Pubblicazione: (2024)
di: Xie, Guanwen, et al.
Pubblicazione: (2024)
Query-OPT: Optimizing Inference of Large Language Models via Multi-Query Instructions in Meeting Summarization
di: Laskar, Md Tahmid Rahman, et al.
Pubblicazione: (2024)
di: Laskar, Md Tahmid Rahman, et al.
Pubblicazione: (2024)
Bradley-Terry and Multi-Objective Reward Modeling Are Complementary
di: Zhang, Zhiwei, et al.
Pubblicazione: (2025)
di: Zhang, Zhiwei, et al.
Pubblicazione: (2025)
STEER: Structured Event Evidence for Video Reasoning via Multi-Objective Reinforcement Learning
di: Li, Zinuo, et al.
Pubblicazione: (2026)
di: Li, Zinuo, et al.
Pubblicazione: (2026)
Multi-Objective Reinforcement Learning for Large Language Model Optimization: Visionary Perspective
di: Kong, Lingxiao, et al.
Pubblicazione: (2025)
di: Kong, Lingxiao, et al.
Pubblicazione: (2025)
Stabilizing Long-term Multi-turn Reinforcement Learning with Gated Rewards
di: Sun, Zetian, et al.
Pubblicazione: (2025)
di: Sun, Zetian, et al.
Pubblicazione: (2025)
R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning
di: Zhao, Qingfei, et al.
Pubblicazione: (2025)
di: Zhao, Qingfei, et al.
Pubblicazione: (2025)
Dynamic Reward Adjustment in Multi-Reward Reinforcement Learning for Counselor Reflection Generation
di: Min, Do June, et al.
Pubblicazione: (2024)
di: Min, Do June, et al.
Pubblicazione: (2024)
Design and Optimization of Reinforcement Learning-Based Agents in Text-Based Games
di: Wang, Haonan, et al.
Pubblicazione: (2025)
di: Wang, Haonan, et al.
Pubblicazione: (2025)
Thinking Forward and Backward: Multi-Objective Reinforcement Learning for Retrieval-Augmented Reasoning
di: Wei, Wenda, et al.
Pubblicazione: (2025)
di: Wei, Wenda, et al.
Pubblicazione: (2025)
Advancing Speech Summarization in Multi-modal LLMs with Reinforcement Learning
di: Ling, Shaoshi, et al.
Pubblicazione: (2025)
di: Ling, Shaoshi, et al.
Pubblicazione: (2025)
EMPOWER: Evolutionary Medical Prompt Optimization With Reinforcement Learning
di: Chen, Yinda, et al.
Pubblicazione: (2025)
di: Chen, Yinda, et al.
Pubblicazione: (2025)
MENTOR: A Reinforcement Learning Framework for Enabling Tool Use in Small Models via Teacher-Optimized Rewards
di: Choi, ChangSu, et al.
Pubblicazione: (2025)
di: Choi, ChangSu, et al.
Pubblicazione: (2025)
HyperEdit: Unlocking Instruction-based Text Editing in LLMs via Hypernetworks
di: Zeng, Yiming, et al.
Pubblicazione: (2025)
di: Zeng, Yiming, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Multi-Dimensional Optimization for Text Summarization via Reinforcement Learning
di: Ryu, Sangwon, et al.
Pubblicazione: (2024) -
Multi-Objective and Mixed-Reward Reinforcement Learning via Reward-Decorrelated Policy Optimization
di: Bai, Yang, et al.
Pubblicazione: (2026) -
Learning to Optimize Multi-Objective Alignment Through Dynamic Reward Weighting
di: Lu, Yining, et al.
Pubblicazione: (2025) -
Graph-Reward-SQL: Execution-Free Reinforcement Learning for Text-to-SQL via Graph Matching and Stepwise Reward
di: Weng, Han, et al.
Pubblicazione: (2025) -
MODABS: Multi-Objective Learning for Dynamic Aspect-Based Summarization
di: Guo, Xiaobo, et al.
Pubblicazione: (2024)