OpenReward: Learning to Reward Long-form Agentic Tasks via Reinforcement Learning
Fuente:
arXiv
Saved in:
| Main Authors: | Hu, Ziyou, Shi, Zhengliang, Zhu, Minghang, Li, Haitao, Sun, Teng, Ren, Pengjie, Verberne, Suzan, Ren, Zhaochun |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Learning to Use Tools via Cooperative and Interactive Agents
by: Shi, Zhengliang, et al.
Published: (2024)
by: Shi, Zhengliang, et al.
Published: (2024)
Iterative Self-Incentivization Empowers Large Language Models as Agentic Searchers
by: Shi, Zhengliang, et al.
Published: (2025)
by: Shi, Zhengliang, et al.
Published: (2025)
Evolution without Large Models: Training Language Model with Task Principles
by: Zhu, Minghang, et al.
Published: (2025)
by: Zhu, Minghang, et al.
Published: (2025)
A Multi-Agent Conversational Recommender System
by: Fang, Jiabao, et al.
Published: (2024)
by: Fang, Jiabao, et al.
Published: (2024)
Bridging the Capability Gap: Joint Alignment Tuning for Harmonizing LLM-based Multi-Agent Systems
by: Zhu, Minghang, et al.
Published: (2025)
by: Zhu, Minghang, et al.
Published: (2025)
Tool Learning in the Wild: Empowering Language Models as Automatic Tool Agents
by: Shi, Zhengliang, et al.
Published: (2024)
by: Shi, Zhengliang, et al.
Published: (2024)
Generate-then-Ground in Retrieval-Augmented Generation for Multi-hop Question Answering
by: Shi, Zhengliang, et al.
Published: (2024)
by: Shi, Zhengliang, et al.
Published: (2024)
CAUSE: Counterfactual Assessment of User Satisfaction Estimation in Task-Oriented Dialogue Systems
by: Abolghasemi, Amin, et al.
Published: (2024)
by: Abolghasemi, Amin, et al.
Published: (2024)
What are the limits of cross-lingual dense passage retrieval for low-resource languages?
by: Wu, Jie, et al.
Published: (2024)
by: Wu, Jie, et al.
Published: (2024)
Retrieval Models Aren't Tool-Savvy: Benchmarking Tool Retrieval for Large Language Models
by: Shi, Zhengliang, et al.
Published: (2025)
by: Shi, Zhengliang, et al.
Published: (2025)
Divide-Then-Aggregate: An Efficient Tool Learning Method via Parallel Tool Invocation
by: Zhu, Dongsheng, et al.
Published: (2025)
by: Zhu, Dongsheng, et al.
Published: (2025)
Agentic Reinforcement Learning with Implicit Step Rewards
by: Liu, Xiaoqian, et al.
Published: (2025)
by: Liu, Xiaoqian, et al.
Published: (2025)
ACE-RL: Adaptive Constraint-Enhanced Reward for Long-form Generation Reinforcement Learning
by: Chen, Jianghao, et al.
Published: (2025)
by: Chen, Jianghao, et al.
Published: (2025)
Long-form RewardBench: Evaluating Reward Models for Long-form Generation
by: Huang, Hui, et al.
Published: (2026)
by: Huang, Hui, et al.
Published: (2026)
Generative Retrieval with Few-shot Indexing
by: Askari, Arian, et al.
Published: (2024)
by: Askari, Arian, et al.
Published: (2024)
ReportLogic: Evaluating Logical Quality in Deep Research Reports
by: Zhao, Jujia, et al.
Published: (2026)
by: Zhao, Jujia, et al.
Published: (2026)
Answer Retrieval in Legal Community Question Answering
by: Askari, Arian, et al.
Published: (2024)
by: Askari, Arian, et al.
Published: (2024)
Stabilizing Long-term Multi-turn Reinforcement Learning with Gated Rewards
by: Sun, Zetian, et al.
Published: (2025)
by: Sun, Zetian, et al.
Published: (2025)
Unifying Search and Recommendation in LLMs via Gradient Multi-Subspace Tuning
by: Zhao, Jujia, et al.
Published: (2026)
by: Zhao, Jujia, et al.
Published: (2026)
Tournament-GRPO: Group-Wise Tournament Rewards for Reinforcement Learning in Open-Ended Long-Form Generation
by: Yang, Zixuan, et al.
Published: (2026)
by: Yang, Zixuan, et al.
Published: (2026)
LongR: Unleashing Long-Context Reasoning via Reinforcement Learning with Dense Utility Rewards
by: Ping, Bowen, et al.
Published: (2026)
by: Ping, Bowen, et al.
Published: (2026)
Unifying Search and Recommendation with Dual-View Representation Learning in a Generative Paradigm
by: Zhao, Jujia, et al.
Published: (2025)
by: Zhao, Jujia, et al.
Published: (2025)
ASLoRA: Adaptive Sharing Low-Rank Adaptation Across Layers
by: Hu, Junyan, et al.
Published: (2024)
by: Hu, Junyan, et al.
Published: (2024)
UIPE: Enhancing LLM Unlearning by Removing Knowledge Related to Forgetting Targets
by: Wang, Wenyu, et al.
Published: (2025)
by: Wang, Wenyu, et al.
Published: (2025)
LongRLVR: Long-Context Reinforcement Learning Requires Verifiable Context Rewards
by: Chen, Guanzheng, et al.
Published: (2026)
by: Chen, Guanzheng, et al.
Published: (2026)
RLAR: An Agentic Reward System for Multi-task Reinforcement Learning on Large Language Models
by: Feng, Andrew Zhuoer, et al.
Published: (2026)
by: Feng, Andrew Zhuoer, et al.
Published: (2026)
Multi-Objective and Mixed-Reward Reinforcement Learning via Reward-Decorrelated Policy Optimization
by: Bai, Yang, et al.
Published: (2026)
by: Bai, Yang, et al.
Published: (2026)
Lookahead Tree-Based Rollouts for Enhanced Trajectory-Level Exploration in Reinforcement Learning with Verifiable Rewards
by: Xing, Shangyu, et al.
Published: (2025)
by: Xing, Shangyu, et al.
Published: (2025)
CogDual: Enhancing Dual Cognition of LLMs via Reinforcement Learning with Implicit Rule-Based Rewards
by: Liu, Cheng, et al.
Published: (2025)
by: Liu, Cheng, et al.
Published: (2025)
From Verifiable Dot to Reward Chain: Harnessing Verifiable Reference-based Rewards for Reinforcement Learning of Open-ended Generation
by: Jiang, Yuxin, et al.
Published: (2026)
by: Jiang, Yuxin, et al.
Published: (2026)
PrLM: Learning Explicit Reasoning for Personalized RAG via Contrastive Reward Optimization
by: Zhang, Kepu, et al.
Published: (2025)
by: Zhang, Kepu, et al.
Published: (2025)
Dataset Creation for Visual Entailment using Generative AI
by: Reijtenbach, Rob, et al.
Published: (2025)
by: Reijtenbach, Rob, et al.
Published: (2025)
Investigating the Robustness of Modelling Decisions for Few-Shot Cross-Topic Stance Detection: A Preregistered Study
by: Reuver, Myrthe, et al.
Published: (2024)
by: Reuver, Myrthe, et al.
Published: (2024)
MEFT: Memory-Efficient Fine-Tuning through Sparse Adapter
by: Hao, Jitai, et al.
Published: (2024)
by: Hao, Jitai, et al.
Published: (2024)
REBEL: Reinforcement Learning via Regressing Relative Rewards
by: Gao, Zhaolin, et al.
Published: (2024)
by: Gao, Zhaolin, et al.
Published: (2024)
MACPO: Weak-to-Strong Alignment via Multi-Agent Contrastive Preference Optimization
by: Lyu, Yougang, et al.
Published: (2024)
by: Lyu, Yougang, et al.
Published: (2024)
Learning to Ask: Conversational Product Search via Representation Learning
by: Zou, Jie, et al.
Published: (2024)
by: Zou, Jie, et al.
Published: (2024)
Undesirable Memorization in Large Language Models: A Survey
by: Satvaty, Ali, et al.
Published: (2024)
by: Satvaty, Ali, et al.
Published: (2024)
Self-Rewarding Rubric-Based Reinforcement Learning for Open-Ended Reasoning
by: Ye, Zhiling, et al.
Published: (2025)
by: Ye, Zhiling, et al.
Published: (2025)
Graph-Reward-SQL: Execution-Free Reinforcement Learning for Text-to-SQL via Graph Matching and Stepwise Reward
by: Weng, Han, et al.
Published: (2025)
by: Weng, Han, et al.
Published: (2025)
Similar Items
-
Learning to Use Tools via Cooperative and Interactive Agents
by: Shi, Zhengliang, et al.
Published: (2024) -
Iterative Self-Incentivization Empowers Large Language Models as Agentic Searchers
by: Shi, Zhengliang, et al.
Published: (2025) -
Evolution without Large Models: Training Language Model with Task Principles
by: Zhu, Minghang, et al.
Published: (2025) -
A Multi-Agent Conversational Recommender System
by: Fang, Jiabao, et al.
Published: (2024) -
Bridging the Capability Gap: Joint Alignment Tuning for Harmonizing LLM-based Multi-Agent Systems
by: Zhu, Minghang, et al.
Published: (2025)