Process vs. Outcome Reward: Which is Better for Agentic RAG Reinforcement Learning
Fuente:
arXiv
Saved in:
| Main Authors: | Zhang, Wenlin, Li, Xiangyang, Dong, Kuicai, Wang, Yichao, Jia, Pengyue, Li, Xiaopeng, Zhang, Yingyi, Xu, Derong, Du, Zhaocheng, Guo, Huifeng, Tang, Ruiming, Zhao, Xiangyu |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
A Survey of Personalization: From RAG to Agent
by: Li, Xiaopeng, et al.
Published: (2025)
by: Li, Xiaopeng, et al.
Published: (2025)
SyNeg: LLM-Driven Synthetic Hard-Negatives for Dense Retrieval
by: Li, Xiaopeng, et al.
Published: (2024)
by: Li, Xiaopeng, et al.
Published: (2024)
Exploring Recommender System Evaluation: A Multi-Modal User Agent Framework for A/B Testing
by: Zhang, Wenlin, et al.
Published: (2026)
by: Zhang, Wenlin, et al.
Published: (2026)
LSRP: A Leader-Subordinate Retrieval Framework for Privacy-Preserving Cloud-Device Collaboration
by: Zhang, Yingyi, et al.
Published: (2025)
by: Zhang, Yingyi, et al.
Published: (2025)
Deep Research: A Survey of Autonomous Research Agents
by: Zhang, Wenlin, et al.
Published: (2025)
by: Zhang, Wenlin, et al.
Published: (2025)
SampleLLM: Optimizing Tabular Data Synthesis in Recommendations
by: Gao, Jingtong, et al.
Published: (2025)
by: Gao, Jingtong, et al.
Published: (2025)
To Search or Not to Search: Aligning the Decision Boundary of Deep Search Agents via Causal Intervention
by: Zhang, Wenlin, et al.
Published: (2026)
by: Zhang, Wenlin, et al.
Published: (2026)
Personalized Deep Research: A User-Centric Framework, Dataset, and Hybrid Evaluation for Knowledge Discovery
by: Li, Xiaopeng, et al.
Published: (2026)
by: Li, Xiaopeng, et al.
Published: (2026)
SELF: Surrogate-light Feature Selection with Large Language Models in Deep Recommender Systems
by: Jia, Pengyue, et al.
Published: (2024)
by: Jia, Pengyue, et al.
Published: (2024)
Personalize Before Retrieve: LLM-based Personalized Query Expansion for User-Centric Retrieval
by: Zhang, Yingyi, et al.
Published: (2025)
by: Zhang, Yingyi, et al.
Published: (2025)
LLMTreeRec: Unleashing the Power of Large Language Models for Cold-Start Recommendations
by: Zhang, Wenlin, et al.
Published: (2024)
by: Zhang, Wenlin, et al.
Published: (2024)
A Unified Framework for Multi-Domain CTR Prediction via Large Language Models
by: Fu, Zichuan, et al.
Published: (2023)
by: Fu, Zichuan, et al.
Published: (2023)
MemSearch-o1: Empowering Large Language Models with Reasoning-Aligned Memory Growth in Agentic Search
by: Zhang, Sheng, et al.
Published: (2026)
by: Zhang, Sheng, et al.
Published: (2026)
Prompt Tuning as User Inherent Profile Inference Machine
by: Lu, Yusheng, et al.
Published: (2024)
by: Lu, Yusheng, et al.
Published: (2024)
ERASE: Benchmarking Feature Selection Methods for Deep Recommender Systems
by: Jia, Pengyue, et al.
Published: (2024)
by: Jia, Pengyue, et al.
Published: (2024)
Evoking User Memory: Personalizing LLM via Recollection-Familiarity Adaptive Retrieval
by: Zhang, Yingyi, et al.
Published: (2026)
by: Zhang, Yingyi, et al.
Published: (2026)
Joint Modeling in Recommendations: A Survey
by: Zhao, Xiangyu, et al.
Published: (2025)
by: Zhao, Xiangyu, et al.
Published: (2025)
Scenario-Wise Rec: A Multi-Scenario Recommendation Benchmark
by: Li, Xiaopeng, et al.
Published: (2024)
by: Li, Xiaopeng, et al.
Published: (2024)
HAMUR: Hyper Adapter for Multi-Domain Recommendation
by: Li, Xiaopeng, et al.
Published: (2023)
by: Li, Xiaopeng, et al.
Published: (2023)
LLM4MSR: An LLM-Enhanced Paradigm for Multi-Scenario Recommendation
by: Wang, Yuhao, et al.
Published: (2024)
by: Wang, Yuhao, et al.
Published: (2024)
LLM4Rerank: LLM-based Auto-Reranking Framework for Recommendations
by: Gao, Jingtong, et al.
Published: (2024)
by: Gao, Jingtong, et al.
Published: (2024)
Bridging Relevance and Reasoning: Rationale Distillation in Retrieval-Augmented Generation
by: Jia, Pengyue, et al.
Published: (2024)
by: Jia, Pengyue, et al.
Published: (2024)
RAGR: Review-Augmented Generative Recommendation
by: Zhang, Yingyi, et al.
Published: (2026)
by: Zhang, Yingyi, et al.
Published: (2026)
No One Left Behind: How to Exploit the Incomplete and Skewed Multi-Label Data for Conversion Rate Prediction
by: Jia, Qinglin, et al.
Published: (2025)
by: Jia, Qinglin, et al.
Published: (2025)
CoIR: A Comprehensive Benchmark for Code Information Retrieval Models
by: Li, Xiangyang, et al.
Published: (2024)
by: Li, Xiangyang, et al.
Published: (2024)
TeaRAG: A Token-Efficient Agentic Retrieval-Augmented Generation Framework
by: Zhang, Chao, et al.
Published: (2025)
by: Zhang, Chao, et al.
Published: (2025)
GeoRouter: Dynamic Paradigm Routing for Worldwide Image Geolocalization
by: Jia, Pengyue, et al.
Published: (2026)
by: Jia, Pengyue, et al.
Published: (2026)
Reinforced Preference Optimization for Reasoning-Augmented Recommendations
by: Gao, Jingtong, et al.
Published: (2026)
by: Gao, Jingtong, et al.
Published: (2026)
From Human Memory to AI Memory: A Survey on Memory Mechanisms in the Era of LLMs
by: Wu, Yaxiong, et al.
Published: (2025)
by: Wu, Yaxiong, et al.
Published: (2025)
Retrievable Domain-Sensitive Feature Memory for Multi-Domain Recommendation
by: Zhao, Yuang, et al.
Published: (2024)
by: Zhao, Yuang, et al.
Published: (2024)
Align-GRAG: Anchor and Rationale Guided Dual Alignment for Graph Retrieval-Augmented Generation
by: Xu, Derong, et al.
Published: (2025)
by: Xu, Derong, et al.
Published: (2025)
Embedding Compression in Recommender Systems: A Survey
by: Li, Shiwei, et al.
Published: (2024)
by: Li, Shiwei, et al.
Published: (2024)
Reasoning RAG via System 1 or System 2: A Survey on Reasoning Agentic Retrieval-Augmented Generation for Industry Challenges
by: Liang, Jintao, et al.
Published: (2025)
by: Liang, Jintao, et al.
Published: (2025)
Invar-RAG: Invariant LLM-aligned Retrieval for Better Generation
by: Liu, Ziwei, et al.
Published: (2024)
by: Liu, Ziwei, et al.
Published: (2024)
MTRec: Learning to Align with User Preferences via Mental Reward Models
by: Zhao, Mengchen, et al.
Published: (2025)
by: Zhao, Mengchen, et al.
Published: (2025)
Tiny-Critic RAG: Empowering Agentic Fallback with Parameter-Efficient Small Language Models
by: Wu, Yichao, et al.
Published: (2026)
by: Wu, Yichao, et al.
Published: (2026)
PROMISE: Process Reward Models Unlock Test-Time Scaling Laws in Generative Recommendations
by: Guo, Chengcheng, et al.
Published: (2026)
by: Guo, Chengcheng, et al.
Published: (2026)
Adaptive Low-Precision Training for Embeddings in Click-Through Rate Prediction
by: Li, Shiwei, et al.
Published: (2022)
by: Li, Shiwei, et al.
Published: (2022)
FollowTable: A Benchmark for Instruction-Following Table Retrieval
by: Jin, Rihui, et al.
Published: (2026)
by: Jin, Rihui, et al.
Published: (2026)
From Local Indices to Global Identifiers: Generative Reranking for Recommender Systems via Global Action Space
by: Jia, Pengyue, et al.
Published: (2026)
by: Jia, Pengyue, et al.
Published: (2026)
Similar Items
-
A Survey of Personalization: From RAG to Agent
by: Li, Xiaopeng, et al.
Published: (2025) -
SyNeg: LLM-Driven Synthetic Hard-Negatives for Dense Retrieval
by: Li, Xiaopeng, et al.
Published: (2024) -
Exploring Recommender System Evaluation: A Multi-Modal User Agent Framework for A/B Testing
by: Zhang, Wenlin, et al.
Published: (2026) -
LSRP: A Leader-Subordinate Retrieval Framework for Privacy-Preserving Cloud-Device Collaboration
by: Zhang, Yingyi, et al.
Published: (2025) -
Deep Research: A Survey of Autonomous Research Agents
by: Zhang, Wenlin, et al.
Published: (2025)