Retrieval, Reward, and Training Protocols: What Matters in Training Search Agents?
Fuente:
arXiv
Saved in:
| Main Authors: | Zhao, Yibo, Ding, Zichen, Wu, Jiayi, Wang, Zun, Li, Xiang |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
GRACE: Reinforcement Learning for Grounded Response and Abstention under Contextual Evidence
by: Zhao, Yibo, et al.
Published: (2026)
by: Zhao, Yibo, et al.
Published: (2026)
Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards
by: Da, Jeff, et al.
Published: (2025)
by: Da, Jeff, et al.
Published: (2025)
RATE: Reviewer Profiling and Annotation-free Training for Expertise Ranking in Peer Review Systems
by: Liu, Weicong, et al.
Published: (2026)
by: Liu, Weicong, et al.
Published: (2026)
How to Train Your Deep Research Agent? Prompt, Reward, and Policy Optimization in Search-R1
by: Xu, Yinuo, et al.
Published: (2026)
by: Xu, Yinuo, et al.
Published: (2026)
SE-Search: Self-Evolving Search Agent via Memory and Dense Reward
by: Li, Jian, et al.
Published: (2026)
by: Li, Jian, et al.
Published: (2026)
ARIA: Training Language Agents with Intention-Driven Reward Aggregation
by: Yang, Ruihan, et al.
Published: (2025)
by: Yang, Ruihan, et al.
Published: (2025)
Sparse Rewards Can Self-Train Dialogue Agents
by: Lattimer, Barrett Martin, et al.
Published: (2024)
by: Lattimer, Barrett Martin, et al.
Published: (2024)
Synthetic Sandbox for Training Machine Learning Engineering Agents
by: Zhou, Yuhang, et al.
Published: (2026)
by: Zhou, Yuhang, et al.
Published: (2026)
Beyond Turn Limits: Training Deep Search Agents with Dynamic Context Window
by: Tang, Qiaoyu, et al.
Published: (2025)
by: Tang, Qiaoyu, et al.
Published: (2025)
RRM: Robust Reward Model Training Mitigates Reward Hacking
by: Liu, Tianqi, et al.
Published: (2024)
by: Liu, Tianqi, et al.
Published: (2024)
From Evidence to Trajectory: Abductive Reasoning Path Synthesis for Training Retrieval-Augmented Generation Agents
by: Li, Muzhi, et al.
Published: (2025)
by: Li, Muzhi, et al.
Published: (2025)
Breaking the Impasse: Dual-Scale Evolutionary Policy Training for Social Language Agents
by: Wang, Minzheng, et al.
Published: (2026)
by: Wang, Minzheng, et al.
Published: (2026)
Highlighting What Matters: Promptable Embeddings for Attribute-Focused Image Retrieval
by: Li, Siting, et al.
Published: (2025)
by: Li, Siting, et al.
Published: (2025)
Data-adaptive Safety Rules for Training Reward Models
by: Li, Xiaomin, et al.
Published: (2025)
by: Li, Xiaomin, et al.
Published: (2025)
Train for Truth, Keep the Skills: Binary Retrieval-Augmented Reward Mitigates Hallucinations
by: Chen, Tong, et al.
Published: (2025)
by: Chen, Tong, et al.
Published: (2025)
SeRTS: Self-Rewarding Tree Search for Biomedical Retrieval-Augmented Generation
by: Hu, Minda, et al.
Published: (2024)
by: Hu, Minda, et al.
Published: (2024)
Training Language Models to Generate Text with Citations via Fine-grained Rewards
by: Huang, Chengyu, et al.
Published: (2024)
by: Huang, Chengyu, et al.
Published: (2024)
ReST-MCTS*: LLM Self-Training via Process Reward Guided Tree Search
by: Zhang, Dan, et al.
Published: (2024)
by: Zhang, Dan, et al.
Published: (2024)
Cross-model Control: Improving Multiple Large Language Models in One-time Training
by: Wu, Jiayi, et al.
Published: (2024)
by: Wu, Jiayi, et al.
Published: (2024)
ConfTuner: Training Large Language Models to Express Their Confidence Verbally
by: Li, Yibo, et al.
Published: (2025)
by: Li, Yibo, et al.
Published: (2025)
ReSeek: A Self-Correcting Framework for Search Agents with Instructive Rewards
by: Li, Shiyu, et al.
Published: (2025)
by: Li, Shiyu, et al.
Published: (2025)
Finding What Matters: Anchoring Context Knowledge with Evolving Indices for Iterative Retrieval
by: Wu, Mingyan, et al.
Published: (2026)
by: Wu, Mingyan, et al.
Published: (2026)
Training Software Engineering Agents and Verifiers with SWE-Gym
by: Pan, Jiayi, et al.
Published: (2024)
by: Pan, Jiayi, et al.
Published: (2024)
Skill is Not One-Size-Fits-All: Model-Aware Skill Alignment for LLM Agents
by: Yu, Jianxiang, et al.
Published: (2026)
by: Yu, Jianxiang, et al.
Published: (2026)
Lessons from Training Grounded LLMs with Verifiable Rewards
by: Sim, Shang Hong, et al.
Published: (2025)
by: Sim, Shang Hong, et al.
Published: (2025)
R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning
by: Zhang, Yi-Fan, et al.
Published: (2025)
by: Zhang, Yi-Fan, et al.
Published: (2025)
WebSeer: Training Deeper Search Agents through Reinforcement Learning with Self-Reflection
by: He, Guanzhong, et al.
Published: (2025)
by: He, Guanzhong, et al.
Published: (2025)
MaskSearch: A Universal Pre-Training Framework to Enhance Agentic Search Capability
by: Wu, Weiqi, et al.
Published: (2025)
by: Wu, Weiqi, et al.
Published: (2025)
Prompt-Level Reward Specifications for Open-Ended Post-Training
by: Weng, Zijun, et al.
Published: (2026)
by: Weng, Zijun, et al.
Published: (2026)
KLong: Training LLM Agent for Extremely Long-horizon Tasks
by: Liu, Yue, et al.
Published: (2026)
by: Liu, Yue, et al.
Published: (2026)
Efficient Multi-Agent System Training with Data Influence-Oriented Tree Search
by: Shi, Wentao, et al.
Published: (2025)
by: Shi, Wentao, et al.
Published: (2025)
Decide Then Retrieve: A Training-Free Framework with Uncertainty-Guided Triggering and Dual-Path Retrieval
by: Chen, Wang, et al.
Published: (2026)
by: Chen, Wang, et al.
Published: (2026)
StoryAlign: Evaluating and Training Reward Models for Story Generation
by: Xia, Haotian, et al.
Published: (2026)
by: Xia, Haotian, et al.
Published: (2026)
GRAM-R$^2$: Self-Training Generative Foundation Reward Models for Reward Reasoning
by: Wang, Chenglong, et al.
Published: (2025)
by: Wang, Chenglong, et al.
Published: (2025)
Kimi-Dev: Agentless Training as Skill Prior for SWE-Agents
by: Yang, Zonghan, et al.
Published: (2025)
by: Yang, Zonghan, et al.
Published: (2025)
Search-P1: Path-Centric Reward Shaping for Stable and Efficient Agentic RAG Training
by: Xia, Tianle, et al.
Published: (2026)
by: Xia, Tianle, et al.
Published: (2026)
What Training Data Teaches RL Memory Agents: An Empirical Study of Curriculum Effects in Memory-Augmented QA
by: He, Xinjie, et al.
Published: (2026)
by: He, Xinjie, et al.
Published: (2026)
HAF-RM: A Hybrid Alignment Framework for Reward Model Training
by: Liu, Shujun, et al.
Published: (2024)
by: Liu, Shujun, et al.
Published: (2024)
OCR-Memory: Optical Context Retrieval for Long-Horizon Agent Memory
by: Li, Jinze, et al.
Published: (2026)
by: Li, Jinze, et al.
Published: (2026)
Improving End-to-End Training of Retrieval-Augmented Generation Models via Joint Stochastic Approximation
by: Cao, Hongyu, et al.
Published: (2025)
by: Cao, Hongyu, et al.
Published: (2025)
Similar Items
-
GRACE: Reinforcement Learning for Grounded Response and Abstention under Contextual Evidence
by: Zhao, Yibo, et al.
Published: (2026) -
Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards
by: Da, Jeff, et al.
Published: (2025) -
RATE: Reviewer Profiling and Annotation-free Training for Expertise Ranking in Peer Review Systems
by: Liu, Weicong, et al.
Published: (2026) -
How to Train Your Deep Research Agent? Prompt, Reward, and Policy Optimization in Search-R1
by: Xu, Yinuo, et al.
Published: (2026) -
SE-Search: Self-Evolving Search Agent via Memory and Dense Reward
by: Li, Jian, et al.
Published: (2026)