R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhao, Qingfei, Wang, Ruobing, Xu, Dingling, Zha, Daren, Liu, Limin |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
PrefRAG: Preference-Driven Multi-Source Retrieval Augmented Generation
por: Zhao, Qingfei, et al.
Publicado: (2024)
por: Zhao, Qingfei, et al.
Publicado: (2024)
LongRAG: A Dual-Perspective Retrieval-Augmented Generation Paradigm for Long-Context Question Answering
por: Zhao, Qingfei, et al.
Publicado: (2024)
por: Zhao, Qingfei, et al.
Publicado: (2024)
Enhanced LLM Reasoning by Optimizing Reward Functions with Search-Driven Reinforcement Learning
por: Ahmadi, Arash, et al.
Publicado: (2026)
por: Ahmadi, Arash, et al.
Publicado: (2026)
Enhancing LLM Reasoning with Reward-guided Tree Search
por: Jiang, Jinhao, et al.
Publicado: (2024)
por: Jiang, Jinhao, et al.
Publicado: (2024)
DeepNote: Note-Centric Deep Retrieval-Augmented Generation
por: Wang, Ruobing, et al.
Publicado: (2024)
por: Wang, Ruobing, et al.
Publicado: (2024)
ConvSearch-R1: Enhancing Query Reformulation for Conversational Search with Reasoning via Reinforcement Learning
por: Zhu, Changtai, et al.
Publicado: (2025)
por: Zhu, Changtai, et al.
Publicado: (2025)
ReSearch: Learning to Reason with Search for LLMs via Reinforcement Learning
por: Chen, Mingyang, et al.
Publicado: (2025)
por: Chen, Mingyang, et al.
Publicado: (2025)
Metacognition as Reward: Reinforcing LLM Reasoning via Knowledge and Regulation Signals
por: Chen, Sirui, et al.
Publicado: (2026)
por: Chen, Sirui, et al.
Publicado: (2026)
Unifying Tree Search Algorithm and Reward Design for LLM Reasoning: A Survey
por: Wei, Jiaqi, et al.
Publicado: (2025)
por: Wei, Jiaqi, et al.
Publicado: (2025)
Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning
por: Jin, Bowen, et al.
Publicado: (2025)
por: Jin, Bowen, et al.
Publicado: (2025)
Agentic Conversational Search with Contextualized Reasoning via Reinforcement Learning
por: Mo, Fengran, et al.
Publicado: (2026)
por: Mo, Fengran, et al.
Publicado: (2026)
PolyGnosis 2.0: Enhancing LLM Reasoning via Agentic Harness Engineering for Polymarket and OSINT Insight Extraction
por: Wang, Daren, et al.
Publicado: (2026)
por: Wang, Daren, et al.
Publicado: (2026)
DeepSearch: Overcome the Bottleneck of Reinforcement Learning with Verifiable Rewards via Monte Carlo Tree Search
por: Wu, Fang, et al.
Publicado: (2025)
por: Wu, Fang, et al.
Publicado: (2025)
Search-R2: Enhancing Search-Integrated Reasoning via Actor-Refiner Collaboration
por: He, Bowei, et al.
Publicado: (2026)
por: He, Bowei, et al.
Publicado: (2026)
VisuoThink: Empowering LVLM Reasoning with Multimodal Tree Search
por: Wang, Yikun, et al.
Publicado: (2025)
por: Wang, Yikun, et al.
Publicado: (2025)
SE-Search: Self-Evolving Search Agent via Memory and Dense Reward
por: Li, Jian, et al.
Publicado: (2026)
por: Li, Jian, et al.
Publicado: (2026)
UserLM-R1: Modeling Human Reasoning in User Language Models with Multi-Reward Reinforcement Learning
por: Zhang, Feng, et al.
Publicado: (2026)
por: Zhang, Feng, et al.
Publicado: (2026)
LaSeR: Reinforcement Learning with Last-Token Self-Rewarding
por: Yang, Wenkai, et al.
Publicado: (2025)
por: Yang, Wenkai, et al.
Publicado: (2025)
Stepwise Informativeness Search for Efficient and Effective LLM Reasoning
por: Wang, Siyuan, et al.
Publicado: (2025)
por: Wang, Siyuan, et al.
Publicado: (2025)
Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning
por: Dong, Guanting, et al.
Publicado: (2025)
por: Dong, Guanting, et al.
Publicado: (2025)
Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search
por: Shen, Maohao, et al.
Publicado: (2025)
por: Shen, Maohao, et al.
Publicado: (2025)
LeTS: Learning to Think-and-Search via Process-and-Outcome Reward Hybridization
por: Zhang, Qi, et al.
Publicado: (2025)
por: Zhang, Qi, et al.
Publicado: (2025)
InfoFlow: Reinforcing Search Agent Via Reward Density Optimization
por: Luo, Kun, et al.
Publicado: (2025)
por: Luo, Kun, et al.
Publicado: (2025)
Annotation-Free Reinforcement Learning Query Rewriting via Verifiable Search Reward
por: Cha, Sungguk, et al.
Publicado: (2025)
por: Cha, Sungguk, et al.
Publicado: (2025)
An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents
por: Jin, Bowen, et al.
Publicado: (2025)
por: Jin, Bowen, et al.
Publicado: (2025)
The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason
por: Lv, Ang, et al.
Publicado: (2025)
por: Lv, Ang, et al.
Publicado: (2025)
CoSearch: Joint Training of Reasoning and Document Ranking via Reinforcement Learning for Agentic Search
por: Zeng, Hansi, et al.
Publicado: (2026)
por: Zeng, Hansi, et al.
Publicado: (2026)
Adaptive Test-Time Reasoning via Reward-Guided Dual-Phase Search
por: Cui, Yingqian, et al.
Publicado: (2025)
por: Cui, Yingqian, et al.
Publicado: (2025)
LongR: Unleashing Long-Context Reasoning via Reinforcement Learning with Dense Utility Rewards
por: Ping, Bowen, et al.
Publicado: (2026)
por: Ping, Bowen, et al.
Publicado: (2026)
Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning
por: Zhang, Kongcheng, et al.
Publicado: (2025)
por: Zhang, Kongcheng, et al.
Publicado: (2025)
R1-Searcher: Incentivizing the Search Capability in LLMs via Reinforcement Learning
por: Song, Huatong, et al.
Publicado: (2025)
por: Song, Huatong, et al.
Publicado: (2025)
IG-Search: Step-Level Information Gain Rewards for Search-Augmented Reasoning
por: Liang, Zihan, et al.
Publicado: (2026)
por: Liang, Zihan, et al.
Publicado: (2026)
Chaining the Evidence: Robust Reinforcement Learning for Deep Search Agents with Citation-Aware Rubric Rewards
por: Zhang, Jiajie, et al.
Publicado: (2026)
por: Zhang, Jiajie, et al.
Publicado: (2026)
GraphSearch: Agentic Search-Augmented Reasoning for Zero-Shot Graph Learning
por: Liu, Jiajin, et al.
Publicado: (2026)
por: Liu, Jiajin, et al.
Publicado: (2026)
DecoupleSearch: Decouple Planning and Search via Hierarchical Reward Modeling
por: Sun, Hao, et al.
Publicado: (2025)
por: Sun, Hao, et al.
Publicado: (2025)
Scaling Search-Augmented LLM Reasoning via Adaptive Information Control
por: Xiong, Siheng, et al.
Publicado: (2026)
por: Xiong, Siheng, et al.
Publicado: (2026)
How to Train Your Deep Research Agent? Prompt, Reward, and Policy Optimization in Search-R1
por: Xu, Yinuo, et al.
Publicado: (2026)
por: Xu, Yinuo, et al.
Publicado: (2026)
ReST-MCTS*: LLM Self-Training via Process Reward Guided Tree Search
por: Zhang, Dan, et al.
Publicado: (2024)
por: Zhang, Dan, et al.
Publicado: (2024)
AdaSearch: Balancing Parametric Knowledge and Search in Large Language Models via Reinforcement Learning
por: Lin, Tzu-Han, et al.
Publicado: (2025)
por: Lin, Tzu-Han, et al.
Publicado: (2025)
Multi-Objective and Mixed-Reward Reinforcement Learning via Reward-Decorrelated Policy Optimization
por: Bai, Yang, et al.
Publicado: (2026)
por: Bai, Yang, et al.
Publicado: (2026)
Ejemplares similares
-
PrefRAG: Preference-Driven Multi-Source Retrieval Augmented Generation
por: Zhao, Qingfei, et al.
Publicado: (2024) -
LongRAG: A Dual-Perspective Retrieval-Augmented Generation Paradigm for Long-Context Question Answering
por: Zhao, Qingfei, et al.
Publicado: (2024) -
Enhanced LLM Reasoning by Optimizing Reward Functions with Search-Driven Reinforcement Learning
por: Ahmadi, Arash, et al.
Publicado: (2026) -
Enhancing LLM Reasoning with Reward-guided Tree Search
por: Jiang, Jinhao, et al.
Publicado: (2024) -
DeepNote: Note-Centric Deep Retrieval-Augmented Generation
por: Wang, Ruobing, et al.
Publicado: (2024)