Deliberative Searcher: Improving LLM Reliability via Reinforcement Learning with constraints
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Yin, Zhenyun, Wang, Shujie, Wang, Xuhong, Ma, Xingjun, Wang, Yinchun |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Constrained Intrinsic Motivation for Reinforcement Learning
von: Zheng, Xiang, et al.
Veröffentlicht: (2024)
von: Zheng, Xiang, et al.
Veröffentlicht: (2024)
DynaSearcher: Dynamic Knowledge Graph Augmented Search Agent via Multi-Reward Reinforcement Learning
von: Hao, Chuzhan, et al.
Veröffentlicht: (2025)
von: Hao, Chuzhan, et al.
Veröffentlicht: (2025)
Q*: Improving Multi-step Reasoning for LLMs with Deliberative Planning
von: Wang, Chaojie, et al.
Veröffentlicht: (2024)
von: Wang, Chaojie, et al.
Veröffentlicht: (2024)
Towards Human-AI Deliberation: Design and Evaluation of LLM-Empowered Deliberative AI for AI-Assisted Decision-Making
von: Ma, Shuai, et al.
Veröffentlicht: (2024)
von: Ma, Shuai, et al.
Veröffentlicht: (2024)
AceSearcher: Bootstrapping Reasoning and Search for LLMs via Reinforced Self-Play
von: Xu, Ran, et al.
Veröffentlicht: (2025)
von: Xu, Ran, et al.
Veröffentlicht: (2025)
Explore with Long-term Memory: A Benchmark and Multimodal LLM-based Reinforcement Learning Framework for Embodied Exploration
von: Wang, Sen, et al.
Veröffentlicht: (2026)
von: Wang, Sen, et al.
Veröffentlicht: (2026)
VERIRL: Boosting the LLM-based Verilog Code Generation via Reinforcement Learning
von: Teng, Fu, et al.
Veröffentlicht: (2025)
von: Teng, Fu, et al.
Veröffentlicht: (2025)
R1-Searcher: Incentivizing the Search Capability in LLMs via Reinforcement Learning
von: Song, Huatong, et al.
Veröffentlicht: (2025)
von: Song, Huatong, et al.
Veröffentlicht: (2025)
R1-Searcher++: Incentivizing the Dynamic Knowledge Acquisition of LLMs via Reinforcement Learning
von: Song, Huatong, et al.
Veröffentlicht: (2025)
von: Song, Huatong, et al.
Veröffentlicht: (2025)
Deliberative Dynamics and Value Alignment in LLM Debates
von: Sachdeva, Pratik S., et al.
Veröffentlicht: (2025)
von: Sachdeva, Pratik S., et al.
Veröffentlicht: (2025)
MemSearcher: Training LLMs to Reason, Search and Manage Memory via End-to-End Reinforcement Learning
von: Yuan, Qianhao, et al.
Veröffentlicht: (2025)
von: Yuan, Qianhao, et al.
Veröffentlicht: (2025)
Improving LLM Code Generation via Requirement-Aware Curriculum Reinforcement Learning
von: Yin, Shouyu, et al.
Veröffentlicht: (2026)
von: Yin, Shouyu, et al.
Veröffentlicht: (2026)
Improving Medical Reasoning with Curriculum-Aware Reinforcement Learning
von: Rui, Shaohao, et al.
Veröffentlicht: (2025)
von: Rui, Shaohao, et al.
Veröffentlicht: (2025)
BoostAPR: Boosting Automated Program Repair via Execution-Grounded Reinforcement Learning with Dual Reward Models
von: Li, Yuanhao, et al.
Veröffentlicht: (2026)
von: Li, Yuanhao, et al.
Veröffentlicht: (2026)
LLM4EFFI: Leveraging Large Language Models to Enhance Code Efficiency and Correctness
von: Ye, Tong, et al.
Veröffentlicht: (2025)
von: Ye, Tong, et al.
Veröffentlicht: (2025)
LightSearcher: Efficient DeepSearch via Experiential Memory
von: Lan, Hengzhi, et al.
Veröffentlicht: (2025)
von: Lan, Hengzhi, et al.
Veröffentlicht: (2025)
Aligning Large Language Models with Searcher Preferences
von: Wu, Wei, et al.
Veröffentlicht: (2026)
von: Wu, Wei, et al.
Veröffentlicht: (2026)
Atom-Searcher: Enhancing Agentic Deep Research via Fine-Grained Atomic Thought Reward
von: Deng, Yong, et al.
Veröffentlicht: (2025)
von: Deng, Yong, et al.
Veröffentlicht: (2025)
From Order to Distribution: A Spectral Characterization of Forgetting in Continual Learning
von: Xu, Zonghuan, et al.
Veröffentlicht: (2026)
von: Xu, Zonghuan, et al.
Veröffentlicht: (2026)
Uncovering LLM-Generated Code: A Zero-Shot Synthetic Code Detector via Code Rewriting
von: Ye, Tong, et al.
Veröffentlicht: (2024)
von: Ye, Tong, et al.
Veröffentlicht: (2024)
Dynamic Adversarial Reinforcement Learning for Robust Multimodal Large Language Models
von: Bao, Yicheng, et al.
Veröffentlicht: (2026)
von: Bao, Yicheng, et al.
Veröffentlicht: (2026)
Beyond Surface Judgments: Human-Grounded Risk Evaluation of LLM-Generated Disinformation
von: Xu, Zonghuan, et al.
Veröffentlicht: (2026)
von: Xu, Zonghuan, et al.
Veröffentlicht: (2026)
VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks
von: Yue, Yu, et al.
Veröffentlicht: (2025)
von: Yue, Yu, et al.
Veröffentlicht: (2025)
BandPO: Bridging Trust Regions and Ratio Clipping via Probability-Aware Bounds for LLM Reinforcement Learning
von: Li, Yuan, et al.
Veröffentlicht: (2026)
von: Li, Yuan, et al.
Veröffentlicht: (2026)
Flash-Searcher: Fast and Effective Web Agents via DAG-Based Parallel Execution
von: Qin, Tianrui, et al.
Veröffentlicht: (2025)
von: Qin, Tianrui, et al.
Veröffentlicht: (2025)
Reasoning over Precedents Alongside Statutes: Case-Augmented Deliberative Alignment for LLM Safety
von: Jin, Can, et al.
Veröffentlicht: (2026)
von: Jin, Can, et al.
Veröffentlicht: (2026)
DORAEMON: Decentralized Ontology-aware Reliable Agent with Enhanced Memory Oriented Navigation
von: Gu, Tianjun, et al.
Veröffentlicht: (2025)
von: Gu, Tianjun, et al.
Veröffentlicht: (2025)
LM-Searcher: Cross-domain Neural Architecture Search with LLMs via Unified Numerical Encoding
von: Hu, Yuxuan, et al.
Veröffentlicht: (2025)
von: Hu, Yuxuan, et al.
Veröffentlicht: (2025)
Privacy Risks of LLM-Empowered Recommender Systems: An Inversion Attack Perspective
von: Wang, Yubo, et al.
Veröffentlicht: (2025)
von: Wang, Yubo, et al.
Veröffentlicht: (2025)
MindSearch: Mimicking Human Minds Elicits Deep AI Searcher
von: Chen, Zehui, et al.
Veröffentlicht: (2024)
von: Chen, Zehui, et al.
Veröffentlicht: (2024)
Efficient Differentiable Causal Discovery via Reliable Super-Structure Learning
von: Ma, Pingchuan, et al.
Veröffentlicht: (2026)
von: Ma, Pingchuan, et al.
Veröffentlicht: (2026)
Tree Search for LLM Agent Reinforcement Learning
von: Ji, Yuxiang, et al.
Veröffentlicht: (2025)
von: Ji, Yuxiang, et al.
Veröffentlicht: (2025)
SimpleDeepSearcher: Deep Information Seeking via Web-Powered Reasoning Trajectory Synthesis
von: Sun, Shuang, et al.
Veröffentlicht: (2025)
von: Sun, Shuang, et al.
Veröffentlicht: (2025)
Deliberative Reasoning Network: An Uncertainty-Driven Paradigm for Belief-Tracked Inference with Pretrained Language Models
von: Xu, Anran, et al.
Veröffentlicht: (2025)
von: Xu, Anran, et al.
Veröffentlicht: (2025)
BackdoorLLM: A Comprehensive Benchmark for Backdoor Attacks and Defenses on Large Language Models
von: Li, Yige, et al.
Veröffentlicht: (2024)
von: Li, Yige, et al.
Veröffentlicht: (2024)
Reinforcement Learning for Self-Improving Agent with Skill Library
von: Wang, Jiongxiao, et al.
Veröffentlicht: (2025)
von: Wang, Jiongxiao, et al.
Veröffentlicht: (2025)
Hybrid Deep Searcher: Scalable Parallel and Sequential Search Reasoning
von: Ko, Dayoon, et al.
Veröffentlicht: (2025)
von: Ko, Dayoon, et al.
Veröffentlicht: (2025)
Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning
von: Yin, Ming, et al.
Veröffentlicht: (2025)
von: Yin, Ming, et al.
Veröffentlicht: (2025)
Formalization Driven LLM Prompt Jailbreaking via Reinforcement Learning
von: Wang, Zhaoqi, et al.
Veröffentlicht: (2025)
von: Wang, Zhaoqi, et al.
Veröffentlicht: (2025)
PaperAsk: A Benchmark for Reliability Evaluation of LLMs in Paper Search and Reading
von: Wu, Yutao, et al.
Veröffentlicht: (2025)
von: Wu, Yutao, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Constrained Intrinsic Motivation for Reinforcement Learning
von: Zheng, Xiang, et al.
Veröffentlicht: (2024) -
DynaSearcher: Dynamic Knowledge Graph Augmented Search Agent via Multi-Reward Reinforcement Learning
von: Hao, Chuzhan, et al.
Veröffentlicht: (2025) -
Q*: Improving Multi-step Reasoning for LLMs with Deliberative Planning
von: Wang, Chaojie, et al.
Veröffentlicht: (2024) -
Towards Human-AI Deliberation: Design and Evaluation of LLM-Empowered Deliberative AI for AI-Assisted Decision-Making
von: Ma, Shuai, et al.
Veröffentlicht: (2024) -
AceSearcher: Bootstrapping Reasoning and Search for LLMs via Reinforced Self-Play
von: Xu, Ran, et al.
Veröffentlicht: (2025)