ReST-MCTS*: LLM Self-Training via Process Reward Guided Tree Search
Fuente:
arXiv
Saved in:
| Main Authors: | Zhang, Dan, Zhoubian, Sining, Hu, Ziniu, Yue, Yisong, Dong, Yuxiao, Tang, Jie |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
ReST-RL: Achieving Accurate Code Reasoning of LLMs with Optimized Self-Training and Decoding
by: Zhoubian, Sining, et al.
Published: (2025)
by: Zhoubian, Sining, et al.
Published: (2025)
SciInstruct: a Self-Reflective Instruction Annotated Dataset for Training Scientific Language Models
by: Zhang, Dan, et al.
Published: (2024)
by: Zhang, Dan, et al.
Published: (2024)
DataSciBench: An LLM Agent Benchmark for Data Science
by: Zhang, Dan, et al.
Published: (2025)
by: Zhang, Dan, et al.
Published: (2025)
Re-ReST: Reflection-Reinforced Self-Training for Language Agents
by: Dou, Zi-Yi, et al.
Published: (2024)
by: Dou, Zi-Yi, et al.
Published: (2024)
TDRM: Smooth Reward Models with Temporal Difference for LLM RL and Inference
by: Zhang, Dan, et al.
Published: (2025)
by: Zhang, Dan, et al.
Published: (2025)
TreeRL: LLM Reinforcement Learning with On-Policy Tree Search
by: Hou, Zhenyu, et al.
Published: (2025)
by: Hou, Zhenyu, et al.
Published: (2025)
Strategist: Self-improvement of LLM Decision Making via Bi-Level Tree Search
by: Light, Jonathan, et al.
Published: (2024)
by: Light, Jonathan, et al.
Published: (2024)
Reward-Centered ReST-MCTS: A Robust Decision-Making Framework for Robotic Manipulation in High Uncertainty Environments
by: Wang, Xibai
Published: (2025)
by: Wang, Xibai
Published: (2025)
ReST-KV: Robust KV Cache Eviction with Layer-wise Output Reconstruction and Spatial-Temporal Smoothing
by: An, Yongqi, et al.
Published: (2026)
by: An, Yongqi, et al.
Published: (2026)
Self-Control of LLM Behaviors by Compressing Suffix Gradient into Prefix Controller
by: Cai, Min, et al.
Published: (2024)
by: Cai, Min, et al.
Published: (2024)
Self-Correcting RAG: Enhancing Faithfulness via MMKP Context Selection and NLI-Guided MCTS
by: Xu, Shijia, et al.
Published: (2026)
by: Xu, Shijia, et al.
Published: (2026)
Beyond Numeric Rewards: In-Context Dueling Bandits with LLM Agents
by: Xia, Fanzeng, et al.
Published: (2024)
by: Xia, Fanzeng, et al.
Published: (2024)
ReSeek: A Self-Correcting Framework for Search Agents with Instructive Rewards
by: Li, Shiyu, et al.
Published: (2025)
by: Li, Shiyu, et al.
Published: (2025)
Rock Classification Based on Residual Networks
by: Zhoubian, Sining, et al.
Published: (2024)
by: Zhoubian, Sining, et al.
Published: (2024)
Enhancing LLM Reasoning with Reward-guided Tree Search
by: Jiang, Jinhao, et al.
Published: (2024)
by: Jiang, Jinhao, et al.
Published: (2024)
MCTS-RAG: Enhancing Retrieval-Augmented Generation with Monte Carlo Tree Search
by: Hu, Yunhai, et al.
Published: (2025)
by: Hu, Yunhai, et al.
Published: (2025)
Detoxifying Large Language Models via Autoregressive Reward Guided Representation Editing
by: Xiao, Yisong, et al.
Published: (2025)
by: Xiao, Yisong, et al.
Published: (2025)
SPaR: Self-Play with Tree-Search Refinement to Improve Instruction-Following in Large Language Models
by: Cheng, Jiale, et al.
Published: (2024)
by: Cheng, Jiale, et al.
Published: (2024)
AutoRE: Document-Level Relation Extraction with Large Language Models
by: Xue, Lilong, et al.
Published: (2024)
by: Xue, Lilong, et al.
Published: (2024)
SRA-MCTS: Self-driven Reasoning Augmentation with Monte Carlo Tree Search for Code Generation
by: Xu, Bin, et al.
Published: (2024)
by: Xu, Bin, et al.
Published: (2024)
Adaptive Test-Time Reasoning via Reward-Guided Dual-Phase Search
by: Cui, Yingqian, et al.
Published: (2025)
by: Cui, Yingqian, et al.
Published: (2025)
WebRL: Training LLM Web Agents via Self-Evolving Online Curriculum Reinforcement Learning
by: Qi, Zehan, et al.
Published: (2024)
by: Qi, Zehan, et al.
Published: (2024)
I-MCTS: Enhancing Agentic AutoML via Introspective Monte Carlo Tree Search
by: Liang, Zujie, et al.
Published: (2025)
by: Liang, Zujie, et al.
Published: (2025)
ChatSOP: An SOP-Guided MCTS Planning Framework for Controllable LLM Dialogue Agents
by: Li, Zhigen, et al.
Published: (2024)
by: Li, Zhigen, et al.
Published: (2024)
RethinkMCTS: Refining Erroneous Thoughts in Monte Carlo Tree Search for Code Generation
by: Li, Qingyao, et al.
Published: (2024)
by: Li, Qingyao, et al.
Published: (2024)
Extensive Self-Contrast Enables Feedback-Free Language Model Alignment
by: Liu, Xiao, et al.
Published: (2024)
by: Liu, Xiao, et al.
Published: (2024)
Ensembling Large Language Models with Process Reward-Guided Tree Search for Better Complex Reasoning
by: Park, Sungjin, et al.
Published: (2024)
by: Park, Sungjin, et al.
Published: (2024)
SceneCraft: An LLM Agent for Synthesizing 3D Scene as Blender Code
by: Hu, Ziniu, et al.
Published: (2024)
by: Hu, Ziniu, et al.
Published: (2024)
Inference Time Alignment with Reward-Guided Tree Search
by: Hung, Chia-Yu, et al.
Published: (2024)
by: Hung, Chia-Yu, et al.
Published: (2024)
Empirical-MCTS: Continuous Agent Evolution via Dual-Experience Monte Carlo Tree Search
by: Lu, Hao, et al.
Published: (2026)
by: Lu, Hao, et al.
Published: (2026)
Think&Cite: Improving Attributed Text Generation with Self-Guided Tree Search and Progress Reward Modeling
by: Li, Junyi, et al.
Published: (2024)
by: Li, Junyi, et al.
Published: (2024)
MCTS-KBQA: Monte Carlo Tree Search for Knowledge Base Question Answering
by: Xiong, Guanming, et al.
Published: (2025)
by: Xiong, Guanming, et al.
Published: (2025)
Self-Guided Process Reward Optimization with Redefined Step-wise Advantage for Process Reinforcement Learning
by: Fei, Wu, et al.
Published: (2025)
by: Fei, Wu, et al.
Published: (2025)
LeTS: Learning to Think-and-Search via Process-and-Outcome Reward Hybridization
by: Zhang, Qi, et al.
Published: (2025)
by: Zhang, Qi, et al.
Published: (2025)
Towards Self-Improvement of LLMs via MCTS: Leveraging Stepwise Knowledge with Curriculum Preference Learning
by: Wang, Xiyao, et al.
Published: (2024)
by: Wang, Xiyao, et al.
Published: (2024)
SE-Search: Self-Evolving Search Agent via Memory and Dense Reward
by: Li, Jian, et al.
Published: (2026)
by: Li, Jian, et al.
Published: (2026)
SeRTS: Self-Rewarding Tree Search for Biomedical Retrieval-Augmented Generation
by: Hu, Minda, et al.
Published: (2024)
by: Hu, Minda, et al.
Published: (2024)
DAMR: Efficient and Adaptive Context-Aware Knowledge Graph Question Answering with LLM-Guided MCTS
by: Wang, Yingxu, et al.
Published: (2025)
by: Wang, Yingxu, et al.
Published: (2025)
ReMiT: RL-Guided Mid-Training for Iterative LLM Evolution
by: Huang, Junjie, et al.
Published: (2026)
by: Huang, Junjie, et al.
Published: (2026)
R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning
by: Zhao, Qingfei, et al.
Published: (2025)
by: Zhao, Qingfei, et al.
Published: (2025)
Similar Items
-
ReST-RL: Achieving Accurate Code Reasoning of LLMs with Optimized Self-Training and Decoding
by: Zhoubian, Sining, et al.
Published: (2025) -
SciInstruct: a Self-Reflective Instruction Annotated Dataset for Training Scientific Language Models
by: Zhang, Dan, et al.
Published: (2024) -
DataSciBench: An LLM Agent Benchmark for Data Science
by: Zhang, Dan, et al.
Published: (2025) -
Re-ReST: Reflection-Reinforced Self-Training for Language Agents
by: Dou, Zi-Yi, et al.
Published: (2024) -
TDRM: Smooth Reward Models with Temporal Difference for LLM RL and Inference
by: Zhang, Dan, et al.
Published: (2025)