Enhancing LLM Reasoning with Reward-guided Tree Search
Fuente:
arXiv
Guardado en:
| Autores principales: | Jiang, Jinhao, Chen, Zhipeng, Min, Yingqian, Chen, Jie, Cheng, Xiaoxue, Wang, Jiapeng, Tang, Yiru, Sun, Haoxiang, Deng, Jia, Zhao, Wayne Xin, Liu, Zheng, Yan, Dong, Xie, Jian, Wang, Zhongyuan, Wen, Ji-Rong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Imitate, Explore, and Self-Improve: A Reproduction Report on Slow-thinking Reasoning Systems
por: Min, Yingqian, et al.
Publicado: (2024)
por: Min, Yingqian, et al.
Publicado: (2024)
Challenging the Boundaries of Reasoning: An Olympiad-Level Math Benchmark for Large Language Models
por: Sun, Haoxiang, et al.
Publicado: (2025)
por: Sun, Haoxiang, et al.
Publicado: (2025)
R1-Searcher: Incentivizing the Search Capability in LLMs via Reinforcement Learning
por: Song, Huatong, et al.
Publicado: (2025)
por: Song, Huatong, et al.
Publicado: (2025)
ICPC-Eval: Probing the Frontiers of LLM Reasoning with Competitive Programming Contests
por: Xu, Shiyi, et al.
Publicado: (2025)
por: Xu, Shiyi, et al.
Publicado: (2025)
Towards Effective Code-Integrated Reasoning
por: Bai, Fei, et al.
Publicado: (2025)
por: Bai, Fei, et al.
Publicado: (2025)
An Empirical Study on Eliciting and Improving R1-like Reasoning Models
por: Chen, Zhipeng, et al.
Publicado: (2025)
por: Chen, Zhipeng, et al.
Publicado: (2025)
Sticker-TTS: Learn to Utilize Historical Experience with a Sticker-driven Test-Time Scaling Framework
por: Chen, Jie, et al.
Publicado: (2025)
por: Chen, Jie, et al.
Publicado: (2025)
Decomposing the Entropy-Performance Exchange: The Missing Keys to Unlocking Effective Reinforcement Learning
por: Deng, Jia, et al.
Publicado: (2025)
por: Deng, Jia, et al.
Publicado: (2025)
R1-Searcher++: Incentivizing the Dynamic Knowledge Acquisition of LLMs via Reinforcement Learning
por: Song, Huatong, et al.
Publicado: (2025)
por: Song, Huatong, et al.
Publicado: (2025)
Low-rank Optimization Trajectories Modeling for LLM RLVR Acceleration
por: Chen, Zhipeng, et al.
Publicado: (2026)
por: Chen, Zhipeng, et al.
Publicado: (2026)
JiuZhang3.0: Efficiently Improving Mathematical Reasoning by Training Small Data Synthesis Models
por: Zhou, Kun, et al.
Publicado: (2024)
por: Zhou, Kun, et al.
Publicado: (2024)
From Trial-and-Error to Improvement: A Systematic Analysis of LLM Exploration Mechanisms in RLVR
por: Deng, Jia, et al.
Publicado: (2025)
por: Deng, Jia, et al.
Publicado: (2025)
YuLan-Mini: An Open Data-efficient Language Model
por: Hu, Yiwen, et al.
Publicado: (2024)
por: Hu, Yiwen, et al.
Publicado: (2024)
RV-Syn: Rational and Verifiable Mathematical Reasoning Data Synthesis based on Structured Function Library
por: Wang, Jiapeng, et al.
Publicado: (2025)
por: Wang, Jiapeng, et al.
Publicado: (2025)
Improving Vision-language Models with Perception-centric Process Reward Models
por: Min, Yingqian, et al.
Publicado: (2026)
por: Min, Yingqian, et al.
Publicado: (2026)
ReasoningLM: Enabling Structural Subgraph Reasoning in Pre-trained Language Models for Question Answering over Knowledge Graph
por: Jiang, Jinhao, et al.
Publicado: (2023)
por: Jiang, Jinhao, et al.
Publicado: (2023)
Adaptive Ability Decomposing for Unlocking Large Reasoning Model Effective Reinforcement Learning
por: Chen, Zhipeng, et al.
Publicado: (2026)
por: Chen, Zhipeng, et al.
Publicado: (2026)
SimpleDeepSearcher: Deep Information Seeking via Web-Powered Reasoning Trajectory Synthesis
por: Sun, Shuang, et al.
Publicado: (2025)
por: Sun, Shuang, et al.
Publicado: (2025)
Towards Effective and Efficient Continual Pre-training of Large Language Models
por: Chen, Jie, et al.
Publicado: (2024)
por: Chen, Jie, et al.
Publicado: (2024)
KG-Agent: An Efficient Autonomous Agent Framework for Complex Reasoning over Knowledge Graph
por: Jiang, Jinhao, et al.
Publicado: (2024)
por: Jiang, Jinhao, et al.
Publicado: (2024)
ProtInvTree: Deliberate Protein Inverse Folding with Reward-guided Tree Search
por: Liu, Mengdi, et al.
Publicado: (2025)
por: Liu, Mengdi, et al.
Publicado: (2025)
Not Everything is All You Need: Toward Low-Redundant Optimization for Large Language Model Alignment
por: Chen, Zhipeng, et al.
Publicado: (2024)
por: Chen, Zhipeng, et al.
Publicado: (2024)
LLMBox: A Comprehensive Library for Large Language Models
por: Tang, Tianyi, et al.
Publicado: (2024)
por: Tang, Tianyi, et al.
Publicado: (2024)
The Dawn After the Dark: An Empirical Study on Factuality Hallucination in Large Language Models
por: Li, Junyi, et al.
Publicado: (2024)
por: Li, Junyi, et al.
Publicado: (2024)
Search-Based Interaction For Conversation Recommendation via Generative Reward Model Based Simulated User
por: Wang, Xiaolei, et al.
Publicado: (2025)
por: Wang, Xiaolei, et al.
Publicado: (2025)
ChainLM: Empowering Large Language Models with Improved Chain-of-Thought Prompting
por: Cheng, Xiaoxue, et al.
Publicado: (2024)
por: Cheng, Xiaoxue, et al.
Publicado: (2024)
Think More, Hallucinate Less: Mitigating Hallucinations via Dual Process of Fast and Slow Thinking
por: Cheng, Xiaoxue, et al.
Publicado: (2025)
por: Cheng, Xiaoxue, et al.
Publicado: (2025)
IG-Search: Step-Level Information Gain Rewards for Search-Augmented Reasoning
por: Liang, Zihan, et al.
Publicado: (2026)
por: Liang, Zihan, et al.
Publicado: (2026)
Adaptive Test-Time Reasoning via Reward-Guided Dual-Phase Search
por: Cui, Yingqian, et al.
Publicado: (2025)
por: Cui, Yingqian, et al.
Publicado: (2025)
MathSE: Improving Multimodal Mathematical Reasoning via Self-Evolving Iterative Reflection and Reward-Guided Fine-Tuning
por: Chen, Jinhao, et al.
Publicado: (2025)
por: Chen, Jinhao, et al.
Publicado: (2025)
LARES: Latent Reasoning for Sequential Recommendation
por: Liu, Enze, et al.
Publicado: (2025)
por: Liu, Enze, et al.
Publicado: (2025)
Extracting and Combining Abilities For Building Multi-lingual Ability-enhanced Large Language Models
por: Chen, Zhipeng, et al.
Publicado: (2024)
por: Chen, Zhipeng, et al.
Publicado: (2024)
R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning
por: Zhao, Qingfei, et al.
Publicado: (2025)
por: Zhao, Qingfei, et al.
Publicado: (2025)
From Objects to Events: Unlocking Complex Visual Understanding in Object Detectors via LLM-guided Symbolic Reasoning
por: Zeng, Yuhui, et al.
Publicado: (2025)
por: Zeng, Yuhui, et al.
Publicado: (2025)
Step-wise Rubric Rewards for LLM Reasoning
por: Xie, Weichu, et al.
Publicado: (2026)
por: Xie, Weichu, et al.
Publicado: (2026)
MMATH: A Multilingual Benchmark for Mathematical Reasoning
por: Luo, Wenyang, et al.
Publicado: (2025)
por: Luo, Wenyang, et al.
Publicado: (2025)
Unveiling the Flaws: Exploring Imperfections in Synthetic Data and Mitigation Strategies for Large Language Models
por: Chen, Jie, et al.
Publicado: (2024)
por: Chen, Jie, et al.
Publicado: (2024)
Revisiting the Necessity of Lengthy Chain-of-Thought in Vision-centric Reasoning Generalization
por: Du, Yifan, et al.
Publicado: (2025)
por: Du, Yifan, et al.
Publicado: (2025)
DQLoRA: A Lightweight Domain-Aware Denoising ASR via Adapter-guided Distillation
por: Yang, Yiru
Publicado: (2025)
por: Yang, Yiru
Publicado: (2025)
POMDP-Guided Active Force-Based Search for Robotic Insertion
por: Wang, Chen, et al.
Publicado: (2024)
por: Wang, Chen, et al.
Publicado: (2024)
Ejemplares similares
-
Imitate, Explore, and Self-Improve: A Reproduction Report on Slow-thinking Reasoning Systems
por: Min, Yingqian, et al.
Publicado: (2024) -
Challenging the Boundaries of Reasoning: An Olympiad-Level Math Benchmark for Large Language Models
por: Sun, Haoxiang, et al.
Publicado: (2025) -
R1-Searcher: Incentivizing the Search Capability in LLMs via Reinforcement Learning
por: Song, Huatong, et al.
Publicado: (2025) -
ICPC-Eval: Probing the Frontiers of LLM Reasoning with Competitive Programming Contests
por: Xu, Shiyi, et al.
Publicado: (2025) -
Towards Effective Code-Integrated Reasoning
por: Bai, Fei, et al.
Publicado: (2025)