Alphazero-like Tree-Search can Guide Large Language Model Decoding and Training
Fuente:
arXiv
Saved in:
| Main Authors: | Feng, Xidong, Wan, Ziyu, Wen, Muning, McAleer, Stephen Marcus, Wen, Ying, Zhang, Weinan, Wang, Jun |
|---|---|
| Format: | Preprint |
| Published: |
2023
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Tree Search for Language Model Agents
by: Koh, Jing Yu, et al.
Published: (2024)
by: Koh, Jing Yu, et al.
Published: (2024)
Reinforcing Language Agents via Policy Optimization with Action Decomposition
by: Wen, Muning, et al.
Published: (2024)
by: Wen, Muning, et al.
Published: (2024)
Plato's 'Republic'
by: McAleer, Sean
Published: (2020)
by: McAleer, Sean
Published: (2020)
OpenR: An Open Source Framework for Advanced Reasoning with Large Language Models
by: Wang, Jun, et al.
Published: (2024)
by: Wang, Jun, et al.
Published: (2024)
P3: A Policy-Driven, Pace-Adaptive, and Diversity-Promoted Framework for data pruning in LLM Training
by: Yang, Yingxuan, et al.
Published: (2024)
by: Yang, Yingxuan, et al.
Published: (2024)
Natural Language Reinforcement Learning
by: Feng, Xidong, et al.
Published: (2024)
by: Feng, Xidong, et al.
Published: (2024)
Language Games as the Pathway to Artificial Superhuman Intelligence
by: Wen, Ying, et al.
Published: (2025)
by: Wen, Ying, et al.
Published: (2025)
Faster Game Solving via Hyperparameter Schedules
by: Zhang, Naifeng, et al.
Published: (2024)
by: Zhang, Naifeng, et al.
Published: (2024)
Natural Language Reinforcement Learning
by: Feng, Xidong, et al.
Published: (2024)
by: Feng, Xidong, et al.
Published: (2024)
Entropy-Regularized Token-Level Policy Optimization for Language Agent Reinforcement
by: Wen, Muning, et al.
Published: (2024)
by: Wen, Muning, et al.
Published: (2024)
PARL-MT: Learning to Call Functions in Multi-Turn Conversation with Progress Awareness
by: Chai, Huacan, et al.
Published: (2025)
by: Chai, Huacan, et al.
Published: (2025)
TRAD: Enhancing LLM Agents with Step-Wise Thought Retrieval and Aligned Decision
by: Zhou, Ruiwen, et al.
Published: (2024)
by: Zhou, Ruiwen, et al.
Published: (2024)
Llemma: An Open Language Model For Mathematics
by: Azerbayev, Zhangir, et al.
Published: (2023)
by: Azerbayev, Zhangir, et al.
Published: (2023)
A Systematic Review to Explore Antenatal Care From the Perspectives of Women With Intellectual Disabilities and Midwives
by: Weam Alhulaibi, et al.
Published: (2024)
by: Weam Alhulaibi, et al.
Published: (2024)
MARFT: Multi-Agent Reinforcement Fine-Tuning
by: Liao, Junwei, et al.
Published: (2025)
by: Liao, Junwei, et al.
Published: (2025)
A* Search Without Expansions: Learning Heuristic Functions with Deep Q-Networks
by: Agostinelli, Forest, et al.
Published: (2021)
by: Agostinelli, Forest, et al.
Published: (2021)
Towards Cold-Start Drafting and Continual Refining: A Value-Driven Memory Approach with Application to NPU Kernel Synthesis
by: Zheng, Yujie, et al.
Published: (2026)
by: Zheng, Yujie, et al.
Published: (2026)
MemRL: Self-Evolving Agents via Runtime Reinforcement Learning on Episodic Memory
by: Zhang, Shengtao, et al.
Published: (2026)
by: Zhang, Shengtao, et al.
Published: (2026)
Please refuse to answer me! Mitigating Over-Refusal in Large Language Models via Adaptive Contrastive Decoding
by: Qi, Yupeng, et al.
Published: (2026)
by: Qi, Yupeng, et al.
Published: (2026)
ReMA: Learning to Meta-think for LLMs with Multi-Agent Reinforcement Learning
by: Wan, Ziyu, et al.
Published: (2025)
by: Wan, Ziyu, et al.
Published: (2025)
HammerBench: Fine-Grained Function-Calling Evaluation in Real Mobile Device Scenarios
by: Wang, Jun, et al.
Published: (2024)
by: Wang, Jun, et al.
Published: (2024)
Improving Diffusion Language Model Decoding through Joint Search in Generation Order and Token Space
by: Shen, Yangyi, et al.
Published: (2026)
by: Shen, Yangyi, et al.
Published: (2026)
ThinkBench: Dynamic Out-of-Distribution Evaluation for Robust LLM Reasoning
by: Huang, Shulin, et al.
Published: (2025)
by: Huang, Shulin, et al.
Published: (2025)
Position: Agentic AI System Is a Foreseeable Pathway to AGI
by: Liao, Junwei, et al.
Published: (2026)
by: Liao, Junwei, et al.
Published: (2026)
Orienting and Engaging New Faculty
by: Pamela MacRae, et al.
Published: (2024)
by: Pamela MacRae, et al.
Published: (2024)
Large Language Models can Contrastively Refine their Generation for Better Sentence Representation Learning
by: Wang, Huiming, et al.
Published: (2023)
by: Wang, Huiming, et al.
Published: (2023)
Policy Space Response Oracles: A Survey
by: Bighashdel, Ariyan, et al.
Published: (2024)
by: Bighashdel, Ariyan, et al.
Published: (2024)
Large Language Model as a Universal Clinical Multi-task Decoder
by: Wu, Yujiang, et al.
Published: (2024)
by: Wu, Yujiang, et al.
Published: (2024)
Entropy Guided Extrapolative Decoding to Improve Factuality in Large Language Models
by: Das, Souvik, et al.
Published: (2024)
by: Das, Souvik, et al.
Published: (2024)
Efficient Beam Search for Large Language Models Using Trie-Based Decoding
by: Chan, Brian J, et al.
Published: (2025)
by: Chan, Brian J, et al.
Published: (2025)
BPDec: Unveiling the Potential of Masked Language Modeling Decoder in BERT pretraining
by: Liang, Wen, et al.
Published: (2024)
by: Liang, Wen, et al.
Published: (2024)
Diagnostic-Driven Layer-Wise Compensation for Post-Training Quantization of Encoder-Decoder ASR Models
by: Wang, Xinyu, et al.
Published: (2026)
by: Wang, Xinyu, et al.
Published: (2026)
Ensembling Large Language Models with Process Reward-Guided Tree Search for Better Complex Reasoning
by: Park, Sungjin, et al.
Published: (2024)
by: Park, Sungjin, et al.
Published: (2024)
Game-Theoretic Multiagent Reinforcement Learning
by: Yang, Yaodong, et al.
Published: (2020)
by: Yang, Yaodong, et al.
Published: (2020)
Can Large Language Models generalize analogy solving like children can?
by: Stevenson, Claire E., et al.
Published: (2024)
by: Stevenson, Claire E., et al.
Published: (2024)
Algorithms and Complexity for Computing Nash Equilibria in Adversarial Team Games
by: Anagnostides, Ioannis, et al.
Published: (2023)
by: Anagnostides, Ioannis, et al.
Published: (2023)
Sample-Efficient Regret-Minimizing Double Oracle in Extensive-Form Games
by: Tang, Xiaohang, et al.
Published: (2024)
by: Tang, Xiaohang, et al.
Published: (2024)
Large Language Models can be Guided to Evade AI-Generated Text Detection
by: Lu, Ning, et al.
Published: (2023)
by: Lu, Ning, et al.
Published: (2023)
ReMiT: RL-Guided Mid-Training for Iterative LLM Evolution
by: Huang, Junjie, et al.
Published: (2026)
by: Huang, Junjie, et al.
Published: (2026)
Latent Distance Guided Alignment Training for Large Language Models
by: Luo, Haotian
Published: (2024)
by: Luo, Haotian
Published: (2024)
Similar Items
-
Tree Search for Language Model Agents
by: Koh, Jing Yu, et al.
Published: (2024) -
Reinforcing Language Agents via Policy Optimization with Action Decomposition
by: Wen, Muning, et al.
Published: (2024) -
Plato's 'Republic'
by: McAleer, Sean
Published: (2020) -
OpenR: An Open Source Framework for Advanced Reasoning with Large Language Models
by: Wang, Jun, et al.
Published: (2024) -
P3: A Policy-Driven, Pace-Adaptive, and Diversity-Promoted Framework for data pruning in LLM Training
by: Yang, Yingxuan, et al.
Published: (2024)