Don't Get Lost in the Trees: Streamlining LLM Reasoning by Overcoming Tree Search Exploration Pitfalls
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Ante, Song, Linfeng, Tian, Ye, Yu, Dian, Mi, Haitao, Duan, Xiangyu, Tu, Zhaopeng, Su, Jinsong, Yu, Dong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
LiteSearch: Efficacious Tree Search for LLM
di: Wang, Ante, et al.
Pubblicazione: (2024)
di: Wang, Ante, et al.
Pubblicazione: (2024)
Self-Consistency Boosts Calibration for Math Reasoning
di: Wang, Ante, et al.
Pubblicazione: (2024)
di: Wang, Ante, et al.
Pubblicazione: (2024)
Fine-Grained Self-Endorsement Improves Factuality and Reasoning
di: Wang, Ante, et al.
Pubblicazione: (2024)
di: Wang, Ante, et al.
Pubblicazione: (2024)
Crossing the Reward Bridge: Expanding RL with Verifiable Rewards Across Diverse Domains
di: Su, Yi, et al.
Pubblicazione: (2025)
di: Su, Yi, et al.
Pubblicazione: (2025)
Teaching LLMs to Refine with Tools
di: Yu, Dian, et al.
Pubblicazione: (2024)
di: Yu, Dian, et al.
Pubblicazione: (2024)
SIaM: Self-Improving Code-Assisted Mathematical Reasoning of Large Language Models
di: Yu, Dian, et al.
Pubblicazione: (2024)
di: Yu, Dian, et al.
Pubblicazione: (2024)
CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models
di: Dai, Runpeng, et al.
Pubblicazione: (2025)
di: Dai, Runpeng, et al.
Pubblicazione: (2025)
Toward Self-Improvement of LLMs via Imagination, Searching, and Criticizing
di: Tian, Ye, et al.
Pubblicazione: (2024)
di: Tian, Ye, et al.
Pubblicazione: (2024)
DOTS: Learning to Reason Dynamically in LLMs via Optimal Reasoning Trajectories Search
di: Yue, Murong, et al.
Pubblicazione: (2024)
di: Yue, Murong, et al.
Pubblicazione: (2024)
Response Enhanced Semi-supervised Dialogue Query Generation
di: Huang, Jianheng, et al.
Pubblicazione: (2023)
di: Huang, Jianheng, et al.
Pubblicazione: (2023)
DeepTheorem: Advancing LLM Reasoning for Theorem Proving Through Natural Language and Reinforcement Learning
di: Zhang, Ziyin, et al.
Pubblicazione: (2025)
di: Zhang, Ziyin, et al.
Pubblicazione: (2025)
DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning
di: He, Zhiwei, et al.
Pubblicazione: (2025)
di: He, Zhiwei, et al.
Pubblicazione: (2025)
Every Question Has Its Own Value: Reinforcement Learning with Explicit Human Values
di: Yu, Dian, et al.
Pubblicazione: (2025)
di: Yu, Dian, et al.
Pubblicazione: (2025)
Dancing with Critiques: Enhancing LLM Reasoning with Stepwise Natural Language Self-Critique
di: Li, Yansi, et al.
Pubblicazione: (2025)
di: Li, Yansi, et al.
Pubblicazione: (2025)
Improving LLM General Preference Alignment via Optimistic Online Mirror Descent
di: Zhang, Yuheng, et al.
Pubblicazione: (2025)
di: Zhang, Yuheng, et al.
Pubblicazione: (2025)
Can LLMs Guide Their Own Exploration? Gradient-Guided Reinforcement Learning for LLM Reasoning
di: Liang, Zhenwen, et al.
Pubblicazione: (2025)
di: Liang, Zhenwen, et al.
Pubblicazione: (2025)
Don't Get Stuck: A Deadlock Recovery Approach
di: Baldini, Francesca, et al.
Pubblicazione: (2024)
di: Baldini, Francesca, et al.
Pubblicazione: (2024)
Don't Get Too Excited -- Eliciting Emotions in LLMs
di: Fazzi, Gino Franco, et al.
Pubblicazione: (2025)
di: Fazzi, Gino Franco, et al.
Pubblicazione: (2025)
When Sourcing Donors, Don't Get in a Rut
Pubblicazione: (2024)
Pubblicazione: (2024)
Rectify, Don't Regret: Avoiding Pitfalls of Differentiable Simulation in Trajectory Prediction
di: Yadav, Harsh, et al.
Pubblicazione: (2026)
di: Yadav, Harsh, et al.
Pubblicazione: (2026)
Don't despair, not today
di: Zhaohui Su
Pubblicazione: (2025)
di: Zhaohui Su
Pubblicazione: (2025)
Towards Self-Improvement of LLMs via MCTS: Leveraging Stepwise Knowledge with Curriculum Preference Learning
di: Wang, Xiyao, et al.
Pubblicazione: (2024)
di: Wang, Xiyao, et al.
Pubblicazione: (2024)
Do NOT Think That Much for 2+3=? On the Overthinking of o1-Like LLMs
di: Chen, Xingyu, et al.
Pubblicazione: (2024)
di: Chen, Xingyu, et al.
Pubblicazione: (2024)
Thoughts Are All Over the Place: On the Underthinking of o1-Like LLMs
di: Wang, Yue, et al.
Pubblicazione: (2025)
di: Wang, Yue, et al.
Pubblicazione: (2025)
Don't Get Left Behind: Moving Library Instruction Online
di: Hillman, Christina R., et al.
Pubblicazione: (2016)
di: Hillman, Christina R., et al.
Pubblicazione: (2016)
Learning to Build the Environment: Self-Evolving Reasoning RL via Verifiable Environment Synthesis
di: Shi, Yucheng, et al.
Pubblicazione: (2026)
di: Shi, Yucheng, et al.
Pubblicazione: (2026)
Beyond "I Don't Know": Evaluating LLM Self-Awareness in Discriminating Data and Model Uncertainty
di: Ren, Jingyi, et al.
Pubblicazione: (2026)
di: Ren, Jingyi, et al.
Pubblicazione: (2026)
Don't Trust: Verify -- Grounding LLM Quantitative Reasoning with Autoformalization
di: Zhou, Jin Peng, et al.
Pubblicazione: (2024)
di: Zhou, Jin Peng, et al.
Pubblicazione: (2024)
Don't Miss the Forest for the Trees: How Abstracting Nature Can Get Us Closer to Our Goals
di: Jake Lawlor
Pubblicazione: (2025)
di: Jake Lawlor
Pubblicazione: (2025)
Dual-Uncertainty Guided Policy Learning for Multimodal Reasoning
di: Liu, Rui, et al.
Pubblicazione: (2025)
di: Liu, Rui, et al.
Pubblicazione: (2025)
Reasoning Models Reason Well, Until They Don't
di: Rameshkumar, Revanth, et al.
Pubblicazione: (2025)
di: Rameshkumar, Revanth, et al.
Pubblicazione: (2025)
Save the Good Prefix: Precise Error Penalization via Process-Supervised RL to Enhance LLM Reasoning
di: Liu, Haolin, et al.
Pubblicazione: (2026)
di: Liu, Haolin, et al.
Pubblicazione: (2026)
Group Distributionally Robust Optimization-Driven Reinforcement Learning for LLM Reasoning
di: Panaganti, Kishan, et al.
Pubblicazione: (2026)
di: Panaganti, Kishan, et al.
Pubblicazione: (2026)
Iterative Nash Policy Optimization: Aligning LLMs with General Preferences via No-Regret Learning
di: Zhang, Yuheng, et al.
Pubblicazione: (2024)
di: Zhang, Yuheng, et al.
Pubblicazione: (2024)
On the Information Redundancy in Non-Autoregressive Translation
di: Wang, Zhihao, et al.
Pubblicazione: (2024)
di: Wang, Zhihao, et al.
Pubblicazione: (2024)
Don't Overthink it. Preferring Shorter Thinking Chains for Improved LLM Reasoning
di: Hassid, Michael, et al.
Pubblicazione: (2025)
di: Hassid, Michael, et al.
Pubblicazione: (2025)
Love Don't Need a Reason
di: Jones, Matthew J.
Pubblicazione: (2020)
di: Jones, Matthew J.
Pubblicazione: (2020)
One Token to Fool LLM-as-a-Judge
di: Zhao, Yulai, et al.
Pubblicazione: (2025)
di: Zhao, Yulai, et al.
Pubblicazione: (2025)
CLUE: Non-parametric Verification from Experience via Hidden-State Clustering
di: Liang, Zhenwen, et al.
Pubblicazione: (2025)
di: Liang, Zhenwen, et al.
Pubblicazione: (2025)
HunyuanProver: A Scalable Data Synthesis Framework and Guided Tree Search for Automated Theorem Proving
di: Li, Yang, et al.
Pubblicazione: (2024)
di: Li, Yang, et al.
Pubblicazione: (2024)
Documenti analoghi
-
LiteSearch: Efficacious Tree Search for LLM
di: Wang, Ante, et al.
Pubblicazione: (2024) -
Self-Consistency Boosts Calibration for Math Reasoning
di: Wang, Ante, et al.
Pubblicazione: (2024) -
Fine-Grained Self-Endorsement Improves Factuality and Reasoning
di: Wang, Ante, et al.
Pubblicazione: (2024) -
Crossing the Reward Bridge: Expanding RL with Verifiable Rewards Across Diverse Domains
di: Su, Yi, et al.
Pubblicazione: (2025) -
Teaching LLMs to Refine with Tools
di: Yu, Dian, et al.
Pubblicazione: (2024)