LiteSearch: Efficacious Tree Search for LLM
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Ante, Song, Linfeng, Tian, Ye, Peng, Baolin, Yu, Dian, Mi, Haitao, Su, Jinsong, Yu, Dong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Toward Self-Improvement of LLMs via Imagination, Searching, and Criticizing
di: Tian, Ye, et al.
Pubblicazione: (2024)
di: Tian, Ye, et al.
Pubblicazione: (2024)
Self-Consistency Boosts Calibration for Math Reasoning
di: Wang, Ante, et al.
Pubblicazione: (2024)
di: Wang, Ante, et al.
Pubblicazione: (2024)
Fine-Grained Self-Endorsement Improves Factuality and Reasoning
di: Wang, Ante, et al.
Pubblicazione: (2024)
di: Wang, Ante, et al.
Pubblicazione: (2024)
Iterative Nash Policy Optimization: Aligning LLMs with General Preferences via No-Regret Learning
di: Zhang, Yuheng, et al.
Pubblicazione: (2024)
di: Zhang, Yuheng, et al.
Pubblicazione: (2024)
DOTS: Learning to Reason Dynamically in LLMs via Optimal Reasoning Trajectories Search
di: Yue, Murong, et al.
Pubblicazione: (2024)
di: Yue, Murong, et al.
Pubblicazione: (2024)
Improving LLM General Preference Alignment via Optimistic Online Mirror Descent
di: Zhang, Yuheng, et al.
Pubblicazione: (2025)
di: Zhang, Yuheng, et al.
Pubblicazione: (2025)
Don't Get Lost in the Trees: Streamlining LLM Reasoning by Overcoming Tree Search Exploration Pitfalls
di: Wang, Ante, et al.
Pubblicazione: (2025)
di: Wang, Ante, et al.
Pubblicazione: (2025)
Towards Self-Improvement of LLMs via MCTS: Leveraging Stepwise Knowledge with Curriculum Preference Learning
di: Wang, Xiyao, et al.
Pubblicazione: (2024)
di: Wang, Xiyao, et al.
Pubblicazione: (2024)
Dual-Uncertainty Guided Policy Learning for Multimodal Reasoning
di: Liu, Rui, et al.
Pubblicazione: (2025)
di: Liu, Rui, et al.
Pubblicazione: (2025)
Group Distributionally Robust Optimization-Driven Reinforcement Learning for LLM Reasoning
di: Panaganti, Kishan, et al.
Pubblicazione: (2026)
di: Panaganti, Kishan, et al.
Pubblicazione: (2026)
CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models
di: Dai, Runpeng, et al.
Pubblicazione: (2025)
di: Dai, Runpeng, et al.
Pubblicazione: (2025)
When is Tree Search Useful for LLM Planning? It Depends on the Discriminator
di: Chen, Ziru, et al.
Pubblicazione: (2024)
di: Chen, Ziru, et al.
Pubblicazione: (2024)
On the Emergence of Thinking in LLMs I: Searching for the Right Intuition
di: Ye, Guanghao, et al.
Pubblicazione: (2025)
di: Ye, Guanghao, et al.
Pubblicazione: (2025)
Response Enhanced Semi-supervised Dialogue Query Generation
di: Huang, Jianheng, et al.
Pubblicazione: (2023)
di: Huang, Jianheng, et al.
Pubblicazione: (2023)
SIaM: Self-Improving Code-Assisted Mathematical Reasoning of Large Language Models
di: Yu, Dian, et al.
Pubblicazione: (2024)
di: Yu, Dian, et al.
Pubblicazione: (2024)
Every Question Has Its Own Value: Reinforcement Learning with Explicit Human Values
di: Yu, Dian, et al.
Pubblicazione: (2025)
di: Yu, Dian, et al.
Pubblicazione: (2025)
R-Zero: Self-Evolving Reasoning LLM from Zero Data
di: Huang, Chengsong, et al.
Pubblicazione: (2025)
di: Huang, Chengsong, et al.
Pubblicazione: (2025)
Tree Search for Language Model Agents
di: Koh, Jing Yu, et al.
Pubblicazione: (2024)
di: Koh, Jing Yu, et al.
Pubblicazione: (2024)
Weak-to-Strong Search: Align Large Language Models via Searching over Small Language Models
di: Zhou, Zhanhui, et al.
Pubblicazione: (2024)
di: Zhou, Zhanhui, et al.
Pubblicazione: (2024)
Self-Alignment for Factuality: Mitigating Hallucinations in LLMs via Self-Evaluation
di: Zhang, Xiaoying, et al.
Pubblicazione: (2024)
di: Zhang, Xiaoying, et al.
Pubblicazione: (2024)
HunyuanProver: A Scalable Data Synthesis Framework and Guided Tree Search for Automated Theorem Proving
di: Li, Yang, et al.
Pubblicazione: (2024)
di: Li, Yang, et al.
Pubblicazione: (2024)
Stratified GRPO: Handling Structural Heterogeneity in Reinforcement Learning of LLM Search Agents
di: Zhu, Mingkang, et al.
Pubblicazione: (2025)
di: Zhu, Mingkang, et al.
Pubblicazione: (2025)
Guided Self-Evolving LLMs with Minimal Human Supervision
di: Yu, Wenhao, et al.
Pubblicazione: (2025)
di: Yu, Wenhao, et al.
Pubblicazione: (2025)
Planning In Natural Language Improves LLM Search For Code Generation
di: Wang, Evan, et al.
Pubblicazione: (2024)
di: Wang, Evan, et al.
Pubblicazione: (2024)
SPEC-RL: Accelerating On-Policy Reinforcement Learning with Speculative Rollouts
di: Liu, Bingshuai, et al.
Pubblicazione: (2025)
di: Liu, Bingshuai, et al.
Pubblicazione: (2025)
Geometry-Lite: Interpretable Safety Probing via Layer-Wise Margin Geometry
di: Sim, Woo Seob, et al.
Pubblicazione: (2026)
di: Sim, Woo Seob, et al.
Pubblicazione: (2026)
LiteCoOp: Lightweight Multi-LLM Shared-Tree Reasoning for Model-Serving Compiler Optimizations
di: Tang, Annabelle Sujun, et al.
Pubblicazione: (2026)
di: Tang, Annabelle Sujun, et al.
Pubblicazione: (2026)
Enhancing Reasoning through Process Supervision with Monte Carlo Tree Search
di: Li, Shuangtao, et al.
Pubblicazione: (2025)
di: Li, Shuangtao, et al.
Pubblicazione: (2025)
Stable and Efficient Single-Rollout RL for Multimodal Reasoning
di: Liu, Rui, et al.
Pubblicazione: (2025)
di: Liu, Rui, et al.
Pubblicazione: (2025)
Context-Enhanced Contrastive Search for Improved LLM Text Generation
di: Sen, Jaydip, et al.
Pubblicazione: (2025)
di: Sen, Jaydip, et al.
Pubblicazione: (2025)
Stream of Search (SoS): Learning to Search in Language
di: Gandhi, Kanishk, et al.
Pubblicazione: (2024)
di: Gandhi, Kanishk, et al.
Pubblicazione: (2024)
TSR: Trajectory-Search Rollouts for Multi-Turn RL of LLM Agents
di: Djuhera, Aladin, et al.
Pubblicazione: (2026)
di: Djuhera, Aladin, et al.
Pubblicazione: (2026)
Low-Rank Adapters Meet Neural Architecture Search for LLM Compression
di: Muñoz, J. Pablo, et al.
Pubblicazione: (2025)
di: Muñoz, J. Pablo, et al.
Pubblicazione: (2025)
Dyna-Think: Synergizing Reasoning, Acting, and World Model Simulation in AI Agents
di: Yu, Xiao, et al.
Pubblicazione: (2025)
di: Yu, Xiao, et al.
Pubblicazione: (2025)
ZeroUnlearn: Few-Shot Knowledge Unlearning in Large Language Models
di: Lin, Yujie, et al.
Pubblicazione: (2026)
di: Lin, Yujie, et al.
Pubblicazione: (2026)
Synthetic Computers at Scale for Long-Horizon Productivity Simulation
di: Ge, Tao, et al.
Pubblicazione: (2026)
di: Ge, Tao, et al.
Pubblicazione: (2026)
Learning Rate Matters: Vanilla LoRA May Suffice for LLM Fine-tuning
di: Lee, Yu-Ang, et al.
Pubblicazione: (2026)
di: Lee, Yu-Ang, et al.
Pubblicazione: (2026)
SELA: Tree-Search Enhanced LLM Agents for Automated Machine Learning
di: Chi, Yizhou, et al.
Pubblicazione: (2024)
di: Chi, Yizhou, et al.
Pubblicazione: (2024)
SealQA: Raising the Bar for Reasoning in Search-Augmented Language Models
di: Pham, Thinh, et al.
Pubblicazione: (2025)
di: Pham, Thinh, et al.
Pubblicazione: (2025)
Value-Guided Search for Efficient Chain-of-Thought Reasoning
di: Wang, Kaiwen, et al.
Pubblicazione: (2025)
di: Wang, Kaiwen, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Toward Self-Improvement of LLMs via Imagination, Searching, and Criticizing
di: Tian, Ye, et al.
Pubblicazione: (2024) -
Self-Consistency Boosts Calibration for Math Reasoning
di: Wang, Ante, et al.
Pubblicazione: (2024) -
Fine-Grained Self-Endorsement Improves Factuality and Reasoning
di: Wang, Ante, et al.
Pubblicazione: (2024) -
Iterative Nash Policy Optimization: Aligning LLMs with General Preferences via No-Regret Learning
di: Zhang, Yuheng, et al.
Pubblicazione: (2024) -
DOTS: Learning to Reason Dynamically in LLMs via Optimal Reasoning Trajectories Search
di: Yue, Murong, et al.
Pubblicazione: (2024)