Towards Self-Improvement of LLMs via MCTS: Leveraging Stepwise Knowledge with Curriculum Preference Learning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Xiyao, Song, Linfeng, Tian, Ye, Yu, Dian, Peng, Baolin, Mi, Haitao, Huang, Furong, Yu, Dong |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Toward Self-Improvement of LLMs via Imagination, Searching, and Criticizing
par: Tian, Ye, et autres
Publié: (2024)
par: Tian, Ye, et autres
Publié: (2024)
SIaM: Self-Improving Code-Assisted Mathematical Reasoning of Large Language Models
par: Yu, Dian, et autres
Publié: (2024)
par: Yu, Dian, et autres
Publié: (2024)
Iterative Nash Policy Optimization: Aligning LLMs with General Preferences via No-Regret Learning
par: Zhang, Yuheng, et autres
Publié: (2024)
par: Zhang, Yuheng, et autres
Publié: (2024)
Self-Alignment for Factuality: Mitigating Hallucinations in LLMs via Self-Evaluation
par: Zhang, Xiaoying, et autres
Publié: (2024)
par: Zhang, Xiaoying, et autres
Publié: (2024)
LiteSearch: Efficacious Tree Search for LLM
par: Wang, Ante, et autres
Publié: (2024)
par: Wang, Ante, et autres
Publié: (2024)
Collaborative decoding of critical tokens for boosting factuality of large language models
par: Jin, Lifeng, et autres
Publié: (2024)
par: Jin, Lifeng, et autres
Publié: (2024)
Self-Consistency Boosts Calibration for Math Reasoning
par: Wang, Ante, et autres
Publié: (2024)
par: Wang, Ante, et autres
Publié: (2024)
Fine-Grained Self-Endorsement Improves Factuality and Reasoning
par: Wang, Ante, et autres
Publié: (2024)
par: Wang, Ante, et autres
Publié: (2024)
Self-Tuning: Instructing LLMs to Effectively Acquire New Knowledge through Self-Teaching
par: Zhang, Xiaoying, et autres
Publié: (2024)
par: Zhang, Xiaoying, et autres
Publié: (2024)
Improving LLM General Preference Alignment via Optimistic Online Mirror Descent
par: Zhang, Yuheng, et autres
Publié: (2025)
par: Zhang, Yuheng, et autres
Publié: (2025)
Teaching LLMs to Refine with Tools
par: Yu, Dian, et autres
Publié: (2024)
par: Yu, Dian, et autres
Publié: (2024)
Entropy Guided Extrapolative Decoding to Improve Factuality in Large Language Models
par: Das, Souvik, et autres
Publié: (2024)
par: Das, Souvik, et autres
Publié: (2024)
SoTA with Less: MCTS-Guided Sample Selection for Data-Efficient Visual Reasoning Self-Improvement
par: Wang, Xiyao, et autres
Publié: (2025)
par: Wang, Xiyao, et autres
Publié: (2025)
Every Question Has Its Own Value: Reinforcement Learning with Explicit Human Values
par: Yu, Dian, et autres
Publié: (2025)
par: Yu, Dian, et autres
Publié: (2025)
MPS-Prover: Advancing Stepwise Theorem Proving by Multi-Perspective Search and Data Curation
par: Liang, Zhenwen, et autres
Publié: (2025)
par: Liang, Zhenwen, et autres
Publié: (2025)
ReCUT: Balancing Reasoning Length and Accuracy in LLMs via Stepwise Trails and Preference Optimization
par: Jin, Zhensheng, et autres
Publié: (2025)
par: Jin, Zhensheng, et autres
Publié: (2025)
DOTS: Learning to Reason Dynamically in LLMs via Optimal Reasoning Trajectories Search
par: Yue, Murong, et autres
Publié: (2024)
par: Yue, Murong, et autres
Publié: (2024)
Don't Get Lost in the Trees: Streamlining LLM Reasoning by Overcoming Tree Search Exploration Pitfalls
par: Wang, Ante, et autres
Publié: (2025)
par: Wang, Ante, et autres
Publié: (2025)
CLUE: Non-parametric Verification from Experience via Hidden-State Clustering
par: Liang, Zhenwen, et autres
Publié: (2025)
par: Liang, Zhenwen, et autres
Publié: (2025)
A Knowledge Plug-and-Play Test Bed for Open-domain Dialogue Generation
par: Li, Xiangci, et autres
Publié: (2024)
par: Li, Xiangci, et autres
Publié: (2024)
Towards Solving More Challenging IMO Problems via Decoupled Reasoning and Proving
par: Liang, Zhenwen, et autres
Publié: (2025)
par: Liang, Zhenwen, et autres
Publié: (2025)
Crossing the Reward Bridge: Expanding RL with Verifiable Rewards Across Diverse Domains
par: Su, Yi, et autres
Publié: (2025)
par: Su, Yi, et autres
Publié: (2025)
Learning to Build the Environment: Self-Evolving Reasoning RL via Verifiable Environment Synthesis
par: Shi, Yucheng, et autres
Publié: (2026)
par: Shi, Yucheng, et autres
Publié: (2026)
Inconsistent dialogue responses and how to recover from them
par: Zhang, Mian, et autres
Publié: (2024)
par: Zhang, Mian, et autres
Publié: (2024)
Towards Stepwise Domain Knowledge-Driven Reasoning Optimization and Reflection Improvement
par: Liu, Chengyuan, et autres
Publié: (2025)
par: Liu, Chengyuan, et autres
Publié: (2025)
ExACT: Teaching AI Agents to Explore with Reflective-MCTS and Exploratory Learning
par: Yu, Xiao, et autres
Publié: (2024)
par: Yu, Xiao, et autres
Publié: (2024)
Dancing with Critiques: Enhancing LLM Reasoning with Stepwise Natural Language Self-Critique
par: Li, Yansi, et autres
Publié: (2025)
par: Li, Yansi, et autres
Publié: (2025)
Guided Self-Evolving LLMs with Minimal Human Supervision
par: Yu, Wenhao, et autres
Publié: (2025)
par: Yu, Wenhao, et autres
Publié: (2025)
WebEvolver: Enhancing Web Agent Self-Improvement with Coevolving World Model
par: Fang, Tianqing, et autres
Publié: (2025)
par: Fang, Tianqing, et autres
Publié: (2025)
Thoughts Are All Over the Place: On the Underthinking of o1-Like LLMs
par: Wang, Yue, et autres
Publié: (2025)
par: Wang, Yue, et autres
Publié: (2025)
MCTS-EP: Empowering Embodied Planning with Online Preference Optimization
par: Xu, Hang, et autres
Publié: (2025)
par: Xu, Hang, et autres
Publié: (2025)
Do NOT Think That Much for 2+3=? On the Overthinking of o1-Like LLMs
par: Chen, Xingyu, et autres
Publié: (2024)
par: Chen, Xingyu, et autres
Publié: (2024)
Evolving Language Models without Labels: Majority Drives Selection, Novelty Promotes Variation
par: Zhou, Yujun, et autres
Publié: (2025)
par: Zhou, Yujun, et autres
Publié: (2025)
Self-Rewarding Vision-Language Model via Reasoning Decomposition
par: Li, Zongxia, et autres
Publié: (2025)
par: Li, Zongxia, et autres
Publié: (2025)
Enhancing Visual-Language Modality Alignment in Large Vision Language Models via Self-Improvement
par: Wang, Xiyao, et autres
Publié: (2024)
par: Wang, Xiyao, et autres
Publié: (2024)
EconProver: Towards More Economical Test-Time Scaling for Automated Theorem Proving
par: Li, Mukai, et autres
Publié: (2025)
par: Li, Mukai, et autres
Publié: (2025)
Scaling Synthetic Data Creation with 1,000,000,000 Personas
par: Ge, Tao, et autres
Publié: (2024)
par: Ge, Tao, et autres
Publié: (2024)
Dual-Uncertainty Guided Policy Learning for Multimodal Reasoning
par: Liu, Rui, et autres
Publié: (2025)
par: Liu, Rui, et autres
Publié: (2025)
CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models
par: Dai, Runpeng, et autres
Publié: (2025)
par: Dai, Runpeng, et autres
Publié: (2025)
Towards Self-Improvement of Diffusion Models via Group Preference Optimization
par: Chen, Renjie, et autres
Publié: (2025)
par: Chen, Renjie, et autres
Publié: (2025)
Documents similaires
-
Toward Self-Improvement of LLMs via Imagination, Searching, and Criticizing
par: Tian, Ye, et autres
Publié: (2024) -
SIaM: Self-Improving Code-Assisted Mathematical Reasoning of Large Language Models
par: Yu, Dian, et autres
Publié: (2024) -
Iterative Nash Policy Optimization: Aligning LLMs with General Preferences via No-Regret Learning
par: Zhang, Yuheng, et autres
Publié: (2024) -
Self-Alignment for Factuality: Mitigating Hallucinations in LLMs via Self-Evaluation
par: Zhang, Xiaoying, et autres
Publié: (2024) -
LiteSearch: Efficacious Tree Search for LLM
par: Wang, Ante, et autres
Publié: (2024)