Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Jiang, Huchen, Ma, Yangyang, Ding, Chaofan, Luan, Kexin, Di, Xinhan |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Enhancing Reasoning through Process Supervision with Monte Carlo Tree Search
par: Li, Shuangtao, et autres
Publié: (2025)
par: Li, Shuangtao, et autres
Publié: (2025)
Low-Rank Adaptation with Task-Relevant Feature Enhancement for Fine-tuning Language Models
par: Li, Changqun, et autres
Publié: (2024)
par: Li, Changqun, et autres
Publié: (2024)
Monte Carlo Tree Search Boosts Reasoning via Iterative Preference Learning
par: Xie, Yuxi, et autres
Publié: (2024)
par: Xie, Yuxi, et autres
Publié: (2024)
DeepDubber-V1: Towards High Quality and Dialogue, Narration, Monologue Adaptive Movie Dubbing Via Multi-Modal Chain-of-Thoughts Reasoning Guidance
par: Zheng, Junjie, et autres
Publié: (2025)
par: Zheng, Junjie, et autres
Publié: (2025)
DeepSound-V1: Start to Think Step-by-Step in the Audio Generation from Videos
par: Liang, Yunming, et autres
Publié: (2025)
par: Liang, Yunming, et autres
Publié: (2025)
Enhance Generation Quality of Flow Matching V2A Model via Multi-Step CoT-Like Guidance and Combined Preference Optimization
par: Zhang, Haomin, et autres
Publié: (2025)
par: Zhang, Haomin, et autres
Publié: (2025)
Towards Explaining Monte-Carlo Tree Search by Using Its Enhancements
par: Kowalski, Jakub, et autres
Publié: (2025)
par: Kowalski, Jakub, et autres
Publié: (2025)
Bailing-TTS: Chinese Dialectal Speech Synthesis Towards Human-like Spontaneous Representation
par: Di, Xinhan, et autres
Publié: (2024)
par: Di, Xinhan, et autres
Publié: (2024)
DeepAudio-V1:Towards Multi-Modal Multi-Stage End-to-End Video to Speech and Audio Generation
par: Zhang, Haomin, et autres
Publié: (2025)
par: Zhang, Haomin, et autres
Publié: (2025)
Multiple Consistency-guided Test-Time Adaptation for Contrastive Audio-Language Models with Unlabeled Audio
par: Chen, Gongyu, et autres
Publié: (2024)
par: Chen, Gongyu, et autres
Publié: (2024)
Self-Supervised Learning of Deviation in Latent Representation for Co-speech Gesture Video Generation
par: Yang, Huan, et autres
Publié: (2024)
par: Yang, Huan, et autres
Publié: (2024)
MM-MovieDubber: Towards Multi-Modal Learning for Multi-Modal Movie Dubbing
par: Zheng, Junjie, et autres
Publié: (2025)
par: Zheng, Junjie, et autres
Publié: (2025)
Enhancing Math Reasoning in Small-sized LLMs via Preview Difficulty-Aware Intervention
par: Di, Xinhan, et autres
Publié: (2025)
par: Di, Xinhan, et autres
Publié: (2025)
OCC-MLLM-Alpha:Empowering Multi-modal Large Language Model for the Understanding of Occluded Objects with Self-Supervised Test-Time Learning
par: Yang, Shuxin, et autres
Publié: (2024)
par: Yang, Shuxin, et autres
Publié: (2024)
Boosting LLM Reasoning via Spontaneous Self-Correction
par: Zhao, Xutong, et autres
Publié: (2025)
par: Zhao, Xutong, et autres
Publié: (2025)
MCTS-Reasoning: Monte Carlo Tree Search for LLM Reasoning
par: Towell, Alex
Publié: (2026)
par: Towell, Alex
Publié: (2026)
SWE-Search: Enhancing Software Agents with Monte Carlo Tree Search and Iterative Refinement
par: Antoniades, Antonis, et autres
Publié: (2024)
par: Antoniades, Antonis, et autres
Publié: (2024)
MatRL: Provably Generalizable Iterative Algorithm Discovery via Monte-Carlo Tree Search
par: Kim, Sungyoon, et autres
Publié: (2025)
par: Kim, Sungyoon, et autres
Publié: (2025)
Interpretable Contrastive Monte Carlo Tree Search Reasoning
par: Gao, Zitian, et autres
Publié: (2024)
par: Gao, Zitian, et autres
Publié: (2024)
Towards Video to Piano Music Generation with Chain-of-Perform Support Benchmarks
par: Liu, Chang, et autres
Publié: (2025)
par: Liu, Chang, et autres
Publié: (2025)
LD-LAudio-V1: Video-to-Long-Form-Audio Generation Extension with Dual Lightweight Adapters
par: Zhang, Haomin, et autres
Publié: (2025)
par: Zhang, Haomin, et autres
Publié: (2025)
SRA-MCTS: Self-driven Reasoning Augmentation with Monte Carlo Tree Search for Code Generation
par: Xu, Bin, et autres
Publié: (2024)
par: Xu, Bin, et autres
Publié: (2024)
Preference Construction: A Bayesian Interactive Preference Elicitation Framework Based on Monte Carlo Tree Search
par: Wang, Yan, et autres
Publié: (2025)
par: Wang, Yan, et autres
Publié: (2025)
W2S-AlignTree: Weak-to-Strong Inference-Time Alignment for Large Language Models via Monte Carlo Tree Search
par: Ding, Zhenyu, et autres
Publié: (2025)
par: Ding, Zhenyu, et autres
Publié: (2025)
Toward Template-Free Explainability for Monte Carlo Tree Search
par: Lu, Siqi, et autres
Publié: (2026)
par: Lu, Siqi, et autres
Publié: (2026)
OCC-MLLM-CoT-Alpha: Towards Multi-stage Occlusion Recognition Based on Large Language Models via 3D-Aware Supervision and Chain-of-Thoughts Guidance
par: Wang, Chaoyi, et autres
Publié: (2025)
par: Wang, Chaoyi, et autres
Publié: (2025)
Towards Film-Making Production Dialogue, Narration, Monologue Adaptive Moving Dubbing Benchmarks
par: Wang, Chaoyi, et autres
Publié: (2025)
par: Wang, Chaoyi, et autres
Publié: (2025)
Enhancements for Real-Time Monte-Carlo Tree Search in General Video Game Playing
par: Soemers, Dennis J. N. J., et autres
Publié: (2024)
par: Soemers, Dennis J. N. J., et autres
Publié: (2024)
VLA-Reasoner: Empowering Vision-Language-Action Models with Reasoning via Online Monte Carlo Tree Search
par: Guo, Wenkai, et autres
Publié: (2025)
par: Guo, Wenkai, et autres
Publié: (2025)
Monte Carlo Search Algorithms Discovering Monte Carlo Tree Search Exploration Terms
par: Cazenave, Tristan
Publié: (2024)
par: Cazenave, Tristan
Publié: (2024)
AdverMCTS: Combating Pseudo-Correctness in Code Generation via Adversarial Monte Carlo Tree Search
par: Li, Qingyao, et autres
Publié: (2026)
par: Li, Qingyao, et autres
Publié: (2026)
Towards Full-parameter and Parameter-efficient Self-learning For Endoscopic Camera Depth Estimation
par: Zhao, Shuting, et autres
Publié: (2024)
par: Zhao, Shuting, et autres
Publié: (2024)
Toward Effective Tool-Integrated Reasoning via Self-Evolved Preference Learning
par: Chen, Yifei, et autres
Publié: (2025)
par: Chen, Yifei, et autres
Publié: (2025)
Improving Monte Carlo Tree Search for Symbolic Regression
par: Huang, Zhengyao, et autres
Publié: (2025)
par: Huang, Zhengyao, et autres
Publié: (2025)
Epistemic Monte Carlo Tree Search
par: Oren, Yaniv, et autres
Publié: (2022)
par: Oren, Yaniv, et autres
Publié: (2022)
RISE: Reasoning Enhancement via Iterative Self-Exploration in Multi-hop Question Answering
par: He, Bolei, et autres
Publié: (2025)
par: He, Bolei, et autres
Publié: (2025)
DeepSearch: Overcome the Bottleneck of Reinforcement Learning with Verifiable Rewards via Monte Carlo Tree Search
par: Wu, Fang, et autres
Publié: (2025)
par: Wu, Fang, et autres
Publié: (2025)
History-Guided Iterative Visual Reasoning with Self-Correction
par: Yang, Xinglong, et autres
Publié: (2026)
par: Yang, Xinglong, et autres
Publié: (2026)
Iterative Reasoning Preference Optimization
par: Pang, Richard Yuanzhe, et autres
Publié: (2024)
par: Pang, Richard Yuanzhe, et autres
Publié: (2024)
Intrinsic Self-Correction in LLMs: Towards Explainable Prompting via Mechanistic Interpretability
par: Lee, Yu-Ting, et autres
Publié: (2025)
par: Lee, Yu-Ting, et autres
Publié: (2025)
Documents similaires
-
Enhancing Reasoning through Process Supervision with Monte Carlo Tree Search
par: Li, Shuangtao, et autres
Publié: (2025) -
Low-Rank Adaptation with Task-Relevant Feature Enhancement for Fine-tuning Language Models
par: Li, Changqun, et autres
Publié: (2024) -
Monte Carlo Tree Search Boosts Reasoning via Iterative Preference Learning
par: Xie, Yuxi, et autres
Publié: (2024) -
DeepDubber-V1: Towards High Quality and Dialogue, Narration, Monologue Adaptive Movie Dubbing Via Multi-Modal Chain-of-Thoughts Reasoning Guidance
par: Zheng, Junjie, et autres
Publié: (2025) -
DeepSound-V1: Start to Think Step-by-Step in the Audio Generation from Videos
par: Liang, Yunming, et autres
Publié: (2025)