Mulberry: Empowering MLLM with o1-like Reasoning and Reflection via Collective Monte Carlo Tree Search
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Yao, Huanjin, Huang, Jiaxing, Wu, Wenhao, Zhang, Jingyi, Wang, Yibo, Liu, Shunyu, Wang, Yingjie, Song, Yuxin, Feng, Haocheng, Shen, Li, Tao, Dacheng |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization
von: Zhang, Jingyi, et al.
Veröffentlicht: (2025)
von: Zhang, Jingyi, et al.
Veröffentlicht: (2025)
R1-ShareVL: Incentivizing Reasoning Capability of Multimodal Large Language Models via Share-GRPO
von: Yao, Huanjin, et al.
Veröffentlicht: (2025)
von: Yao, Huanjin, et al.
Veröffentlicht: (2025)
A Survey on Agentic Multimodal Large Language Models
von: Yao, Huanjin, et al.
Veröffentlicht: (2025)
von: Yao, Huanjin, et al.
Veröffentlicht: (2025)
R1-SyntheticVL: Is Synthetic Data from Generative Models Ready for Multimodal Large Language Model?
von: Zhang, Jingyi, et al.
Veröffentlicht: (2026)
von: Zhang, Jingyi, et al.
Veröffentlicht: (2026)
MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI
von: Yao, Huanjin, et al.
Veröffentlicht: (2025)
von: Yao, Huanjin, et al.
Veröffentlicht: (2025)
MM-DeepResearch: A Simple and Effective Multimodal Agentic Search Baseline
von: Yao, Huanjin, et al.
Veröffentlicht: (2026)
von: Yao, Huanjin, et al.
Veröffentlicht: (2026)
R1-Compress: Long Chain-of-Thought Compression via Chunk Compression and Search
von: Wang, Yibo, et al.
Veröffentlicht: (2025)
von: Wang, Yibo, et al.
Veröffentlicht: (2025)
Panacea: Mitigating Harmful Fine-tuning for Large Language Models via Post-fine-tuning Perturbation
von: Wang, Yibo, et al.
Veröffentlicht: (2025)
von: Wang, Yibo, et al.
Veröffentlicht: (2025)
Multimodal Reasoning Agent for Zero-Shot Composed Image Retrieval
von: Tu, Rong-Cheng, et al.
Veröffentlicht: (2025)
von: Tu, Rong-Cheng, et al.
Veröffentlicht: (2025)
MLLM-Guided VLM Fine-Tuning with Joint Inference for Zero-Shot Composed Image Retrieval
von: Tu, Rong-Cheng, et al.
Veröffentlicht: (2025)
von: Tu, Rong-Cheng, et al.
Veröffentlicht: (2025)
Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning
von: Zhang, Kongcheng, et al.
Veröffentlicht: (2025)
von: Zhang, Kongcheng, et al.
Veröffentlicht: (2025)
Reasoning with Reinforced Functional Token Tuning
von: Zhang, Kongcheng, et al.
Veröffentlicht: (2025)
von: Zhang, Kongcheng, et al.
Veröffentlicht: (2025)
GPT4Vis: What Can GPT-4 Do for Zero-shot Visual Recognition?
von: Wu, Wenhao, et al.
Veröffentlicht: (2023)
von: Wu, Wenhao, et al.
Veröffentlicht: (2023)
SPAZER: Spatial-Semantic Progressive Reasoning Agent for Zero-shot 3D Visual Grounding
von: Jin, Zhao, et al.
Veröffentlicht: (2025)
von: Jin, Zhao, et al.
Veröffentlicht: (2025)
CoVeR: Conformal Calibration for Versatile and Reliable Autoregressive Next-Token Prediction
von: Chen, Yuzhu, et al.
Veröffentlicht: (2025)
von: Chen, Yuzhu, et al.
Veröffentlicht: (2025)
Dynamic Parallel Tree Search for Efficient LLM Reasoning
von: Ding, Yifu, et al.
Veröffentlicht: (2025)
von: Ding, Yifu, et al.
Veröffentlicht: (2025)
VisuoThink: Empowering LVLM Reasoning with Multimodal Tree Search
von: Wang, Yikun, et al.
Veröffentlicht: (2025)
von: Wang, Yikun, et al.
Veröffentlicht: (2025)
VTC-R1: Vision-Text Compression for Efficient Long-Context Reasoning
von: Wang, Yibo, et al.
Veröffentlicht: (2026)
von: Wang, Yibo, et al.
Veröffentlicht: (2026)
VLA-Reasoner: Empowering Vision-Language-Action Models with Reasoning via Online Monte Carlo Tree Search
von: Guo, Wenkai, et al.
Veröffentlicht: (2025)
von: Guo, Wenkai, et al.
Veröffentlicht: (2025)
Towards Efficient Multimodal Unified Reasoning Model via Model Merging
von: Yin, Qixiang, et al.
Veröffentlicht: (2025)
von: Yin, Qixiang, et al.
Veröffentlicht: (2025)
SPAgent: Adaptive Task Decomposition and Model Selection for General Video Generation and Editing
von: Tu, Rong-Cheng, et al.
Veröffentlicht: (2024)
von: Tu, Rong-Cheng, et al.
Veröffentlicht: (2024)
Automated Multi-level Preference for MLLMs
von: Zhang, Mengxi, et al.
Veröffentlicht: (2024)
von: Zhang, Mengxi, et al.
Veröffentlicht: (2024)
VORTA: Efficient Video Diffusion via Routing Sparse Attention
von: Sun, Wenhao, et al.
Veröffentlicht: (2025)
von: Sun, Wenhao, et al.
Veröffentlicht: (2025)
A Simple "Motivation" Can Enhance Reinforcement Finetuning of Large Reasoning Models
von: Zhang, Junjie, et al.
Veröffentlicht: (2025)
von: Zhang, Junjie, et al.
Veröffentlicht: (2025)
Graph-Augmented Reasoning: Evolving Step-by-Step Knowledge Graph Retrieval for LLM Reasoning
von: Wu, Wenjie, et al.
Veröffentlicht: (2025)
von: Wu, Wenjie, et al.
Veröffentlicht: (2025)
Diffusion Model-Based Video Editing: A Survey
von: Sun, Wenhao, et al.
Veröffentlicht: (2024)
von: Sun, Wenhao, et al.
Veröffentlicht: (2024)
BadCLIP++: Stealthy and Persistent Backdoors in Multimodal Contrastive Learning
von: Liang, Siyuan, et al.
Veröffentlicht: (2026)
von: Liang, Siyuan, et al.
Veröffentlicht: (2026)
Dense Connector for MLLMs
von: Yao, Huanjin, et al.
Veröffentlicht: (2024)
von: Yao, Huanjin, et al.
Veröffentlicht: (2024)
MCTS-Reasoning: Monte Carlo Tree Search for LLM Reasoning
von: Towell, Alex
Veröffentlicht: (2026)
von: Towell, Alex
Veröffentlicht: (2026)
GraphScout: Empowering Large Language Models with Intrinsic Exploration Ability for Agentic Graph Reasoning
von: Ying, Yuchen, et al.
Veröffentlicht: (2026)
von: Ying, Yuchen, et al.
Veröffentlicht: (2026)
Conformal tubular parameterization and toroidal bending of tube-like surfaces
von: Yao, Shunyu, et al.
Veröffentlicht: (2026)
von: Yao, Shunyu, et al.
Veröffentlicht: (2026)
Modeling All Response Surfaces in One for Conditional Search Spaces
von: Li, Jiaxing, et al.
Veröffentlicht: (2025)
von: Li, Jiaxing, et al.
Veröffentlicht: (2025)
Interpretable Contrastive Monte Carlo Tree Search Reasoning
von: Gao, Zitian, et al.
Veröffentlicht: (2024)
von: Gao, Zitian, et al.
Veröffentlicht: (2024)
A Theoretical Survey on Foundation Models
von: Fu, Shi, et al.
Veröffentlicht: (2024)
von: Fu, Shi, et al.
Veröffentlicht: (2024)
RTV-Bench: Benchmarking MLLM Continuous Perception, Understanding and Reasoning through Real-Time Video
von: Xun, Shuhang, et al.
Veröffentlicht: (2025)
von: Xun, Shuhang, et al.
Veröffentlicht: (2025)
Co‐Fermentation of Saccharomyces cerevisiae and Lactobacillus plantarum Enhances Mulberry Anthocyanin Stability via Amino Acid–Mediated Co‐Pigmentation Mechanisms
von: Xiang Yin, et al.
Veröffentlicht: (2026)
von: Xiang Yin, et al.
Veröffentlicht: (2026)
AsymRnR: Video Diffusion Transformers Acceleration with Asymmetric Reduction and Restoration
von: Sun, Wenhao, et al.
Veröffentlicht: (2024)
von: Sun, Wenhao, et al.
Veröffentlicht: (2024)
Safety Reasoning with Guidelines
von: Wang, Haoyu, et al.
Veröffentlicht: (2025)
von: Wang, Haoyu, et al.
Veröffentlicht: (2025)
Boosting MLLM Reasoning with Text-Debiased Hint-GRPO
von: Huang, Qihan, et al.
Veröffentlicht: (2025)
von: Huang, Qihan, et al.
Veröffentlicht: (2025)
CoLoGen: Progressive Learning of Concept-Localization Duality for Unified Image Generation
von: Song, YuXin, et al.
Veröffentlicht: (2026)
von: Song, YuXin, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization
von: Zhang, Jingyi, et al.
Veröffentlicht: (2025) -
R1-ShareVL: Incentivizing Reasoning Capability of Multimodal Large Language Models via Share-GRPO
von: Yao, Huanjin, et al.
Veröffentlicht: (2025) -
A Survey on Agentic Multimodal Large Language Models
von: Yao, Huanjin, et al.
Veröffentlicht: (2025) -
R1-SyntheticVL: Is Synthetic Data from Generative Models Ready for Multimodal Large Language Model?
von: Zhang, Jingyi, et al.
Veröffentlicht: (2026) -
MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI
von: Yao, Huanjin, et al.
Veröffentlicht: (2025)