MM-Verify: Enhancing Multimodal Reasoning with Chain-of-Thought Verification
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Sun, Linzhuang, Liang, Hao, Wei, Jingxuan, Yu, Bihui, Li, Tianpeng, Yang, Fan, Zhou, Zenan, Zhang, Wentao |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
BEATS: Optimizing LLM Mathematical Capabilities with BackVerify and Adaptive Disambiguate based Efficient Tree Search
von: Sun, Linzhuang, et al.
Veröffentlicht: (2024)
von: Sun, Linzhuang, et al.
Veröffentlicht: (2024)
MathScape: Benchmarking Multimodal Large Language Models in Real-World Mathematical Contexts
von: Liang, Hao, et al.
Veröffentlicht: (2024)
von: Liang, Hao, et al.
Veröffentlicht: (2024)
Efficient-Empathy: Towards Efficient and Effective Selection of Empathy Data
von: Sun, Linzhuang, et al.
Veröffentlicht: (2024)
von: Sun, Linzhuang, et al.
Veröffentlicht: (2024)
Guided Verifier: Collaborative Multimodal Reasoning via Dynamic Process Supervision
von: Sun, Lingzhuang, et al.
Veröffentlicht: (2026)
von: Sun, Lingzhuang, et al.
Veröffentlicht: (2026)
Synth-Empathy: Towards High-Quality Synthetic Empathy Data
von: Liang, Hao, et al.
Veröffentlicht: (2024)
von: Liang, Hao, et al.
Veröffentlicht: (2024)
Retrieval Meets Reasoning: Even High-school Textbook Knowledge Benefits Multimodal Reasoning
von: Tan, Cheng, et al.
Veröffentlicht: (2024)
von: Tan, Cheng, et al.
Veröffentlicht: (2024)
Sentence-Level or Token-Level? A Comprehensive Study on Knowledge Distillation
von: Wei, Jingxuan, et al.
Veröffentlicht: (2024)
von: Wei, Jingxuan, et al.
Veröffentlicht: (2024)
Rethinking Text-to-SQL: Dynamic Multi-turn SQL Interaction for Real-world Database Exploration
von: Sun, Linzhuang, et al.
Veröffentlicht: (2025)
von: Sun, Linzhuang, et al.
Veröffentlicht: (2025)
Skywork R1V: Pioneering Multimodal Reasoning with Chain-of-Thought
von: Peng, Yi, et al.
Veröffentlicht: (2025)
von: Peng, Yi, et al.
Veröffentlicht: (2025)
Canvas-of-Thought: Grounding Reasoning via Mutable Structured States
von: Sun, Lingzhuang, et al.
Veröffentlicht: (2026)
von: Sun, Lingzhuang, et al.
Veröffentlicht: (2026)
LLaVA-NeuMT: Selective Layer-Neuron Modulation for Efficient Multilingual Multimodal Translation
von: Wei, Jingxuan, et al.
Veröffentlicht: (2025)
von: Wei, Jingxuan, et al.
Veröffentlicht: (2025)
MathCanvas: Intrinsic Visual Chain-of-Thought for Multimodal Mathematical Reasoning
von: Shi, Weikang, et al.
Veröffentlicht: (2025)
von: Shi, Weikang, et al.
Veröffentlicht: (2025)
RBF++: Quantifying and Optimizing Reasoning Boundaries across Measurable and Unmeasurable Capabilities for Chain-of-Thought Reasoning
von: Chen, Qiguang, et al.
Veröffentlicht: (2025)
von: Chen, Qiguang, et al.
Veröffentlicht: (2025)
Render-of-Thought: Rendering Textual Chain-of-Thought as Images for Visual Latent Reasoning
von: Wang, Yifan, et al.
Veröffentlicht: (2026)
von: Wang, Yifan, et al.
Veröffentlicht: (2026)
Multimodal Chain-of-Thought Reasoning in Language Models
von: Zhang, Zhuosheng, et al.
Veröffentlicht: (2023)
von: Zhang, Zhuosheng, et al.
Veröffentlicht: (2023)
Uni-cot: Towards Unified Chain-of-Thought Reasoning Across Text and Vision
von: Qin, Luozheng, et al.
Veröffentlicht: (2025)
von: Qin, Luozheng, et al.
Veröffentlicht: (2025)
MM-CoT:A Benchmark for Probing Visual Chain-of-Thought Reasoning in Multimodal Models
von: Zhang, Jusheng, et al.
Veröffentlicht: (2025)
von: Zhang, Jusheng, et al.
Veröffentlicht: (2025)
Visual Thoughts: A Unified Perspective of Understanding Multimodal Chain-of-Thought
von: Cheng, Zihui, et al.
Veröffentlicht: (2025)
von: Cheng, Zihui, et al.
Veröffentlicht: (2025)
ChartReasoner: Code-Driven Modality Bridging for Long-Chain Reasoning in Chart Question Answering
von: Jia, Caijun, et al.
Veröffentlicht: (2025)
von: Jia, Caijun, et al.
Veröffentlicht: (2025)
Cantor: Inspiring Multimodal Chain-of-Thought of MLLM
von: Gao, Timin, et al.
Veröffentlicht: (2024)
von: Gao, Timin, et al.
Veröffentlicht: (2024)
TRACER: Verifiable Generative Provenance for Multimodal Tool-Using Agents
von: Yu, Bihui, et al.
Veröffentlicht: (2026)
von: Yu, Bihui, et al.
Veröffentlicht: (2026)
Chain-of-Thought Compression Should Not Be Blind: V-Skip for Efficient Multimodal Reasoning via Dual-Path Anchoring
von: Zhang, Dongxu, et al.
Veröffentlicht: (2026)
von: Zhang, Dongxu, et al.
Veröffentlicht: (2026)
MM-RLHF: The Next Step Forward in Multimodal LLM Alignment
von: Zhang, Yi-Fan, et al.
Veröffentlicht: (2025)
von: Zhang, Yi-Fan, et al.
Veröffentlicht: (2025)
EndoCoT: Scaling Endogenous Chain-of-Thought Reasoning in Diffusion Models
von: Dai, Xuanlang, et al.
Veröffentlicht: (2026)
von: Dai, Xuanlang, et al.
Veröffentlicht: (2026)
A Survey on Image-text Multimodal Models
von: Guo, Ruifeng, et al.
Veröffentlicht: (2023)
von: Guo, Ruifeng, et al.
Veröffentlicht: (2023)
How RL Unlocks the Aha Moment in Geometric Interleaved Reasoning
von: Zhang, Xiangxiang, et al.
Veröffentlicht: (2026)
von: Zhang, Xiangxiang, et al.
Veröffentlicht: (2026)
Integrating Chain-of-Thought for Multimodal Alignment: A Study on 3D Vision-Language Learning
von: Chen, Yanjun, et al.
Veröffentlicht: (2025)
von: Chen, Yanjun, et al.
Veröffentlicht: (2025)
Visual Chain of Thought: Bridging Logical Gaps with Multimodal Infillings
von: Rose, Daniel, et al.
Veröffentlicht: (2023)
von: Rose, Daniel, et al.
Veröffentlicht: (2023)
Latent Sketchpad: Sketching Visual Thoughts to Elicit Multimodal Reasoning in MLLMs
von: Zhang, Huanyu, et al.
Veröffentlicht: (2025)
von: Zhang, Huanyu, et al.
Veröffentlicht: (2025)
Generative Universal Verifier as Multimodal Meta-Reasoner
von: Zhang, Xinchen, et al.
Veröffentlicht: (2025)
von: Zhang, Xinchen, et al.
Veröffentlicht: (2025)
ReSearch: Learning to Reason with Search for LLMs via Reinforcement Learning
von: Chen, Mingyang, et al.
Veröffentlicht: (2025)
von: Chen, Mingyang, et al.
Veröffentlicht: (2025)
Facilitating Multi-turn Function Calling for LLMs via Compositional Instruction Tuning
von: Chen, Mingyang, et al.
Veröffentlicht: (2024)
von: Chen, Mingyang, et al.
Veröffentlicht: (2024)
MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency
von: Jiang, Dongzhi, et al.
Veröffentlicht: (2025)
von: Jiang, Dongzhi, et al.
Veröffentlicht: (2025)
MemeMind: A Large-Scale Multimodal Dataset with Chain-of-Thought Reasoning for Harmful Meme Detection
von: Gu, Hexiang, et al.
Veröffentlicht: (2025)
von: Gu, Hexiang, et al.
Veröffentlicht: (2025)
AgentThink: A Unified Framework for Tool-Augmented Chain-of-Thought Reasoning in Vision-Language Models for Autonomous Driving
von: Qian, Kangan, et al.
Veröffentlicht: (2025)
von: Qian, Kangan, et al.
Veröffentlicht: (2025)
Emma-X: An Embodied Multimodal Action Model with Grounded Chain of Thought and Look-ahead Spatial Reasoning
von: Sun, Qi, et al.
Veröffentlicht: (2024)
von: Sun, Qi, et al.
Veröffentlicht: (2024)
Multimodal Reasoning for Science: Technical Report and 1st Place Solution to the ICML 2025 SeePhys Challenge
von: Liang, Hao, et al.
Veröffentlicht: (2025)
von: Liang, Hao, et al.
Veröffentlicht: (2025)
Imagine while Reasoning in Space: Multimodal Visualization-of-Thought
von: Li, Chengzu, et al.
Veröffentlicht: (2025)
von: Li, Chengzu, et al.
Veröffentlicht: (2025)
From Answers to Rationales: Self-Aligning Multimodal Reasoning with Answer-Oriented Chain-of-Thought
von: Tan, Wentao, et al.
Veröffentlicht: (2025)
von: Tan, Wentao, et al.
Veröffentlicht: (2025)
ChartMind: A Comprehensive Benchmark for Complex Real-world Multimodal Chart Question Answering
von: Wei, Jingxuan, et al.
Veröffentlicht: (2025)
von: Wei, Jingxuan, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
BEATS: Optimizing LLM Mathematical Capabilities with BackVerify and Adaptive Disambiguate based Efficient Tree Search
von: Sun, Linzhuang, et al.
Veröffentlicht: (2024) -
MathScape: Benchmarking Multimodal Large Language Models in Real-World Mathematical Contexts
von: Liang, Hao, et al.
Veröffentlicht: (2024) -
Efficient-Empathy: Towards Efficient and Effective Selection of Empathy Data
von: Sun, Linzhuang, et al.
Veröffentlicht: (2024) -
Guided Verifier: Collaborative Multimodal Reasoning via Dynamic Process Supervision
von: Sun, Lingzhuang, et al.
Veröffentlicht: (2026) -
Synth-Empathy: Towards High-Quality Synthetic Empathy Data
von: Liang, Hao, et al.
Veröffentlicht: (2024)