MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency
Fuente:
arXiv
Salvato in:
| Autori principali: | Jiang, Dongzhi, Zhang, Renrui, Guo, Ziyu, Li, Yanwei, Qi, Yu, Chen, Xinyan, Wang, Liuhui, Jin, Jianhan, Guo, Claire, Yan, Shen, Zhang, Bo, Fu, Chaoyou, Gao, Peng, Li, Hongsheng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MINT-CoT: Enabling Interleaved Visual Tokens in Mathematical Chain-of-Thought Reasoning
di: Chen, Xinyan, et al.
Pubblicazione: (2025)
di: Chen, Xinyan, et al.
Pubblicazione: (2025)
Are Video Models Ready as Zero-Shot Reasoners? An Empirical Study with the MME-CoF Benchmark
di: Guo, Ziyu, et al.
Pubblicazione: (2025)
di: Guo, Ziyu, et al.
Pubblicazione: (2025)
DraCo: Draft as CoT for Text-to-Image Preview and Rare Concept Generation
di: Jiang, Dongzhi, et al.
Pubblicazione: (2025)
di: Jiang, Dongzhi, et al.
Pubblicazione: (2025)
T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT
di: Jiang, Dongzhi, et al.
Pubblicazione: (2025)
di: Jiang, Dongzhi, et al.
Pubblicazione: (2025)
MME-Reasoning: A Comprehensive Benchmark for Logical Reasoning in MLLMs
di: Yuan, Jiakang, et al.
Pubblicazione: (2025)
di: Yuan, Jiakang, et al.
Pubblicazione: (2025)
Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO
di: Tong, Chengzhuo, et al.
Pubblicazione: (2025)
di: Tong, Chengzhuo, et al.
Pubblicazione: (2025)
MME-Finance: A Multimodal Finance Benchmark for Expert-level Understanding and Reasoning
di: Gan, Ziliang, et al.
Pubblicazione: (2024)
di: Gan, Ziliang, et al.
Pubblicazione: (2024)
MME-CoF-Pro: Evaluating Reasoning Coherence in Video Generative Models with Text and Visual Hints
di: Qi, Yu, et al.
Pubblicazione: (2026)
di: Qi, Yu, et al.
Pubblicazione: (2026)
Visual CoT: Advancing Multi-Modal Language Models with a Comprehensive Dataset and Benchmark for Chain-of-Thought Reasoning
di: Shao, Hao, et al.
Pubblicazione: (2024)
di: Shao, Hao, et al.
Pubblicazione: (2024)
KAM-CoT: Knowledge Augmented Multimodal Chain-of-Thoughts Reasoning
di: Mondal, Debjyoti, et al.
Pubblicazione: (2024)
di: Mondal, Debjyoti, et al.
Pubblicazione: (2024)
AIM-CoT: Active Information-driven Multimodal Chain-of-Thought for Vision-Language Reasoning
di: Li, Xiping, et al.
Pubblicazione: (2025)
di: Li, Xiping, et al.
Pubblicazione: (2025)
CoT-Evo: Evolutionary Distillation of Chain-of-Thought for Scientific Reasoning
di: Feng, Kehua, et al.
Pubblicazione: (2025)
di: Feng, Kehua, et al.
Pubblicazione: (2025)
Can We Generate Images with CoT? Let's Verify and Reinforce Image Generation Step by Step
di: Guo, Ziyu, et al.
Pubblicazione: (2025)
di: Guo, Ziyu, et al.
Pubblicazione: (2025)
MMSearch: Benchmarking the Potential of Large Models as Multi-modal Search Engines
di: Jiang, Dongzhi, et al.
Pubblicazione: (2024)
di: Jiang, Dongzhi, et al.
Pubblicazione: (2024)
Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis
di: Fu, Chaoyou, et al.
Pubblicazione: (2024)
di: Fu, Chaoyou, et al.
Pubblicazione: (2024)
MME-Unify: A Comprehensive Benchmark for Unified Multimodal Understanding and Generation Models
di: Xie, Wulin, et al.
Pubblicazione: (2025)
di: Xie, Wulin, et al.
Pubblicazione: (2025)
CoT-BERT: Enhancing Unsupervised Sentence Representation through Chain-of-Thought
di: Zhang, Bowen, et al.
Pubblicazione: (2023)
di: Zhang, Bowen, et al.
Pubblicazione: (2023)
The Curse of CoT: On the Limitations of Chain-of-Thought in In-Context Learning
di: Zheng, Tianshi, et al.
Pubblicazione: (2025)
di: Zheng, Tianshi, et al.
Pubblicazione: (2025)
MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models
di: Fu, Chaoyou, et al.
Pubblicazione: (2023)
di: Fu, Chaoyou, et al.
Pubblicazione: (2023)
MME-Emotion: A Holistic Evaluation Benchmark for Emotional Intelligence in Multimodal Large Language Models
di: Zhang, Fan, et al.
Pubblicazione: (2025)
di: Zhang, Fan, et al.
Pubblicazione: (2025)
ImageGen-CoT: Enhancing Text-to-Image In-context Learning with Chain-of-Thought Reasoning
di: Liao, Jiaqi, et al.
Pubblicazione: (2025)
di: Liao, Jiaqi, et al.
Pubblicazione: (2025)
Co-CoT: A Prompt-Based Framework for Collaborative Chain-of-Thought Reasoning
di: Yoo, Seunghyun
Pubblicazione: (2025)
di: Yoo, Seunghyun
Pubblicazione: (2025)
S3-CoT: Self-Sampled Succinct Reasoning Enables Efficient Chain-of-Thought LLMs
di: Du, Yanrui, et al.
Pubblicazione: (2026)
di: Du, Yanrui, et al.
Pubblicazione: (2026)
CoT-RVS: Zero-Shot Chain-of-Thought Reasoning Segmentation for Videos
di: Kao, Shiu-hong, et al.
Pubblicazione: (2025)
di: Kao, Shiu-hong, et al.
Pubblicazione: (2025)
CoT-Seg: Rethinking Segmentation with Chain-of-Thought Reasoning and Self-Correction
di: Kao, Shiu-hong, et al.
Pubblicazione: (2026)
di: Kao, Shiu-hong, et al.
Pubblicazione: (2026)
CoMat: Aligning Text-to-Image Diffusion Model with Image-to-Text Concept Matching
di: Jiang, Dongzhi, et al.
Pubblicazione: (2024)
di: Jiang, Dongzhi, et al.
Pubblicazione: (2024)
MME-Survey: A Comprehensive Survey on Evaluation of Multimodal LLMs
di: Fu, Chaoyou, et al.
Pubblicazione: (2024)
di: Fu, Chaoyou, et al.
Pubblicazione: (2024)
SIM-CoT: Supervised Implicit Chain-of-Thought
di: Wei, Xilin, et al.
Pubblicazione: (2025)
di: Wei, Xilin, et al.
Pubblicazione: (2025)
CoT-RAG: Integrating Chain of Thought and Retrieval-Augmented Generation to Enhance Reasoning in Large Language Models
di: Li, Feiyang, et al.
Pubblicazione: (2025)
di: Li, Feiyang, et al.
Pubblicazione: (2025)
Cantor: Inspiring Multimodal Chain-of-Thought of MLLM
di: Gao, Timin, et al.
Pubblicazione: (2024)
di: Gao, Timin, et al.
Pubblicazione: (2024)
CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action Models
di: Zhao, Qingqing, et al.
Pubblicazione: (2025)
di: Zhao, Qingqing, et al.
Pubblicazione: (2025)
CoT-UQ: Improving Response-wise Uncertainty Quantification in LLMs with Chain-of-Thought
di: Zhang, Boxuan, et al.
Pubblicazione: (2025)
di: Zhang, Boxuan, et al.
Pubblicazione: (2025)
Video-Skill-CoT: Skill-based Chain-of-Thoughts for Domain-Adaptive Video Reasoning
di: Lee, Daeun, et al.
Pubblicazione: (2025)
di: Lee, Daeun, et al.
Pubblicazione: (2025)
MM-CoT:A Benchmark for Probing Visual Chain-of-Thought Reasoning in Multimodal Models
di: Zhang, Jusheng, et al.
Pubblicazione: (2025)
di: Zhang, Jusheng, et al.
Pubblicazione: (2025)
ERA-CoT: Improving Chain-of-Thought through Entity Relationship Analysis
di: Liu, Yanming, et al.
Pubblicazione: (2024)
di: Liu, Yanming, et al.
Pubblicazione: (2024)
Multimodal Chain-of-Thought Reasoning in Language Models
di: Zhang, Zhuosheng, et al.
Pubblicazione: (2023)
di: Zhang, Zhuosheng, et al.
Pubblicazione: (2023)
M3Hop-CoT: Misogynous Meme Identification with Multimodal Multi-hop Chain-of-Thought
di: Kumari, Gitanjali, et al.
Pubblicazione: (2024)
di: Kumari, Gitanjali, et al.
Pubblicazione: (2024)
L2V-CoT: Cross-Modal Transfer of Chain-of-Thought Reasoning via Latent Intervention
di: Zhan, Yuliang, et al.
Pubblicazione: (2025)
di: Zhan, Yuliang, et al.
Pubblicazione: (2025)
M$^3$CoT: A Novel Benchmark for Multi-Domain Multi-step Multi-modal Chain-of-Thought
di: Chen, Qiguang, et al.
Pubblicazione: (2024)
di: Chen, Qiguang, et al.
Pubblicazione: (2024)
CoT-Valve: Length-Compressible Chain-of-Thought Tuning
di: Ma, Xinyin, et al.
Pubblicazione: (2025)
di: Ma, Xinyin, et al.
Pubblicazione: (2025)
Documenti analoghi
-
MINT-CoT: Enabling Interleaved Visual Tokens in Mathematical Chain-of-Thought Reasoning
di: Chen, Xinyan, et al.
Pubblicazione: (2025) -
Are Video Models Ready as Zero-Shot Reasoners? An Empirical Study with the MME-CoF Benchmark
di: Guo, Ziyu, et al.
Pubblicazione: (2025) -
DraCo: Draft as CoT for Text-to-Image Preview and Rare Concept Generation
di: Jiang, Dongzhi, et al.
Pubblicazione: (2025) -
T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT
di: Jiang, Dongzhi, et al.
Pubblicazione: (2025) -
MME-Reasoning: A Comprehensive Benchmark for Logical Reasoning in MLLMs
di: Yuan, Jiakang, et al.
Pubblicazione: (2025)