CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Cheng, Zihui, Chen, Qiguang, Zhang, Jin, Fei, Hao, Feng, Xiaocheng, Che, Wanxiang, Li, Min, Qin, Libo |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
M$^3$CoT: A Novel Benchmark for Multi-Domain Multi-step Multi-modal Chain-of-Thought
por: Chen, Qiguang, et al.
Publicado: (2024)
por: Chen, Qiguang, et al.
Publicado: (2024)
ViTCoT: Video-Text Interleaved Chain-of-Thought for Boosting Video Understanding in Large Language Models
por: Zhang, Yongheng, et al.
Publicado: (2025)
por: Zhang, Yongheng, et al.
Publicado: (2025)
AutoCAP: Towards Automatic Cross-lingual Alignment Planning for Zero-shot Chain-of-Thought
por: Zhang, Yongheng, et al.
Publicado: (2024)
por: Zhang, Yongheng, et al.
Publicado: (2024)
Unlocking the Capabilities of Thought: A Reasoning Boundary Framework to Quantify and Optimize Chain-of-Thought
por: Chen, Qiguang, et al.
Publicado: (2024)
por: Chen, Qiguang, et al.
Publicado: (2024)
Visual Thoughts: A Unified Perspective of Understanding Multimodal Chain-of-Thought
por: Cheng, Zihui, et al.
Publicado: (2025)
por: Cheng, Zihui, et al.
Publicado: (2025)
CoMT: Chain-of-Medical-Thought Reduces Hallucination in Medical Report Generation
por: Jiang, Yue, et al.
Publicado: (2024)
por: Jiang, Yue, et al.
Publicado: (2024)
MPCC: A Novel Benchmark for Multimodal Planning with Complex Constraints in Multimodal Large Language Models
por: Ji, Yiyan, et al.
Publicado: (2025)
por: Ji, Yiyan, et al.
Publicado: (2025)
What Factors Affect Multi-Modal In-Context Learning? An In-Depth Exploration
por: Qin, Libo, et al.
Publicado: (2024)
por: Qin, Libo, et al.
Publicado: (2024)
OMIBench: Benchmarking Olympiad-Level Multi-Image Reasoning in Large Vision-Language Model
por: Chen, Qiguang, et al.
Publicado: (2026)
por: Chen, Qiguang, et al.
Publicado: (2026)
RBF++: Quantifying and Optimizing Reasoning Boundaries across Measurable and Unmeasurable Capabilities for Chain-of-Thought Reasoning
por: Chen, Qiguang, et al.
Publicado: (2025)
por: Chen, Qiguang, et al.
Publicado: (2025)
Towards Reasoning Era: A Survey of Long Chain-of-Thought for Reasoning Large Language Models
por: Chen, Qiguang, et al.
Publicado: (2025)
por: Chen, Qiguang, et al.
Publicado: (2025)
Beyond Surface Reasoning: Unveiling the True Long Chain-of-Thought Capacity of Diffusion Large Language Models
por: Chen, Qiguang, et al.
Publicado: (2025)
por: Chen, Qiguang, et al.
Publicado: (2025)
Large Language Models Meet NLP: A Survey
por: Qin, Libo, et al.
Publicado: (2024)
por: Qin, Libo, et al.
Publicado: (2024)
CCHall: A Novel Benchmark for Joint Cross-Lingual and Cross-Modal Hallucinations Detection in Large Language Models
por: Zhang, Yongheng, et al.
Publicado: (2025)
por: Zhang, Yongheng, et al.
Publicado: (2025)
The Molecular Structure of Thought: Mapping the Topology of Long Chain-of-Thought Reasoning
por: Chen, Qiguang, et al.
Publicado: (2026)
por: Chen, Qiguang, et al.
Publicado: (2026)
MLDebugging: Towards Benchmarking Code Debugging Across Multi-Library Scenarios
por: Huang, Jinyang, et al.
Publicado: (2025)
por: Huang, Jinyang, et al.
Publicado: (2025)
Multilingual Large Language Model: A Survey of Resources, Taxonomy and Frontiers
por: Qin, Libo, et al.
Publicado: (2024)
por: Qin, Libo, et al.
Publicado: (2024)
Exploring Multi-Grained Concept Annotations for Multimodal Large Language Models
por: Xu, Xiao, et al.
Publicado: (2024)
por: Xu, Xiao, et al.
Publicado: (2024)
Aware First, Think Less: Dynamic Boundary Self-Awareness Drives Extreme Reasoning Efficiency in Large Language Models
por: Chen, Qiguang, et al.
Publicado: (2025)
por: Chen, Qiguang, et al.
Publicado: (2025)
Electronic Circuit Principles of Large Language Models
por: Chen, Qiguang, et al.
Publicado: (2025)
por: Chen, Qiguang, et al.
Publicado: (2025)
Let's Think with Images Efficiently! An Interleaved-Modal Chain-of-Thought Reasoning Framework with Dynamic and Precise Visual Thoughts
por: Liu, Xu, et al.
Publicado: (2026)
por: Liu, Xu, et al.
Publicado: (2026)
Improving Language Model Reasoning with Self-motivated Learning
por: Feng, Yunlong, et al.
Publicado: (2024)
por: Feng, Yunlong, et al.
Publicado: (2024)
Beware of Reasoning Overconfidence: Pitfalls in the Reasoning Process for Multi-solution Tasks
por: Guan, Jiannan, et al.
Publicado: (2025)
por: Guan, Jiannan, et al.
Publicado: (2025)
Less Languages, Less Tokens: An Efficient Unified Logic Cross-lingual Chain-of-Thought Reasoning Framework
por: Zhang, Chenyuan, et al.
Publicado: (2026)
por: Zhang, Chenyuan, et al.
Publicado: (2026)
CroPrompt: Cross-task Interactive Prompting for Zero-shot Spoken Language Understanding
por: Qin, Libo, et al.
Publicado: (2024)
por: Qin, Libo, et al.
Publicado: (2024)
Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs
por: Xu, Xiao, et al.
Publicado: (2025)
por: Xu, Xiao, et al.
Publicado: (2025)
Retrieval-augmented Multi-modal Chain-of-Thoughts Reasoning for Large Language Models
por: Liu, Bingshuai, et al.
Publicado: (2023)
por: Liu, Bingshuai, et al.
Publicado: (2023)
Boosting Multi-modal Keyphrase Prediction with Dynamic Chain-of-Thought in Vision-Language Models
por: Ma, Qihang, et al.
Publicado: (2025)
por: Ma, Qihang, et al.
Publicado: (2025)
ESAinsTOD: A Unified End-to-End Schema-Aware Instruction-Tuning Framework for Task-Oriented Dialog Modeling
por: Teng, Dechuan, et al.
Publicado: (2026)
por: Teng, Dechuan, et al.
Publicado: (2026)
A Two-Stage Framework with Self-Supervised Distillation For Cross-Domain Text Classification
por: Feng, Yunlong, et al.
Publicado: (2023)
por: Feng, Yunlong, et al.
Publicado: (2023)
Pro-HAN: A Heterogeneous Graph Attention Network for Profile-Based Spoken Language Understanding
por: Teng, Dechuan, et al.
Publicado: (2024)
por: Teng, Dechuan, et al.
Publicado: (2024)
Wrong-of-Thought: An Integrated Reasoning Framework with Multi-Perspective Verification and Wrong Information
por: Zhang, Yongheng, et al.
Publicado: (2024)
por: Zhang, Yongheng, et al.
Publicado: (2024)
Python is Not Always the Best Choice: Embracing Multilingual Program of Thoughts
por: Luo, Xianzhen, et al.
Publicado: (2024)
por: Luo, Xianzhen, et al.
Publicado: (2024)
What are the Essential Factors in Crafting Effective Long Context Multi-Hop Instruction Datasets? Insights and Best Practices
por: Chen, Zhi, et al.
Publicado: (2024)
por: Chen, Zhi, et al.
Publicado: (2024)
CVLUE: A New Benchmark Dataset for Chinese Vision-Language Understanding Evaluation
por: Wang, Yuxuan, et al.
Publicado: (2024)
por: Wang, Yuxuan, et al.
Publicado: (2024)
Learning the Boundary of Solvability: Aligning LLMs to Detect Unsolvable Problems
por: Peng, Dengyun, et al.
Publicado: (2025)
por: Peng, Dengyun, et al.
Publicado: (2025)
Bounds of Chain-of-Thought Robustness: Reasoning Steps, Embed Norms, and Beyond
por: Wang, Dingzirui, et al.
Publicado: (2025)
por: Wang, Dingzirui, et al.
Publicado: (2025)
MCoT-MVS: Multi-level Vision Selection by Multi-modal Chain-of-Thought Reasoning for Composed Image Retrieval
por: Ge, Xuri, et al.
Publicado: (2026)
por: Ge, Xuri, et al.
Publicado: (2026)
MMLongCite: A Benchmark for Evaluating Fidelity of Long-Context Vision-Language Models
por: Zhou, Keyan, et al.
Publicado: (2025)
por: Zhou, Keyan, et al.
Publicado: (2025)
Dynamic Chain-of-Thought: Towards Adaptive Deep Reasoning
por: Wang, Libo
Publicado: (2025)
por: Wang, Libo
Publicado: (2025)
Ejemplares similares
-
M$^3$CoT: A Novel Benchmark for Multi-Domain Multi-step Multi-modal Chain-of-Thought
por: Chen, Qiguang, et al.
Publicado: (2024) -
ViTCoT: Video-Text Interleaved Chain-of-Thought for Boosting Video Understanding in Large Language Models
por: Zhang, Yongheng, et al.
Publicado: (2025) -
AutoCAP: Towards Automatic Cross-lingual Alignment Planning for Zero-shot Chain-of-Thought
por: Zhang, Yongheng, et al.
Publicado: (2024) -
Unlocking the Capabilities of Thought: A Reasoning Boundary Framework to Quantify and Optimize Chain-of-Thought
por: Chen, Qiguang, et al.
Publicado: (2024) -
Visual Thoughts: A Unified Perspective of Understanding Multimodal Chain-of-Thought
por: Cheng, Zihui, et al.
Publicado: (2025)