Exploring the Reasoning Abilities of Multimodal Large Language Models (MLLMs): A Comprehensive Survey on Emerging Trends in Multimodal Reasoning
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Yiqi, Chen, Wentao, Han, Xiaotian, Lin, Xudong, Zhao, Haiteng, Liu, Yongfei, Zhai, Bohan, Yuan, Jianbo, You, Quanzeng, Yang, Hongxia |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
COCO is "ALL'' You Need for Visual Instruction Fine-tuning
di: Han, Xiaotian, et al.
Pubblicazione: (2024)
di: Han, Xiaotian, et al.
Pubblicazione: (2024)
Law of Vision Representation in MLLMs
di: Yang, Shijia, et al.
Pubblicazione: (2024)
di: Yang, Shijia, et al.
Pubblicazione: (2024)
Visual Anchors Are Strong Information Aggregators For Multimodal Large Language Model
di: Liu, Haogeng, et al.
Pubblicazione: (2024)
di: Liu, Haogeng, et al.
Pubblicazione: (2024)
InfiMM-HD: A Leap Forward in High-Resolution Multimodal Understanding
di: Liu, Haogeng, et al.
Pubblicazione: (2024)
di: Liu, Haogeng, et al.
Pubblicazione: (2024)
InfiMM-WebMath-40B: Advancing Multimodal Pre-Training for Enhanced Mathematical Reasoning
di: Han, Xiaotian, et al.
Pubblicazione: (2024)
di: Han, Xiaotian, et al.
Pubblicazione: (2024)
ViTAR: Vision Transformer with Any Resolution
di: Fan, Qihang, et al.
Pubblicazione: (2024)
di: Fan, Qihang, et al.
Pubblicazione: (2024)
Actial: Activate Spatial Reasoning Ability of Multimodal Large Language Models
di: Zhan, Xiaoyu, et al.
Pubblicazione: (2025)
di: Zhan, Xiaoyu, et al.
Pubblicazione: (2025)
Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models
di: Huang, Wenxuan, et al.
Pubblicazione: (2025)
di: Huang, Wenxuan, et al.
Pubblicazione: (2025)
InfiR : Crafting Effective Small Language Models and Multimodal Small Language Models in Reasoning
di: Xie, Congkai, et al.
Pubblicazione: (2025)
di: Xie, Congkai, et al.
Pubblicazione: (2025)
DreamClear: High-Capacity Real-World Image Restoration with Privacy-Safe Dataset Curation
di: Ai, Yuang, et al.
Pubblicazione: (2024)
di: Ai, Yuang, et al.
Pubblicazione: (2024)
Exploring Graph Structure Comprehension Ability of Multimodal Large Language Models: Case Studies
di: Zhong, Zhiqiang, et al.
Pubblicazione: (2024)
di: Zhong, Zhiqiang, et al.
Pubblicazione: (2024)
A Survey of Efficient Reasoning for Large Reasoning Models: Language, Multimodality, and Beyond
di: Qu, Xiaoye, et al.
Pubblicazione: (2025)
di: Qu, Xiaoye, et al.
Pubblicazione: (2025)
Exploring and Evaluating Multimodal Knowledge Reasoning Consistency of Multimodal Large Language Models
di: Jia, Boyu, et al.
Pubblicazione: (2025)
di: Jia, Boyu, et al.
Pubblicazione: (2025)
Infi-MMR: Curriculum-based Unlocking Multimodal Reasoning via Phased Reinforcement Learning in Multimodal Small Language Models
di: Liu, Zeyu, et al.
Pubblicazione: (2025)
di: Liu, Zeyu, et al.
Pubblicazione: (2025)
MLLMReID: Multimodal Large Language Model-based Person Re-identification
di: Yang, Shan, et al.
Pubblicazione: (2024)
di: Yang, Shan, et al.
Pubblicazione: (2024)
Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey
di: Wang, Yaoting, et al.
Pubblicazione: (2025)
di: Wang, Yaoting, et al.
Pubblicazione: (2025)
Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark
di: Cheng, Ziming, et al.
Pubblicazione: (2025)
di: Cheng, Ziming, et al.
Pubblicazione: (2025)
Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization
di: Wang, Weiyun, et al.
Pubblicazione: (2024)
di: Wang, Weiyun, et al.
Pubblicazione: (2024)
Multimodal Large Language Models Meet Multimodal Emotion Recognition and Reasoning: A Survey
di: Shou, Yuntao, et al.
Pubblicazione: (2025)
di: Shou, Yuntao, et al.
Pubblicazione: (2025)
Attribute-Grounded Selective Reasoning for Artwork Emotion Understanding with Multimodal Large Language Models
di: Zhang, Cheng, et al.
Pubblicazione: (2026)
di: Zhang, Cheng, et al.
Pubblicazione: (2026)
MME-Reasoning: A Comprehensive Benchmark for Logical Reasoning in MLLMs
di: Yuan, Jiakang, et al.
Pubblicazione: (2025)
di: Yuan, Jiakang, et al.
Pubblicazione: (2025)
InfiGUI-R1: Advancing Multimodal GUI Agents from Reactive Actors to Deliberative Reasoners
di: Liu, Yuhang, et al.
Pubblicazione: (2025)
di: Liu, Yuhang, et al.
Pubblicazione: (2025)
InfiGUIAgent: A Multimodal Generalist GUI Agent with Native Reasoning and Reflection
di: Liu, Yuhang, et al.
Pubblicazione: (2025)
di: Liu, Yuhang, et al.
Pubblicazione: (2025)
BabelBench: An Omni Benchmark for Code-Driven Analysis of Multimodal and Multistructured Data
di: Wang, Xuwu, et al.
Pubblicazione: (2024)
di: Wang, Xuwu, et al.
Pubblicazione: (2024)
Attention-guided Fine-tuning of Multimodal Large Language Models Improves Chain-of-Thought Reasoning
di: Sinha, Sanchit, et al.
Pubblicazione: (2026)
di: Sinha, Sanchit, et al.
Pubblicazione: (2026)
Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens
di: Chen, Feng, et al.
Pubblicazione: (2024)
di: Chen, Feng, et al.
Pubblicazione: (2024)
Learning Stackable and Skippable LEGO Bricks for Efficient, Reconfigurable, and Variable-Resolution Diffusion Modeling
di: Zheng, Huangjie, et al.
Pubblicazione: (2023)
di: Zheng, Huangjie, et al.
Pubblicazione: (2023)
Distill Visual Chart Reasoning Ability from LLMs to MLLMs
di: He, Wei, et al.
Pubblicazione: (2024)
di: He, Wei, et al.
Pubblicazione: (2024)
Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models
di: Li, Yunxin, et al.
Pubblicazione: (2025)
di: Li, Yunxin, et al.
Pubblicazione: (2025)
Latent Sketchpad: Sketching Visual Thoughts to Elicit Multimodal Reasoning in MLLMs
di: Zhang, Huanyu, et al.
Pubblicazione: (2025)
di: Zhang, Huanyu, et al.
Pubblicazione: (2025)
What MLLMs Learn about When they Learn about Multimodal Reasoning
di: Chung, Jiwan, et al.
Pubblicazione: (2025)
di: Chung, Jiwan, et al.
Pubblicazione: (2025)
Can MLLMs Reason Beyond Language? VisReason: A Comprehensive Benchmark for Vision-Centric Reasoning
di: Guo, Longteng, et al.
Pubblicazione: (2026)
di: Guo, Longteng, et al.
Pubblicazione: (2026)
A Survey on Enhancing Causal Reasoning Ability of Large Language Models
di: Li, Xin, et al.
Pubblicazione: (2025)
di: Li, Xin, et al.
Pubblicazione: (2025)
ORACLE: Optimizing Reasoning Abilities of Large Language Models via Constraint-Led Synthetic Data Elicitation
di: Yang, Zhuojie, et al.
Pubblicazione: (2026)
di: Yang, Zhuojie, et al.
Pubblicazione: (2026)
Social Genome: Grounded Social Reasoning Abilities of Multimodal Models
di: Mathur, Leena, et al.
Pubblicazione: (2025)
di: Mathur, Leena, et al.
Pubblicazione: (2025)
HumanSense: From Multimodal Perception to Empathetic Context-Aware Responses through Reasoning MLLMs
di: Qin, Zheng, et al.
Pubblicazione: (2025)
di: Qin, Zheng, et al.
Pubblicazione: (2025)
Multimodal Reasoning for Science: Technical Report and 1st Place Solution to the ICML 2025 SeePhys Challenge
di: Liang, Hao, et al.
Pubblicazione: (2025)
di: Liang, Hao, et al.
Pubblicazione: (2025)
APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization
di: Hong, Minjie, et al.
Pubblicazione: (2025)
di: Hong, Minjie, et al.
Pubblicazione: (2025)
Tables as Texts or Images: Evaluating the Table Reasoning Ability of LLMs and MLLMs
di: Deng, Naihao, et al.
Pubblicazione: (2024)
di: Deng, Naihao, et al.
Pubblicazione: (2024)
Reinforced MLLM: A Survey on RL-Based Reasoning in Multimodal Large Language Models
di: Zhou, Guanghao, et al.
Pubblicazione: (2025)
di: Zhou, Guanghao, et al.
Pubblicazione: (2025)
Documenti analoghi
-
COCO is "ALL'' You Need for Visual Instruction Fine-tuning
di: Han, Xiaotian, et al.
Pubblicazione: (2024) -
Law of Vision Representation in MLLMs
di: Yang, Shijia, et al.
Pubblicazione: (2024) -
Visual Anchors Are Strong Information Aggregators For Multimodal Large Language Model
di: Liu, Haogeng, et al.
Pubblicazione: (2024) -
InfiMM-HD: A Leap Forward in High-Resolution Multimodal Understanding
di: Liu, Haogeng, et al.
Pubblicazione: (2024) -
InfiMM-WebMath-40B: Advancing Multimodal Pre-Training for Enhanced Mathematical Reasoning
di: Han, Xiaotian, et al.
Pubblicazione: (2024)