Benchmarking Multimodal Mathematical Reasoning with Explicit Visual Dependency
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Zhikai, Sun, Jiashuo, Zhang, Wenqi, Hu, Zhiqiang, Li, Xin, Wang, Fan, Zhao, Deli |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
2.5 Years in Class: A Multimodal Textbook for Vision-Language Pretraining
di: Zhang, Wenqi, et al.
Pubblicazione: (2025)
di: Zhang, Wenqi, et al.
Pubblicazione: (2025)
MMR1: Enhancing Multimodal Reasoning with Variance-Aware Sampling and Open Resources
di: Leng, Sicong, et al.
Pubblicazione: (2025)
di: Leng, Sicong, et al.
Pubblicazione: (2025)
VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding
di: Zhang, Boqiang, et al.
Pubblicazione: (2025)
di: Zhang, Boqiang, et al.
Pubblicazione: (2025)
VTPerception-R1: Enhancing Multimodal Reasoning via Explicit Visual and Textual Perceptual Grounding
di: Ding, Yizhuo, et al.
Pubblicazione: (2025)
di: Ding, Yizhuo, et al.
Pubblicazione: (2025)
CODIS: Benchmarking Context-Dependent Visual Comprehension for Multimodal Large Language Models
di: Luo, Fuwen, et al.
Pubblicazione: (2024)
di: Luo, Fuwen, et al.
Pubblicazione: (2024)
MathCanvas: Intrinsic Visual Chain-of-Thought for Multimodal Mathematical Reasoning
di: Shi, Weikang, et al.
Pubblicazione: (2025)
di: Shi, Weikang, et al.
Pubblicazione: (2025)
Explicit Context Reasoning with Supervision for Visual Tracking
di: Zeng, Fansheng, et al.
Pubblicazione: (2025)
di: Zeng, Fansheng, et al.
Pubblicazione: (2025)
The Role of Visual Modality in Multimodal Mathematical Reasoning: Challenges and Insights
di: Liu, Yufang, et al.
Pubblicazione: (2025)
di: Liu, Yufang, et al.
Pubblicazione: (2025)
Visual Reasoning Tracer: Object-Level Grounded Reasoning Benchmark
di: Yuan, Haobo, et al.
Pubblicazione: (2025)
di: Yuan, Haobo, et al.
Pubblicazione: (2025)
MPBench: A Comprehensive Multimodal Reasoning Benchmark for Process Errors Identification
di: Xu, Zhaopan, et al.
Pubblicazione: (2025)
di: Xu, Zhaopan, et al.
Pubblicazione: (2025)
VERIFY: A Benchmark of Visual Explanation and Reasoning for Investigating Multimodal Reasoning Fidelity
di: Bi, Jing, et al.
Pubblicazione: (2025)
di: Bi, Jing, et al.
Pubblicazione: (2025)
CausalStep: A Benchmark for Explicit Stepwise Causal Reasoning in Videos
di: Li, Xuchen, et al.
Pubblicazione: (2025)
di: Li, Xuchen, et al.
Pubblicazione: (2025)
MM-CoT:A Benchmark for Probing Visual Chain-of-Thought Reasoning in Multimodal Models
di: Zhang, Jusheng, et al.
Pubblicazione: (2025)
di: Zhang, Jusheng, et al.
Pubblicazione: (2025)
RynnEC: Bringing MLLMs into Embodied World
di: Dang, Ronghao, et al.
Pubblicazione: (2025)
di: Dang, Ronghao, et al.
Pubblicazione: (2025)
STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs
di: Li, Zongzhao, et al.
Pubblicazione: (2025)
di: Li, Zongzhao, et al.
Pubblicazione: (2025)
OmniSch: A Multimodal PCB Schematic Benchmark For Structured Diagram Visual Reasoning
di: Lu, Taiting, et al.
Pubblicazione: (2026)
di: Lu, Taiting, et al.
Pubblicazione: (2026)
RVTBench: A Benchmark for Visual Reasoning Tasks
di: Shen, Yiqing, et al.
Pubblicazione: (2025)
di: Shen, Yiqing, et al.
Pubblicazione: (2025)
G$^2$TR: Generation-Guided Visual Token Reduction for Separate-Encoder Unified Multimodal Models
di: Li, Junxian, et al.
Pubblicazione: (2026)
di: Li, Junxian, et al.
Pubblicazione: (2026)
The Curse of Multi-Modalities: Evaluating Hallucinations of Large Multimodal Models across Language, Visual, and Audio
di: Leng, Sicong, et al.
Pubblicazione: (2024)
di: Leng, Sicong, et al.
Pubblicazione: (2024)
VideoMathQA: Benchmarking Mathematical Reasoning via Multimodal Understanding in Videos
di: Rasheed, Hanoona, et al.
Pubblicazione: (2025)
di: Rasheed, Hanoona, et al.
Pubblicazione: (2025)
TAMER: Tree-Aware Transformer for Handwritten Mathematical Expression Recognition
di: Zhu, Jianhua, et al.
Pubblicazione: (2024)
di: Zhu, Jianhua, et al.
Pubblicazione: (2024)
MM-PRM: Enhancing Multimodal Mathematical Reasoning with Scalable Step-Level Supervision
di: Du, Lingxiao, et al.
Pubblicazione: (2025)
di: Du, Lingxiao, et al.
Pubblicazione: (2025)
TableVista: Benchmarking Multimodal Table Reasoning under Visual and Structural Complexity
di: Yang, Zheyuan, et al.
Pubblicazione: (2026)
di: Yang, Zheyuan, et al.
Pubblicazione: (2026)
MoviePuzzle: Visual Narrative Reasoning through Multimodal Order Learning
di: Wang, Jianghui, et al.
Pubblicazione: (2023)
di: Wang, Jianghui, et al.
Pubblicazione: (2023)
Seeing Is Believing? A Benchmark for Multimodal Large Language Models on Visual Illusions and Anomalies
di: Hou, Wenjin, et al.
Pubblicazione: (2026)
di: Hou, Wenjin, et al.
Pubblicazione: (2026)
ViRC: Enhancing Visual Interleaved Mathematical CoT with Reason Chunking
di: Wang, Lihong, et al.
Pubblicazione: (2025)
di: Wang, Lihong, et al.
Pubblicazione: (2025)
Multimodal Mathematical Reasoning Embedded in Aerial Vehicle Imagery: Benchmarking, Analysis, and Exploration
di: Zhou, Yue, et al.
Pubblicazione: (2025)
di: Zhou, Yue, et al.
Pubblicazione: (2025)
Breaking the Memory Barrier: Near Infinite Batch Size Scaling for Contrastive Loss
di: Cheng, Zesen, et al.
Pubblicazione: (2024)
di: Cheng, Zesen, et al.
Pubblicazione: (2024)
MathScape: Benchmarking Multimodal Large Language Models in Real-World Mathematical Contexts
di: Liang, Hao, et al.
Pubblicazione: (2024)
di: Liang, Hao, et al.
Pubblicazione: (2024)
ExpVid: A Benchmark for Experiment Video Understanding & Reasoning
di: Xu, Yicheng, et al.
Pubblicazione: (2025)
di: Xu, Yicheng, et al.
Pubblicazione: (2025)
VisioMath: Benchmarking Figure-based Mathematical Reasoning in LMMs
di: Li, Can, et al.
Pubblicazione: (2025)
di: Li, Can, et al.
Pubblicazione: (2025)
Multimodal Self-Instruct: Synthetic Abstract Image and Visual Reasoning Instruction Using Language Model
di: Zhang, Wenqi, et al.
Pubblicazione: (2024)
di: Zhang, Wenqi, et al.
Pubblicazione: (2024)
When Visualizing is the First Step to Reasoning: MIRA, a Benchmark for Visual Chain-of-Thought
di: Zhou, Yiyang, et al.
Pubblicazione: (2025)
di: Zhou, Yiyang, et al.
Pubblicazione: (2025)
VisAidMath: Benchmarking Visual-Aided Mathematical Reasoning
di: Ma, Jingkun, et al.
Pubblicazione: (2024)
di: Ma, Jingkun, et al.
Pubblicazione: (2024)
Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark
di: Hu, Jinpeng, et al.
Pubblicazione: (2025)
di: Hu, Jinpeng, et al.
Pubblicazione: (2025)
Crab: A Unified Audio-Visual Scene Understanding Model with Explicit Cooperation
di: Du, Henghui, et al.
Pubblicazione: (2025)
di: Du, Henghui, et al.
Pubblicazione: (2025)
VisualTrans: A Benchmark for Real-World Visual Transformation Reasoning
di: Ji, Yuheng, et al.
Pubblicazione: (2025)
di: Ji, Yuheng, et al.
Pubblicazione: (2025)
Explicit Visual Prompts for Visual Object Tracking
di: Shi, Liangtao, et al.
Pubblicazione: (2024)
di: Shi, Liangtao, et al.
Pubblicazione: (2024)
LogicVista: Multimodal LLM Logical Reasoning Benchmark in Visual Contexts
di: Xiao, Yijia, et al.
Pubblicazione: (2024)
di: Xiao, Yijia, et al.
Pubblicazione: (2024)
DUALVISION: RGB-Infrared Multimodal Large Language Models for Robust Visual Reasoning
di: Majeedi, Abrar, et al.
Pubblicazione: (2026)
di: Majeedi, Abrar, et al.
Pubblicazione: (2026)
Documenti analoghi
-
2.5 Years in Class: A Multimodal Textbook for Vision-Language Pretraining
di: Zhang, Wenqi, et al.
Pubblicazione: (2025) -
MMR1: Enhancing Multimodal Reasoning with Variance-Aware Sampling and Open Resources
di: Leng, Sicong, et al.
Pubblicazione: (2025) -
VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding
di: Zhang, Boqiang, et al.
Pubblicazione: (2025) -
VTPerception-R1: Enhancing Multimodal Reasoning via Explicit Visual and Textual Perceptual Grounding
di: Ding, Yizhuo, et al.
Pubblicazione: (2025) -
CODIS: Benchmarking Context-Dependent Visual Comprehension for Multimodal Large Language Models
di: Luo, Fuwen, et al.
Pubblicazione: (2024)