MV-MATH: Evaluating Multimodal Math Reasoning in Multi-Visual Contexts
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Wang, Peijie, Li, Zhong-Zhi, Yin, Fei, Yang, Xin, Ran, Dekang, Liu, Cheng-Lin |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
SOLIDGEO: Measuring Multimodal Spatial Math Reasoning in Solid Geometry
von: Wang, Peijie, et al.
Veröffentlicht: (2025)
von: Wang, Peijie, et al.
Veröffentlicht: (2025)
MATH-Perturb: Benchmarking LLMs' Math Reasoning Abilities against Hard Perturbations
von: Huang, Kaixuan, et al.
Veröffentlicht: (2025)
von: Huang, Kaixuan, et al.
Veröffentlicht: (2025)
VAR-MATH: Probing True Mathematical Reasoning in LLMS via Symbolic Multi-Instance Benchmarks
von: Yao, Jian, et al.
Veröffentlicht: (2025)
von: Yao, Jian, et al.
Veröffentlicht: (2025)
M$^3$-ACE: Rectifying Visual Perception in Multimodal Math Reasoning via Multi-Agentic Context Engineering
von: Xie, Peijin, et al.
Veröffentlicht: (2026)
von: Xie, Peijin, et al.
Veröffentlicht: (2026)
CMMaTH: A Chinese Multi-modal Math Skill Evaluation Benchmark for Foundation Models
von: Li, Zhong-Zhi, et al.
Veröffentlicht: (2024)
von: Li, Zhong-Zhi, et al.
Veröffentlicht: (2024)
MultiMath: Bridging Visual and Mathematical Reasoning for Large Language Models
von: Peng, Shuai, et al.
Veröffentlicht: (2024)
von: Peng, Shuai, et al.
Veröffentlicht: (2024)
MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts
von: Lu, Pan, et al.
Veröffentlicht: (2023)
von: Lu, Pan, et al.
Veröffentlicht: (2023)
Measuring Multimodal Mathematical Reasoning with MATH-Vision Dataset
von: Wang, Ke, et al.
Veröffentlicht: (2024)
von: Wang, Ke, et al.
Veröffentlicht: (2024)
Fuse, Reason and Verify: Geometry Problem Solving with Parsed Clauses from Diagram
von: Zhang, Ming-Liang, et al.
Veröffentlicht: (2024)
von: Zhang, Ming-Liang, et al.
Veröffentlicht: (2024)
FormalMATH: Benchmarking Formal Mathematical Reasoning of Large Language Models
von: Yu, Zhouliang, et al.
Veröffentlicht: (2025)
von: Yu, Zhouliang, et al.
Veröffentlicht: (2025)
InfinityMATH: A Scalable Instruction Tuning Dataset in Programmatic Mathematical Reasoning
von: Zhang, Bo-Wen, et al.
Veröffentlicht: (2024)
von: Zhang, Bo-Wen, et al.
Veröffentlicht: (2024)
TabularMath: Understanding Math Reasoning over Tables with Large Language Models
von: Tian, Shi-Yu, et al.
Veröffentlicht: (2025)
von: Tian, Shi-Yu, et al.
Veröffentlicht: (2025)
MMCL-Bench: Multimodal Context Learning from Visual Rules, Procedures, and Evidence
von: Chen, Yifan, et al.
Veröffentlicht: (2026)
von: Chen, Yifan, et al.
Veröffentlicht: (2026)
LongDocURL: a Comprehensive Multimodal Long Document Benchmark Integrating Understanding, Reasoning, and Locating
von: Deng, Chao, et al.
Veröffentlicht: (2024)
von: Deng, Chao, et al.
Veröffentlicht: (2024)
Neuro-Symbolic Data Generation for Math Reasoning
von: Li, Zenan, et al.
Veröffentlicht: (2024)
von: Li, Zenan, et al.
Veröffentlicht: (2024)
Integrating Visual Interpretation and Linguistic Reasoning for Math Problem Solving
von: Guo, Zixian, et al.
Veröffentlicht: (2025)
von: Guo, Zixian, et al.
Veröffentlicht: (2025)
UTMath: Math Evaluation with Unit Test via Reasoning-to-Coding Thoughts
von: Yang, Bo, et al.
Veröffentlicht: (2024)
von: Yang, Bo, et al.
Veröffentlicht: (2024)
Nemotron-Math: Efficient Long-Context Distillation of Mathematical Reasoning from Multi-Mode Supervision
von: Du, Wei, et al.
Veröffentlicht: (2025)
von: Du, Wei, et al.
Veröffentlicht: (2025)
EvolMathEval: Towards Evolvable Benchmarks for Mathematical Reasoning via Evolutionary Testing
von: Wang, Shengbo, et al.
Veröffentlicht: (2025)
von: Wang, Shengbo, et al.
Veröffentlicht: (2025)
A Compute-Matched Re-Evaluation of TroVE on MATH
von: Sesterhenn, Tobias, et al.
Veröffentlicht: (2025)
von: Sesterhenn, Tobias, et al.
Veröffentlicht: (2025)
AgenticMath: Enhancing LLM Reasoning via Agentic-based Math Data Generation
von: Liu, Xianyang, et al.
Veröffentlicht: (2025)
von: Liu, Xianyang, et al.
Veröffentlicht: (2025)
Do Multimodal Language Models Really Understand Direction? A Benchmark for Compass Direction Reasoning
von: Yin, Hang, et al.
Veröffentlicht: (2024)
von: Yin, Hang, et al.
Veröffentlicht: (2024)
MuMath-Code: Combining Tool-Use Large Language Models with Multi-perspective Data Augmentation for Mathematical Reasoning
von: Yin, Shuo, et al.
Veröffentlicht: (2024)
von: Yin, Shuo, et al.
Veröffentlicht: (2024)
MMCR: Advancing Visual Language Model in Multimodal Multi-Turn Contextual Reasoning
von: Yan, Dawei, et al.
Veröffentlicht: (2025)
von: Yan, Dawei, et al.
Veröffentlicht: (2025)
Multimodal Agricultural Agent Architecture (MA3): A New Paradigm for Intelligent Agricultural Decision-Making
von: Xu, Zhuoning, et al.
Veröffentlicht: (2025)
von: Xu, Zhuoning, et al.
Veröffentlicht: (2025)
ChemVTS-Bench: Evaluating Visual-Textual-Symbolic Reasoning of Multimodal Large Language Models in Chemistry
von: Huang, Zhiyuan, et al.
Veröffentlicht: (2025)
von: Huang, Zhiyuan, et al.
Veröffentlicht: (2025)
LANS: A Layout-Aware Neural Solver for Plane Geometry Problem
von: Li, Zhong-Zhi, et al.
Veröffentlicht: (2023)
von: Li, Zhong-Zhi, et al.
Veröffentlicht: (2023)
MARGE: Improving Math Reasoning for LLMs with Guided Exploration
von: Gao, Jingyue, et al.
Veröffentlicht: (2025)
von: Gao, Jingyue, et al.
Veröffentlicht: (2025)
We-Math 2.0: A Versatile MathBook System for Incentivizing Visual Mathematical Reasoning
von: Qiao, Runqi, et al.
Veröffentlicht: (2025)
von: Qiao, Runqi, et al.
Veröffentlicht: (2025)
Multi-tool Integration Application for Math Reasoning Using Large Language Model
von: Duan, Zhihua, et al.
Veröffentlicht: (2024)
von: Duan, Zhihua, et al.
Veröffentlicht: (2024)
U-MATH: A University-Level Benchmark for Evaluating Mathematical Skills in LLMs
von: Chernyshev, Konstantin, et al.
Veröffentlicht: (2024)
von: Chernyshev, Konstantin, et al.
Veröffentlicht: (2024)
Pessimistic Verification for Open Ended Math Questions
von: Huang, Yanxing, et al.
Veröffentlicht: (2025)
von: Huang, Yanxing, et al.
Veröffentlicht: (2025)
Skywork-Math: Data Scaling Laws for Mathematical Reasoning in Large Language Models -- The Story Goes On
von: Zeng, Liang, et al.
Veröffentlicht: (2024)
von: Zeng, Liang, et al.
Veröffentlicht: (2024)
FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI
von: Glazer, Elliot, et al.
Veröffentlicht: (2024)
von: Glazer, Elliot, et al.
Veröffentlicht: (2024)
KisMATH: Do LLMs Have Knowledge of Implicit Structures in Mathematical Reasoning?
von: Saha, Soumadeep, et al.
Veröffentlicht: (2025)
von: Saha, Soumadeep, et al.
Veröffentlicht: (2025)
MathFimer: Enhancing Mathematical Reasoning by Expanding Reasoning Steps through Fill-in-the-Middle Task
von: Yan, Yuchen, et al.
Veröffentlicht: (2025)
von: Yan, Yuchen, et al.
Veröffentlicht: (2025)
TABQAWORLD: Optimizing Multimodal Reasoning for Multi-Turn Table Question Answering
von: Kwok, Tung Sum Thomas, et al.
Veröffentlicht: (2026)
von: Kwok, Tung Sum Thomas, et al.
Veröffentlicht: (2026)
AceMath: Advancing Frontier Math Reasoning with Post-Training and Reward Modeling
von: Liu, Zihan, et al.
Veröffentlicht: (2024)
von: Liu, Zihan, et al.
Veröffentlicht: (2024)
SuperCLUE-Math6: Graded Multi-Step Math Reasoning Benchmark for LLMs in Chinese
von: Xu, Liang, et al.
Veröffentlicht: (2024)
von: Xu, Liang, et al.
Veröffentlicht: (2024)
MemoSight: Unifying Context Compression and Multi Token Prediction for Reasoning Acceleration
von: Liu, Xinyu, et al.
Veröffentlicht: (2026)
von: Liu, Xinyu, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
SOLIDGEO: Measuring Multimodal Spatial Math Reasoning in Solid Geometry
von: Wang, Peijie, et al.
Veröffentlicht: (2025) -
MATH-Perturb: Benchmarking LLMs' Math Reasoning Abilities against Hard Perturbations
von: Huang, Kaixuan, et al.
Veröffentlicht: (2025) -
VAR-MATH: Probing True Mathematical Reasoning in LLMS via Symbolic Multi-Instance Benchmarks
von: Yao, Jian, et al.
Veröffentlicht: (2025) -
M$^3$-ACE: Rectifying Visual Perception in Multimodal Math Reasoning via Multi-Agentic Context Engineering
von: Xie, Peijin, et al.
Veröffentlicht: (2026) -
CMMaTH: A Chinese Multi-modal Math Skill Evaluation Benchmark for Foundation Models
von: Li, Zhong-Zhi, et al.
Veröffentlicht: (2024)