MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Lu, Pan, Bansal, Hritik, Xia, Tony, Liu, Jiacheng, Li, Chunyuan, Hajishirzi, Hannaneh, Cheng, Hao, Chang, Kai-Wei, Galley, Michel, Gao, Jianfeng |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ConTextual: Evaluating Context-Sensitive Text-Rich Visual Reasoning in Large Multimodal Models
par: Wadhawan, Rohan, et autres
Publié: (2024)
par: Wadhawan, Rohan, et autres
Publié: (2024)
OMEGA: Can LLMs Reason Outside the Box in Math? Evaluating Exploratory, Compositional, and Transformative Generalization
par: Sun, Yiyou, et autres
Publié: (2025)
par: Sun, Yiyou, et autres
Publié: (2025)
Infini-gram mini: Exact n-gram Search at the Internet Scale with FM-Index
par: Xu, Hao, et autres
Publié: (2025)
par: Xu, Hao, et autres
Publié: (2025)
ASTRO: Teaching Language Models to Reason by Reflecting and Backtracking In-Context
par: Kim, Joongwon, et autres
Publié: (2025)
par: Kim, Joongwon, et autres
Publié: (2025)
Peeking Behind Closed Doors: Risks of LLM Evaluation by Private Data Curators
par: Bansal, Hritik, et autres
Publié: (2025)
par: Bansal, Hritik, et autres
Publié: (2025)
PolyMath: Evaluating Mathematical Reasoning in Multilingual Contexts
par: Wang, Yiming, et autres
Publié: (2025)
par: Wang, Yiming, et autres
Publié: (2025)
OpenVLThinker: Complex Vision-Language Reasoning via Iterative SFT-RL Cycles
par: Deng, Yihe, et autres
Publié: (2025)
par: Deng, Yihe, et autres
Publié: (2025)
Husky: A Unified, Open-Source Language Agent for Multi-Step Reasoning
par: Kim, Joongwon, et autres
Publié: (2024)
par: Kim, Joongwon, et autres
Publié: (2024)
Infini-gram: Scaling Unbounded n-gram Language Models to a Trillion Tokens
par: Liu, Jiacheng, et autres
Publié: (2024)
par: Liu, Jiacheng, et autres
Publié: (2024)
APT: Adaptive Pruning and Tuning Pretrained Language Models for Efficient Training and Inference
par: Zhao, Bowen, et autres
Publié: (2024)
par: Zhao, Bowen, et autres
Publié: (2024)
MentorCollab: Selective Large-to-Small Inference-Time Guidance for Efficient Reasoning
par: Wang, Haojin, et autres
Publié: (2026)
par: Wang, Haojin, et autres
Publié: (2026)
MultiMath: Bridging Visual and Mathematical Reasoning for Large Language Models
par: Peng, Shuai, et autres
Publié: (2024)
par: Peng, Shuai, et autres
Publié: (2024)
MathCanvas: Intrinsic Visual Chain-of-Thought for Multimodal Mathematical Reasoning
par: Shi, Weikang, et autres
Publié: (2025)
par: Shi, Weikang, et autres
Publié: (2025)
VisAidMath: Benchmarking Visual-Aided Mathematical Reasoning
par: Ma, Jingkun, et autres
Publié: (2024)
par: Ma, Jingkun, et autres
Publié: (2024)
MathHay: An Automated Benchmark for Long-Context Mathematical Reasoning in LLMs
par: Wang, Lei, et autres
Publié: (2024)
par: Wang, Lei, et autres
Publié: (2024)
Teaching Language Models to Self-Improve through Interactive Demonstrations
par: Yu, Xiao, et autres
Publié: (2023)
par: Yu, Xiao, et autres
Publié: (2023)
Self-Checker: Plug-and-Play Modules for Fact-Checking with Large Language Models
par: Li, Miaoran, et autres
Publié: (2023)
par: Li, Miaoran, et autres
Publié: (2023)
LogicVista: Multimodal LLM Logical Reasoning Benchmark in Visual Contexts
par: Xiao, Yijia, et autres
Publié: (2024)
par: Xiao, Yijia, et autres
Publié: (2024)
Data Engineering for Scaling Language Models to 128K Context
par: Fu, Yao, et autres
Publié: (2024)
par: Fu, Yao, et autres
Publié: (2024)
ScienceMeter: Tracking Scientific Knowledge Updates in Language Models
par: Wang, Yike, et autres
Publié: (2025)
par: Wang, Yike, et autres
Publié: (2025)
ExACT: Teaching AI Agents to Explore with Reflective-MCTS and Exploratory Learning
par: Yu, Xiao, et autres
Publié: (2024)
par: Yu, Xiao, et autres
Publié: (2024)
Dyna-Think: Synergizing Reasoning, Acting, and World Model Simulation in AI Agents
par: Yu, Xiao, et autres
Publié: (2025)
par: Yu, Xiao, et autres
Publié: (2025)
Don't throw away your value model! Generating more preferable text with Value-Guided Monte-Carlo Tree Search decoding
par: Liu, Jiacheng, et autres
Publié: (2023)
par: Liu, Jiacheng, et autres
Publié: (2023)
MathCoder2: Better Math Reasoning from Continued Pretraining on Model-translated Mathematical Code
par: Lu, Zimu, et autres
Publié: (2024)
par: Lu, Zimu, et autres
Publié: (2024)
HREF: Human Response-Guided Evaluation of Instruction Following in Language Models
par: Lyu, Xinxi, et autres
Publié: (2024)
par: Lyu, Xinxi, et autres
Publié: (2024)
BTR: Binary Token Representations for Efficient Retrieval Augmented Language Models
par: Cao, Qingqing, et autres
Publié: (2023)
par: Cao, Qingqing, et autres
Publié: (2023)
When To Solve, When To Verify: Compute-Optimal Problem Solving and Generative Verification for LLM Reasoning
par: Singhi, Nishad, et autres
Publié: (2025)
par: Singhi, Nishad, et autres
Publié: (2025)
MathVerse: Does Your Multi-modal LLM Truly See the Diagrams in Visual Math Problems?
par: Zhang, Renrui, et autres
Publié: (2024)
par: Zhang, Renrui, et autres
Publié: (2024)
CMM-Math: A Chinese Multimodal Math Dataset To Evaluate and Enhance the Mathematics Reasoning of Large Multimodal Models
par: Liu, Wentao, et autres
Publié: (2024)
par: Liu, Wentao, et autres
Publié: (2024)
EvalTree: Profiling Language Model Weaknesses via Hierarchical Capability Trees
par: Zeng, Zhiyuan, et autres
Publié: (2025)
par: Zeng, Zhiyuan, et autres
Publié: (2025)
Rethinking Interpretability in the Era of Large Language Models
par: Singh, Chandan, et autres
Publié: (2024)
par: Singh, Chandan, et autres
Publié: (2024)
Peering Through Preferences: Unraveling Feedback Acquisition for Aligning Large Language Models
par: Bansal, Hritik, et autres
Publié: (2023)
par: Bansal, Hritik, et autres
Publié: (2023)
MathScape: Benchmarking Multimodal Large Language Models in Real-World Mathematical Contexts
par: Liang, Hao, et autres
Publié: (2024)
par: Liang, Hao, et autres
Publié: (2024)
HoneyBee: Data Recipes for Vision-Language Reasoners
par: Bansal, Hritik, et autres
Publié: (2025)
par: Bansal, Hritik, et autres
Publié: (2025)
MathCoder-VL: Bridging Vision and Code for Enhanced Multimodal Mathematical Reasoning
par: Wang, Ke, et autres
Publié: (2025)
par: Wang, Ke, et autres
Publié: (2025)
MathOPEval: A Fine-grained Evaluation Benchmark for Visual Operations of MLLMs in Mathematical Reasoning
par: Li, Xiaoyuan, et autres
Publié: (2025)
par: Li, Xiaoyuan, et autres
Publié: (2025)
We-Math 2.0: A Versatile MathBook System for Incentivizing Visual Mathematical Reasoning
par: Qiao, Runqi, et autres
Publié: (2025)
par: Qiao, Runqi, et autres
Publié: (2025)
SUPERNOVA: Eliciting General Reasoning in LLMs with Reinforcement Learning on Natural Instructions
par: Suvarna, Ashima, et autres
Publié: (2026)
par: Suvarna, Ashima, et autres
Publié: (2026)
DynaMath: A Dynamic Visual Benchmark for Evaluating Mathematical Reasoning Robustness of Vision Language Models
par: Zou, Chengke, et autres
Publié: (2024)
par: Zou, Chengke, et autres
Publié: (2024)
Smaller, Weaker, Yet Better: Training LLM Reasoners via Compute-Optimal Sampling
par: Bansal, Hritik, et autres
Publié: (2024)
par: Bansal, Hritik, et autres
Publié: (2024)
Documents similaires
-
ConTextual: Evaluating Context-Sensitive Text-Rich Visual Reasoning in Large Multimodal Models
par: Wadhawan, Rohan, et autres
Publié: (2024) -
OMEGA: Can LLMs Reason Outside the Box in Math? Evaluating Exploratory, Compositional, and Transformative Generalization
par: Sun, Yiyou, et autres
Publié: (2025) -
Infini-gram mini: Exact n-gram Search at the Internet Scale with FM-Index
par: Xu, Hao, et autres
Publié: (2025) -
ASTRO: Teaching Language Models to Reason by Reflecting and Backtracking In-Context
par: Kim, Joongwon, et autres
Publié: (2025) -
Peeking Behind Closed Doors: Risks of LLM Evaluation by Private Data Curators
par: Bansal, Hritik, et autres
Publié: (2025)