MARIO Eval: Evaluate Your Math LLM with your Math LLM--A mathematical dataset evaluation toolkit
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Boning, Li, Chengxi, Fan, Kai |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
AlphaMath Almost Zero: Process Supervision without Process
par: Chen, Guoxin, et autres
Publié: (2024)
par: Chen, Guoxin, et autres
Publié: (2024)
MathVerse: Does Your Multi-modal LLM Truly See the Diagrams in Visual Math Problems?
par: Zhang, Renrui, et autres
Publié: (2024)
par: Zhang, Renrui, et autres
Publié: (2024)
DocMath-Eval: Evaluating Math Reasoning Capabilities of LLMs in Understanding Long and Specialized Documents
par: Zhao, Yilun, et autres
Publié: (2023)
par: Zhao, Yilun, et autres
Publié: (2023)
MathChat: Converse to Tackle Challenging Math Problems with LLM Agents
par: Wu, Yiran, et autres
Publié: (2023)
par: Wu, Yiran, et autres
Publié: (2023)
Simulating LLM-to-LLM Tutoring for Multilingual Math Feedback
par: Tonga, Junior Cedric, et autres
Publié: (2025)
par: Tonga, Junior Cedric, et autres
Publié: (2025)
Code2Math: Can Your Code Agent Effectively Evolve Math Problems Through Exploration?
par: Guo, Dadi, et autres
Publié: (2026)
par: Guo, Dadi, et autres
Publié: (2026)
MARIO: MAth Reasoning with code Interpreter Output -- A Reproducible Pipeline
par: Liao, Minpeng, et autres
Publié: (2024)
par: Liao, Minpeng, et autres
Publié: (2024)
AgenticMath: Enhancing LLM Reasoning via Agentic-based Math Data Generation
par: Liu, Xianyang, et autres
Publié: (2025)
par: Liu, Xianyang, et autres
Publié: (2025)
MathArena: Evaluating LLMs on Uncontaminated Math Competitions
par: Balunović, Mislav, et autres
Publié: (2025)
par: Balunović, Mislav, et autres
Publié: (2025)
Is Your Model Really A Good Math Reasoner? Evaluating Mathematical Reasoning with Checklist
par: Zhou, Zihao, et autres
Publié: (2024)
par: Zhou, Zihao, et autres
Publié: (2024)
MathDivide: Improved mathematical reasoning by large language models
par: Srivastava, Saksham Sahai, et autres
Publié: (2024)
par: Srivastava, Saksham Sahai, et autres
Publié: (2024)
Does Math Reasoning Improve General LLM Capabilities? Understanding Transferability of LLM Reasoning
par: Huan, Maggie, et autres
Publié: (2025)
par: Huan, Maggie, et autres
Publié: (2025)
InternLM-Math: Open Math Large Language Models Toward Verifiable Reasoning
par: Ying, Huaiyuan, et autres
Publié: (2024)
par: Ying, Huaiyuan, et autres
Publié: (2024)
FinanceMath: Knowledge-Intensive Math Reasoning in Finance Domains
par: Zhao, Yilun, et autres
Publié: (2023)
par: Zhao, Yilun, et autres
Publié: (2023)
DICE: Detecting In-distribution Contamination in LLM's Fine-tuning Phase for Math Reasoning
par: Tu, Shangqing, et autres
Publié: (2024)
par: Tu, Shangqing, et autres
Publié: (2024)
Iterative LLM-Based Generation and Refinement of Distracting Conditions in Math Word Problems
par: Yang, Kaiqi, et autres
Publié: (2025)
par: Yang, Kaiqi, et autres
Publié: (2025)
Cutting Through the Noise: Boosting LLM Performance on Math Word Problems
par: Anantheswaran, Ujjwala, et autres
Publié: (2024)
par: Anantheswaran, Ujjwala, et autres
Publié: (2024)
rStar-Math: Small LLMs Can Master Math Reasoning with Self-Evolved Deep Thinking
par: Guan, Xinyu, et autres
Publié: (2025)
par: Guan, Xinyu, et autres
Publié: (2025)
Reasoning Curriculum: Bootstrapping Broad LLM Reasoning from Math
par: Pang, Bo, et autres
Publié: (2025)
par: Pang, Bo, et autres
Publié: (2025)
CMM-Math: A Chinese Multimodal Math Dataset To Evaluate and Enhance the Mathematics Reasoning of Large Multimodal Models
par: Liu, Wentao, et autres
Publié: (2024)
par: Liu, Wentao, et autres
Publié: (2024)
MathVC: An LLM-Simulated Multi-Character Virtual Classroom for Mathematics Education
par: Yue, Murong, et autres
Publié: (2024)
par: Yue, Murong, et autres
Publié: (2024)
MegaMath: Pushing the Limits of Open Math Corpora
par: Zhou, Fan, et autres
Publié: (2025)
par: Zhou, Fan, et autres
Publié: (2025)
Let's Reason Formally: Natural-Formal Hybrid Reasoning Enhances LLM's Math Capability
par: Wang, Ruida, et autres
Publié: (2025)
par: Wang, Ruida, et autres
Publié: (2025)
MM-MATH: Advancing Multimodal Math Evaluation with Process Evaluation and Fine-grained Classification
par: Sun, Kai, et autres
Publié: (2024)
par: Sun, Kai, et autres
Publié: (2024)
Template-Driven LLM-Paraphrased Framework for Tabular Math Word Problem Generation
par: Kang, Xiaoqiang, et autres
Publié: (2024)
par: Kang, Xiaoqiang, et autres
Publié: (2024)
CoinMath: Harnessing the Power of Coding Instruction for Math LLMs
par: Wei, Chengwei, et autres
Publié: (2024)
par: Wei, Chengwei, et autres
Publié: (2024)
SafeMath: Inference-time Safety improves Math Accuracy
par: Basu, Sagnik, et autres
Publié: (2026)
par: Basu, Sagnik, et autres
Publié: (2026)
GeoMathCode: Understanding Interleaved Math-Code Reasoning for Geometry Problem Solving
par: Zhang, Yingji, et autres
Publié: (2026)
par: Zhang, Yingji, et autres
Publié: (2026)
MathFusion: Enhancing Mathematical Problem-solving of LLM through Instruction Fusion
par: Pei, Qizhi, et autres
Publié: (2025)
par: Pei, Qizhi, et autres
Publié: (2025)
PolyMath: Evaluating Mathematical Reasoning in Multilingual Contexts
par: Wang, Yiming, et autres
Publié: (2025)
par: Wang, Yiming, et autres
Publié: (2025)
TreeCut: A Synthetic Unanswerable Math Word Problem Dataset for LLM Hallucination Evaluation
par: Ouyang, Jialin
Publié: (2025)
par: Ouyang, Jialin
Publié: (2025)
The CompMath-MCQ Dataset: Are LLMs Ready for Higher-Level Math?
par: Raimondi, Bianca, et autres
Publié: (2026)
par: Raimondi, Bianca, et autres
Publié: (2026)
MathBuddy: A Multimodal System for Affective Math Tutoring
par: Kar, Debanjana, et autres
Publié: (2025)
par: Kar, Debanjana, et autres
Publié: (2025)
MetaMath: Bootstrap Your Own Mathematical Questions for Large Language Models
par: Yu, Longhui, et autres
Publié: (2023)
par: Yu, Longhui, et autres
Publié: (2023)
MathPile: A Billion-Token-Scale Pretraining Corpus for Math
par: Wang, Zengzhi, et autres
Publié: (2023)
par: Wang, Zengzhi, et autres
Publié: (2023)
DrawEduMath: Evaluating Vision Language Models with Expert-Annotated Students' Hand-Drawn Math Images
par: Baral, Sami, et autres
Publié: (2025)
par: Baral, Sami, et autres
Publié: (2025)
A Single Character can Make or Break Your LLM Evals
par: Su, Jingtong, et autres
Publié: (2025)
par: Su, Jingtong, et autres
Publié: (2025)
Orca-Math: Unlocking the potential of SLMs in Grade School Math
par: Mitra, Arindam, et autres
Publié: (2024)
par: Mitra, Arindam, et autres
Publié: (2024)
SQLStructEval: Structural Evaluation of LLM Text-to-SQL Generation
par: Zhou, Yixi, et autres
Publié: (2026)
par: Zhou, Yixi, et autres
Publié: (2026)
ChatGPT as a Math Questioner? Evaluating ChatGPT on Generating Pre-university Math Questions
par: Van Long, Phuoc Pham, et autres
Publié: (2023)
par: Van Long, Phuoc Pham, et autres
Publié: (2023)
Documents similaires
-
AlphaMath Almost Zero: Process Supervision without Process
par: Chen, Guoxin, et autres
Publié: (2024) -
MathVerse: Does Your Multi-modal LLM Truly See the Diagrams in Visual Math Problems?
par: Zhang, Renrui, et autres
Publié: (2024) -
DocMath-Eval: Evaluating Math Reasoning Capabilities of LLMs in Understanding Long and Specialized Documents
par: Zhao, Yilun, et autres
Publié: (2023) -
MathChat: Converse to Tackle Challenging Math Problems with LLM Agents
par: Wu, Yiran, et autres
Publié: (2023) -
Simulating LLM-to-LLM Tutoring for Multilingual Math Feedback
par: Tonga, Junior Cedric, et autres
Publié: (2025)