MMTutorBench: The First Multimodal Benchmark for AI Math Tutoring
Fuente:
arXiv
Salvato in:
| Autori principali: | Yang, Tengchao, Guo, Sichen, Jia, Mengzhao, Su, Jiaming, Liu, Yuanyang, Zhang, Zhihan, Jiang, Meng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Prioritizing the Best: Incentivizing Reliable Multimodal Reasoning by Rewarding Beyond Answer Correctness
di: Jia, Mengzhao, et al.
Pubblicazione: (2026)
di: Jia, Mengzhao, et al.
Pubblicazione: (2026)
Describe-then-Reason: Improving Multimodal Mathematical Reasoning through Visual Comprehension Training
di: Jia, Mengzhao, et al.
Pubblicazione: (2024)
di: Jia, Mengzhao, et al.
Pubblicazione: (2024)
AutoRubric: Rubric-Based Generative Rewards for Faithful Multimodal Reasoning
di: Jia, Mengzhao, et al.
Pubblicazione: (2025)
di: Jia, Mengzhao, et al.
Pubblicazione: (2025)
MultiChartQA: Benchmarking Vision-Language Models on Multi-Chart Problems
di: Zhu, Zifeng, et al.
Pubblicazione: (2024)
di: Zhu, Zifeng, et al.
Pubblicazione: (2024)
MathTutorBench: A Benchmark for Measuring Open-ended Pedagogical Capabilities of LLM Tutors
di: Macina, Jakub, et al.
Pubblicazione: (2025)
di: Macina, Jakub, et al.
Pubblicazione: (2025)
Protecting Privacy in Multimodal Large Language Models with MLLMU-Bench
di: Liu, Zheyuan, et al.
Pubblicazione: (2024)
di: Liu, Zheyuan, et al.
Pubblicazione: (2024)
MathBuddy: A Multimodal System for Affective Math Tutoring
di: Kar, Debanjana, et al.
Pubblicazione: (2025)
di: Kar, Debanjana, et al.
Pubblicazione: (2025)
Towards Reward Modeling for AI Tutors in Math Mistake Remediation
di: Petukhova, Kseniia, et al.
Pubblicazione: (2026)
di: Petukhova, Kseniia, et al.
Pubblicazione: (2026)
Utility-Preserving De-Identification for Math Tutoring: Investigating Numeric Ambiguity in the MathEd-PII Benchmark Dataset
di: Zhou, Zhuqian, et al.
Pubblicazione: (2026)
di: Zhou, Zhuqian, et al.
Pubblicazione: (2026)
PLUG: Leveraging Pivot Language in Cross-Lingual Instruction Tuning
di: Zhang, Zhihan, et al.
Pubblicazione: (2023)
di: Zhang, Zhihan, et al.
Pubblicazione: (2023)
Learn Beyond The Answer: Training Language Models with Reflection for Mathematical Reasoning
di: Zhang, Zhihan, et al.
Pubblicazione: (2024)
di: Zhang, Zhihan, et al.
Pubblicazione: (2024)
SafeTutors: Benchmarking Pedagogical Safety in AI Tutoring Systems
di: Hazra, Rima, et al.
Pubblicazione: (2026)
di: Hazra, Rima, et al.
Pubblicazione: (2026)
XFinBench: Benchmarking LLMs in Complex Financial Problem Solving and Reasoning
di: Zhang, Zhihan, et al.
Pubblicazione: (2025)
di: Zhang, Zhihan, et al.
Pubblicazione: (2025)
MathBench: Evaluating the Theory and Application Proficiency of LLMs with a Hierarchical Mathematics Benchmark
di: Liu, Hongwei, et al.
Pubblicazione: (2024)
di: Liu, Hongwei, et al.
Pubblicazione: (2024)
BankMathBench: A Benchmark for Numerical Reasoning in Banking Scenarios
di: Lee, Yunseung, et al.
Pubblicazione: (2026)
di: Lee, Yunseung, et al.
Pubblicazione: (2026)
IsoBench: Benchmarking Multimodal Foundation Models on Isomorphic Representations
di: Fu, Deqing, et al.
Pubblicazione: (2024)
di: Fu, Deqing, et al.
Pubblicazione: (2024)
CMM-Math: A Chinese Multimodal Math Dataset To Evaluate and Enhance the Mathematics Reasoning of Large Multimodal Models
di: Liu, Wentao, et al.
Pubblicazione: (2024)
di: Liu, Wentao, et al.
Pubblicazione: (2024)
LLMs Are Already Good Tutors: Training-Free Prompt Optimization for Pedagogical Math Tutoring
di: Lee, Unggi, et al.
Pubblicazione: (2026)
di: Lee, Unggi, et al.
Pubblicazione: (2026)
Leopard: A Vision Language Model For Text-Rich Multi-Image Tasks
di: Jia, Mengzhao, et al.
Pubblicazione: (2024)
di: Jia, Mengzhao, et al.
Pubblicazione: (2024)
WirelessMathBench: A Mathematical Modeling Benchmark for LLMs in Wireless Communications
di: Li, Xin, et al.
Pubblicazione: (2025)
di: Li, Xin, et al.
Pubblicazione: (2025)
Simulating LLM-to-LLM Tutoring for Multilingual Math Feedback
di: Tonga, Junior Cedric, et al.
Pubblicazione: (2025)
di: Tonga, Junior Cedric, et al.
Pubblicazione: (2025)
MER-Bench: A Comprehensive Benchmark for Multimodal Meme Reappraisal
di: Nie, Yiqi, et al.
Pubblicazione: (2026)
di: Nie, Yiqi, et al.
Pubblicazione: (2026)
BabelBench: An Omni Benchmark for Code-Driven Analysis of Multimodal and Multistructured Data
di: Wang, Xuwu, et al.
Pubblicazione: (2024)
di: Wang, Xuwu, et al.
Pubblicazione: (2024)
RepoGraph: Enhancing AI Software Engineering with Repository-level Code Graph
di: Ouyang, Siru, et al.
Pubblicazione: (2024)
di: Ouyang, Siru, et al.
Pubblicazione: (2024)
IV-Bench: A Benchmark for Image-Grounded Video Perception and Reasoning in Multimodal LLMs
di: Ma, David, et al.
Pubblicazione: (2025)
di: Ma, David, et al.
Pubblicazione: (2025)
MMKE-Bench: A Multimodal Editing Benchmark for Diverse Visual Knowledge
di: Du, Yuntao, et al.
Pubblicazione: (2025)
di: Du, Yuntao, et al.
Pubblicazione: (2025)
MathScape: Benchmarking Multimodal Large Language Models in Real-World Mathematical Contexts
di: Liang, Hao, et al.
Pubblicazione: (2024)
di: Liang, Hao, et al.
Pubblicazione: (2024)
MEMO-Bench: A Multiple Benchmark for Text-to-Image and Multimodal Large Language Models on Human Emotion Analysis
di: Zhou, Yingjie, et al.
Pubblicazione: (2024)
di: Zhou, Yingjie, et al.
Pubblicazione: (2024)
BenchBench: Benchmarking Automated Benchmark Generation
di: Zheng, Yandan, et al.
Pubblicazione: (2026)
di: Zheng, Yandan, et al.
Pubblicazione: (2026)
SNS-Bench-VL: Benchmarking Multimodal Large Language Models in Social Networking Services
di: Guo, Hongcheng, et al.
Pubblicazione: (2025)
di: Guo, Hongcheng, et al.
Pubblicazione: (2025)
II-Bench: An Image Implication Understanding Benchmark for Multimodal Large Language Models
di: Liu, Ziqiang, et al.
Pubblicazione: (2024)
di: Liu, Ziqiang, et al.
Pubblicazione: (2024)
MathClean: A Benchmark for Synthetic Mathematical Data Cleaning
di: Liang, Hao, et al.
Pubblicazione: (2025)
di: Liang, Hao, et al.
Pubblicazione: (2025)
EpiBench: Benchmarking Multi-turn Research Workflows for Multimodal Agents
di: Dong, Xuan, et al.
Pubblicazione: (2026)
di: Dong, Xuan, et al.
Pubblicazione: (2026)
TOWER: Tree Organized Weighting for Evaluating Complex Instructions
di: Ziems, Noah, et al.
Pubblicazione: (2024)
di: Ziems, Noah, et al.
Pubblicazione: (2024)
UAL-Bench: The First Comprehensive Unusual Activity Localization Benchmark
di: Abdullah, Hasnat Md, et al.
Pubblicazione: (2024)
di: Abdullah, Hasnat Md, et al.
Pubblicazione: (2024)
BackportBench: A Multilingual Benchmark for Automated Backporting of Patches
di: Zhong, Zhiqing, et al.
Pubblicazione: (2025)
di: Zhong, Zhiqing, et al.
Pubblicazione: (2025)
Large Language Models Approach Expert Pedagogical Quality in Math Tutoring but Differ in Instructional and Linguistic Profiles
di: Abdulsalam, Ramatu Oiza, et al.
Pubblicazione: (2025)
di: Abdulsalam, Ramatu Oiza, et al.
Pubblicazione: (2025)
Code2Math: Can Your Code Agent Effectively Evolve Math Problems Through Exploration?
di: Guo, Dadi, et al.
Pubblicazione: (2026)
di: Guo, Dadi, et al.
Pubblicazione: (2026)
MathOdyssey: Benchmarking Mathematical Problem-Solving Skills in Large Language Models Using Odyssey Math Data
di: Fang, Meng, et al.
Pubblicazione: (2024)
di: Fang, Meng, et al.
Pubblicazione: (2024)
DeepTutor: Towards Agentic Personalized Tutoring
di: Zhao, Bingxi, et al.
Pubblicazione: (2026)
di: Zhao, Bingxi, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Prioritizing the Best: Incentivizing Reliable Multimodal Reasoning by Rewarding Beyond Answer Correctness
di: Jia, Mengzhao, et al.
Pubblicazione: (2026) -
Describe-then-Reason: Improving Multimodal Mathematical Reasoning through Visual Comprehension Training
di: Jia, Mengzhao, et al.
Pubblicazione: (2024) -
AutoRubric: Rubric-Based Generative Rewards for Faithful Multimodal Reasoning
di: Jia, Mengzhao, et al.
Pubblicazione: (2025) -
MultiChartQA: Benchmarking Vision-Language Models on Multi-Chart Problems
di: Zhu, Zifeng, et al.
Pubblicazione: (2024) -
MathTutorBench: A Benchmark for Measuring Open-ended Pedagogical Capabilities of LLM Tutors
di: Macina, Jakub, et al.
Pubblicazione: (2025)