MM-MATH: Advancing Multimodal Math Evaluation with Process Evaluation and Fine-grained Classification
Fuente:
arXiv
Salvato in:
| Autori principali: | Sun, Kai, Bai, Yushi, Qi, Ji, Hou, Lei, Li, Juanzi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
DICE: Detecting In-distribution Contamination in LLM's Fine-tuning Phase for Math Reasoning
di: Tu, Shangqing, et al.
Pubblicazione: (2024)
di: Tu, Shangqing, et al.
Pubblicazione: (2024)
MMGeoLM: Hard Negative Contrastive Learning for Fine-Grained Geometric Understanding in Large Multimodal Models
di: Sun, Kai, et al.
Pubblicazione: (2025)
di: Sun, Kai, et al.
Pubblicazione: (2025)
WaterBench: Towards Holistic Evaluation of Watermarks for Large Language Models
di: Tu, Shangqing, et al.
Pubblicazione: (2023)
di: Tu, Shangqing, et al.
Pubblicazione: (2023)
LongCite: Enabling LLMs to Generate Fine-grained Citations in Long-context QA
di: Zhang, Jiajie, et al.
Pubblicazione: (2024)
di: Zhang, Jiajie, et al.
Pubblicazione: (2024)
DeepPrune: Parallel Scaling without Inter-trace Redundancy
di: Tu, Shangqing, et al.
Pubblicazione: (2025)
di: Tu, Shangqing, et al.
Pubblicazione: (2025)
MM-THEBench: Do Reasoning MLLMs Think Reasonably?
di: Huang, Zhidian, et al.
Pubblicazione: (2026)
di: Huang, Zhidian, et al.
Pubblicazione: (2026)
MathOPEval: A Fine-grained Evaluation Benchmark for Visual Operations of MLLMs in Mathematical Reasoning
di: Li, Xiaoyuan, et al.
Pubblicazione: (2025)
di: Li, Xiaoyuan, et al.
Pubblicazione: (2025)
Towards Understanding Safety Alignment: A Mechanistic Perspective from Safety Neurons
di: Chen, Jianhui, et al.
Pubblicazione: (2024)
di: Chen, Jianhui, et al.
Pubblicazione: (2024)
LongAlign: A Recipe for Long Context Alignment of Large Language Models
di: Bai, Yushi, et al.
Pubblicazione: (2024)
di: Bai, Yushi, et al.
Pubblicazione: (2024)
SIRI: Scaling Iterative Reinforcement Learning with Interleaved Compression
di: Wen, Haoming, et al.
Pubblicazione: (2025)
di: Wen, Haoming, et al.
Pubblicazione: (2025)
VidCoM: Fast Video Comprehension through Large Language Models with Multimodal Tools
di: Qi, Ji, et al.
Pubblicazione: (2023)
di: Qi, Ji, et al.
Pubblicazione: (2023)
MATH-Perturb: Benchmarking LLMs' Math Reasoning Abilities against Hard Perturbations
di: Huang, Kaixuan, et al.
Pubblicazione: (2025)
di: Huang, Kaixuan, et al.
Pubblicazione: (2025)
Fine-grained and Explainable Factuality Evaluation for Multimodal Summarization
di: Zhang, Yue, et al.
Pubblicazione: (2024)
di: Zhang, Yue, et al.
Pubblicazione: (2024)
Pre-training Distillation for Large Language Models: A Design Space Exploration
di: Peng, Hao, et al.
Pubblicazione: (2024)
di: Peng, Hao, et al.
Pubblicazione: (2024)
CMM-Math: A Chinese Multimodal Math Dataset To Evaluate and Enhance the Mathematics Reasoning of Large Multimodal Models
di: Liu, Wentao, et al.
Pubblicazione: (2024)
di: Liu, Wentao, et al.
Pubblicazione: (2024)
RPC-Bench: A Fine-grained Benchmark for Research Paper Comprehension
di: Chen, Yelin, et al.
Pubblicazione: (2026)
di: Chen, Yelin, et al.
Pubblicazione: (2026)
Establishing Trustworthy LLM Evaluation via Shortcut Neuron Analysis
di: Zhu, Kejian, et al.
Pubblicazione: (2025)
di: Zhu, Kejian, et al.
Pubblicazione: (2025)
StoryAlign: Evaluating and Training Reward Models for Story Generation
di: Xia, Haotian, et al.
Pubblicazione: (2026)
di: Xia, Haotian, et al.
Pubblicazione: (2026)
Evaluating Generative Language Models in Information Extraction as Subjective Question Correction
di: Fan, Yuchen, et al.
Pubblicazione: (2024)
di: Fan, Yuchen, et al.
Pubblicazione: (2024)
Large Margin Prototypical Network for Few-shot Relation Classification with Fine-grained Features
di: Fan, Miao, et al.
Pubblicazione: (2024)
di: Fan, Miao, et al.
Pubblicazione: (2024)
MortalMATH: Evaluating the Conflict Between Reasoning Objectives and Emergency Contexts
di: Lanzeray, Etienne, et al.
Pubblicazione: (2026)
di: Lanzeray, Etienne, et al.
Pubblicazione: (2026)
An LMM for Efficient Video Understanding via Reinforced Compression of Video Cubes
di: Qi, Ji, et al.
Pubblicazione: (2025)
di: Qi, Ji, et al.
Pubblicazione: (2025)
ChatLog: Carefully Evaluating the Evolution of ChatGPT Across Time
di: Tu, Shangqing, et al.
Pubblicazione: (2023)
di: Tu, Shangqing, et al.
Pubblicazione: (2023)
Preserving Knowledge Invariance: Rethinking Robustness Evaluation of Open Information Extraction
di: Qi, Ji, et al.
Pubblicazione: (2023)
di: Qi, Ji, et al.
Pubblicazione: (2023)
CogCoM: A Visual Language Model with Chain-of-Manipulations Reasoning
di: Qi, Ji, et al.
Pubblicazione: (2024)
di: Qi, Ji, et al.
Pubblicazione: (2024)
MARIO Eval: Evaluate Your Math LLM with your Math LLM--A mathematical dataset evaluation toolkit
di: Zhang, Boning, et al.
Pubblicazione: (2024)
di: Zhang, Boning, et al.
Pubblicazione: (2024)
SuperWriter: Reflection-Driven Long-Form Generation with Large Language Models
di: Wu, Yuhao, et al.
Pubblicazione: (2025)
di: Wu, Yuhao, et al.
Pubblicazione: (2025)
MM-CRITIC: A Holistic Evaluation of Large Multimodal Models as Multimodal Critique
di: Zeng, Gailun, et al.
Pubblicazione: (2025)
di: Zeng, Gailun, et al.
Pubblicazione: (2025)
MATH-PT: A Math Reasoning Benchmark for European and Brazilian Portuguese
di: Teixeira, Tiago, et al.
Pubblicazione: (2026)
di: Teixeira, Tiago, et al.
Pubblicazione: (2026)
A Multimodal, Multilingual, and Multidimensional Pipeline for Fine-grained Crowdsourcing Earthquake Damage Evaluation
di: Ma, Zihui, et al.
Pubblicazione: (2025)
di: Ma, Zihui, et al.
Pubblicazione: (2025)
U-MATH: A University-Level Benchmark for Evaluating Mathematical Skills in LLMs
di: Chernyshev, Konstantin, et al.
Pubblicazione: (2024)
di: Chernyshev, Konstantin, et al.
Pubblicazione: (2024)
Reliable Fine-Grained Evaluation of Natural Language Math Proofs
di: Ma, Wenjie, et al.
Pubblicazione: (2025)
di: Ma, Wenjie, et al.
Pubblicazione: (2025)
LongWriter: Unleashing 10,000+ Word Generation from Long Context LLMs
di: Bai, Yushi, et al.
Pubblicazione: (2024)
di: Bai, Yushi, et al.
Pubblicazione: (2024)
Training Language Models to Generate Text with Citations via Fine-grained Rewards
di: Huang, Chengyu, et al.
Pubblicazione: (2024)
di: Huang, Chengyu, et al.
Pubblicazione: (2024)
Measuring Multimodal Mathematical Reasoning with MATH-Vision Dataset
di: Wang, Ke, et al.
Pubblicazione: (2024)
di: Wang, Ke, et al.
Pubblicazione: (2024)
Precise Localization of Memories: A Fine-grained Neuron-level Knowledge Editing Technique for LLMs
di: Pan, Haowen, et al.
Pubblicazione: (2025)
di: Pan, Haowen, et al.
Pubblicazione: (2025)
Gaps or Hallucinations? Gazing into Machine-Generated Legal Analysis for Fine-grained Text Evaluations
di: Hou, Abe Bohan, et al.
Pubblicazione: (2024)
di: Hou, Abe Bohan, et al.
Pubblicazione: (2024)
MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities
di: Yu, Weihao, et al.
Pubblicazione: (2023)
di: Yu, Weihao, et al.
Pubblicazione: (2023)
Davidsonian Scene Graph: Improving Reliability in Fine-grained Evaluation for Text-to-Image Generation
di: Cho, Jaemin, et al.
Pubblicazione: (2023)
di: Cho, Jaemin, et al.
Pubblicazione: (2023)
ADELIE: Aligning Large Language Models on Information Extraction
di: Qi, Yunjia, et al.
Pubblicazione: (2024)
di: Qi, Yunjia, et al.
Pubblicazione: (2024)
Documenti analoghi
-
DICE: Detecting In-distribution Contamination in LLM's Fine-tuning Phase for Math Reasoning
di: Tu, Shangqing, et al.
Pubblicazione: (2024) -
MMGeoLM: Hard Negative Contrastive Learning for Fine-Grained Geometric Understanding in Large Multimodal Models
di: Sun, Kai, et al.
Pubblicazione: (2025) -
WaterBench: Towards Holistic Evaluation of Watermarks for Large Language Models
di: Tu, Shangqing, et al.
Pubblicazione: (2023) -
LongCite: Enabling LLMs to Generate Fine-grained Citations in Long-context QA
di: Zhang, Jiajie, et al.
Pubblicazione: (2024) -
DeepPrune: Parallel Scaling without Inter-trace Redundancy
di: Tu, Shangqing, et al.
Pubblicazione: (2025)