MR-GSM8K: A Meta-Reasoning Benchmark for Large Language Model Evaluation
Fuente:
arXiv
Salvato in:
| Autori principali: | Zeng, Zhongshen, Chen, Pengguang, Liu, Shu, Jiang, Haiyun, Jia, Jiaya |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MR-Ben: A Meta-Reasoning Benchmark for Evaluating System-2 Thinking in LLMs
di: Zeng, Zhongshen, et al.
Pubblicazione: (2024)
di: Zeng, Zhongshen, et al.
Pubblicazione: (2024)
MoTCoder: Elevating Large Language Models with Modular of Thought for Challenging Programming Tasks
di: Li, Jingyao, et al.
Pubblicazione: (2023)
di: Li, Jingyao, et al.
Pubblicazione: (2023)
MR-Align: Meta-Reasoning Informed Factuality Alignment for Large Reasoning Models
di: Wang, Xinming, et al.
Pubblicazione: (2025)
di: Wang, Xinming, et al.
Pubblicazione: (2025)
Scalable Language Model with Generalized Continual Learning
di: Peng, Bohao, et al.
Pubblicazione: (2024)
di: Peng, Bohao, et al.
Pubblicazione: (2024)
MOODv2: Masked Image Modeling for Out-of-Distribution Detection
di: Li, Jingyao, et al.
Pubblicazione: (2024)
di: Li, Jingyao, et al.
Pubblicazione: (2024)
GLBench: A Comprehensive Benchmark for Graph with Large Language Models
di: Li, Yuhan, et al.
Pubblicazione: (2024)
di: Li, Yuhan, et al.
Pubblicazione: (2024)
BaziQA-Benchmark: Evaluating Symbolic and Temporally Compositional Reasoning in Large Language Models
di: Chen, Jiangxi, et al.
Pubblicazione: (2026)
di: Chen, Jiangxi, et al.
Pubblicazione: (2026)
TagCLIP: Improving Discrimination Ability of Open-Vocabulary Semantic Segmentation
di: Li, Jingyao, et al.
Pubblicazione: (2023)
di: Li, Jingyao, et al.
Pubblicazione: (2023)
GridMask Data Augmentation
di: Chen, Pengguang, et al.
Pubblicazione: (2020)
di: Chen, Pengguang, et al.
Pubblicazione: (2020)
GSM8K-V: Can Vision Language Models Solve Grade School Math Word Problems in Visual Contexts
di: Yuan, Fan, et al.
Pubblicazione: (2025)
di: Yuan, Fan, et al.
Pubblicazione: (2025)
StrategyLLM: Large Language Models as Strategy Generators, Executors, Optimizers, and Evaluators for Problem Solving
di: Gao, Chang, et al.
Pubblicazione: (2023)
di: Gao, Chang, et al.
Pubblicazione: (2023)
GSM-Plus: A Comprehensive Benchmark for Evaluating the Robustness of LLMs as Mathematical Problem Solvers
di: Li, Qintong, et al.
Pubblicazione: (2024)
di: Li, Qintong, et al.
Pubblicazione: (2024)
SocialMaze: A Benchmark for Evaluating Social Reasoning in Large Language Models
di: Xu, Zixiang, et al.
Pubblicazione: (2025)
di: Xu, Zixiang, et al.
Pubblicazione: (2025)
MT-Eval: A Multi-Turn Capabilities Evaluation Benchmark for Large Language Models
di: Kwan, Wai-Chung, et al.
Pubblicazione: (2024)
di: Kwan, Wai-Chung, et al.
Pubblicazione: (2024)
From Noisy Traces to Stable Gradients: Bias-Variance Optimized Preference Optimization for Aligning Large Reasoning Models
di: Zhu, Mingkang, et al.
Pubblicazione: (2025)
di: Zhu, Mingkang, et al.
Pubblicazione: (2025)
Meta Reasoning for Large Language Models
di: Gao, Peizhong, et al.
Pubblicazione: (2024)
di: Gao, Peizhong, et al.
Pubblicazione: (2024)
CASTLE: A Comprehensive Benchmark for Evaluating Student-Tailored Personalized Safety in Large Language Models
di: Jia, Rui, et al.
Pubblicazione: (2026)
di: Jia, Rui, et al.
Pubblicazione: (2026)
When Language Overrules: Revealing Text Dominance in Multimodal Large Language Models
di: Wu, Huyu, et al.
Pubblicazione: (2025)
di: Wu, Huyu, et al.
Pubblicazione: (2025)
Medical Reasoning with Large Language Models: A Survey and MR-Bench
di: Ren, Xiaohan, et al.
Pubblicazione: (2026)
di: Ren, Xiaohan, et al.
Pubblicazione: (2026)
VLPose: Bridging the Domain Gap in Pose Estimation with Language-Vision Tuning
di: Li, Jingyao, et al.
Pubblicazione: (2024)
di: Li, Jingyao, et al.
Pubblicazione: (2024)
EffiReason-Bench: A Unified Benchmark for Evaluating and Advancing Efficient Reasoning in Large Language Models
di: Huang, Junquan, et al.
Pubblicazione: (2025)
di: Huang, Junquan, et al.
Pubblicazione: (2025)
A Comprehensive Evaluation on Event Reasoning of Large Language Models
di: Tao, Zhengwei, et al.
Pubblicazione: (2024)
di: Tao, Zhengwei, et al.
Pubblicazione: (2024)
Evaluating Large Language Models for Financial Reasoning: A CFA-Based Benchmark Study
di: Yao, Xuan, et al.
Pubblicazione: (2025)
di: Yao, Xuan, et al.
Pubblicazione: (2025)
EconLogicQA: A Question-Answering Benchmark for Evaluating Large Language Models in Economic Sequential Reasoning
di: Quan, Yinzhu, et al.
Pubblicazione: (2024)
di: Quan, Yinzhu, et al.
Pubblicazione: (2024)
A Survey on Large Language Models for Mathematical Reasoning
di: Wang, Peng-Yuan, et al.
Pubblicazione: (2025)
di: Wang, Peng-Yuan, et al.
Pubblicazione: (2025)
RUPBench: Benchmarking Reasoning Under Perturbations for Robustness Evaluation in Large Language Models
di: Wang, Yuqing, et al.
Pubblicazione: (2024)
di: Wang, Yuqing, et al.
Pubblicazione: (2024)
LongLoRA: Efficient Fine-tuning of Long-Context Large Language Models
di: Chen, Yukang, et al.
Pubblicazione: (2023)
di: Chen, Yukang, et al.
Pubblicazione: (2023)
TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models
di: Li, Ce, et al.
Pubblicazione: (2025)
di: Li, Ce, et al.
Pubblicazione: (2025)
JMedBench: A Benchmark for Evaluating Japanese Biomedical Large Language Models
di: Jiang, Junfeng, et al.
Pubblicazione: (2024)
di: Jiang, Junfeng, et al.
Pubblicazione: (2024)
CodeMind: Evaluating Large Language Models for Code Reasoning
di: Liu, Changshu, et al.
Pubblicazione: (2024)
di: Liu, Changshu, et al.
Pubblicazione: (2024)
LTLBench: Towards Benchmarks for Evaluating Temporal Reasoning in Large Language Models
di: Tang, Weizhi, et al.
Pubblicazione: (2024)
di: Tang, Weizhi, et al.
Pubblicazione: (2024)
A Cognitive Evaluation Benchmark of Image Reasoning and Description for Large Vision-Language Models
di: Song, Xiujie, et al.
Pubblicazione: (2024)
di: Song, Xiujie, et al.
Pubblicazione: (2024)
McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models
di: Lan, Tian, et al.
Pubblicazione: (2025)
di: Lan, Tian, et al.
Pubblicazione: (2025)
Evaluating the Meta- and Object-Level Reasoning of Large Language Models for Question Answering
di: Ferguson, Nick, et al.
Pubblicazione: (2025)
di: Ferguson, Nick, et al.
Pubblicazione: (2025)
JustLogic: A Comprehensive Benchmark for Evaluating Deductive Reasoning in Large Language Models
di: Chen, Michael K., et al.
Pubblicazione: (2025)
di: Chen, Michael K., et al.
Pubblicazione: (2025)
Achieving >97% on GSM8K: Deeply Understanding the Problems Makes LLMs Better Solvers for Math Word Problems
di: Zhong, Qihuang, et al.
Pubblicazione: (2024)
di: Zhong, Qihuang, et al.
Pubblicazione: (2024)
Prompt Highlighter: Interactive Control for Multi-Modal LLMs
di: Zhang, Yuechen, et al.
Pubblicazione: (2023)
di: Zhang, Yuechen, et al.
Pubblicazione: (2023)
OMGEval: An Open Multilingual Generative Evaluation Benchmark for Large Language Models
di: Liu, Yang, et al.
Pubblicazione: (2024)
di: Liu, Yang, et al.
Pubblicazione: (2024)
Iterative Data Generation with Large Language Models for Aspect-based Sentiment Analysis
di: Zhong, Qihuang, et al.
Pubblicazione: (2024)
di: Zhong, Qihuang, et al.
Pubblicazione: (2024)
LISA: Reasoning Segmentation via Large Language Model
di: Lai, Xin, et al.
Pubblicazione: (2023)
di: Lai, Xin, et al.
Pubblicazione: (2023)
Documenti analoghi
-
MR-Ben: A Meta-Reasoning Benchmark for Evaluating System-2 Thinking in LLMs
di: Zeng, Zhongshen, et al.
Pubblicazione: (2024) -
MoTCoder: Elevating Large Language Models with Modular of Thought for Challenging Programming Tasks
di: Li, Jingyao, et al.
Pubblicazione: (2023) -
MR-Align: Meta-Reasoning Informed Factuality Alignment for Large Reasoning Models
di: Wang, Xinming, et al.
Pubblicazione: (2025) -
Scalable Language Model with Generalized Continual Learning
di: Peng, Bohao, et al.
Pubblicazione: (2024) -
MOODv2: Masked Image Modeling for Out-of-Distribution Detection
di: Li, Jingyao, et al.
Pubblicazione: (2024)