Zeng, Z., Chen, P., Liu, S., Jiang, H., & Jia, J. (2023). MR-GSM8K: A Meta-Reasoning Benchmark for Large Language Model Evaluation.
Chicago Style (17th ed.) CitationZeng, Zhongshen, Pengguang Chen, Shu Liu, Haiyun Jiang, and Jiaya Jia. MR-GSM8K: A Meta-Reasoning Benchmark for Large Language Model Evaluation. 2023.
MLA (9th ed.) CitationZeng, Zhongshen, et al. MR-GSM8K: A Meta-Reasoning Benchmark for Large Language Model Evaluation. 2023.
Warning: These citations may not always be 100% accurate.