Socratic-PRMBench: Benchmarking Process Reward Models with Systematic Reasoning Patterns

Fuente: arXiv
Saved in:
Bibliographic Details
Main Authors: Li, Xiang, Yu, Haiyang, Zhang, Xinghua, Huang, Ziyang, He, Shizhu, Liu, Kang, Zhao, Jun, Huang, Fei, Li, Yongbin
Format: Preprint
Published: 2025
Subjects:
Online Access:
Tags: Add Tag
No Tags, Be the first to tag this record!
_version_ 1866918038173908992
author Li, Xiang
Yu, Haiyang
Zhang, Xinghua
Huang, Ziyang
He, Shizhu
Liu, Kang
Zhao, Jun
Huang, Fei
Li, Yongbin
author_facet Li, Xiang
Yu, Haiyang
Zhang, Xinghua
Huang, Ziyang
He, Shizhu
Liu, Kang
Zhao, Jun
Huang, Fei
Li, Yongbin
contents Process Reward Models (PRMs) are crucial in complex reasoning and problem-solving tasks (e.g., LLM agents with long-horizon decision-making) by verifying the correctness of each intermediate reasoning step. In real-world scenarios, LLMs may apply various reasoning patterns (e.g., decomposition) to solve a problem, potentially suffering from errors under various reasoning patterns. Therefore, PRMs are required to identify errors under various reasoning patterns during the reasoning process. However, existing benchmarks mainly focus on evaluating PRMs with stepwise correctness, ignoring a systematic evaluation of PRMs under various reasoning patterns. To mitigate this gap, we introduce Socratic-PRMBench, a new benchmark to evaluate PRMs systematically under six reasoning patterns, including Transformation, Decomposition, Regather, Deduction, Verification, and Integration. Socratic-PRMBench}comprises 2995 reasoning paths with flaws within the aforementioned six reasoning patterns. Through our experiments on both PRMs and LLMs prompted as critic models, we identify notable deficiencies in existing PRMs. These observations underscore the significant weakness of current PRMs in conducting evaluations on reasoning steps under various reasoning patterns. We hope Socratic-PRMBench can serve as a comprehensive testbed for systematic evaluation of PRMs under diverse reasoning patterns and pave the way for future development of PRMs.
format Preprint
id arxiv_https___arxiv_org_abs_2505_23474
institution arXiv
publishDate 2025
record_format arxiv
spellingShingle Socratic-PRMBench: Benchmarking Process Reward Models with Systematic Reasoning Patterns
Li, Xiang
Yu, Haiyang
Zhang, Xinghua
Huang, Ziyang
He, Shizhu
Liu, Kang
Zhao, Jun
Huang, Fei
Li, Yongbin
Artificial Intelligence
Computation and Language
Process Reward Models (PRMs) are crucial in complex reasoning and problem-solving tasks (e.g., LLM agents with long-horizon decision-making) by verifying the correctness of each intermediate reasoning step. In real-world scenarios, LLMs may apply various reasoning patterns (e.g., decomposition) to solve a problem, potentially suffering from errors under various reasoning patterns. Therefore, PRMs are required to identify errors under various reasoning patterns during the reasoning process. However, existing benchmarks mainly focus on evaluating PRMs with stepwise correctness, ignoring a systematic evaluation of PRMs under various reasoning patterns. To mitigate this gap, we introduce Socratic-PRMBench, a new benchmark to evaluate PRMs systematically under six reasoning patterns, including Transformation, Decomposition, Regather, Deduction, Verification, and Integration. Socratic-PRMBench}comprises 2995 reasoning paths with flaws within the aforementioned six reasoning patterns. Through our experiments on both PRMs and LLMs prompted as critic models, we identify notable deficiencies in existing PRMs. These observations underscore the significant weakness of current PRMs in conducting evaluations on reasoning steps under various reasoning patterns. We hope Socratic-PRMBench can serve as a comprehensive testbed for systematic evaluation of PRMs under diverse reasoning patterns and pave the way for future development of PRMs.
title Socratic-PRMBench: Benchmarking Process Reward Models with Systematic Reasoning Patterns
topic Artificial Intelligence
Computation and Language
url https://arxiv.org/abs/2505.23474