GR-Ben: A General Reasoning Benchmark for Evaluating Process Reward Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Sun, Zhouhao, Zhang, Xuan, Ding, Xiao, Cai, Bibo, Du, Li, Xiong, Kai, Dai, Xinran, Zhang, Fei, tang, weidi, Kan, Zhiyuan, Zhao, Yang, Qin, Bing, Liu, Ting |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
DeepTool: Scaling Interleaved Deliberation in Tool-Integrated Reasoning via Process-Supervised Reinforcement Learning
di: He, Yang, et al.
Pubblicazione: (2026)
di: He, Yang, et al.
Pubblicazione: (2026)
Self-Route: Automatic Mode Switching via Capability Estimation for Efficient Reasoning
di: He, Yang, et al.
Pubblicazione: (2025)
di: He, Yang, et al.
Pubblicazione: (2025)
Large Language Models Are Still Misled by Simple Bias Ensembles
di: Sun, Zhouhao, et al.
Pubblicazione: (2025)
di: Sun, Zhouhao, et al.
Pubblicazione: (2025)
Towards Generalizable and Faithful Logic Reasoning over Natural Language via Resolution Refutation
di: Sun, Zhouhao, et al.
Pubblicazione: (2024)
di: Sun, Zhouhao, et al.
Pubblicazione: (2024)
MAESTRO: Meta-learning Adaptive Estimation of Scalarization Trade-offs for Reward Optimization
di: Zhao, Yang, et al.
Pubblicazione: (2026)
di: Zhao, Yang, et al.
Pubblicazione: (2026)
Consolidation or Adaptation? PRISM: Disentangling SFT and RL Data via Gradient Concentration
di: Zhao, Yang, et al.
Pubblicazione: (2026)
di: Zhao, Yang, et al.
Pubblicazione: (2026)
Deciphering the Impact of Pretraining Data on Large Language Models through Machine Unlearning
di: Zhao, Yang, et al.
Pubblicazione: (2024)
di: Zhao, Yang, et al.
Pubblicazione: (2024)
ExpeTrans: LLMs Are Experiential Transfer Learners
di: Gao, Jinglong, et al.
Pubblicazione: (2025)
di: Gao, Jinglong, et al.
Pubblicazione: (2025)
MedPRMBench: A Fine-grained Benchmark for Process Reward Models in Medical Reasoning
di: Wu, Lingyan, et al.
Pubblicazione: (2026)
di: Wu, Lingyan, et al.
Pubblicazione: (2026)
Com$^2$: A Causal-Guided Benchmark for Exploring Complex Commonsense Reasoning in Large Language Models
di: Xiong, Kai, et al.
Pubblicazione: (2025)
di: Xiong, Kai, et al.
Pubblicazione: (2025)
UFO-RL: Uncertainty-Focused Optimization for Efficient Reinforcement Learning Data Selection
di: Zhao, Yang, et al.
Pubblicazione: (2025)
di: Zhao, Yang, et al.
Pubblicazione: (2025)
Causal-Guided Active Learning for Debiasing Large Language Models
di: Du, Li, et al.
Pubblicazione: (2024)
di: Du, Li, et al.
Pubblicazione: (2024)
Information Gain-Guided Causal Intervention for Autonomous Debiasing Large Language Models
di: Sun, Zhouhao, et al.
Pubblicazione: (2025)
di: Sun, Zhouhao, et al.
Pubblicazione: (2025)
Socratic-PRMBench: Benchmarking Process Reward Models with Systematic Reasoning Patterns
di: Li, Xiang, et al.
Pubblicazione: (2025)
di: Li, Xiang, et al.
Pubblicazione: (2025)
Linking Process to Outcome: Conditional Reward Modeling for LLM Reasoning
di: Zhang, Zheng, et al.
Pubblicazione: (2025)
di: Zhang, Zheng, et al.
Pubblicazione: (2025)
Supervised Fine-Tuning Achieve Rapid Task Adaption Via Alternating Attention Head Activation Patterns
di: Zhao, Yang, et al.
Pubblicazione: (2024)
di: Zhao, Yang, et al.
Pubblicazione: (2024)
Additivity of disjoint interval entanglement in quasiparticle excited states
di: Guo, Zhouhao, et al.
Pubblicazione: (2026)
di: Guo, Zhouhao, et al.
Pubblicazione: (2026)
$\texttt{MixGR}$: Enhancing Retriever Generalization for Scientific Domain through Complementary Granularity
di: Cai, Fengyu, et al.
Pubblicazione: (2024)
di: Cai, Fengyu, et al.
Pubblicazione: (2024)
Profiling RNA G‐Quadruplexes In vivo
di: Bibo Yang, et al.
Pubblicazione: (2025)
di: Bibo Yang, et al.
Pubblicazione: (2025)
ReCo: Reliable Causal Chain Reasoning via Structural Causal Recurrent Neural Networks
di: Xiong, Kai, et al.
Pubblicazione: (2022)
di: Xiong, Kai, et al.
Pubblicazione: (2022)
Examining Inter-Consistency of Large Language Models Collaboration: An In-depth Analysis via Debate
di: Xiong, Kai, et al.
Pubblicazione: (2023)
di: Xiong, Kai, et al.
Pubblicazione: (2023)
MR-Ben: A Meta-Reasoning Benchmark for Evaluating System-2 Thinking in LLMs
di: Zeng, Zhongshen, et al.
Pubblicazione: (2024)
di: Zeng, Zhongshen, et al.
Pubblicazione: (2024)
Beyond Similarity: A Gradient-based Graph Method for Instruction Tuning Data Selection
di: Zhao, Yang, et al.
Pubblicazione: (2025)
di: Zhao, Yang, et al.
Pubblicazione: (2025)
Free Process Rewards without Process Labels
di: Yuan, Lifan, et al.
Pubblicazione: (2024)
di: Yuan, Lifan, et al.
Pubblicazione: (2024)
How Sensitive Are Safety Benchmarks to Judge Configuration Choices?
di: Zhang, Xinran
Pubblicazione: (2026)
di: Zhang, Xinran
Pubblicazione: (2026)
Precision over Diversity: High-Precision Reward Generalizes to Robust Instruction Following
di: Zeng, Yirong, et al.
Pubblicazione: (2026)
di: Zeng, Yirong, et al.
Pubblicazione: (2026)
Diagnosing and Remedying Knowledge Deficiencies in LLMs via Label-free Curricular Meaningful Learning
di: Xiong, Kai, et al.
Pubblicazione: (2024)
di: Xiong, Kai, et al.
Pubblicazione: (2024)
FinBen: A Holistic Financial Benchmark for Large Language Models
di: Xie, Qianqian, et al.
Pubblicazione: (2024)
di: Xie, Qianqian, et al.
Pubblicazione: (2024)
Meaningful Learning: Enhancing Abstract Reasoning in Large Language Models via Generic Fact Guidance
di: Xiong, Kai, et al.
Pubblicazione: (2024)
di: Xiong, Kai, et al.
Pubblicazione: (2024)
MedGR$^2$: Breaking the Data Barrier for Medical Reasoning via Generative Reward Learning
di: Zhi, Weihai, et al.
Pubblicazione: (2025)
di: Zhi, Weihai, et al.
Pubblicazione: (2025)
Mobility-Aware Resource Allocation for mmWave IAB Networks: A Multi-Agent Reinforcement Learning Approach
di: Zhang, Bibo, et al.
Pubblicazione: (2022)
di: Zhang, Bibo, et al.
Pubblicazione: (2022)
Retrieval-Augmented Process Reward Model for Generalizable Mathematical Reasoning
di: Zhu, Jiachen, et al.
Pubblicazione: (2025)
di: Zhu, Jiachen, et al.
Pubblicazione: (2025)
An Efficient and Precise Training Data Construction Framework for Process-supervised Reward Model in Mathematical Reasoning
di: Sun, Wei, et al.
Pubblicazione: (2025)
di: Sun, Wei, et al.
Pubblicazione: (2025)
Energy characteristics and damage constitutive model of pre‐cracked granite with or without filling materials
di: Tao Tan, et al.
Pubblicazione: (2024)
di: Tao Tan, et al.
Pubblicazione: (2024)
Unmasking Reasoning Processes: A Process-aware Benchmark for Evaluating Structural Mathematical Reasoning in LLMs
di: Zheng, Xiang, et al.
Pubblicazione: (2026)
di: Zheng, Xiang, et al.
Pubblicazione: (2026)
Verifiable Process Rewards for Agentic Reasoning
di: Yuan, Huining, et al.
Pubblicazione: (2026)
di: Yuan, Huining, et al.
Pubblicazione: (2026)
This compressed archive contains the bibliometric dataset and derived analytical files used in this study.
di: hsieh, tang min
Pubblicazione: (2025)
di: hsieh, tang min
Pubblicazione: (2025)
GM-PRM: A Generative Multimodal Process Reward Model for Multimodal Mathematical Reasoning
di: Zhang, Jianghangfan, et al.
Pubblicazione: (2025)
di: Zhang, Jianghangfan, et al.
Pubblicazione: (2025)
Outcome Accuracy is Not Enough: Aligning the Reasoning Process of Reward Models
di: Wang, Binghai, et al.
Pubblicazione: (2026)
di: Wang, Binghai, et al.
Pubblicazione: (2026)
Guiding VLM Agents with Process Rewards at Inference Time for GUI Navigation
di: Hu, Zhiyuan, et al.
Pubblicazione: (2025)
di: Hu, Zhiyuan, et al.
Pubblicazione: (2025)
Documenti analoghi
-
DeepTool: Scaling Interleaved Deliberation in Tool-Integrated Reasoning via Process-Supervised Reinforcement Learning
di: He, Yang, et al.
Pubblicazione: (2026) -
Self-Route: Automatic Mode Switching via Capability Estimation for Efficient Reasoning
di: He, Yang, et al.
Pubblicazione: (2025) -
Large Language Models Are Still Misled by Simple Bias Ensembles
di: Sun, Zhouhao, et al.
Pubblicazione: (2025) -
Towards Generalizable and Faithful Logic Reasoning over Natural Language via Resolution Refutation
di: Sun, Zhouhao, et al.
Pubblicazione: (2024) -
MAESTRO: Meta-learning Adaptive Estimation of Scalarization Trade-offs for Reward Optimization
di: Zhao, Yang, et al.
Pubblicazione: (2026)