PRIME: A Process-Outcome Alignment Benchmark for Verifiable Reasoning in Mathematics and Engineering
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Xiangfeng, Guo, Hangyu, Lai, Yanlin, Huang, Mitt, Zhao, Liang, Yao, Chengyuan, Zhang, Yinmin, Han, Qi, Ren, Xiaoxiao, Yuan, Chun, Xu, Tong, Ge, Zheng, Zhang, Xiangyu, Jiang, Daxin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
R-Align: Enhancing Generative Reward Models through Rationale-Centric Meta-Judging
di: Lai, Yanlin, et al.
Pubblicazione: (2026)
di: Lai, Yanlin, et al.
Pubblicazione: (2026)
WebVR: Benchmarking Multimodal LLMs for WebPage Recreation from Videos via Human-Aligned Visual Rubrics
di: Dai, Yuhong, et al.
Pubblicazione: (2026)
di: Dai, Yuhong, et al.
Pubblicazione: (2026)
Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model
di: Hu, Jingcheng, et al.
Pubblicazione: (2025)
di: Hu, Jingcheng, et al.
Pubblicazione: (2025)
EngTrace: A Symbolic Benchmark for Verifiable Process Supervision of Engineering Reasoning
di: Gull, Ayesha, et al.
Pubblicazione: (2025)
di: Gull, Ayesha, et al.
Pubblicazione: (2025)
Thinking by Doing: Building Efficient World Model Reasoning in LLMs via Multi-turn Interaction
di: Shu, Bao, et al.
Pubblicazione: (2025)
di: Shu, Bao, et al.
Pubblicazione: (2025)
Unmasking Reasoning Processes: A Process-aware Benchmark for Evaluating Structural Mathematical Reasoning in LLMs
di: Zheng, Xiang, et al.
Pubblicazione: (2026)
di: Zheng, Xiang, et al.
Pubblicazione: (2026)
Verifier-Backed Hard Problem Generation for Mathematical Reasoning
di: Lai, Yuhang, et al.
Pubblicazione: (2026)
di: Lai, Yuhang, et al.
Pubblicazione: (2026)
Multi-matrix Factorization Attention
di: Hu, Jingcheng, et al.
Pubblicazione: (2024)
di: Hu, Jingcheng, et al.
Pubblicazione: (2024)
PaCoRe: Learning to Scale Test-Time Compute with Parallel Coordinated Reasoning
di: Hu, Jingcheng, et al.
Pubblicazione: (2026)
di: Hu, Jingcheng, et al.
Pubblicazione: (2026)
Beyond the First Error: Process Reward Models for Reflective Mathematical Reasoning
di: Yang, Zhaohui, et al.
Pubblicazione: (2025)
di: Yang, Zhaohui, et al.
Pubblicazione: (2025)
PRIME: Planning and Retrieval-Integrated Memory for Enhanced Reasoning
di: Tran, Hieu, et al.
Pubblicazione: (2025)
di: Tran, Hieu, et al.
Pubblicazione: (2025)
GEBench: Benchmarking Image Generation Models as GUI Environments
di: Li, Haodong, et al.
Pubblicazione: (2026)
di: Li, Haodong, et al.
Pubblicazione: (2026)
DeepSeekMath-V2: Towards Self-Verifiable Mathematical Reasoning
di: Shao, Zhihong, et al.
Pubblicazione: (2025)
di: Shao, Zhihong, et al.
Pubblicazione: (2025)
Trade-R1: Bridging Verifiable Rewards to Stochastic Environments via Process-Level Reasoning Verification
di: Sun, Rui, et al.
Pubblicazione: (2026)
di: Sun, Rui, et al.
Pubblicazione: (2026)
Open Vision Reasoner: Transferring Linguistic Cognitive Behavior for Visual Reasoning
di: Wei, Yana, et al.
Pubblicazione: (2025)
di: Wei, Yana, et al.
Pubblicazione: (2025)
Beyond Outcome Verification: Verifiable Process Reward Models for Structured Reasoning
di: Pronesti, Massimiliano, et al.
Pubblicazione: (2026)
di: Pronesti, Massimiliano, et al.
Pubblicazione: (2026)
DistTrain: Addressing Model and Data Heterogeneity with Disaggregated Training for Multimodal Large Language Models
di: Zhang, Zili, et al.
Pubblicazione: (2024)
di: Zhang, Zili, et al.
Pubblicazione: (2024)
PRIME-DP: Pre-trained Integrated Model for Earthquake Data Processing
di: Yu, Ziye, et al.
Pubblicazione: (2024)
di: Yu, Ziye, et al.
Pubblicazione: (2024)
VeRA: Verified Reasoning Data Augmentation at Scale
di: Cheng, Zerui, et al.
Pubblicazione: (2026)
di: Cheng, Zerui, et al.
Pubblicazione: (2026)
VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains
di: Li, Xuzhao, et al.
Pubblicazione: (2025)
di: Li, Xuzhao, et al.
Pubblicazione: (2025)
Random Policy Valuation is Enough for LLM Reasoning with Verifiable Rewards
di: He, Haoran, et al.
Pubblicazione: (2025)
di: He, Haoran, et al.
Pubblicazione: (2025)
VERIFY-RL: Verifiable Recursive Decomposition for Reinforcement Learning in Mathematical Reasoning
di: Qasim, Kaleem Ullah, et al.
Pubblicazione: (2026)
di: Qasim, Kaleem Ullah, et al.
Pubblicazione: (2026)
Verifiable Process Rewards for Agentic Reasoning
di: Yuan, Huining, et al.
Pubblicazione: (2026)
di: Yuan, Huining, et al.
Pubblicazione: (2026)
EvolMathEval: Towards Evolvable Benchmarks for Mathematical Reasoning via Evolutionary Testing
di: Wang, Shengbo, et al.
Pubblicazione: (2025)
di: Wang, Shengbo, et al.
Pubblicazione: (2025)
Formal Conjectures: An Open and Evolving Benchmark for Verified Discovery in Mathematics
di: Firsching, Moritz, et al.
Pubblicazione: (2026)
di: Firsching, Moritz, et al.
Pubblicazione: (2026)
PRIME: Large Language Model Personalization with Cognitive Dual-Memory and Personalized Thought Process
di: Zhang, Xinliang Frederick, et al.
Pubblicazione: (2025)
di: Zhang, Xinliang Frederick, et al.
Pubblicazione: (2025)
SymCode: A Neurosymbolic Approach to Mathematical Reasoning via Verifiable Code Generation
di: Nezhad, Sina Bagheri, et al.
Pubblicazione: (2025)
di: Nezhad, Sina Bagheri, et al.
Pubblicazione: (2025)
MathSmith: Towards Extremely Hard Mathematical Reasoning by Forging Synthetic Problems with a Reinforced Policy
di: Zhan, Shaoxiong, et al.
Pubblicazione: (2025)
di: Zhan, Shaoxiong, et al.
Pubblicazione: (2025)
MathChat: Benchmarking Mathematical Reasoning and Instruction Following in Multi-Turn Interactions
di: Liang, Zhenwen, et al.
Pubblicazione: (2024)
di: Liang, Zhenwen, et al.
Pubblicazione: (2024)
ProcessBench: Identifying Process Errors in Mathematical Reasoning
di: Zheng, Chujie, et al.
Pubblicazione: (2024)
di: Zheng, Chujie, et al.
Pubblicazione: (2024)
Reasoning Pattern Alignment Merging for Adaptive Reasoning
di: Zhong, Zhaofeng, et al.
Pubblicazione: (2026)
di: Zhong, Zhaofeng, et al.
Pubblicazione: (2026)
PRIME: Protect Your Videos From Malicious Editing
di: Li, Guanlin, et al.
Pubblicazione: (2024)
di: Li, Guanlin, et al.
Pubblicazione: (2024)
HERMES: Towards Efficient and Verifiable Mathematical Reasoning in LLMs
di: Ospanov, Azim, et al.
Pubblicazione: (2025)
di: Ospanov, Azim, et al.
Pubblicazione: (2025)
Scaling Flaws of Verifier-Guided Search in Mathematical Reasoning
di: Yu, Fei, et al.
Pubblicazione: (2025)
di: Yu, Fei, et al.
Pubblicazione: (2025)
PERMUTABLE PRIME NUMBERS and CIRCULAR PRIME NUMBERS DECOMPOSITIONS FOR MERSENNES EXPONENTS
di: Martin, Doina
Pubblicazione: (2026)
di: Martin, Doina
Pubblicazione: (2026)
Linking Process to Outcome: Conditional Reward Modeling for LLM Reasoning
di: Zhang, Zheng, et al.
Pubblicazione: (2025)
di: Zhang, Zheng, et al.
Pubblicazione: (2025)
FormalMATH: Benchmarking Formal Mathematical Reasoning of Large Language Models
di: Yu, Zhouliang, et al.
Pubblicazione: (2025)
di: Yu, Zhouliang, et al.
Pubblicazione: (2025)
Self-Supervised Visual Preference Alignment
di: Zhu, Ke, et al.
Pubblicazione: (2024)
di: Zhu, Ke, et al.
Pubblicazione: (2024)
A Survey of Multimodal Mathematical Reasoning: From Perception, Alignment to Reasoning
di: Yang, Tianyu, et al.
Pubblicazione: (2026)
di: Yang, Tianyu, et al.
Pubblicazione: (2026)
PRIME: Policy-Reinforced Iterative Multi-agent Execution for Algorithmic Reasoning in Large Language Models
di: Xu, Jiawei, et al.
Pubblicazione: (2026)
di: Xu, Jiawei, et al.
Pubblicazione: (2026)
Documenti analoghi
-
R-Align: Enhancing Generative Reward Models through Rationale-Centric Meta-Judging
di: Lai, Yanlin, et al.
Pubblicazione: (2026) -
WebVR: Benchmarking Multimodal LLMs for WebPage Recreation from Videos via Human-Aligned Visual Rubrics
di: Dai, Yuhong, et al.
Pubblicazione: (2026) -
Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model
di: Hu, Jingcheng, et al.
Pubblicazione: (2025) -
EngTrace: A Symbolic Benchmark for Verifiable Process Supervision of Engineering Reasoning
di: Gull, Ayesha, et al.
Pubblicazione: (2025) -
Thinking by Doing: Building Efficient World Model Reasoning in LLMs via Multi-turn Interaction
di: Shu, Bao, et al.
Pubblicazione: (2025)