Proof-RM: A Scalable and Generalizable Reward Model for Math Proof
Fuente:
arXiv
Salvato in:
| Autori principali: | Yang, Haotong, Wang, Zitong, Kang, Shijia, Yang, Siqi, Yu, Wenkai, Niu, Xu, Sun, Yike, Hu, Yi, Lin, Zhouchen, Zhang, Muhan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Number Cookbook: Number Understanding of Language Models and How to Improve It
di: Yang, Haotong, et al.
Pubblicazione: (2024)
di: Yang, Haotong, et al.
Pubblicazione: (2024)
LiteToken: Removing Intermediate Merge Residues From BPE Tokenizers
di: Sun, Yike, et al.
Pubblicazione: (2026)
di: Sun, Yike, et al.
Pubblicazione: (2026)
Beyond Single-Task: Robust Multi-Task Length Generalization for LLMs
di: Hu, Yi, et al.
Pubblicazione: (2025)
di: Hu, Yi, et al.
Pubblicazione: (2025)
Parrot Mind: Towards Explaining the Complex Task Reasoning of Pretrained Large Language Models with Template-Content Structure
di: Yang, Haotong, et al.
Pubblicazione: (2023)
di: Yang, Haotong, et al.
Pubblicazione: (2023)
Case-Based or Rule-Based: How Do Transformers Do the Math?
di: Hu, Yi, et al.
Pubblicazione: (2024)
di: Hu, Yi, et al.
Pubblicazione: (2024)
GL-Fusion: Rethinking the Combination of Graph Neural Network and Large Language model
di: Yang, Haotong, et al.
Pubblicazione: (2024)
di: Yang, Haotong, et al.
Pubblicazione: (2024)
FormalProofBench: Can Models Write Graduate Level Math Proofs That Are Formally Verified?
di: Ravi, Nikil, et al.
Pubblicazione: (2026)
di: Ravi, Nikil, et al.
Pubblicazione: (2026)
ImplicitRM: Unbiased Reward Modeling from Implicit Preference Data for LLM alignment
di: Wang, Hao, et al.
Pubblicazione: (2026)
di: Wang, Hao, et al.
Pubblicazione: (2026)
CausalRM: Causal-Theoretic Reward Modeling for RLHF from Observational User Feedbacks
di: Wang, Hao, et al.
Pubblicazione: (2026)
di: Wang, Hao, et al.
Pubblicazione: (2026)
Proof or Bluff? Evaluating LLMs on 2025 USA Math Olympiad
di: Petrov, Ivo, et al.
Pubblicazione: (2025)
di: Petrov, Ivo, et al.
Pubblicazione: (2025)
SteerRM: Debiasing Reward Models via Sparse Autoencoders
di: Sun, Mengyuan, et al.
Pubblicazione: (2026)
di: Sun, Mengyuan, et al.
Pubblicazione: (2026)
ToolRM: Towards Agentic Tool-Use Reward Modeling
di: Li, Renhao, et al.
Pubblicazione: (2025)
di: Li, Renhao, et al.
Pubblicazione: (2025)
Reliable Fine-Grained Evaluation of Natural Language Math Proofs
di: Ma, Wenjie, et al.
Pubblicazione: (2025)
di: Ma, Wenjie, et al.
Pubblicazione: (2025)
AgentRM: Enhancing Agent Generalization with Reward Modeling
di: Xia, Yu, et al.
Pubblicazione: (2025)
di: Xia, Yu, et al.
Pubblicazione: (2025)
APE-Bench: Evaluating Automated Proof Engineering for Formal Math Libraries
di: Xin, Huajian, et al.
Pubblicazione: (2025)
di: Xin, Huajian, et al.
Pubblicazione: (2025)
Proof2Hybrid: Automatic Mathematical Benchmark Synthesis for Proof-Centric Problems
di: Peng, Yebo, et al.
Pubblicazione: (2025)
di: Peng, Yebo, et al.
Pubblicazione: (2025)
Can LLMs Solve longer Math Word Problems Better?
di: Xu, Xin, et al.
Pubblicazione: (2024)
di: Xu, Xin, et al.
Pubblicazione: (2024)
RM-Distiller: Exploiting Generative LLM for Reward Model Distillation
di: Zhou, Hongli, et al.
Pubblicazione: (2026)
di: Zhou, Hongli, et al.
Pubblicazione: (2026)
RM-R1: Reward Modeling as Reasoning
di: Chen, Xiusi, et al.
Pubblicazione: (2025)
di: Chen, Xiusi, et al.
Pubblicazione: (2025)
P-GenRM: Personalized Generative Reward Model with Test-time User-based Scaling
di: Zhang, Pinyi, et al.
Pubblicazione: (2026)
di: Zhang, Pinyi, et al.
Pubblicazione: (2026)
MathGAP: Out-of-Distribution Evaluation on Problems with Arbitrarily Complex Proofs
di: Opedal, Andreas, et al.
Pubblicazione: (2024)
di: Opedal, Andreas, et al.
Pubblicazione: (2024)
ProofOptimizer: Training Language Models to Simplify Proofs without Human Demonstrations
di: Gu, Alex, et al.
Pubblicazione: (2025)
di: Gu, Alex, et al.
Pubblicazione: (2025)
AceMath: Advancing Frontier Math Reasoning with Post-Training and Reward Modeling
di: Liu, Zihan, et al.
Pubblicazione: (2024)
di: Liu, Zihan, et al.
Pubblicazione: (2024)
DogeRM: Equipping Reward Models with Domain Knowledge through Model Merging
di: Lin, Tzu-Han, et al.
Pubblicazione: (2024)
di: Lin, Tzu-Han, et al.
Pubblicazione: (2024)
Dynamic and Generalizable Process Reward Modeling
di: Yin, Zhangyue, et al.
Pubblicazione: (2025)
di: Yin, Zhangyue, et al.
Pubblicazione: (2025)
ProgRM: Build Better GUI Agents with Progress Rewards
di: Zhang, Danyang, et al.
Pubblicazione: (2025)
di: Zhang, Danyang, et al.
Pubblicazione: (2025)
Regularizing Hidden States Enables Learning Generalizable Reward Model for LLMs
di: Yang, Rui, et al.
Pubblicazione: (2024)
di: Yang, Rui, et al.
Pubblicazione: (2024)
RM-Bench: Benchmarking Reward Models of Language Models with Subtlety and Style
di: Liu, Yantao, et al.
Pubblicazione: (2024)
di: Liu, Yantao, et al.
Pubblicazione: (2024)
What Affects the Effective Depth of Large Language Models?
di: Hu, Yi, et al.
Pubblicazione: (2025)
di: Hu, Yi, et al.
Pubblicazione: (2025)
Natural Language Translation of Formal Proofs through Informalization of Proof Steps and Recursive Summarization along Proof Structure
di: Hattori, Seiji, et al.
Pubblicazione: (2025)
di: Hattori, Seiji, et al.
Pubblicazione: (2025)
CE-RM: A Pointwise Generative Reward Model Optimized via Two-Stage Rollout and Unified Criteria
di: Hu, Xinyu, et al.
Pubblicazione: (2026)
di: Hu, Xinyu, et al.
Pubblicazione: (2026)
ConsistRM: Improving Generative Reward Models via Consistency-Aware Self-Training
di: Liang, Yu, et al.
Pubblicazione: (2026)
di: Liang, Yu, et al.
Pubblicazione: (2026)
HAF-RM: A Hybrid Alignment Framework for Reward Model Training
di: Liu, Shujun, et al.
Pubblicazione: (2024)
di: Liu, Shujun, et al.
Pubblicazione: (2024)
LongRM: Revealing and Unlocking the Context Boundary of Reward Modeling
di: Tang, Zecheng, et al.
Pubblicazione: (2025)
di: Tang, Zecheng, et al.
Pubblicazione: (2025)
Automating Equational Proofs in Dirac Notation
di: Xu, Yingte, et al.
Pubblicazione: (2024)
di: Xu, Yingte, et al.
Pubblicazione: (2024)
ToolRM: Outcome Reward Models for Tool-Calling Large Language Models
di: Agarwal, Mayank, et al.
Pubblicazione: (2025)
di: Agarwal, Mayank, et al.
Pubblicazione: (2025)
Learning beyond Teacher: Generalized On-Policy Distillation with Reward Extrapolation
di: Yang, Wenkai, et al.
Pubblicazione: (2026)
di: Yang, Wenkai, et al.
Pubblicazione: (2026)
Not All Proofs Are Equal: Evaluating LLM Proof Quality Beyond Correctness
di: Petrov, Ivo, et al.
Pubblicazione: (2026)
di: Petrov, Ivo, et al.
Pubblicazione: (2026)
AnyPoC: Universal Proof-of-Concept Test Generation for Scalable LLM-Based Bug Detection
di: Zhao, Zijie, et al.
Pubblicazione: (2026)
di: Zhao, Zijie, et al.
Pubblicazione: (2026)
ExVerus: Verus Proof Repair via Counterexample Reasoning
di: Yang, Jun, et al.
Pubblicazione: (2026)
di: Yang, Jun, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Number Cookbook: Number Understanding of Language Models and How to Improve It
di: Yang, Haotong, et al.
Pubblicazione: (2024) -
LiteToken: Removing Intermediate Merge Residues From BPE Tokenizers
di: Sun, Yike, et al.
Pubblicazione: (2026) -
Beyond Single-Task: Robust Multi-Task Length Generalization for LLMs
di: Hu, Yi, et al.
Pubblicazione: (2025) -
Parrot Mind: Towards Explaining the Complex Task Reasoning of Pretrained Large Language Models with Template-Content Structure
di: Yang, Haotong, et al.
Pubblicazione: (2023) -
Case-Based or Rule-Based: How Do Transformers Do the Math?
di: Hu, Yi, et al.
Pubblicazione: (2024)