Proof-RM: A Scalable and Generalizable Reward Model for Math Proof
Fuente:
arXiv
Guardado en:
| Autores principales: | Yang, Haotong, Wang, Zitong, Kang, Shijia, Yang, Siqi, Yu, Wenkai, Niu, Xu, Sun, Yike, Hu, Yi, Lin, Zhouchen, Zhang, Muhan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Number Cookbook: Number Understanding of Language Models and How to Improve It
por: Yang, Haotong, et al.
Publicado: (2024)
por: Yang, Haotong, et al.
Publicado: (2024)
LiteToken: Removing Intermediate Merge Residues From BPE Tokenizers
por: Sun, Yike, et al.
Publicado: (2026)
por: Sun, Yike, et al.
Publicado: (2026)
Beyond Single-Task: Robust Multi-Task Length Generalization for LLMs
por: Hu, Yi, et al.
Publicado: (2025)
por: Hu, Yi, et al.
Publicado: (2025)
Parrot Mind: Towards Explaining the Complex Task Reasoning of Pretrained Large Language Models with Template-Content Structure
por: Yang, Haotong, et al.
Publicado: (2023)
por: Yang, Haotong, et al.
Publicado: (2023)
Case-Based or Rule-Based: How Do Transformers Do the Math?
por: Hu, Yi, et al.
Publicado: (2024)
por: Hu, Yi, et al.
Publicado: (2024)
GL-Fusion: Rethinking the Combination of Graph Neural Network and Large Language model
por: Yang, Haotong, et al.
Publicado: (2024)
por: Yang, Haotong, et al.
Publicado: (2024)
FormalProofBench: Can Models Write Graduate Level Math Proofs That Are Formally Verified?
por: Ravi, Nikil, et al.
Publicado: (2026)
por: Ravi, Nikil, et al.
Publicado: (2026)
ImplicitRM: Unbiased Reward Modeling from Implicit Preference Data for LLM alignment
por: Wang, Hao, et al.
Publicado: (2026)
por: Wang, Hao, et al.
Publicado: (2026)
CausalRM: Causal-Theoretic Reward Modeling for RLHF from Observational User Feedbacks
por: Wang, Hao, et al.
Publicado: (2026)
por: Wang, Hao, et al.
Publicado: (2026)
Proof or Bluff? Evaluating LLMs on 2025 USA Math Olympiad
por: Petrov, Ivo, et al.
Publicado: (2025)
por: Petrov, Ivo, et al.
Publicado: (2025)
SteerRM: Debiasing Reward Models via Sparse Autoencoders
por: Sun, Mengyuan, et al.
Publicado: (2026)
por: Sun, Mengyuan, et al.
Publicado: (2026)
ToolRM: Towards Agentic Tool-Use Reward Modeling
por: Li, Renhao, et al.
Publicado: (2025)
por: Li, Renhao, et al.
Publicado: (2025)
Reliable Fine-Grained Evaluation of Natural Language Math Proofs
por: Ma, Wenjie, et al.
Publicado: (2025)
por: Ma, Wenjie, et al.
Publicado: (2025)
AgentRM: Enhancing Agent Generalization with Reward Modeling
por: Xia, Yu, et al.
Publicado: (2025)
por: Xia, Yu, et al.
Publicado: (2025)
APE-Bench: Evaluating Automated Proof Engineering for Formal Math Libraries
por: Xin, Huajian, et al.
Publicado: (2025)
por: Xin, Huajian, et al.
Publicado: (2025)
Proof2Hybrid: Automatic Mathematical Benchmark Synthesis for Proof-Centric Problems
por: Peng, Yebo, et al.
Publicado: (2025)
por: Peng, Yebo, et al.
Publicado: (2025)
Can LLMs Solve longer Math Word Problems Better?
por: Xu, Xin, et al.
Publicado: (2024)
por: Xu, Xin, et al.
Publicado: (2024)
RM-Distiller: Exploiting Generative LLM for Reward Model Distillation
por: Zhou, Hongli, et al.
Publicado: (2026)
por: Zhou, Hongli, et al.
Publicado: (2026)
RM-R1: Reward Modeling as Reasoning
por: Chen, Xiusi, et al.
Publicado: (2025)
por: Chen, Xiusi, et al.
Publicado: (2025)
P-GenRM: Personalized Generative Reward Model with Test-time User-based Scaling
por: Zhang, Pinyi, et al.
Publicado: (2026)
por: Zhang, Pinyi, et al.
Publicado: (2026)
MathGAP: Out-of-Distribution Evaluation on Problems with Arbitrarily Complex Proofs
por: Opedal, Andreas, et al.
Publicado: (2024)
por: Opedal, Andreas, et al.
Publicado: (2024)
ProofOptimizer: Training Language Models to Simplify Proofs without Human Demonstrations
por: Gu, Alex, et al.
Publicado: (2025)
por: Gu, Alex, et al.
Publicado: (2025)
AceMath: Advancing Frontier Math Reasoning with Post-Training and Reward Modeling
por: Liu, Zihan, et al.
Publicado: (2024)
por: Liu, Zihan, et al.
Publicado: (2024)
DogeRM: Equipping Reward Models with Domain Knowledge through Model Merging
por: Lin, Tzu-Han, et al.
Publicado: (2024)
por: Lin, Tzu-Han, et al.
Publicado: (2024)
Dynamic and Generalizable Process Reward Modeling
por: Yin, Zhangyue, et al.
Publicado: (2025)
por: Yin, Zhangyue, et al.
Publicado: (2025)
ProgRM: Build Better GUI Agents with Progress Rewards
por: Zhang, Danyang, et al.
Publicado: (2025)
por: Zhang, Danyang, et al.
Publicado: (2025)
Regularizing Hidden States Enables Learning Generalizable Reward Model for LLMs
por: Yang, Rui, et al.
Publicado: (2024)
por: Yang, Rui, et al.
Publicado: (2024)
RM-Bench: Benchmarking Reward Models of Language Models with Subtlety and Style
por: Liu, Yantao, et al.
Publicado: (2024)
por: Liu, Yantao, et al.
Publicado: (2024)
What Affects the Effective Depth of Large Language Models?
por: Hu, Yi, et al.
Publicado: (2025)
por: Hu, Yi, et al.
Publicado: (2025)
Natural Language Translation of Formal Proofs through Informalization of Proof Steps and Recursive Summarization along Proof Structure
por: Hattori, Seiji, et al.
Publicado: (2025)
por: Hattori, Seiji, et al.
Publicado: (2025)
CE-RM: A Pointwise Generative Reward Model Optimized via Two-Stage Rollout and Unified Criteria
por: Hu, Xinyu, et al.
Publicado: (2026)
por: Hu, Xinyu, et al.
Publicado: (2026)
ConsistRM: Improving Generative Reward Models via Consistency-Aware Self-Training
por: Liang, Yu, et al.
Publicado: (2026)
por: Liang, Yu, et al.
Publicado: (2026)
HAF-RM: A Hybrid Alignment Framework for Reward Model Training
por: Liu, Shujun, et al.
Publicado: (2024)
por: Liu, Shujun, et al.
Publicado: (2024)
LongRM: Revealing and Unlocking the Context Boundary of Reward Modeling
por: Tang, Zecheng, et al.
Publicado: (2025)
por: Tang, Zecheng, et al.
Publicado: (2025)
Automating Equational Proofs in Dirac Notation
por: Xu, Yingte, et al.
Publicado: (2024)
por: Xu, Yingte, et al.
Publicado: (2024)
ToolRM: Outcome Reward Models for Tool-Calling Large Language Models
por: Agarwal, Mayank, et al.
Publicado: (2025)
por: Agarwal, Mayank, et al.
Publicado: (2025)
Learning beyond Teacher: Generalized On-Policy Distillation with Reward Extrapolation
por: Yang, Wenkai, et al.
Publicado: (2026)
por: Yang, Wenkai, et al.
Publicado: (2026)
Not All Proofs Are Equal: Evaluating LLM Proof Quality Beyond Correctness
por: Petrov, Ivo, et al.
Publicado: (2026)
por: Petrov, Ivo, et al.
Publicado: (2026)
AnyPoC: Universal Proof-of-Concept Test Generation for Scalable LLM-Based Bug Detection
por: Zhao, Zijie, et al.
Publicado: (2026)
por: Zhao, Zijie, et al.
Publicado: (2026)
ExVerus: Verus Proof Repair via Counterexample Reasoning
por: Yang, Jun, et al.
Publicado: (2026)
por: Yang, Jun, et al.
Publicado: (2026)
Ejemplares similares
-
Number Cookbook: Number Understanding of Language Models and How to Improve It
por: Yang, Haotong, et al.
Publicado: (2024) -
LiteToken: Removing Intermediate Merge Residues From BPE Tokenizers
por: Sun, Yike, et al.
Publicado: (2026) -
Beyond Single-Task: Robust Multi-Task Length Generalization for LLMs
por: Hu, Yi, et al.
Publicado: (2025) -
Parrot Mind: Towards Explaining the Complex Task Reasoning of Pretrained Large Language Models with Template-Content Structure
por: Yang, Haotong, et al.
Publicado: (2023) -
Case-Based or Rule-Based: How Do Transformers Do the Math?
por: Hu, Yi, et al.
Publicado: (2024)