FormalRewardBench: A Benchmark for Formal Theorem Proving Reward Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Uluşan, Zeynel A., Akbudak, Burak S., Erer, Can S., Şahin, Gözde Gül |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Steering LLMs for Formal Theorem Proving
por: Kirtania, Shashank, et al.
Publicado: (2025)
por: Kirtania, Shashank, et al.
Publicado: (2025)
Beyond Theorem Proving: Formulation, Framework and Benchmark for Formal Problem-Solving
por: Liu, Qi, et al.
Publicado: (2025)
por: Liu, Qi, et al.
Publicado: (2025)
Mathesis: Towards Formal Theorem Proving from Natural Languages
por: Xuejun, Yu, et al.
Publicado: (2025)
por: Xuejun, Yu, et al.
Publicado: (2025)
What are the Right Symmetries for Formal Theorem Proving?
por: Olejniczak, Krzysztof, et al.
Publicado: (2026)
por: Olejniczak, Krzysztof, et al.
Publicado: (2026)
OProver: A Unified Framework for Agentic Formal Theorem Proving
por: Ma, David, et al.
Publicado: (2026)
por: Ma, David, et al.
Publicado: (2026)
An In-Context Learning Agent for Formal Theorem-Proving
por: Thakur, Amitayush, et al.
Publicado: (2023)
por: Thakur, Amitayush, et al.
Publicado: (2023)
GAR: Generative Adversarial Reinforcement Learning for Formal Theorem Proving
por: Wang, Ruida, et al.
Publicado: (2025)
por: Wang, Ruida, et al.
Publicado: (2025)
LeanAgent: Lifelong Learning for Formal Theorem Proving
por: Kumarappan, Adarsh, et al.
Publicado: (2024)
por: Kumarappan, Adarsh, et al.
Publicado: (2024)
MSC-180: A Benchmark for Automated Formal Theorem Proving from Mathematical Subject Classification
por: Li, Sirui, et al.
Publicado: (2025)
por: Li, Sirui, et al.
Publicado: (2025)
A Zero-Shot Open-Vocabulary Pipeline for Dialogue Understanding
por: Safa, Abdulfattah, et al.
Publicado: (2024)
por: Safa, Abdulfattah, et al.
Publicado: (2024)
GECTurk WEB: An Explainable Online Platform for Turkish Grammatical Error Detection and Correction
por: Gebeşçe, Ali, et al.
Publicado: (2024)
por: Gebeşçe, Ali, et al.
Publicado: (2024)
Expected Value Alignment for Generative Reward Modeling in Formal Mathematics Verification
por: Ji, Shihao, et al.
Publicado: (2026)
por: Ji, Shihao, et al.
Publicado: (2026)
Enhancing Formal Theorem Proving: A Comprehensive Dataset for Training AI Models on Coq Code
por: Florath, Andreas
Publicado: (2024)
por: Florath, Andreas
Publicado: (2024)
FVEL: Interactive Formal Verification Environment with Large Language Models via Theorem Proving
por: Lin, Xiaohan, et al.
Publicado: (2024)
por: Lin, Xiaohan, et al.
Publicado: (2024)
EvolProver: Advancing Automated Theorem Proving by Evolving Formalized Problems via Symmetry and Difficulty
por: Tian, Yuchen, et al.
Publicado: (2025)
por: Tian, Yuchen, et al.
Publicado: (2025)
OptProver: Bridging Olympiad and Optimization through Continual Training in Formal Theorem Proving
por: Li, Chenyi, et al.
Publicado: (2026)
por: Li, Chenyi, et al.
Publicado: (2026)
Neural Theorem Proving: Generating and Structuring Proofs for Formal Verification
por: Rao, Balaji, et al.
Publicado: (2025)
por: Rao, Balaji, et al.
Publicado: (2025)
Formal Theorem Proving by Rewarding LLMs to Decompose Proofs Hierarchically
por: Dong, Kefan, et al.
Publicado: (2024)
por: Dong, Kefan, et al.
Publicado: (2024)
Leanabell-Prover-V2: Verifier-integrated Reasoning for Formal Theorem Proving via Reinforcement Learning
por: Ji, Xingguang, et al.
Publicado: (2025)
por: Ji, Xingguang, et al.
Publicado: (2025)
MA-LoT: Model-Collaboration Lean-based Long Chain-of-Thought Reasoning enhances Formal Theorem Proving
por: Wang, Ruida, et al.
Publicado: (2025)
por: Wang, Ruida, et al.
Publicado: (2025)
MemoryRewardBench: Benchmarking Reward Models for Long-Term Memory Management in Large Language Models
por: Tang, Zecheng, et al.
Publicado: (2026)
por: Tang, Zecheng, et al.
Publicado: (2026)
RAG-RewardBench: Benchmarking Reward Models in Retrieval Augmented Generation for Preference Alignment
por: Jin, Zhuoran, et al.
Publicado: (2024)
por: Jin, Zhuoran, et al.
Publicado: (2024)
Proving the Coding Interview: A Benchmark for Formally Verified Code Generation
por: Dougherty, Quinn, et al.
Publicado: (2025)
por: Dougherty, Quinn, et al.
Publicado: (2025)
Goedel-Prover-V2: Scaling Formal Theorem Proving with Scaffolded Data Synthesis and Self-Correction
por: Lin, Yong, et al.
Publicado: (2025)
por: Lin, Yong, et al.
Publicado: (2025)
Cetvel: A Unified Benchmark for Evaluating Language Understanding, Generation and Cultural Capacity of LLMs for Turkish
por: Er, Yakup Abrek, et al.
Publicado: (2025)
por: Er, Yakup Abrek, et al.
Publicado: (2025)
Med-RewardBench: Benchmarking Reward Models and Judges for Medical Multimodal Large Language Models
por: Ding, Meidan, et al.
Publicado: (2025)
por: Ding, Meidan, et al.
Publicado: (2025)
Quantifying Divergence for Human-AI Collaboration and Cognitive Trust
por: Kural, Müge, et al.
Publicado: (2023)
por: Kural, Müge, et al.
Publicado: (2023)
M-RewardBench: Evaluating Reward Models in Multilingual Settings
por: Gureja, Srishti, et al.
Publicado: (2024)
por: Gureja, Srishti, et al.
Publicado: (2024)
A Combinatorial Identities Benchmark for Theorem Proving via Automated Theorem Generation
por: Xiong, Beibei, et al.
Publicado: (2025)
por: Xiong, Beibei, et al.
Publicado: (2025)
DafnyBench: A Benchmark for Formal Software Verification
por: Loughridge, Chloe, et al.
Publicado: (2024)
por: Loughridge, Chloe, et al.
Publicado: (2024)
VerifyBench: Benchmarking Reference-based Reward Systems for Large Language Models
por: Yan, Yuchen, et al.
Publicado: (2025)
por: Yan, Yuchen, et al.
Publicado: (2025)
Exploring RL-based LLM Training for Formal Language Tasks with Programmed Rewards
por: Padula, Alexander G., et al.
Publicado: (2024)
por: Padula, Alexander G., et al.
Publicado: (2024)
Multimodal RewardBench: Holistic Evaluation of Reward Models for Vision Language Models
por: Yasunaga, Michihiro, et al.
Publicado: (2025)
por: Yasunaga, Michihiro, et al.
Publicado: (2025)
MCJudgeBench: A Benchmark for Constraint-Level Judge Evaluation in Multi-Constraint Instruction Following
por: Lee, Jaeyun, et al.
Publicado: (2026)
por: Lee, Jaeyun, et al.
Publicado: (2026)
FormalMATH: Benchmarking Formal Mathematical Reasoning of Large Language Models
por: Yu, Zhouliang, et al.
Publicado: (2025)
por: Yu, Zhouliang, et al.
Publicado: (2025)
Lean Meets Theoretical Computer Science: Scalable Synthesis of Theorem Proving Challenges in Formal-Informal Pairs
por: Zhang, Terry Jingchen, et al.
Publicado: (2025)
por: Zhang, Terry Jingchen, et al.
Publicado: (2025)
Proving Theorems Recursively
por: Wang, Haiming, et al.
Publicado: (2024)
por: Wang, Haiming, et al.
Publicado: (2024)
Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents
por: Men, Tianyi, et al.
Publicado: (2025)
por: Men, Tianyi, et al.
Publicado: (2025)
VideoRewardBench: Comprehensive Evaluation of Multimodal Reward Models for Video Understanding
por: Zhang, Zhihong, et al.
Publicado: (2025)
por: Zhang, Zhihong, et al.
Publicado: (2025)
Video Understanding Reward Modeling: A Robust Benchmark and Performant Reward Models
por: Wei, Yuancheng, et al.
Publicado: (2026)
por: Wei, Yuancheng, et al.
Publicado: (2026)
Ejemplares similares
-
Steering LLMs for Formal Theorem Proving
por: Kirtania, Shashank, et al.
Publicado: (2025) -
Beyond Theorem Proving: Formulation, Framework and Benchmark for Formal Problem-Solving
por: Liu, Qi, et al.
Publicado: (2025) -
Mathesis: Towards Formal Theorem Proving from Natural Languages
por: Xuejun, Yu, et al.
Publicado: (2025) -
What are the Right Symmetries for Formal Theorem Proving?
por: Olejniczak, Krzysztof, et al.
Publicado: (2026) -
OProver: A Unified Framework for Agentic Formal Theorem Proving
por: Ma, David, et al.
Publicado: (2026)