FormalMATH: Benchmarking Formal Mathematical Reasoning of Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yu, Zhouliang, Peng, Ruotian, Ding, Keyi, Li, Yizhe, Peng, Zhongyuan, Liu, Minghao, Zhang, Yifan, Yuan, Zheng, Xin, Huajian, Huang, Wenhao, Wen, Yandong, Zhang, Ge, Liu, Weiyang |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SimKO: Simple Pass@K Policy Optimization
par: Peng, Ruotian, et autres
Publié: (2025)
par: Peng, Ruotian, et autres
Publié: (2025)
CriticLean: Critic-Guided Reinforcement Learning for Mathematical Formalization
par: Peng, Zhongyuan, et autres
Publié: (2025)
par: Peng, Zhongyuan, et autres
Publié: (2025)
PEFT-Arena: Understanding Parameter-Efficient Finetuning from a Stability-Plasticity Perspective
par: Huang, Yangyi, et autres
Publié: (2026)
par: Huang, Yangyi, et autres
Publié: (2026)
InfinityMATH: A Scalable Instruction Tuning Dataset in Programmatic Mathematical Reasoning
par: Zhang, Bo-Wen, et autres
Publié: (2024)
par: Zhang, Bo-Wen, et autres
Publié: (2024)
MathlibLemma: Folklore Lemma Generation and Benchmark for Formal Mathematics
par: Liu, Xinyu, et autres
Publié: (2026)
par: Liu, Xinyu, et autres
Publié: (2026)
MathlibPR: Pull Request Merge-Readiness Benchmark for Formal Mathematical Libraries
par: Xie, Zixuan, et autres
Publié: (2026)
par: Xie, Zixuan, et autres
Publié: (2026)
Model Merging with Functional Dual Anchors
par: Shi, Kexuan, et autres
Publié: (2025)
par: Shi, Kexuan, et autres
Publié: (2025)
Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models
par: Gao, Bofei, et autres
Publié: (2024)
par: Gao, Bofei, et autres
Publié: (2024)
Patch Matters: Training-free Fine-grained Image Caption Enhancement via Local Perception
par: Peng, Ruotian, et autres
Publié: (2025)
par: Peng, Ruotian, et autres
Publié: (2025)
Safe: Enhancing Mathematical Reasoning in Large Language Models via Retrospective Step-aware Formal Verification
par: Liu, Chengwu, et autres
Publié: (2025)
par: Liu, Chengwu, et autres
Publié: (2025)
Measuring Multimodal Mathematical Reasoning with MATH-Vision Dataset
par: Wang, Ke, et autres
Publié: (2024)
par: Wang, Ke, et autres
Publié: (2024)
FMC: Formalization of Natural Language Mathematical Competition Problems
par: Xie, Jiaxuan, et autres
Publié: (2025)
par: Xie, Jiaxuan, et autres
Publié: (2025)
M2F: Automated Formalization of Mathematical Literature at Scale
par: Wang, Zichen, et autres
Publié: (2026)
par: Wang, Zichen, et autres
Publié: (2026)
MSC-180: A Benchmark for Automated Formal Theorem Proving from Mathematical Subject Classification
par: Li, Sirui, et autres
Publié: (2025)
par: Li, Sirui, et autres
Publié: (2025)
Advocate for Complete Benchmarks for Formal Reasoning with Formal/Informal Statements and Formal/Informal Proofs
par: Yousefzadeh, Roozbeh, et autres
Publié: (2025)
par: Yousefzadeh, Roozbeh, et autres
Publié: (2025)
DeepSeek-Prover-V2: Advancing Formal Mathematical Reasoning via Reinforcement Learning for Subgoal Decomposition
par: Ren, Z. Z., et autres
Publié: (2025)
par: Ren, Z. Z., et autres
Publié: (2025)
MATH-Perturb: Benchmarking LLMs' Math Reasoning Abilities against Hard Perturbations
par: Huang, Kaixuan, et autres
Publié: (2025)
par: Huang, Kaixuan, et autres
Publié: (2025)
VAR-MATH: Probing True Mathematical Reasoning in LLMS via Symbolic Multi-Instance Benchmarks
par: Yao, Jian, et autres
Publié: (2025)
par: Yao, Jian, et autres
Publié: (2025)
Conjecturing: An Overlooked Step in Formal Mathematical Reasoning
par: Sivakumar, Jasivan Alex, et autres
Publié: (2025)
par: Sivakumar, Jasivan Alex, et autres
Publié: (2025)
Formal Conjectures: An Open and Evolving Benchmark for Verified Discovery in Mathematics
par: Firsching, Moritz, et autres
Publié: (2026)
par: Firsching, Moritz, et autres
Publié: (2026)
Generating Symbolic World Models via Test-time Scaling of Large Language Models
par: Yu, Zhouliang, et autres
Publié: (2025)
par: Yu, Zhouliang, et autres
Publié: (2025)
Feint Behaviors and Strategies: Formalization, Implementation and Evaluation
par: Liu, Junyu, et autres
Publié: (2024)
par: Liu, Junyu, et autres
Publié: (2024)
APE-Bench: Evaluating Automated Proof Engineering for Formal Math Libraries
par: Xin, Huajian, et autres
Publié: (2025)
par: Xin, Huajian, et autres
Publié: (2025)
FormalML: A Benchmark for Evaluating Formal Subgoal Completion in Machine Learning Theory
par: Yang, Xiao-Wen, et autres
Publié: (2025)
par: Yang, Xiao-Wen, et autres
Publié: (2025)
Beyond Gold Standards: Epistemic Ensemble of LLM Judges for Formal Mathematical Reasoning
par: Zhang, Lan, et autres
Publié: (2025)
par: Zhang, Lan, et autres
Publié: (2025)
Formal Mathematical Reasoning: A New Frontier in AI
par: Yang, Kaiyu, et autres
Publié: (2024)
par: Yang, Kaiyu, et autres
Publié: (2024)
Artificial Intelligence, Formal Methods, and Mathematical Reasoning (NSF)
Publié: (2024)
Publié: (2024)
Formalizing Mathematics at Scale
par: Rammal, Ahmad, et autres
Publié: (2026)
par: Rammal, Ahmad, et autres
Publié: (2026)
U-MATH: A University-Level Benchmark for Evaluating Mathematical Skills in LLMs
par: Chernyshev, Konstantin, et autres
Publié: (2024)
par: Chernyshev, Konstantin, et autres
Publié: (2024)
Numina-Lean-Agent: An Open and General Agentic Reasoning System for Formal Mathematics
par: Liu, Junqi, et autres
Publié: (2026)
par: Liu, Junqi, et autres
Publié: (2026)
Leanabell-Prover: Posttraining Scaling in Formal Reasoning
par: Zhang, Jingyuan, et autres
Publié: (2025)
par: Zhang, Jingyuan, et autres
Publié: (2025)
KisMATH: Do LLMs Have Knowledge of Implicit Structures in Mathematical Reasoning?
par: Saha, Soumadeep, et autres
Publié: (2025)
par: Saha, Soumadeep, et autres
Publié: (2025)
Mathematical Opportunities in Digital Twins (MATH-DT)
par: Antil, Harbir
Publié: (2024)
par: Antil, Harbir
Publié: (2024)
Let's Reason Formally: Natural-Formal Hybrid Reasoning Enhances LLM's Math Capability
par: Wang, Ruida, et autres
Publié: (2025)
par: Wang, Ruida, et autres
Publié: (2025)
Rethinking Wireless Communications through Formal Mathematical AI Reasoning
par: Zhao, Changyuan, et autres
Publié: (2026)
par: Zhao, Changyuan, et autres
Publié: (2026)
KOR-Bench: Benchmarking Language Models on Knowledge-Orthogonal Reasoning Tasks
par: Ma, Kaijing, et autres
Publié: (2024)
par: Ma, Kaijing, et autres
Publié: (2024)
MV-MATH: Evaluating Multimodal Math Reasoning in Multi-Visual Contexts
par: Wang, Peijie, et autres
Publié: (2025)
par: Wang, Peijie, et autres
Publié: (2025)
NeuroCore™: Mathematical Formalization
par: Nicoletti, Davide Luca
Publié: (2026)
par: Nicoletti, Davide Luca
Publié: (2026)
MATH-PT: A Math Reasoning Benchmark for European and Brazilian Portuguese
par: Teixeira, Tiago, et autres
Publié: (2026)
par: Teixeira, Tiago, et autres
Publié: (2026)
Formalizing Feint Actions, and Example Studies in Two-Player Games
par: Liu, Junyu, et autres
Publié: (2024)
par: Liu, Junyu, et autres
Publié: (2024)
Documents similaires
-
SimKO: Simple Pass@K Policy Optimization
par: Peng, Ruotian, et autres
Publié: (2025) -
CriticLean: Critic-Guided Reinforcement Learning for Mathematical Formalization
par: Peng, Zhongyuan, et autres
Publié: (2025) -
PEFT-Arena: Understanding Parameter-Efficient Finetuning from a Stability-Plasticity Perspective
par: Huang, Yangyi, et autres
Publié: (2026) -
InfinityMATH: A Scalable Instruction Tuning Dataset in Programmatic Mathematical Reasoning
par: Zhang, Bo-Wen, et autres
Publié: (2024) -
MathlibLemma: Folklore Lemma Generation and Benchmark for Formal Mathematics
par: Liu, Xinyu, et autres
Publié: (2026)