Psychometric-Based Evaluation for Theorem Proving with Large Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhang, Jianyu, Zhao, Yongwang, Zhang, Long, Hu, Jilin, Luan, Xiaokun, Xu, Zhiwei, Yang, Feng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
HybridProver: Augmenting Theorem Proving with LLM-Driven Proof Synthesis and Refinement
por: Hu, Jilin, et al.
Publicado: (2025)
por: Hu, Jilin, et al.
Publicado: (2025)
Towards Real-World Industrial-Scale Verification: LLM-Driven Theorem Proving on seL4
por: Zhang, Jianyu, et al.
Publicado: (2026)
por: Zhang, Jianyu, et al.
Publicado: (2026)
DeepTheorem: Advancing LLM Reasoning for Theorem Proving Through Natural Language and Reinforcement Learning
por: Zhang, Ziyin, et al.
Publicado: (2025)
por: Zhang, Ziyin, et al.
Publicado: (2025)
Automata-Based Steering of Large Language Models for Diverse Structured Generation
por: Luan, Xiaokun, et al.
Publicado: (2025)
por: Luan, Xiaokun, et al.
Publicado: (2025)
Rethinking Supervision Granularity: Segment-Level Learning for LLM-Based Theorem Proving
por: Xu, Shuo, et al.
Publicado: (2026)
por: Xu, Shuo, et al.
Publicado: (2026)
Lean Copilot: Large Language Models as Copilots for Theorem Proving in Lean
por: Song, Peiyang, et al.
Publicado: (2024)
por: Song, Peiyang, et al.
Publicado: (2024)
Proving Theorems Recursively
por: Wang, Haiming, et al.
Publicado: (2024)
por: Wang, Haiming, et al.
Publicado: (2024)
Mathesis: Towards Formal Theorem Proving from Natural Languages
por: Xuejun, Yu, et al.
Publicado: (2025)
por: Xuejun, Yu, et al.
Publicado: (2025)
Reviving DSP for Advanced Theorem Proving in the Era of Reasoning Models
por: Cao, Chenrui, et al.
Publicado: (2025)
por: Cao, Chenrui, et al.
Publicado: (2025)
A Survey on Deep Learning for Theorem Proving
por: Li, Zhaoyu, et al.
Publicado: (2024)
por: Li, Zhaoyu, et al.
Publicado: (2024)
MPS-Prover: Advancing Stepwise Theorem Proving by Multi-Perspective Search and Data Curation
por: Liang, Zhenwen, et al.
Publicado: (2025)
por: Liang, Zhenwen, et al.
Publicado: (2025)
Neural Theorem Proving for Verification Conditions: A Real-World Benchmark
por: Xu, Qiyuan, et al.
Publicado: (2026)
por: Xu, Qiyuan, et al.
Publicado: (2026)
RLMEval: Evaluating Research-Level Neural Theorem Proving
por: Poiroux, Auguste, et al.
Publicado: (2025)
por: Poiroux, Auguste, et al.
Publicado: (2025)
PhysProver: Advancing Automatic Theorem Proving for Physics
por: Zhang, Hanning, et al.
Publicado: (2026)
por: Zhang, Hanning, et al.
Publicado: (2026)
FVEL: Interactive Formal Verification Environment with Large Language Models via Theorem Proving
por: Lin, Xiaohan, et al.
Publicado: (2024)
por: Lin, Xiaohan, et al.
Publicado: (2024)
LLM-based Automated Theorem Proving Hinges on Scalable Synthetic Data Generation
por: Lai, Junyu, et al.
Publicado: (2025)
por: Lai, Junyu, et al.
Publicado: (2025)
A Combinatorial Identities Benchmark for Theorem Proving via Automated Theorem Generation
por: Xiong, Beibei, et al.
Publicado: (2025)
por: Xiong, Beibei, et al.
Publicado: (2025)
Distilling LLM Feedback for Lean Theorem Proving
por: Narozniak, Gaetan, et al.
Publicado: (2026)
por: Narozniak, Gaetan, et al.
Publicado: (2026)
A Minimal Agent for Automated Theorem Proving
por: Requena, Borja, et al.
Publicado: (2026)
por: Requena, Borja, et al.
Publicado: (2026)
OProver: A Unified Framework for Agentic Formal Theorem Proving
por: Ma, David, et al.
Publicado: (2026)
por: Ma, David, et al.
Publicado: (2026)
Seed-Prover: Deep and Broad Reasoning for Automated Theorem Proving
por: Chen, Luoxin, et al.
Publicado: (2025)
por: Chen, Luoxin, et al.
Publicado: (2025)
miniCTX: Neural Theorem Proving with (Long-)Contexts
por: Hu, Jiewen, et al.
Publicado: (2024)
por: Hu, Jiewen, et al.
Publicado: (2024)
GAR: Generative Adversarial Reinforcement Learning for Formal Theorem Proving
por: Wang, Ruida, et al.
Publicado: (2025)
por: Wang, Ruida, et al.
Publicado: (2025)
MA-LoT: Model-Collaboration Lean-based Long Chain-of-Thought Reasoning enhances Formal Theorem Proving
por: Wang, Ruida, et al.
Publicado: (2025)
por: Wang, Ruida, et al.
Publicado: (2025)
Measuring Human and AI Values Based on Generative Psychometrics with Large Language Models
por: Ye, Haoran, et al.
Publicado: (2024)
por: Ye, Haoran, et al.
Publicado: (2024)
Leanabell-Prover-V2: Verifier-integrated Reasoning for Formal Theorem Proving via Reinforcement Learning
por: Ji, Xingguang, et al.
Publicado: (2025)
por: Ji, Xingguang, et al.
Publicado: (2025)
Discover and Prove: An Open-source Agentic Framework for Hard Mode Automated Theorem Proving in Lean 4
por: Liu, Chengwu, et al.
Publicado: (2026)
por: Liu, Chengwu, et al.
Publicado: (2026)
FormalRewardBench: A Benchmark for Formal Theorem Proving Reward Models
por: Uluşan, Zeynel A., et al.
Publicado: (2026)
por: Uluşan, Zeynel A., et al.
Publicado: (2026)
BFS-Prover: Scalable Best-First Tree Search for LLM-based Automatic Theorem Proving
por: Xin, Ran, et al.
Publicado: (2025)
por: Xin, Ran, et al.
Publicado: (2025)
Aristotle: IMO-level Automated Theorem Proving
por: Achim, Tudor, et al.
Publicado: (2025)
por: Achim, Tudor, et al.
Publicado: (2025)
DeepSeek-Prover: Advancing Theorem Proving in LLMs through Large-Scale Synthetic Data
por: Xin, Huajian, et al.
Publicado: (2024)
por: Xin, Huajian, et al.
Publicado: (2024)
Large Language Model Psychometrics: A Systematic Review of Evaluation, Validation, and Enhancement
por: Ye, Haoran, et al.
Publicado: (2025)
por: Ye, Haoran, et al.
Publicado: (2025)
Goedel-Prover: A Frontier Model for Open-Source Automated Theorem Proving
por: Lin, Yong, et al.
Publicado: (2025)
por: Lin, Yong, et al.
Publicado: (2025)
LeanConjecturer: Automatic Generation of Mathematical Conjectures for Theorem Proving
por: Onda, Naoto, et al.
Publicado: (2025)
por: Onda, Naoto, et al.
Publicado: (2025)
Alchemy: Amplifying Theorem-Proving Capability through Symbolic Mutation
por: Wu, Shaonan, et al.
Publicado: (2024)
por: Wu, Shaonan, et al.
Publicado: (2024)
Steering LLMs for Formal Theorem Proving
por: Kirtania, Shashank, et al.
Publicado: (2025)
por: Kirtania, Shashank, et al.
Publicado: (2025)
SubgoalXL: Subgoal-based Expert Learning for Theorem Proving
por: Zhao, Xueliang, et al.
Publicado: (2024)
por: Zhao, Xueliang, et al.
Publicado: (2024)
AgriGPT: a Large Language Model Ecosystem for Agriculture
por: Yang, Bo, et al.
Publicado: (2025)
por: Yang, Bo, et al.
Publicado: (2025)
How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking
por: Li, Xuchen, et al.
Publicado: (2024)
por: Li, Xuchen, et al.
Publicado: (2024)
Partial Label Learning for Automated Theorem Proving
por: Zombori, Zsolt, et al.
Publicado: (2025)
por: Zombori, Zsolt, et al.
Publicado: (2025)
Ejemplares similares
-
HybridProver: Augmenting Theorem Proving with LLM-Driven Proof Synthesis and Refinement
por: Hu, Jilin, et al.
Publicado: (2025) -
Towards Real-World Industrial-Scale Verification: LLM-Driven Theorem Proving on seL4
por: Zhang, Jianyu, et al.
Publicado: (2026) -
DeepTheorem: Advancing LLM Reasoning for Theorem Proving Through Natural Language and Reinforcement Learning
por: Zhang, Ziyin, et al.
Publicado: (2025) -
Automata-Based Steering of Large Language Models for Diverse Structured Generation
por: Luan, Xiaokun, et al.
Publicado: (2025) -
Rethinking Supervision Granularity: Segment-Level Learning for LLM-Based Theorem Proving
por: Xu, Shuo, et al.
Publicado: (2026)