Psychometric-Based Evaluation for Theorem Proving with Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Jianyu, Zhao, Yongwang, Zhang, Long, Hu, Jilin, Luan, Xiaokun, Xu, Zhiwei, Yang, Feng |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
HybridProver: Augmenting Theorem Proving with LLM-Driven Proof Synthesis and Refinement
par: Hu, Jilin, et autres
Publié: (2025)
par: Hu, Jilin, et autres
Publié: (2025)
Towards Real-World Industrial-Scale Verification: LLM-Driven Theorem Proving on seL4
par: Zhang, Jianyu, et autres
Publié: (2026)
par: Zhang, Jianyu, et autres
Publié: (2026)
DeepTheorem: Advancing LLM Reasoning for Theorem Proving Through Natural Language and Reinforcement Learning
par: Zhang, Ziyin, et autres
Publié: (2025)
par: Zhang, Ziyin, et autres
Publié: (2025)
Automata-Based Steering of Large Language Models for Diverse Structured Generation
par: Luan, Xiaokun, et autres
Publié: (2025)
par: Luan, Xiaokun, et autres
Publié: (2025)
Rethinking Supervision Granularity: Segment-Level Learning for LLM-Based Theorem Proving
par: Xu, Shuo, et autres
Publié: (2026)
par: Xu, Shuo, et autres
Publié: (2026)
Lean Copilot: Large Language Models as Copilots for Theorem Proving in Lean
par: Song, Peiyang, et autres
Publié: (2024)
par: Song, Peiyang, et autres
Publié: (2024)
Proving Theorems Recursively
par: Wang, Haiming, et autres
Publié: (2024)
par: Wang, Haiming, et autres
Publié: (2024)
Mathesis: Towards Formal Theorem Proving from Natural Languages
par: Xuejun, Yu, et autres
Publié: (2025)
par: Xuejun, Yu, et autres
Publié: (2025)
Reviving DSP for Advanced Theorem Proving in the Era of Reasoning Models
par: Cao, Chenrui, et autres
Publié: (2025)
par: Cao, Chenrui, et autres
Publié: (2025)
A Survey on Deep Learning for Theorem Proving
par: Li, Zhaoyu, et autres
Publié: (2024)
par: Li, Zhaoyu, et autres
Publié: (2024)
MPS-Prover: Advancing Stepwise Theorem Proving by Multi-Perspective Search and Data Curation
par: Liang, Zhenwen, et autres
Publié: (2025)
par: Liang, Zhenwen, et autres
Publié: (2025)
Neural Theorem Proving for Verification Conditions: A Real-World Benchmark
par: Xu, Qiyuan, et autres
Publié: (2026)
par: Xu, Qiyuan, et autres
Publié: (2026)
RLMEval: Evaluating Research-Level Neural Theorem Proving
par: Poiroux, Auguste, et autres
Publié: (2025)
par: Poiroux, Auguste, et autres
Publié: (2025)
PhysProver: Advancing Automatic Theorem Proving for Physics
par: Zhang, Hanning, et autres
Publié: (2026)
par: Zhang, Hanning, et autres
Publié: (2026)
FVEL: Interactive Formal Verification Environment with Large Language Models via Theorem Proving
par: Lin, Xiaohan, et autres
Publié: (2024)
par: Lin, Xiaohan, et autres
Publié: (2024)
LLM-based Automated Theorem Proving Hinges on Scalable Synthetic Data Generation
par: Lai, Junyu, et autres
Publié: (2025)
par: Lai, Junyu, et autres
Publié: (2025)
A Combinatorial Identities Benchmark for Theorem Proving via Automated Theorem Generation
par: Xiong, Beibei, et autres
Publié: (2025)
par: Xiong, Beibei, et autres
Publié: (2025)
Distilling LLM Feedback for Lean Theorem Proving
par: Narozniak, Gaetan, et autres
Publié: (2026)
par: Narozniak, Gaetan, et autres
Publié: (2026)
A Minimal Agent for Automated Theorem Proving
par: Requena, Borja, et autres
Publié: (2026)
par: Requena, Borja, et autres
Publié: (2026)
OProver: A Unified Framework for Agentic Formal Theorem Proving
par: Ma, David, et autres
Publié: (2026)
par: Ma, David, et autres
Publié: (2026)
Seed-Prover: Deep and Broad Reasoning for Automated Theorem Proving
par: Chen, Luoxin, et autres
Publié: (2025)
par: Chen, Luoxin, et autres
Publié: (2025)
miniCTX: Neural Theorem Proving with (Long-)Contexts
par: Hu, Jiewen, et autres
Publié: (2024)
par: Hu, Jiewen, et autres
Publié: (2024)
GAR: Generative Adversarial Reinforcement Learning for Formal Theorem Proving
par: Wang, Ruida, et autres
Publié: (2025)
par: Wang, Ruida, et autres
Publié: (2025)
MA-LoT: Model-Collaboration Lean-based Long Chain-of-Thought Reasoning enhances Formal Theorem Proving
par: Wang, Ruida, et autres
Publié: (2025)
par: Wang, Ruida, et autres
Publié: (2025)
Measuring Human and AI Values Based on Generative Psychometrics with Large Language Models
par: Ye, Haoran, et autres
Publié: (2024)
par: Ye, Haoran, et autres
Publié: (2024)
Leanabell-Prover-V2: Verifier-integrated Reasoning for Formal Theorem Proving via Reinforcement Learning
par: Ji, Xingguang, et autres
Publié: (2025)
par: Ji, Xingguang, et autres
Publié: (2025)
Discover and Prove: An Open-source Agentic Framework for Hard Mode Automated Theorem Proving in Lean 4
par: Liu, Chengwu, et autres
Publié: (2026)
par: Liu, Chengwu, et autres
Publié: (2026)
FormalRewardBench: A Benchmark for Formal Theorem Proving Reward Models
par: Uluşan, Zeynel A., et autres
Publié: (2026)
par: Uluşan, Zeynel A., et autres
Publié: (2026)
BFS-Prover: Scalable Best-First Tree Search for LLM-based Automatic Theorem Proving
par: Xin, Ran, et autres
Publié: (2025)
par: Xin, Ran, et autres
Publié: (2025)
Aristotle: IMO-level Automated Theorem Proving
par: Achim, Tudor, et autres
Publié: (2025)
par: Achim, Tudor, et autres
Publié: (2025)
DeepSeek-Prover: Advancing Theorem Proving in LLMs through Large-Scale Synthetic Data
par: Xin, Huajian, et autres
Publié: (2024)
par: Xin, Huajian, et autres
Publié: (2024)
Large Language Model Psychometrics: A Systematic Review of Evaluation, Validation, and Enhancement
par: Ye, Haoran, et autres
Publié: (2025)
par: Ye, Haoran, et autres
Publié: (2025)
Goedel-Prover: A Frontier Model for Open-Source Automated Theorem Proving
par: Lin, Yong, et autres
Publié: (2025)
par: Lin, Yong, et autres
Publié: (2025)
LeanConjecturer: Automatic Generation of Mathematical Conjectures for Theorem Proving
par: Onda, Naoto, et autres
Publié: (2025)
par: Onda, Naoto, et autres
Publié: (2025)
Alchemy: Amplifying Theorem-Proving Capability through Symbolic Mutation
par: Wu, Shaonan, et autres
Publié: (2024)
par: Wu, Shaonan, et autres
Publié: (2024)
Steering LLMs for Formal Theorem Proving
par: Kirtania, Shashank, et autres
Publié: (2025)
par: Kirtania, Shashank, et autres
Publié: (2025)
SubgoalXL: Subgoal-based Expert Learning for Theorem Proving
par: Zhao, Xueliang, et autres
Publié: (2024)
par: Zhao, Xueliang, et autres
Publié: (2024)
AgriGPT: a Large Language Model Ecosystem for Agriculture
par: Yang, Bo, et autres
Publié: (2025)
par: Yang, Bo, et autres
Publié: (2025)
How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking
par: Li, Xuchen, et autres
Publié: (2024)
par: Li, Xuchen, et autres
Publié: (2024)
Partial Label Learning for Automated Theorem Proving
par: Zombori, Zsolt, et autres
Publié: (2025)
par: Zombori, Zsolt, et autres
Publié: (2025)
Documents similaires
-
HybridProver: Augmenting Theorem Proving with LLM-Driven Proof Synthesis and Refinement
par: Hu, Jilin, et autres
Publié: (2025) -
Towards Real-World Industrial-Scale Verification: LLM-Driven Theorem Proving on seL4
par: Zhang, Jianyu, et autres
Publié: (2026) -
DeepTheorem: Advancing LLM Reasoning for Theorem Proving Through Natural Language and Reinforcement Learning
par: Zhang, Ziyin, et autres
Publié: (2025) -
Automata-Based Steering of Large Language Models for Diverse Structured Generation
par: Luan, Xiaokun, et autres
Publié: (2025) -
Rethinking Supervision Granularity: Segment-Level Learning for LLM-Based Theorem Proving
par: Xu, Shuo, et autres
Publié: (2026)