Psychometric-Based Evaluation for Theorem Proving with Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Jianyu, Zhao, Yongwang, Zhang, Long, Hu, Jilin, Luan, Xiaokun, Xu, Zhiwei, Yang, Feng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
HybridProver: Augmenting Theorem Proving with LLM-Driven Proof Synthesis and Refinement
di: Hu, Jilin, et al.
Pubblicazione: (2025)
di: Hu, Jilin, et al.
Pubblicazione: (2025)
Towards Real-World Industrial-Scale Verification: LLM-Driven Theorem Proving on seL4
di: Zhang, Jianyu, et al.
Pubblicazione: (2026)
di: Zhang, Jianyu, et al.
Pubblicazione: (2026)
DeepTheorem: Advancing LLM Reasoning for Theorem Proving Through Natural Language and Reinforcement Learning
di: Zhang, Ziyin, et al.
Pubblicazione: (2025)
di: Zhang, Ziyin, et al.
Pubblicazione: (2025)
Automata-Based Steering of Large Language Models for Diverse Structured Generation
di: Luan, Xiaokun, et al.
Pubblicazione: (2025)
di: Luan, Xiaokun, et al.
Pubblicazione: (2025)
Rethinking Supervision Granularity: Segment-Level Learning for LLM-Based Theorem Proving
di: Xu, Shuo, et al.
Pubblicazione: (2026)
di: Xu, Shuo, et al.
Pubblicazione: (2026)
Lean Copilot: Large Language Models as Copilots for Theorem Proving in Lean
di: Song, Peiyang, et al.
Pubblicazione: (2024)
di: Song, Peiyang, et al.
Pubblicazione: (2024)
Proving Theorems Recursively
di: Wang, Haiming, et al.
Pubblicazione: (2024)
di: Wang, Haiming, et al.
Pubblicazione: (2024)
Mathesis: Towards Formal Theorem Proving from Natural Languages
di: Xuejun, Yu, et al.
Pubblicazione: (2025)
di: Xuejun, Yu, et al.
Pubblicazione: (2025)
Reviving DSP for Advanced Theorem Proving in the Era of Reasoning Models
di: Cao, Chenrui, et al.
Pubblicazione: (2025)
di: Cao, Chenrui, et al.
Pubblicazione: (2025)
A Survey on Deep Learning for Theorem Proving
di: Li, Zhaoyu, et al.
Pubblicazione: (2024)
di: Li, Zhaoyu, et al.
Pubblicazione: (2024)
MPS-Prover: Advancing Stepwise Theorem Proving by Multi-Perspective Search and Data Curation
di: Liang, Zhenwen, et al.
Pubblicazione: (2025)
di: Liang, Zhenwen, et al.
Pubblicazione: (2025)
Neural Theorem Proving for Verification Conditions: A Real-World Benchmark
di: Xu, Qiyuan, et al.
Pubblicazione: (2026)
di: Xu, Qiyuan, et al.
Pubblicazione: (2026)
RLMEval: Evaluating Research-Level Neural Theorem Proving
di: Poiroux, Auguste, et al.
Pubblicazione: (2025)
di: Poiroux, Auguste, et al.
Pubblicazione: (2025)
PhysProver: Advancing Automatic Theorem Proving for Physics
di: Zhang, Hanning, et al.
Pubblicazione: (2026)
di: Zhang, Hanning, et al.
Pubblicazione: (2026)
FVEL: Interactive Formal Verification Environment with Large Language Models via Theorem Proving
di: Lin, Xiaohan, et al.
Pubblicazione: (2024)
di: Lin, Xiaohan, et al.
Pubblicazione: (2024)
LLM-based Automated Theorem Proving Hinges on Scalable Synthetic Data Generation
di: Lai, Junyu, et al.
Pubblicazione: (2025)
di: Lai, Junyu, et al.
Pubblicazione: (2025)
A Combinatorial Identities Benchmark for Theorem Proving via Automated Theorem Generation
di: Xiong, Beibei, et al.
Pubblicazione: (2025)
di: Xiong, Beibei, et al.
Pubblicazione: (2025)
Distilling LLM Feedback for Lean Theorem Proving
di: Narozniak, Gaetan, et al.
Pubblicazione: (2026)
di: Narozniak, Gaetan, et al.
Pubblicazione: (2026)
A Minimal Agent for Automated Theorem Proving
di: Requena, Borja, et al.
Pubblicazione: (2026)
di: Requena, Borja, et al.
Pubblicazione: (2026)
OProver: A Unified Framework for Agentic Formal Theorem Proving
di: Ma, David, et al.
Pubblicazione: (2026)
di: Ma, David, et al.
Pubblicazione: (2026)
Seed-Prover: Deep and Broad Reasoning for Automated Theorem Proving
di: Chen, Luoxin, et al.
Pubblicazione: (2025)
di: Chen, Luoxin, et al.
Pubblicazione: (2025)
miniCTX: Neural Theorem Proving with (Long-)Contexts
di: Hu, Jiewen, et al.
Pubblicazione: (2024)
di: Hu, Jiewen, et al.
Pubblicazione: (2024)
GAR: Generative Adversarial Reinforcement Learning for Formal Theorem Proving
di: Wang, Ruida, et al.
Pubblicazione: (2025)
di: Wang, Ruida, et al.
Pubblicazione: (2025)
MA-LoT: Model-Collaboration Lean-based Long Chain-of-Thought Reasoning enhances Formal Theorem Proving
di: Wang, Ruida, et al.
Pubblicazione: (2025)
di: Wang, Ruida, et al.
Pubblicazione: (2025)
Measuring Human and AI Values Based on Generative Psychometrics with Large Language Models
di: Ye, Haoran, et al.
Pubblicazione: (2024)
di: Ye, Haoran, et al.
Pubblicazione: (2024)
Leanabell-Prover-V2: Verifier-integrated Reasoning for Formal Theorem Proving via Reinforcement Learning
di: Ji, Xingguang, et al.
Pubblicazione: (2025)
di: Ji, Xingguang, et al.
Pubblicazione: (2025)
Discover and Prove: An Open-source Agentic Framework for Hard Mode Automated Theorem Proving in Lean 4
di: Liu, Chengwu, et al.
Pubblicazione: (2026)
di: Liu, Chengwu, et al.
Pubblicazione: (2026)
FormalRewardBench: A Benchmark for Formal Theorem Proving Reward Models
di: Uluşan, Zeynel A., et al.
Pubblicazione: (2026)
di: Uluşan, Zeynel A., et al.
Pubblicazione: (2026)
BFS-Prover: Scalable Best-First Tree Search for LLM-based Automatic Theorem Proving
di: Xin, Ran, et al.
Pubblicazione: (2025)
di: Xin, Ran, et al.
Pubblicazione: (2025)
Aristotle: IMO-level Automated Theorem Proving
di: Achim, Tudor, et al.
Pubblicazione: (2025)
di: Achim, Tudor, et al.
Pubblicazione: (2025)
DeepSeek-Prover: Advancing Theorem Proving in LLMs through Large-Scale Synthetic Data
di: Xin, Huajian, et al.
Pubblicazione: (2024)
di: Xin, Huajian, et al.
Pubblicazione: (2024)
Large Language Model Psychometrics: A Systematic Review of Evaluation, Validation, and Enhancement
di: Ye, Haoran, et al.
Pubblicazione: (2025)
di: Ye, Haoran, et al.
Pubblicazione: (2025)
Goedel-Prover: A Frontier Model for Open-Source Automated Theorem Proving
di: Lin, Yong, et al.
Pubblicazione: (2025)
di: Lin, Yong, et al.
Pubblicazione: (2025)
LeanConjecturer: Automatic Generation of Mathematical Conjectures for Theorem Proving
di: Onda, Naoto, et al.
Pubblicazione: (2025)
di: Onda, Naoto, et al.
Pubblicazione: (2025)
Alchemy: Amplifying Theorem-Proving Capability through Symbolic Mutation
di: Wu, Shaonan, et al.
Pubblicazione: (2024)
di: Wu, Shaonan, et al.
Pubblicazione: (2024)
Steering LLMs for Formal Theorem Proving
di: Kirtania, Shashank, et al.
Pubblicazione: (2025)
di: Kirtania, Shashank, et al.
Pubblicazione: (2025)
SubgoalXL: Subgoal-based Expert Learning for Theorem Proving
di: Zhao, Xueliang, et al.
Pubblicazione: (2024)
di: Zhao, Xueliang, et al.
Pubblicazione: (2024)
AgriGPT: a Large Language Model Ecosystem for Agriculture
di: Yang, Bo, et al.
Pubblicazione: (2025)
di: Yang, Bo, et al.
Pubblicazione: (2025)
How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking
di: Li, Xuchen, et al.
Pubblicazione: (2024)
di: Li, Xuchen, et al.
Pubblicazione: (2024)
Partial Label Learning for Automated Theorem Proving
di: Zombori, Zsolt, et al.
Pubblicazione: (2025)
di: Zombori, Zsolt, et al.
Pubblicazione: (2025)
Documenti analoghi
-
HybridProver: Augmenting Theorem Proving with LLM-Driven Proof Synthesis and Refinement
di: Hu, Jilin, et al.
Pubblicazione: (2025) -
Towards Real-World Industrial-Scale Verification: LLM-Driven Theorem Proving on seL4
di: Zhang, Jianyu, et al.
Pubblicazione: (2026) -
DeepTheorem: Advancing LLM Reasoning for Theorem Proving Through Natural Language and Reinforcement Learning
di: Zhang, Ziyin, et al.
Pubblicazione: (2025) -
Automata-Based Steering of Large Language Models for Diverse Structured Generation
di: Luan, Xiaokun, et al.
Pubblicazione: (2025) -
Rethinking Supervision Granularity: Segment-Level Learning for LLM-Based Theorem Proving
di: Xu, Shuo, et al.
Pubblicazione: (2026)