ATG: Benchmarking Automated Theorem Generation for Generative Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Lin, Xiaohan, Cao, Qingxing, Huang, Yinya, Yang, Zhicheng, Liu, Zhengying, Li, Zhenguo, Liang, Xiaodan |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
FVEL: Interactive Formal Verification Environment with Large Language Models via Theorem Proving
by: Lin, Xiaohan, et al.
Published: (2024)
by: Lin, Xiaohan, et al.
Published: (2024)
MUSTARD: Mastering Uniform Synthesis of Theorem and Proof Data
by: Huang, Yinya, et al.
Published: (2024)
by: Huang, Yinya, et al.
Published: (2024)
Lyra: Orchestrating Dual Correction in Automated Theorem Proving
by: Zheng, Chuanyang, et al.
Published: (2023)
by: Zheng, Chuanyang, et al.
Published: (2023)
Proving Theorems Recursively
by: Wang, Haiming, et al.
Published: (2024)
by: Wang, Haiming, et al.
Published: (2024)
CLOMO: Counterfactual Logical Modification with Large Language Models
by: Huang, Yinya, et al.
Published: (2023)
by: Huang, Yinya, et al.
Published: (2023)
FormalAlign: Automated Alignment Evaluation for Autoformalization
by: Lu, Jianqiao, et al.
Published: (2024)
by: Lu, Jianqiao, et al.
Published: (2024)
Forward-Backward Reasoning in Large Language Models for Mathematical Verification
by: Jiang, Weisen, et al.
Published: (2023)
by: Jiang, Weisen, et al.
Published: (2023)
MetaMath: Bootstrap Your Own Mathematical Questions for Large Language Models
by: Yu, Longhui, et al.
Published: (2023)
by: Yu, Longhui, et al.
Published: (2023)
Respond Beyond Language: A Benchmark for Video Generation in Response to Realistic User Intents
by: Wang, Shuting, et al.
Published: (2025)
by: Wang, Shuting, et al.
Published: (2025)
ORMind: A Cognitive-Inspired End-to-End Reasoning Framework for Operations Research
by: Wang, Zhiyuan, et al.
Published: (2025)
by: Wang, Zhiyuan, et al.
Published: (2025)
PPM: Automated Generation of Diverse Programming Problems for Benchmarking Code Generation Models
by: Chen, Simin, et al.
Published: (2024)
by: Chen, Simin, et al.
Published: (2024)
General Phrase Debiaser: Debiasing Masked Language Models at a Multi-Token Level
by: Shi, Bingkang, et al.
Published: (2023)
by: Shi, Bingkang, et al.
Published: (2023)
GPG: Generalized Policy Gradient Theorem for Transformer-based Policies
by: Mao, Hangyu, et al.
Published: (2025)
by: Mao, Hangyu, et al.
Published: (2025)
General365: Benchmarking General Reasoning in Large Language Models Across Diverse and Challenging Tasks
by: Liu, Junlin, et al.
Published: (2026)
by: Liu, Junlin, et al.
Published: (2026)
DeepJSONEval: Benchmarking Complex Nested JSON Data Mining for Large Language Models
by: Zhou, Zhicheng, et al.
Published: (2025)
by: Zhou, Zhicheng, et al.
Published: (2025)
Evaluating Clinical Competencies of Large Language Models with a General Practice Benchmark
by: Li, Zheqing, et al.
Published: (2025)
by: Li, Zheqing, et al.
Published: (2025)
DA-Code: Agent Data Science Code Generation Benchmark for Large Language Models
by: Huang, Yiming, et al.
Published: (2024)
by: Huang, Yiming, et al.
Published: (2024)
Gaining Wisdom from Setbacks: Aligning Large Language Models via Mistake Analysis
by: Chen, Kai, et al.
Published: (2023)
by: Chen, Kai, et al.
Published: (2023)
Generating Benchmarks for Factuality Evaluation of Language Models
by: Muhlgay, Dor, et al.
Published: (2023)
by: Muhlgay, Dor, et al.
Published: (2023)
Generate, Not Recommend: Personalized Multimodal Content Generation
by: Liu, Jiongnan, et al.
Published: (2025)
by: Liu, Jiongnan, et al.
Published: (2025)
Training Language Models to Generate Quality Code with Program Analysis Feedback
by: Yao, Feng, et al.
Published: (2025)
by: Yao, Feng, et al.
Published: (2025)
AlignedCoT: Prompting Large Language Models via Native-Speaking Demonstrations
by: Yang, Zhicheng, et al.
Published: (2023)
by: Yang, Zhicheng, et al.
Published: (2023)
Large Language Models as Psychological Simulators: A Methodological Guide
by: Lin, Zhicheng
Published: (2025)
by: Lin, Zhicheng
Published: (2025)
ReaRAG: Knowledge-guided Reasoning Enhances Factuality of Large Reasoning Models with Iterative Retrieval Augmented Generation
by: Lee, Zhicheng, et al.
Published: (2025)
by: Lee, Zhicheng, et al.
Published: (2025)
TaskBench: Benchmarking Large Language Models for Task Automation
by: Shen, Yongliang, et al.
Published: (2023)
by: Shen, Yongliang, et al.
Published: (2023)
Seed-Prover: Deep and Broad Reasoning for Automated Theorem Proving
by: Chen, Luoxin, et al.
Published: (2025)
by: Chen, Luoxin, et al.
Published: (2025)
Human-Calibrated Automated Testing and Validation of Generative Language Models
by: Sudjianto, Agus, et al.
Published: (2024)
by: Sudjianto, Agus, et al.
Published: (2024)
Beyond Correctness: Benchmarking Multi-dimensional Code Generation for Large Language Models
by: Zheng, Jiasheng, et al.
Published: (2024)
by: Zheng, Jiasheng, et al.
Published: (2024)
Ineq-Comp: Benchmarking Human-Intuitive Compositional Reasoning in Automated Theorem Proving on Inequalities
by: Zhao, Haoyu, et al.
Published: (2025)
by: Zhao, Haoyu, et al.
Published: (2025)
Measuring and Benchmarking Large Language Models' Capabilities to Generate Persuasive Language
by: Pauli, Amalie Brogaard, et al.
Published: (2024)
by: Pauli, Amalie Brogaard, et al.
Published: (2024)
Bench4KE: Benchmarking Automated Competency Question Generation
by: Lippolis, Anna Sofia, et al.
Published: (2025)
by: Lippolis, Anna Sofia, et al.
Published: (2025)
APTNESS: Incorporating Appraisal Theory and Emotion Support Strategies for Empathetic Response Generation
by: Hu, Yuxuan, et al.
Published: (2024)
by: Hu, Yuxuan, et al.
Published: (2024)
BacktestBench: Benchmarking Large Language Models for Automated Quantitative Strategy Backtesting
by: Wang, Zhensheng, et al.
Published: (2026)
by: Wang, Zhensheng, et al.
Published: (2026)
Deriving Strategic Market Insights with Large Language Models: A Benchmark for Forward Counterfactual Generation
by: Ong, Keane, et al.
Published: (2025)
by: Ong, Keane, et al.
Published: (2025)
The Future of Learning in the Age of Generative AI: Automated Question Generation and Assessment with Large Language Models
by: Maity, Subhankar, et al.
Published: (2024)
by: Maity, Subhankar, et al.
Published: (2024)
Logic Contrastive Reasoning with Lightweight Large Language Model for Math Word Problems
by: Kai, Ding, et al.
Published: (2024)
by: Kai, Ding, et al.
Published: (2024)
EconProver: Towards More Economical Test-Time Scaling for Automated Theorem Proving
by: Li, Mukai, et al.
Published: (2025)
by: Li, Mukai, et al.
Published: (2025)
QUILL: Quotation Generation Enhancement of Large Language Models
by: Xiao, Jin, et al.
Published: (2024)
by: Xiao, Jin, et al.
Published: (2024)
DeepTheorem: Advancing LLM Reasoning for Theorem Proving Through Natural Language and Reinforcement Learning
by: Zhang, Ziyin, et al.
Published: (2025)
by: Zhang, Ziyin, et al.
Published: (2025)
Text2World: Benchmarking Large Language Models for Symbolic World Model Generation
by: Hu, Mengkang, et al.
Published: (2025)
by: Hu, Mengkang, et al.
Published: (2025)
Similar Items
-
FVEL: Interactive Formal Verification Environment with Large Language Models via Theorem Proving
by: Lin, Xiaohan, et al.
Published: (2024) -
MUSTARD: Mastering Uniform Synthesis of Theorem and Proof Data
by: Huang, Yinya, et al.
Published: (2024) -
Lyra: Orchestrating Dual Correction in Automated Theorem Proving
by: Zheng, Chuanyang, et al.
Published: (2023) -
Proving Theorems Recursively
by: Wang, Haiming, et al.
Published: (2024) -
CLOMO: Counterfactual Logical Modification with Large Language Models
by: Huang, Yinya, et al.
Published: (2023)