FormalScience: Scalable Human-in-the-Loop Autoformalisation of Science with Agentic Code Generation in Lean
Fuente:
arXiv
Salvato in:
| Autori principali: | Meadows, Jordan, Zhang, Lan, Freitas, Andre |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Lean Meets Theoretical Computer Science: Scalable Synthesis of Theorem Proving Challenges in Formal-Informal Pairs
di: Zhang, Terry Jingchen, et al.
Pubblicazione: (2025)
di: Zhang, Terry Jingchen, et al.
Pubblicazione: (2025)
MedAgentGym: A Scalable Agentic Training Environment for Code-Centric Reasoning in Biomedical Data Science
di: Xu, Ran, et al.
Pubblicazione: (2025)
di: Xu, Ran, et al.
Pubblicazione: (2025)
GFLean: An Autoformalisation Framework for Lean via GF
di: Pathak, Shashank
Pubblicazione: (2024)
di: Pathak, Shashank
Pubblicazione: (2024)
DA-Code: Agent Data Science Code Generation Benchmark for Large Language Models
di: Huang, Yiming, et al.
Pubblicazione: (2024)
di: Huang, Yiming, et al.
Pubblicazione: (2024)
A Cloud-based Multi-Agentic Workflow for Science
di: Acharya, Anurag, et al.
Pubblicazione: (2026)
di: Acharya, Anurag, et al.
Pubblicazione: (2026)
FANS -- Formal Answer Selection for Natural Language Math Reasoning Using Lean4
di: Yao, Jiarui, et al.
Pubblicazione: (2025)
di: Yao, Jiarui, et al.
Pubblicazione: (2025)
Multi-Operational Mathematical Derivations in Latent Space
di: Valentino, Marco, et al.
Pubblicazione: (2023)
di: Valentino, Marco, et al.
Pubblicazione: (2023)
Accelerating Social Science Research via Agentic Hypothesization and Experimentation
di: Gupta, Jishu Sen, et al.
Pubblicazione: (2026)
di: Gupta, Jishu Sen, et al.
Pubblicazione: (2026)
DeepAnalyze: Agentic Large Language Models for Autonomous Data Science
di: Zhang, Shaolei, et al.
Pubblicazione: (2025)
di: Zhang, Shaolei, et al.
Pubblicazione: (2025)
LLMs for Science: Usage for Code Generation and Data Analysis
di: Nejjar, Mohamed, et al.
Pubblicazione: (2023)
di: Nejjar, Mohamed, et al.
Pubblicazione: (2023)
MA-LoT: Model-Collaboration Lean-based Long Chain-of-Thought Reasoning enhances Formal Theorem Proving
di: Wang, Ruida, et al.
Pubblicazione: (2025)
di: Wang, Ruida, et al.
Pubblicazione: (2025)
OProver: A Unified Framework for Agentic Formal Theorem Proving
di: Ma, David, et al.
Pubblicazione: (2026)
di: Ma, David, et al.
Pubblicazione: (2026)
STRUCTSENSE: A Task-Agnostic Agentic Framework for Structured Information Extraction with Human-In-The-Loop Evaluation and Benchmarking
di: Chhetri, Tek Raj, et al.
Pubblicazione: (2025)
di: Chhetri, Tek Raj, et al.
Pubblicazione: (2025)
WebShaper: Agentically Data Synthesizing via Information-Seeking Formalization
di: Tao, Zhengwei, et al.
Pubblicazione: (2025)
di: Tao, Zhengwei, et al.
Pubblicazione: (2025)
HiLDe: Intentional Code Generation via Human-in-the-Loop Decoding
di: González, Emmanuel Anaya, et al.
Pubblicazione: (2025)
di: González, Emmanuel Anaya, et al.
Pubblicazione: (2025)
PEIRCE: Unifying Material and Formal Reasoning via LLM-Driven Neuro-Symbolic Refinement
di: Quan, Xin, et al.
Pubblicazione: (2025)
di: Quan, Xin, et al.
Pubblicazione: (2025)
Agentic Driving Coach: Robustness and Determinism of Agentic AI-Powered Human-in-the-Loop Cyber-Physical Systems
di: Prahlad, Deeksha, et al.
Pubblicazione: (2026)
di: Prahlad, Deeksha, et al.
Pubblicazione: (2026)
The Third Ambition: Artificial Intelligence and the Science of Human Behavior
di: Neuman, W. Russell, et al.
Pubblicazione: (2026)
di: Neuman, W. Russell, et al.
Pubblicazione: (2026)
A Survey in Mathematical Language Processing
di: Meadows, Jordan, et al.
Pubblicazione: (2022)
di: Meadows, Jordan, et al.
Pubblicazione: (2022)
The Science of Evaluating Foundation Models
di: Yuan, Jiayi, et al.
Pubblicazione: (2025)
di: Yuan, Jiayi, et al.
Pubblicazione: (2025)
Benchmarking Data Science Agents
di: Zhang, Yuge, et al.
Pubblicazione: (2024)
di: Zhang, Yuge, et al.
Pubblicazione: (2024)
DSBench: How Far Are Data Science Agents from Becoming Data Science Experts?
di: Jing, Liqiang, et al.
Pubblicazione: (2024)
di: Jing, Liqiang, et al.
Pubblicazione: (2024)
Discover and Prove: An Open-source Agentic Framework for Hard Mode Automated Theorem Proving in Lean 4
di: Liu, Chengwu, et al.
Pubblicazione: (2026)
di: Liu, Chengwu, et al.
Pubblicazione: (2026)
VeriThoughts: Enabling Automated Verilog Code Generation using Reasoning and Formal Verification
di: Yubeaton, Patrick, et al.
Pubblicazione: (2025)
di: Yubeaton, Patrick, et al.
Pubblicazione: (2025)
The Ever-Evolving Science Exam
di: Wang, Junying, et al.
Pubblicazione: (2025)
di: Wang, Junying, et al.
Pubblicazione: (2025)
Lean-ing on Quality: How High-Quality Data Beats Diverse Multilingual Data in AutoFormalization
di: Chan, Willy, et al.
Pubblicazione: (2025)
di: Chan, Willy, et al.
Pubblicazione: (2025)
Scalable Qualitative Coding with LLMs: Chain-of-Thought Reasoning Matches Human Performance in Some Hermeneutic Tasks
di: Dunivin, Zackary Okun
Pubblicazione: (2024)
di: Dunivin, Zackary Okun
Pubblicazione: (2024)
FormalML: A Benchmark for Evaluating Formal Subgoal Completion in Machine Learning Theory
di: Yang, Xiao-Wen, et al.
Pubblicazione: (2025)
di: Yang, Xiao-Wen, et al.
Pubblicazione: (2025)
Can Coding Agents Reproduce Findings in Computational Materials Science?
di: Huang, Ziyang, et al.
Pubblicazione: (2026)
di: Huang, Ziyang, et al.
Pubblicazione: (2026)
Vibe Coding vs. Agentic Coding: Fundamentals and Practical Implications of Agentic AI
di: Sapkota, Ranjan, et al.
Pubblicazione: (2025)
di: Sapkota, Ranjan, et al.
Pubblicazione: (2025)
Lean Atlas: An Integrated Proof Environment for Scalable Human-AI Collaborative Formalization
di: Yanahama, Banri, et al.
Pubblicazione: (2026)
di: Yanahama, Banri, et al.
Pubblicazione: (2026)
Memoria: A Scalable Agentic Memory Framework for Personalized Conversational AI
di: Sarin, Samarth, et al.
Pubblicazione: (2025)
di: Sarin, Samarth, et al.
Pubblicazione: (2025)
MobEvolve: An Agentic Self-Evolving Heuristic System for Interpretable Human Mobility Generation
di: He, Junlin, et al.
Pubblicazione: (2026)
di: He, Junlin, et al.
Pubblicazione: (2026)
LongCat-Flash-Prover: Advancing Native Formal Reasoning via Agentic Tool-Integrated Reinforcement Learning
di: Wang, Jianing, et al.
Pubblicazione: (2026)
di: Wang, Jianing, et al.
Pubblicazione: (2026)
Replicating Human Social Perception in Generative AI: Evaluating the Valence-Dominance Model
di: Gurkan, Necdet, et al.
Pubblicazione: (2025)
di: Gurkan, Necdet, et al.
Pubblicazione: (2025)
BALAR : A Bayesian Agentic Loop for Active Reasoning
di: Echarghaoui, Aymen, et al.
Pubblicazione: (2026)
di: Echarghaoui, Aymen, et al.
Pubblicazione: (2026)
SEW: Self-Evolving Agentic Workflows for Automated Code Generation
di: Liu, Siwei, et al.
Pubblicazione: (2025)
di: Liu, Siwei, et al.
Pubblicazione: (2025)
KnowledgeGain: Evaluating and Optimizing Science News Generation for Reader Learning
di: Soós, Dominik, et al.
Pubblicazione: (2026)
di: Soós, Dominik, et al.
Pubblicazione: (2026)
InfiniteScienceGym: An Unbounded, Procedurally-Generated Benchmark for Scientific Analysis
di: Bentham, Oliver, et al.
Pubblicazione: (2026)
di: Bentham, Oliver, et al.
Pubblicazione: (2026)
Small Language Models Offer Significant Potential for Science Community
di: Zhang, Jian
Pubblicazione: (2025)
di: Zhang, Jian
Pubblicazione: (2025)
Documenti analoghi
-
Lean Meets Theoretical Computer Science: Scalable Synthesis of Theorem Proving Challenges in Formal-Informal Pairs
di: Zhang, Terry Jingchen, et al.
Pubblicazione: (2025) -
MedAgentGym: A Scalable Agentic Training Environment for Code-Centric Reasoning in Biomedical Data Science
di: Xu, Ran, et al.
Pubblicazione: (2025) -
GFLean: An Autoformalisation Framework for Lean via GF
di: Pathak, Shashank
Pubblicazione: (2024) -
DA-Code: Agent Data Science Code Generation Benchmark for Large Language Models
di: Huang, Yiming, et al.
Pubblicazione: (2024) -
A Cloud-based Multi-Agentic Workflow for Science
di: Acharya, Anurag, et al.
Pubblicazione: (2026)