Do We Need Frontier Models to Verify Mathematical Proofs?
Fuente:
arXiv
Saved in:
| Main Authors: | Naik, Aaditya, Shabadi, Guruprerana, Alur, Rajeev, Naik, Mayur |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Risk-Sensitive Agent Compositions
by: Shabadi, Guruprerana, et al.
Published: (2025)
by: Shabadi, Guruprerana, et al.
Published: (2025)
Once Upon an Input: Reasoning via Per-Instance Program Synthesis
by: Stein, Adam, et al.
Published: (2025)
by: Stein, Adam, et al.
Published: (2025)
Programmatic Reinforcement Learning: Navigating Gridworlds
by: Shabadi, Guruprerana, et al.
Published: (2024)
by: Shabadi, Guruprerana, et al.
Published: (2024)
Towards Compositionality in Concept Learning
by: Stein, Adam, et al.
Published: (2024)
by: Stein, Adam, et al.
Published: (2024)
Delta Activations: A Representation for Finetuned Large Language Models
by: Xu, Zhiqiu, et al.
Published: (2025)
by: Xu, Zhiqiu, et al.
Published: (2025)
Probabilistic Consensus through Ensemble Validation: A Framework for LLM Reliability
by: Naik, Ninad
Published: (2024)
by: Naik, Ninad
Published: (2024)
Lobster: A GPU-Accelerated Framework for Neurosymbolic Programming
by: Biberstein, Paul, et al.
Published: (2025)
by: Biberstein, Paul, et al.
Published: (2025)
ProofSketch: Efficient Verified Reasoning for Large Language Models
by: Sheshanarayana, Disha, et al.
Published: (2025)
by: Sheshanarayana, Disha, et al.
Published: (2025)
Logicbreaks: A Framework for Understanding Subversion of Rule-based Inference
by: Xue, Anton, et al.
Published: (2024)
by: Xue, Anton, et al.
Published: (2024)
FormalProofBench: Can Models Write Graduate Level Math Proofs That Are Formally Verified?
by: Ravi, Nikil, et al.
Published: (2026)
by: Ravi, Nikil, et al.
Published: (2026)
Auction-Based Online Policy Adaptation for Evolving Objectives
by: Shabadi, Guruprerana, et al.
Published: (2026)
by: Shabadi, Guruprerana, et al.
Published: (2026)
Logits are All We Need to Adapt Closed Models
by: Hiranandani, Gaurush, et al.
Published: (2025)
by: Hiranandani, Gaurush, et al.
Published: (2025)
M2R2: Mixture of Multi-Rate Residuals for Efficient Transformer Inference
by: Bhendawade, Nikhil, et al.
Published: (2025)
by: Bhendawade, Nikhil, et al.
Published: (2025)
Verifier-Backed Hard Problem Generation for Mathematical Reasoning
by: Lai, Yuhang, et al.
Published: (2026)
by: Lai, Yuhang, et al.
Published: (2026)
From Accuracy to Robustness: A Study of Rule- and Model-based Verifiers in Mathematical Reasoning
by: Huang, Yuzhen, et al.
Published: (2025)
by: Huang, Yuzhen, et al.
Published: (2025)
Relational Programming with Foundation Models
by: Li, Ziyang, et al.
Published: (2024)
by: Li, Ziyang, et al.
Published: (2024)
Hard2Verify: A Step-Level Verification Benchmark for Open-Ended Frontier Math
by: Pandit, Shrey, et al.
Published: (2025)
by: Pandit, Shrey, et al.
Published: (2025)
Stable Prediction of Adverse Events in Medical Time-Series Data
by: Keoliya, Mayank, et al.
Published: (2025)
by: Keoliya, Mayank, et al.
Published: (2025)
How Far Are We From AGI: Are LLMs All We Need?
by: Feng, Tao, et al.
Published: (2024)
by: Feng, Tao, et al.
Published: (2024)
Distilling Multi-Scale Knowledge for Event Temporal Relation Extraction
by: Yao, Hao-Ren, et al.
Published: (2022)
by: Yao, Hao-Ren, et al.
Published: (2022)
Do Retrieval-Augmented Language Models Adapt to Varying User Needs?
by: Wu, Peilin, et al.
Published: (2025)
by: Wu, Peilin, et al.
Published: (2025)
AXIOM: A Trust-First Neuro-Symbolic Execution Architecture for Verifiable Mathematical Reasoning
by: Bruno, Alessio
Published: (2026)
by: Bruno, Alessio
Published: (2026)
Scaling Smart: Accelerating Large Language Model Pre-training with Small Model Initialization
by: Samragh, Mohammad, et al.
Published: (2024)
by: Samragh, Mohammad, et al.
Published: (2024)
Attention Satisfies: A Constraint-Satisfaction Lens on Factual Errors of Language Models
by: Yuksekgonul, Mert, et al.
Published: (2023)
by: Yuksekgonul, Mert, et al.
Published: (2023)
Do Enterprise Systems Need Learned World Models? The Importance of Context to Infer Dynamics
by: Nair, Jishnu Sethumadhavan, et al.
Published: (2026)
by: Nair, Jishnu Sethumadhavan, et al.
Published: (2026)
Verifying the Verifiers: Unveiling Pitfalls and Potentials in Fact Verifiers
by: Seo, Wooseok, et al.
Published: (2025)
by: Seo, Wooseok, et al.
Published: (2025)
Do Large Language Models Truly Grasp Mathematics? An Empirical Exploration From Cognitive Psychology
by: Xie, Wei, et al.
Published: (2024)
by: Xie, Wei, et al.
Published: (2024)
MedicalBERT: enhancing biomedical natural language processing using pretrained BERT-based model
by: Reddy, K. Sahit, et al.
Published: (2025)
by: Reddy, K. Sahit, et al.
Published: (2025)
SCI-Verifier: Scientific Verifier with Thinking
by: Zheng, Shenghe, et al.
Published: (2025)
by: Zheng, Shenghe, et al.
Published: (2025)
Response-Level Rewards Are All You Need for Online Reinforcement Learning in LLMs: A Mathematical Perspective
by: He, Shenghua, et al.
Published: (2025)
by: He, Shenghua, et al.
Published: (2025)
Search, Verify and Feedback: Towards Next Generation Post-training Paradigm of Foundation Models via Verifier Engineering
by: Guan, Xinyan, et al.
Published: (2024)
by: Guan, Xinyan, et al.
Published: (2024)
Recover-LoRA: Data-Free Accuracy Recovery of Degraded Language Models via Low-Rank Adaptation
by: Das, Devleena, et al.
Published: (2025)
by: Das, Devleena, et al.
Published: (2025)
Solving Inequality Proofs with Large Language Models
by: Lu, Pan, et al.
Published: (2025)
by: Lu, Pan, et al.
Published: (2025)
Training Deliberative Monitors for Black-Box Scheming Detection
by: Sinha, Aditya, et al.
Published: (2026)
by: Sinha, Aditya, et al.
Published: (2026)
Dynamic Context Evolution for Scalable Synthetic Data Generation
by: Lingo, Ryan, et al.
Published: (2026)
by: Lingo, Ryan, et al.
Published: (2026)
Detecting Safety Violations Across Many Agent Traces
by: Stein, Adam, et al.
Published: (2026)
by: Stein, Adam, et al.
Published: (2026)
Do We Really Need Curated Malicious Data for Safety Alignment in Multi-modal Large Language Models?
by: Wang, Yanbo, et al.
Published: (2025)
by: Wang, Yanbo, et al.
Published: (2025)
The Road to Generalizable Neuro-Symbolic Learning Should be Paved with Foundation Models
by: Stein, Adam, et al.
Published: (2025)
by: Stein, Adam, et al.
Published: (2025)
Learning to Reason at the Frontier of Learnability
by: Foster, Thomas, et al.
Published: (2025)
by: Foster, Thomas, et al.
Published: (2025)
On the Ability of Transformers to Verify Plans
by: Sarrof, Yash, et al.
Published: (2026)
by: Sarrof, Yash, et al.
Published: (2026)
Similar Items
-
Risk-Sensitive Agent Compositions
by: Shabadi, Guruprerana, et al.
Published: (2025) -
Once Upon an Input: Reasoning via Per-Instance Program Synthesis
by: Stein, Adam, et al.
Published: (2025) -
Programmatic Reinforcement Learning: Navigating Gridworlds
by: Shabadi, Guruprerana, et al.
Published: (2024) -
Towards Compositionality in Concept Learning
by: Stein, Adam, et al.
Published: (2024) -
Delta Activations: A Representation for Finetuned Large Language Models
by: Xu, Zhiqiu, et al.
Published: (2025)