MathConstruct: Challenging LLM Reasoning with Constructive Proofs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Balunović, Mislav, Dekoninck, Jasper, Jovanović, Nikola, Petrov, Ivo, Vechev, Martin |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MathArena: Evaluating LLMs on Uncontaminated Math Competitions
par: Balunović, Mislav, et autres
Publié: (2025)
par: Balunović, Mislav, et autres
Publié: (2025)
Proof or Bluff? Evaluating LLMs on 2025 USA Math Olympiad
par: Petrov, Ivo, et autres
Publié: (2025)
par: Petrov, Ivo, et autres
Publié: (2025)
BrokenMath: A Benchmark for Sycophancy in Theorem Proving with LLMs
par: Petrov, Ivo, et autres
Publié: (2025)
par: Petrov, Ivo, et autres
Publié: (2025)
The Open Proof Corpus: A Large-Scale Study of LLM-Generated Mathematical Proofs
par: Dekoninck, Jasper, et autres
Publié: (2025)
par: Dekoninck, Jasper, et autres
Publié: (2025)
ToolFuzz -- Automated Agent Tool Testing
par: Milev, Ivan, et autres
Publié: (2025)
par: Milev, Ivan, et autres
Publié: (2025)
Not All Proofs Are Equal: Evaluating LLM Proof Quality Beyond Correctness
par: Petrov, Ivo, et autres
Publié: (2026)
par: Petrov, Ivo, et autres
Publié: (2026)
Beyond Memorization: Violating Privacy Via Inference with Large Language Models
par: Staab, Robin, et autres
Publié: (2023)
par: Staab, Robin, et autres
Publié: (2023)
Polyrating: A Cost-Effective and Bias-Aware Rating System for LLM Evaluation
par: Dekoninck, Jasper, et autres
Publié: (2024)
par: Dekoninck, Jasper, et autres
Publié: (2024)
Beyond Benchmarks: MathArena as an Evaluation Platform for Mathematics with LLMs
par: Dekoninck, Jasper, et autres
Publié: (2026)
par: Dekoninck, Jasper, et autres
Publié: (2026)
Large Language Models are Advanced Anonymizers
par: Staab, Robin, et autres
Publié: (2024)
par: Staab, Robin, et autres
Publié: (2024)
COMPL-AI Framework: A Technical Interpretation and LLM Benchmarking Suite for the EU Artificial Intelligence Act
par: Guldimann, Philipp, et autres
Publié: (2024)
par: Guldimann, Philipp, et autres
Publié: (2024)
Adaptive Generation of Bias-Eliciting Questions for LLMs
par: Staab, Robin, et autres
Publié: (2025)
par: Staab, Robin, et autres
Publié: (2025)
A Unified Framework for LLM Watermarks
par: Gloaguen, Thibaud, et autres
Publié: (2026)
par: Gloaguen, Thibaud, et autres
Publié: (2026)
Ward: Provable RAG Dataset Inference via LLM Watermarks
par: Jovanović, Nikola, et autres
Publié: (2024)
par: Jovanović, Nikola, et autres
Publié: (2024)
Watermark Stealing in Large Language Models
par: Jovanović, Nikola, et autres
Publié: (2024)
par: Jovanović, Nikola, et autres
Publié: (2024)
CuTS: Customizable Tabular Synthetic Data Generation
par: Vero, Mark, et autres
Publié: (2023)
par: Vero, Mark, et autres
Publié: (2023)
Watermarking Diffusion Language Models
par: Gloaguen, Thibaud, et autres
Publié: (2025)
par: Gloaguen, Thibaud, et autres
Publié: (2025)
Discovering Spoofing Attempts on Language Model Watermarks
par: Gloaguen, Thibaud, et autres
Publié: (2024)
par: Gloaguen, Thibaud, et autres
Publié: (2024)
Back to the Drawing Board for Fair Representation Learning
par: Pouget, Angéline, et autres
Publié: (2024)
par: Pouget, Angéline, et autres
Publié: (2024)
Evading Data Contamination Detection for Language Models is (too) Easy
par: Dekoninck, Jasper, et autres
Publié: (2024)
par: Dekoninck, Jasper, et autres
Publié: (2024)
Delay, Plateau, or Collapse: Evaluating the Impact of Systematic Verification Error on RLVR
par: Egashira, Kazuki, et autres
Publié: (2026)
par: Egashira, Kazuki, et autres
Publié: (2026)
Learning from Saturated Data: Signals Beyond Correctness for LLM Training
par: Hiss, Hanno, et autres
Publié: (2026)
par: Hiss, Hanno, et autres
Publié: (2026)
Watermarking Autoregressive Image Generation
par: Jovanović, Nikola, et autres
Publié: (2025)
par: Jovanović, Nikola, et autres
Publié: (2025)
Pay Attention to the Triggers: Constructing Backdoors That Survive Distillation
par: De Muri, Giovanni, et autres
Publié: (2025)
par: De Muri, Giovanni, et autres
Publié: (2025)
AlphaIntegrator: Transformer Action Search for Symbolic Integration Proofs
par: Ünsal, Mert, et autres
Publié: (2024)
par: Ünsal, Mert, et autres
Publié: (2024)
Exploring the Role of Reasoning Structures for Constructing Proofs in Multi-Step Natural Language Reasoning with Large Language Models
par: Zheng, Zi'ou, et autres
Publié: (2024)
par: Zheng, Zi'ou, et autres
Publié: (2024)
Constrained Decoding of Diffusion LLMs with Context-Free Grammars
par: Mündler, Niels, et autres
Publié: (2025)
par: Mündler, Niels, et autres
Publié: (2025)
A Unified Approach to Routing and Cascading for LLMs
par: Dekoninck, Jasper, et autres
Publié: (2024)
par: Dekoninck, Jasper, et autres
Publié: (2024)
ProofSketcher: Hybrid LLM + Lightweight Proof Checker for Reliable Math/Logic Reasoning
par: Kommuru, Kranthi, et autres
Publié: (2026)
par: Kommuru, Kranthi, et autres
Publié: (2026)
Constructive Ethics Based on Proof - Layer 2: The Epistemic Overlay Reasoning Under Uncertainty in a Constructive Ethical System
par: Nymion
Publié: (2025)
par: Nymion
Publié: (2025)
Constructive Ethics Based on Proof - Layer 2: The Epistemic Overlay Reasoning Under Uncertainty in a Constructive Ethical System
par: Nymion
Publié: (2025)
par: Nymion
Publié: (2025)
BaxBench: Can LLMs Generate Correct and Secure Backends?
par: Vero, Mark, et autres
Publié: (2025)
par: Vero, Mark, et autres
Publié: (2025)
Reasoning Curriculum: Bootstrapping Broad LLM Reasoning from Math
par: Pang, Bo, et autres
Publié: (2025)
par: Pang, Bo, et autres
Publié: (2025)
AgenticMath: Enhancing LLM Reasoning via Agentic-based Math Data Generation
par: Liu, Xianyang, et autres
Publié: (2025)
par: Liu, Xianyang, et autres
Publié: (2025)
ConStat: Performance-Based Contamination Detection in Large Language Models
par: Dekoninck, Jasper, et autres
Publié: (2024)
par: Dekoninck, Jasper, et autres
Publié: (2024)
Knowledge Graph Construction for Stock Markets with LLM-Based Explainable Reasoning
par: Lee, Cheonsol, et autres
Publié: (2025)
par: Lee, Cheonsol, et autres
Publié: (2025)
Does Math Reasoning Improve General LLM Capabilities? Understanding Transferability of LLM Reasoning
par: Huan, Maggie, et autres
Publié: (2025)
par: Huan, Maggie, et autres
Publié: (2025)
Every Bit, Everywhere, All at Once: A Binomial Multibit LLM Watermark
par: Gloaguen, Thibaud, et autres
Publié: (2026)
par: Gloaguen, Thibaud, et autres
Publié: (2026)
LLM Fingerprinting via Semantically Conditioned Watermarks
par: Gloaguen, Thibaud, et autres
Publié: (2025)
par: Gloaguen, Thibaud, et autres
Publié: (2025)
Population-Evolve: a Parallel Sampling and Evolutionary Method for LLM Math Reasoning
par: Zhang, Yanzhi, et autres
Publié: (2025)
par: Zhang, Yanzhi, et autres
Publié: (2025)
Documents similaires
-
MathArena: Evaluating LLMs on Uncontaminated Math Competitions
par: Balunović, Mislav, et autres
Publié: (2025) -
Proof or Bluff? Evaluating LLMs on 2025 USA Math Olympiad
par: Petrov, Ivo, et autres
Publié: (2025) -
BrokenMath: A Benchmark for Sycophancy in Theorem Proving with LLMs
par: Petrov, Ivo, et autres
Publié: (2025) -
The Open Proof Corpus: A Large-Scale Study of LLM-Generated Mathematical Proofs
par: Dekoninck, Jasper, et autres
Publié: (2025) -
ToolFuzz -- Automated Agent Tool Testing
par: Milev, Ivan, et autres
Publié: (2025)