Reliable Evaluation and Benchmarks for Statement Autoformalization
Fuente:
arXiv
Salvato in:
| Autori principali: | Poiroux, Auguste, Weiss, Gail, Kunčak, Viktor, Bosselut, Antoine |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
RLMEval: Evaluating Research-Level Neural Theorem Proving
di: Poiroux, Auguste, et al.
Pubblicazione: (2025)
di: Poiroux, Auguste, et al.
Pubblicazione: (2025)
Do LLMs Game Formalization? Evaluating Faithfulness in Logical Reasoning
di: Kim, Kyuhee, et al.
Pubblicazione: (2026)
di: Kim, Kyuhee, et al.
Pubblicazione: (2026)
Discovering Knowledge-Critical Subnetworks in Pretrained Language Models
di: Bayazit, Deniz, et al.
Pubblicazione: (2023)
di: Bayazit, Deniz, et al.
Pubblicazione: (2023)
An Evaluation Benchmark for Autoformalization in Lean4
di: Gulati, Aryan, et al.
Pubblicazione: (2024)
di: Gulati, Aryan, et al.
Pubblicazione: (2024)
Crosscoding Through Time: Tracking Emergence & Consolidation Of Linguistic Representations Throughout LLM Pretraining
di: Bayazit, Deniz, et al.
Pubblicazione: (2025)
di: Bayazit, Deniz, et al.
Pubblicazione: (2025)
PERK: Long-Context Reasoning as Parameter-Efficient Test-Time Learning
di: Chen, Zeming, et al.
Pubblicazione: (2025)
di: Chen, Zeming, et al.
Pubblicazione: (2025)
LLMs Are In-Context Bandit Reinforcement Learners
di: Monea, Giovanni, et al.
Pubblicazione: (2024)
di: Monea, Giovanni, et al.
Pubblicazione: (2024)
FormalAlign: Automated Alignment Evaluation for Autoformalization
di: Lu, Jianqiao, et al.
Pubblicazione: (2024)
di: Lu, Jianqiao, et al.
Pubblicazione: (2024)
Revisiting Multilingual Data Mixtures in Language Model Pretraining
di: Foroutan, Negar, et al.
Pubblicazione: (2025)
di: Foroutan, Negar, et al.
Pubblicazione: (2025)
ConLID: Supervised Contrastive Learning for Low-Resource Language Identification
di: Foroutan, Negar, et al.
Pubblicazione: (2025)
di: Foroutan, Negar, et al.
Pubblicazione: (2025)
Evaluating Language Model Agency through Negotiations
di: Davidson, Tim R., et al.
Pubblicazione: (2024)
di: Davidson, Tim R., et al.
Pubblicazione: (2024)
Don't Trust: Verify -- Grounding LLM Quantitative Reasoning with Autoformalization
di: Zhou, Jin Peng, et al.
Pubblicazione: (2024)
di: Zhou, Jin Peng, et al.
Pubblicazione: (2024)
ATLAS: Autoformalizing Theorems through Lifting, Augmentation, and Synthesis of Data
di: Liu, Xiaoyang, et al.
Pubblicazione: (2025)
di: Liu, Xiaoyang, et al.
Pubblicazione: (2025)
A Logical Fallacy-Informed Framework for Argument Generation
di: Mouchel, Luca, et al.
Pubblicazione: (2024)
di: Mouchel, Luca, et al.
Pubblicazione: (2024)
StepFun-Formalizer: Unlocking the Autoformalization Potential of LLMs through Knowledge-Reasoning Fusion
di: Wu, Yutong, et al.
Pubblicazione: (2025)
di: Wu, Yutong, et al.
Pubblicazione: (2025)
Parity-Aware Byte-Pair Encoding: Improving Cross-lingual Fairness in Tokenization
di: Foroutan, Negar, et al.
Pubblicazione: (2025)
di: Foroutan, Negar, et al.
Pubblicazione: (2025)
Rational Metareasoning for Large Language Models
di: De Sabbata, C. Nicolò, et al.
Pubblicazione: (2024)
di: De Sabbata, C. Nicolò, et al.
Pubblicazione: (2024)
Generalized Tree Edit Distance (GTED): A Faithful Evaluation Metric for Statement Autoformalization
di: Liu, Yuntian, et al.
Pubblicazione: (2025)
di: Liu, Yuntian, et al.
Pubblicazione: (2025)
DrBenchmark: A Large Language Understanding Evaluation Benchmark for French Biomedical Domain
di: Labrak, Yanis, et al.
Pubblicazione: (2024)
di: Labrak, Yanis, et al.
Pubblicazione: (2024)
Autoformalizing Natural Language to First-Order Logic: A Case Study in Logical Fallacy Detection
di: Lalwani, Abhinav, et al.
Pubblicazione: (2024)
di: Lalwani, Abhinav, et al.
Pubblicazione: (2024)
Can AI Freelancers Compete? Benchmarking Earnings, Reliability, and Task Success at Scale
di: Noever, David, et al.
Pubblicazione: (2025)
di: Noever, David, et al.
Pubblicazione: (2025)
AIMS.au: A Dataset for the Analysis of Modern Slavery Countermeasures in Corporate Statements
di: Bora, Adriana Eufrosina, et al.
Pubblicazione: (2025)
di: Bora, Adriana Eufrosina, et al.
Pubblicazione: (2025)
TDBench: A Benchmark for Top-Down Image Understanding with Reliability Analysis of Vision-Language Models
di: Hou, Kaiyuan, et al.
Pubblicazione: (2025)
di: Hou, Kaiyuan, et al.
Pubblicazione: (2025)
Reliable and Efficient Amortized Model-based Evaluation
di: Truong, Sang, et al.
Pubblicazione: (2025)
di: Truong, Sang, et al.
Pubblicazione: (2025)
From Rubrics to Reliable Scores: Evidence-Grounded Text Evaluation with LLM Judges
di: Hong, Yihan, et al.
Pubblicazione: (2026)
di: Hong, Yihan, et al.
Pubblicazione: (2026)
BEExAI: Benchmark to Evaluate Explainable AI
di: Sithakoul, Samuel, et al.
Pubblicazione: (2024)
di: Sithakoul, Samuel, et al.
Pubblicazione: (2024)
ECG-Reasoning-Benchmark: A Benchmark for Evaluating Clinical Reasoning Capabilities in ECG Interpretation
di: Oh, Jungwoo, et al.
Pubblicazione: (2026)
di: Oh, Jungwoo, et al.
Pubblicazione: (2026)
Can LLMs Speak For Diverse People? Tuning LLMs via Debate to Generate Controllable Controversial Statements
di: Li, Ming, et al.
Pubblicazione: (2024)
di: Li, Ming, et al.
Pubblicazione: (2024)
MathAtlas: A Benchmark for Autoformalization in the Wild
di: Patel, Nilay, et al.
Pubblicazione: (2026)
di: Patel, Nilay, et al.
Pubblicazione: (2026)
Paloma: A Benchmark for Evaluating Language Model Fit
di: Magnusson, Ian, et al.
Pubblicazione: (2023)
di: Magnusson, Ian, et al.
Pubblicazione: (2023)
JudgeBench: A Benchmark for Evaluating LLM-based Judges
di: Tan, Sijun, et al.
Pubblicazione: (2024)
di: Tan, Sijun, et al.
Pubblicazione: (2024)
Improving Model Evaluation using SMART Filtering of Benchmark Datasets
di: Gupta, Vipul, et al.
Pubblicazione: (2024)
di: Gupta, Vipul, et al.
Pubblicazione: (2024)
Evaluating the Generalization Ability of Quantized LLMs: Benchmark, Analysis, and Toolbox
di: Liu, Yijun, et al.
Pubblicazione: (2024)
di: Liu, Yijun, et al.
Pubblicazione: (2024)
Geak: Introducing Triton Kernel AI Agent & Evaluation Benchmarks
di: Wang, Jianghui, et al.
Pubblicazione: (2025)
di: Wang, Jianghui, et al.
Pubblicazione: (2025)
Fine-Grained Benchmark Generation for Comprehensive Evaluation of Foundation Models
di: Islam, Mohammed Saidul, et al.
Pubblicazione: (2026)
di: Islam, Mohammed Saidul, et al.
Pubblicazione: (2026)
Episodic Memories Generation and Evaluation Benchmark for Large Language Models
di: Huet, Alexis, et al.
Pubblicazione: (2025)
di: Huet, Alexis, et al.
Pubblicazione: (2025)
Beyond the Singular: Revealing the Value of Multiple Generations in Benchmark Evaluation
di: Zhang, Wenbo, et al.
Pubblicazione: (2025)
di: Zhang, Wenbo, et al.
Pubblicazione: (2025)
Autoformalizing Euclidean Geometry
di: Murphy, Logan, et al.
Pubblicazione: (2024)
di: Murphy, Logan, et al.
Pubblicazione: (2024)
AQA-Bench: An Interactive Benchmark for Evaluating LLMs' Sequential Reasoning Ability
di: Yang, Siwei, et al.
Pubblicazione: (2024)
di: Yang, Siwei, et al.
Pubblicazione: (2024)
PersonaLens: A Benchmark for Personalization Evaluation in Conversational AI Assistants
di: Zhao, Zheng, et al.
Pubblicazione: (2025)
di: Zhao, Zheng, et al.
Pubblicazione: (2025)
Documenti analoghi
-
RLMEval: Evaluating Research-Level Neural Theorem Proving
di: Poiroux, Auguste, et al.
Pubblicazione: (2025) -
Do LLMs Game Formalization? Evaluating Faithfulness in Logical Reasoning
di: Kim, Kyuhee, et al.
Pubblicazione: (2026) -
Discovering Knowledge-Critical Subnetworks in Pretrained Language Models
di: Bayazit, Deniz, et al.
Pubblicazione: (2023) -
An Evaluation Benchmark for Autoformalization in Lean4
di: Gulati, Aryan, et al.
Pubblicazione: (2024) -
Crosscoding Through Time: Tracking Emergence & Consolidation Of Linguistic Representations Throughout LLM Pretraining
di: Bayazit, Deniz, et al.
Pubblicazione: (2025)