Can LLMs Reason Like Automated Theorem Provers for Rust Verification? VCoT-Bench: Evaluating via Verification Chain of Thought
Fuente:
arXiv
Salvato in:
| Autori principali: | Xie, Zichen, Wang, Wenxi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Scoring Verifiers: Evaluating Synthetic Verification for Code and Reasoning
di: Ficek, Aleksander, et al.
Pubblicazione: (2025)
di: Ficek, Aleksander, et al.
Pubblicazione: (2025)
DafnyBench: A Benchmark for Formal Software Verification
di: Loughridge, Chloe, et al.
Pubblicazione: (2024)
di: Loughridge, Chloe, et al.
Pubblicazione: (2024)
PostTrainBench: Can LLM Agents Automate LLM Post-Training?
di: Rank, Ben, et al.
Pubblicazione: (2026)
di: Rank, Ben, et al.
Pubblicazione: (2026)
KernelBench: Can LLMs Write Efficient GPU Kernels?
di: Ouyang, Anne, et al.
Pubblicazione: (2025)
di: Ouyang, Anne, et al.
Pubblicazione: (2025)
VeriContest: A Competitive-Programming Benchmark for Verifiable Code Generation
di: Xie, Zichen, et al.
Pubblicazione: (2026)
di: Xie, Zichen, et al.
Pubblicazione: (2026)
EsoLang-Bench: Evaluating Genuine Reasoning in Large Language Models via Esoteric Programming Languages
di: Sharma, Aman, et al.
Pubblicazione: (2026)
di: Sharma, Aman, et al.
Pubblicazione: (2026)
Talking with Verifiers: Automatic Specification Generation for Neural Network Verification
di: Elboher, Yizhak Y., et al.
Pubblicazione: (2026)
di: Elboher, Yizhak Y., et al.
Pubblicazione: (2026)
Towards Robust Agentic CUDA Kernel Benchmarking, Verification, and Optimization
di: Lange, Robert Tjarko, et al.
Pubblicazione: (2025)
di: Lange, Robert Tjarko, et al.
Pubblicazione: (2025)
Goedel-Code-Prover: Hierarchical Proof Search for Open State-of-the-Art Code Verification
di: Li, Zenan, et al.
Pubblicazione: (2026)
di: Li, Zenan, et al.
Pubblicazione: (2026)
Property-Driven Evaluation of GNN Expressiveness at Scale: Datasets, Framework, and Study
di: Che, Sicong, et al.
Pubblicazione: (2026)
di: Che, Sicong, et al.
Pubblicazione: (2026)
Towards Automated Formal Verification of Backend Systems with LLMs
di: Xu, Kangping, et al.
Pubblicazione: (2025)
di: Xu, Kangping, et al.
Pubblicazione: (2025)
CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification
di: Xu, Jiacheng, et al.
Pubblicazione: (2025)
di: Xu, Jiacheng, et al.
Pubblicazione: (2025)
First Three Years of the International Verification of Neural Networks Competition (VNN-COMP)
di: Brix, Christopher, et al.
Pubblicazione: (2023)
di: Brix, Christopher, et al.
Pubblicazione: (2023)
LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs
di: Zhou, Zenghui, et al.
Pubblicazione: (2026)
di: Zhou, Zenghui, et al.
Pubblicazione: (2026)
Chain of Targeted Verification Questions to Improve the Reliability of Code Generated by LLMs
di: Ngassom, Sylvain Kouemo, et al.
Pubblicazione: (2024)
di: Ngassom, Sylvain Kouemo, et al.
Pubblicazione: (2024)
StackSight: Unveiling WebAssembly through Large Language Models and Neurosymbolic Chain-of-Thought Decompilation
di: Fang, Weike, et al.
Pubblicazione: (2024)
di: Fang, Weike, et al.
Pubblicazione: (2024)
Can LLMs Enable Verification in Mainstream Programming?
di: Shefer, Aleksandr, et al.
Pubblicazione: (2025)
di: Shefer, Aleksandr, et al.
Pubblicazione: (2025)
Automating Code Adaptation for MLOps -- A Benchmarking Study on LLMs
di: Patel, Harsh, et al.
Pubblicazione: (2024)
di: Patel, Harsh, et al.
Pubblicazione: (2024)
CodeTaste: Can LLMs Generate Human-Level Code Refactorings?
di: Thillen, Alex, et al.
Pubblicazione: (2026)
di: Thillen, Alex, et al.
Pubblicazione: (2026)
Can LLMs Generate Architectural Design Decisions? -An Exploratory Empirical study
di: Dhar, Rudra, et al.
Pubblicazione: (2024)
di: Dhar, Rudra, et al.
Pubblicazione: (2024)
MermaidSeqBench: An Evaluation Benchmark for NL-to-Mermaid Sequence Diagram Generation
di: Shbita, Basel, et al.
Pubblicazione: (2025)
di: Shbita, Basel, et al.
Pubblicazione: (2025)
On the Effectiveness of LLMs for Manual Test Verifications
di: Peixoto, Myron David Lucena Campos, et al.
Pubblicazione: (2024)
di: Peixoto, Myron David Lucena Campos, et al.
Pubblicazione: (2024)
Next Steps in LLM-Supported Java Verification
di: Teuber, Samuel, et al.
Pubblicazione: (2025)
di: Teuber, Samuel, et al.
Pubblicazione: (2025)
Automated Proof Generation for Rust Code via Self-Evolution
di: Chen, Tianyu, et al.
Pubblicazione: (2024)
di: Chen, Tianyu, et al.
Pubblicazione: (2024)
Monitizer: Automating Design and Evaluation of Neural Network Monitors
di: Azeem, Muqsit, et al.
Pubblicazione: (2024)
di: Azeem, Muqsit, et al.
Pubblicazione: (2024)
ReLoop: Structured Modeling and Behavioral Verification for Reliable LLM-Based Optimization
di: Lian, Junbo Jacob, et al.
Pubblicazione: (2026)
di: Lian, Junbo Jacob, et al.
Pubblicazione: (2026)
Evaluating the Use of LLMs for Documentation to Code Traceability
di: Alor, Ebube, et al.
Pubblicazione: (2025)
di: Alor, Ebube, et al.
Pubblicazione: (2025)
Retrieval-Augmented Instruction Tuning for Automated Process Engineering Calculations : A Tool-Chaining Problem-Solving Framework with Attributable Reflection
di: Sakhinana, Sagar Srinivas, et al.
Pubblicazione: (2024)
di: Sakhinana, Sagar Srinivas, et al.
Pubblicazione: (2024)
Verification-Guided Context Optimization for Tool Calling via Hierarchical LLMs-as-Editors
di: Li, Henger, et al.
Pubblicazione: (2025)
di: Li, Henger, et al.
Pubblicazione: (2025)
An Empirical Evaluation of Locally Deployed LLMs for Bug Detection in Python Code
di: Vulićević, Jelena Ilić
Pubblicazione: (2026)
di: Vulićević, Jelena Ilić
Pubblicazione: (2026)
SnipGen: A Mining Repository Framework for Evaluating LLMs for Code
di: Rodriguez-Cardenas, Daniel, et al.
Pubblicazione: (2025)
di: Rodriguez-Cardenas, Daniel, et al.
Pubblicazione: (2025)
LiCoEval: Evaluating LLMs on License Compliance in Code Generation
di: Xu, Weiwei, et al.
Pubblicazione: (2024)
di: Xu, Weiwei, et al.
Pubblicazione: (2024)
SWE-Bench-CL: Continual Learning for Coding Agents
di: Joshi, Thomas, et al.
Pubblicazione: (2025)
di: Joshi, Thomas, et al.
Pubblicazione: (2025)
LiveCodeBench Pro: How Do Olympiad Medalists Judge LLMs in Competitive Programming?
di: Zheng, Zihan, et al.
Pubblicazione: (2025)
di: Zheng, Zihan, et al.
Pubblicazione: (2025)
VCoT-Grasp: Grasp Foundation Models with Visual Chain-of-Thought Reasoning for Language-driven Grasp Generation
di: Zhang, Haoran, et al.
Pubblicazione: (2025)
di: Zhang, Haoran, et al.
Pubblicazione: (2025)
Automated File-Level Logging Generation for Machine Learning Applications using LLMs: A Case Study using GPT-4o Mini
di: Rodriguez, Mayra Sofia Ruiz, et al.
Pubblicazione: (2025)
di: Rodriguez, Mayra Sofia Ruiz, et al.
Pubblicazione: (2025)
Beyond Output Correctness: Benchmarking and Evaluating Large Language Model Reasoning in Coding Tasks
di: Li, Yuangang, et al.
Pubblicazione: (2026)
di: Li, Yuangang, et al.
Pubblicazione: (2026)
SoundnessBench: A Soundness Benchmark for Neural Network Verifiers
di: Zhou, Xingjian, et al.
Pubblicazione: (2024)
di: Zhou, Xingjian, et al.
Pubblicazione: (2024)
Deep-Bench: Deep Learning Benchmark Dataset for Code Generation
di: Daghighfarsoodeh, Alireza, et al.
Pubblicazione: (2025)
di: Daghighfarsoodeh, Alireza, et al.
Pubblicazione: (2025)
Automating Formal Verification with Reinforcement Learning and Recursive Inference
di: Tan, Max
Pubblicazione: (2026)
di: Tan, Max
Pubblicazione: (2026)
Documenti analoghi
-
Scoring Verifiers: Evaluating Synthetic Verification for Code and Reasoning
di: Ficek, Aleksander, et al.
Pubblicazione: (2025) -
DafnyBench: A Benchmark for Formal Software Verification
di: Loughridge, Chloe, et al.
Pubblicazione: (2024) -
PostTrainBench: Can LLM Agents Automate LLM Post-Training?
di: Rank, Ben, et al.
Pubblicazione: (2026) -
KernelBench: Can LLMs Write Efficient GPU Kernels?
di: Ouyang, Anne, et al.
Pubblicazione: (2025) -
VeriContest: A Competitive-Programming Benchmark for Verifiable Code Generation
di: Xie, Zichen, et al.
Pubblicazione: (2026)