AlgoVeri: An Aligned Benchmark for Verified Code Generation on Classical Algorithms
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhao, Haoyu, Yang, Ziran, Li, Jiawei, He, Deyuan, Li, Zenan, Jin, Chi, Veeravalli, Venugopal V., Gupta, Aarti, Arora, Sanjeev |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Goedel-Code-Prover: Hierarchical Proof Search for Open State-of-the-Art Code Verification
di: Li, Zenan, et al.
Pubblicazione: (2026)
di: Li, Zenan, et al.
Pubblicazione: (2026)
CodeDPO: Aligning Code Models with Self Generated and Verified Source Code
di: Zhang, Kechi, et al.
Pubblicazione: (2024)
di: Zhang, Kechi, et al.
Pubblicazione: (2024)
VeriContest: A Competitive-Programming Benchmark for Verifiable Code Generation
di: Xie, Zichen, et al.
Pubblicazione: (2026)
di: Xie, Zichen, et al.
Pubblicazione: (2026)
VeriFix: Verifying Your Fix Towards An Atomicity Violation
di: Li, Zhuang, et al.
Pubblicazione: (2025)
di: Li, Zhuang, et al.
Pubblicazione: (2025)
VeriScale: Adversarial Test-Suite Scaling for Verifiable Code Generation
di: Bai, Yifan, et al.
Pubblicazione: (2026)
di: Bai, Yifan, et al.
Pubblicazione: (2026)
EvoCodeBench: An Evolving Code Generation Benchmark Aligned with Real-World Code Repositories
di: Li, Jia, et al.
Pubblicazione: (2024)
di: Li, Jia, et al.
Pubblicazione: (2024)
DevEval: A Manually-Annotated Code Generation Benchmark Aligned with Real-World Code Repositories
di: Li, Jia, et al.
Pubblicazione: (2024)
di: Li, Jia, et al.
Pubblicazione: (2024)
An Execution-Verified Multi-Language Benchmark for Code Semantic Reasoning
di: Li, Yikun, et al.
Pubblicazione: (2026)
di: Li, Yikun, et al.
Pubblicazione: (2026)
RealBench: A Repo-Level Code Generation Benchmark Aligned with Real-World Software Development Practices
di: Li, Jia, et al.
Pubblicazione: (2026)
di: Li, Jia, et al.
Pubblicazione: (2026)
VERINA: Benchmarking Verifiable Code Generation
di: Ye, Zhe, et al.
Pubblicazione: (2025)
di: Ye, Zhe, et al.
Pubblicazione: (2025)
ExecVerify: White-Box RL with Verifiable Stepwise Rewards for Code Execution Reasoning
di: Tang, Lingxiao, et al.
Pubblicazione: (2026)
di: Tang, Lingxiao, et al.
Pubblicazione: (2026)
VeriGuard: Enhancing LLM Agent Safety via Verified Code Generation
di: Miculicich, Lesly, et al.
Pubblicazione: (2025)
di: Miculicich, Lesly, et al.
Pubblicazione: (2025)
Edit, But Verify: An Empirical Audit of Instructed Code-Editing Benchmarks
di: Ebrahimi, Amir M., et al.
Pubblicazione: (2026)
di: Ebrahimi, Amir M., et al.
Pubblicazione: (2026)
TransferFuzz: Fuzzing with Historical Trace for Verifying Propagated Vulnerability Code
di: Li, Siyuan, et al.
Pubblicazione: (2024)
di: Li, Siyuan, et al.
Pubblicazione: (2024)
VeriSBOM: Secure and Verifiable SBOM Sharing Via Zero-Knowledge Proofs
di: Castiglione, Gianpietro, et al.
Pubblicazione: (2026)
di: Castiglione, Gianpietro, et al.
Pubblicazione: (2026)
VeriAct: Beyond Verifiability -- Agentic Synthesis of Correct and Complete Formal Specifications
di: Misu, Md Rakib Hossain, et al.
Pubblicazione: (2026)
di: Misu, Md Rakib Hossain, et al.
Pubblicazione: (2026)
EvoCodeBench: An Evolving Code Generation Benchmark with Domain-Specific Evaluations
di: Li, Jia, et al.
Pubblicazione: (2024)
di: Li, Jia, et al.
Pubblicazione: (2024)
ACECode: A Reinforcement Learning Framework for Aligning Code Efficiency and Correctness in Code Language Models
di: Yang, Chengran, et al.
Pubblicazione: (2024)
di: Yang, Chengran, et al.
Pubblicazione: (2024)
LONGCODEU: Benchmarking Long-Context Language Models on Long Code Understanding
di: Li, Jia, et al.
Pubblicazione: (2025)
di: Li, Jia, et al.
Pubblicazione: (2025)
COFFE: A Code Efficiency Benchmark for Code Generation
di: Peng, Yun, et al.
Pubblicazione: (2025)
di: Peng, Yun, et al.
Pubblicazione: (2025)
Uncovering Systematic Failures of LLMs in Verifying Code Against Natural Language Specifications
di: Jin, Haolin, et al.
Pubblicazione: (2025)
di: Jin, Haolin, et al.
Pubblicazione: (2025)
SelfCodeAlign: Self-Alignment for Code Generation
di: Wei, Yuxiang, et al.
Pubblicazione: (2024)
di: Wei, Yuxiang, et al.
Pubblicazione: (2024)
EditFlow: Benchmarking and Optimizing Code Edit Recommendation Systems via Reconstruction of Developer Flows
di: Liu, Chenyan, et al.
Pubblicazione: (2026)
di: Liu, Chenyan, et al.
Pubblicazione: (2026)
Proving the Coding Interview: A Benchmark for Formally Verified Code Generation
di: Dougherty, Quinn, et al.
Pubblicazione: (2025)
di: Dougherty, Quinn, et al.
Pubblicazione: (2025)
FLAG: Formal and LLM-assisted SVA Generation for Formal Specifications of On-Chip Communication Protocols
di: Shih, Yu-An, et al.
Pubblicazione: (2025)
di: Shih, Yu-An, et al.
Pubblicazione: (2025)
Cross-Task Benchmarking and Evaluation of General-Purpose and Code-Specific Large Language Models
di: Das, Gunjan, et al.
Pubblicazione: (2025)
di: Das, Gunjan, et al.
Pubblicazione: (2025)
Unrealized Expectations: Comparing AI Methods vs Classical Algorithms for Maximum Independent Set
di: Wu, Yikai, et al.
Pubblicazione: (2025)
di: Wu, Yikai, et al.
Pubblicazione: (2025)
Human-Aligned Code Readability Assessment with Large Language Models
di: Ouédraogo, Wendkûuni C., et al.
Pubblicazione: (2025)
di: Ouédraogo, Wendkûuni C., et al.
Pubblicazione: (2025)
Task Abstention for Large Language Models in Code Generation
di: Zhou, Yanke, et al.
Pubblicazione: (2026)
di: Zhou, Yanke, et al.
Pubblicazione: (2026)
Principled Detection of Hallucinations in Large Language Models via Multiple Testing
di: Li, Jiawei, et al.
Pubblicazione: (2025)
di: Li, Jiawei, et al.
Pubblicazione: (2025)
Towards Verified Code Reasoning by LLMs
di: Sistla, Meghana, et al.
Pubblicazione: (2025)
di: Sistla, Meghana, et al.
Pubblicazione: (2025)
ATLAS: Automated Toolkit for Large-Scale Verified Code Synthesis
di: Baksys, Mantas, et al.
Pubblicazione: (2025)
di: Baksys, Mantas, et al.
Pubblicazione: (2025)
VerifyThisBench: Generating Code, Specifications, and Proofs All at Once
di: Deng, Xun, et al.
Pubblicazione: (2025)
di: Deng, Xun, et al.
Pubblicazione: (2025)
CodeScore: Evaluating Code Generation by Learning Code Execution
di: Dong, Yihong, et al.
Pubblicazione: (2023)
di: Dong, Yihong, et al.
Pubblicazione: (2023)
JMigBench: A Benchmark for Evaluating LLMs on Source Code Migration (Java 8 to Java 11)
di: Amin, Nishil, et al.
Pubblicazione: (2026)
di: Amin, Nishil, et al.
Pubblicazione: (2026)
StepCodeReasoner: Aligning Code Reasoning with Stepwise Execution Traces via Reinforcement Learning
di: Wang, Hao, et al.
Pubblicazione: (2026)
di: Wang, Hao, et al.
Pubblicazione: (2026)
WybeCoder: Verified Imperative Code Generation
di: Gloeckle, Fabian, et al.
Pubblicazione: (2026)
di: Gloeckle, Fabian, et al.
Pubblicazione: (2026)
SIEVE: Towards Verifiable Certification for Code-datasets
di: Mbodji, Fatou Ndiaye, et al.
Pubblicazione: (2025)
di: Mbodji, Fatou Ndiaye, et al.
Pubblicazione: (2025)
CriterAlign: Criterion-Centric Rationale Alignment for Code Preference Judging
di: Li, Zhenyu, et al.
Pubblicazione: (2026)
di: Li, Zhenyu, et al.
Pubblicazione: (2026)
CodeAgent: Enhancing Code Generation with Tool-Integrated Agent Systems for Real-World Repo-level Coding Challenges
di: Zhang, Kechi, et al.
Pubblicazione: (2024)
di: Zhang, Kechi, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Goedel-Code-Prover: Hierarchical Proof Search for Open State-of-the-Art Code Verification
di: Li, Zenan, et al.
Pubblicazione: (2026) -
CodeDPO: Aligning Code Models with Self Generated and Verified Source Code
di: Zhang, Kechi, et al.
Pubblicazione: (2024) -
VeriContest: A Competitive-Programming Benchmark for Verifiable Code Generation
di: Xie, Zichen, et al.
Pubblicazione: (2026) -
VeriFix: Verifying Your Fix Towards An Atomicity Violation
di: Li, Zhuang, et al.
Pubblicazione: (2025) -
VeriScale: Adversarial Test-Suite Scaling for Verifiable Code Generation
di: Bai, Yifan, et al.
Pubblicazione: (2026)